Giới thiệu
Qwen ra mắt Qwen-Image-3.0, thế hệ thứ ba trong dòng model tạo ảnh nền tảng của Qwen-Image. Nếu Qwen-Image-1.0 tập trung vào “Precision”, Qwen-Image-2.0 mở rộng sang “Precision, Variety, Completeness, Beauty, Authenticity”, thì Qwen-Image-3.0 gom trọng tâm vào một chữ: Real.
Với bản này, Qwen mô tả ba năng lực chính:
- Rich Content: nhận prompt tới 4,5k token, đủ để mô tả layout phức tạp như báo, storyboard, đề thi, infographic nhiều vùng.
- Authentic Details: render text nhỏ tới 10px, cùng chi tiết như tóc, lỗ chân lông, texture giấy và nét bút.
- Deep Knowledge: render native 12 ngôn ngữ, mô phỏng UI phổ biến như web page, game, livestream và dùng world knowledge rộng hơn.
Thông điệp của release không chỉ là ảnh đẹp hơn. Qwen muốn image generation đi vào nhóm việc “dùng được trong production”: tài liệu nhiều chữ, slide kỹ thuật, UI concept, infographic giáo dục, restoration và visual editing.
Rich Content
Qwen-Image-3.0 được thiết kế cho ảnh nhiều thông tin, không chỉ một vật thể đẹp ở giữa canvas. Ví dụ demo gồm một slide toán có quan hệ không gian, ký hiệu, theorem description và layout rõ ràng.
Điểm nặng hơn là một ảnh 3x3 sinh trong một pass, không ghép từ nhiều ảnh. Mỗi cell là một infographic riêng: truyện tranh an toàn đường hầm, bài hình học không gian, phân tích văn học, vật lý chuyển động ném, sinh học ký sinh trùng, sơ đồ y khoa, Sylow theorems, infographic kiểm soát nội bộ ngân hàng và so sánh cấu trúc DNA. Qwen nói prompt để mô tả toàn bộ grid dài khoảng 3,7k token.
Năng lực này kiểm tra hai thứ:
- Semantic juxtaposition: đặt nhiều khái niệm song song trong cùng canvas mà không lẫn nhau.
- Spatial control: giữ quan hệ vị trí và layout đủ rõ để người đọc hiểu được nội dung.
Qwen cũng demo depth theo kiểu “ảnh trong ảnh”: VSCode interface chứa Qwen Chat, bên trong lại có WeChat, rồi poster cà phê. Mỗi lớp giữ phong cách UI riêng. Với dev/design team, đây là kiểu khả năng hữu dụng khi cần prototype màn hình, flow hoặc tài liệu sản phẩm có nhiều vùng thông tin.
Authentic Details
Phần “Authentic Details” nhắm vào lỗi cổ điển của image model: chữ sai, ký hiệu nát, texture quá nhựa. Qwen nói bản 3.0 có thể render text nhỏ 10px vẫn đọc được và thể hiện chi tiết micro-level.
Các demo chính:
- Infographic cá mập voi với nhiều text và hình minh họa.
- Trang paper toán có LaTeX, superscript, subscript, Greek letters, fraction bar và multi-line alignment.
- Trang báo giả lập với text dày và chất giấy tự nhiên.
- Editing task thêm ghi chú tay màu đỏ lên trang sách, gồm gạch chân, vòng tròn, mũi tên và comment ngắn.
- Portrait và vật thể với texture tóc, da, giấy, chất liệu.
- Restoration tranh truyền thống bị hỏng, giữ brushwork và composition ban đầu.
Điểm cần giữ tỉnh táo: đây vẫn là demo vendor. Dev nên kiểm tra lại bằng prompt thật của mình, đặc biệt với chữ nhỏ, công thức và ngôn ngữ ngoài tiếng Trung/Anh. Nhưng nếu khả năng này ổn định, nó giảm đáng kể vòng sửa tay trong pipeline tạo slide, report, worksheet, UI mockup và content marketing có nhiều text.
Deep Knowledge
Qwen-Image-3.0 hỗ trợ render 12 ngôn ngữ, nhiều font, hơn 100 style nghệ thuật và nhiều dạng interface. Bài viết đưa ví dụ tiếng Nhật, Hàn, Tây Ban Nha, cùng các UI realistic.
Một demo đáng quan tâm là chuyển ảnh côn trùng thật thành infographic nghiên cứu: model giữ chủ thể chính, thêm taxonomy, annotation hình thái, vùng phóng to chi tiết và scale bar. Đây là ví dụ gần với workflow khoa học/giáo dục hơn là ảnh minh họa chung chung.
Qwen cũng nói model có thể kết nối internet để lấy kiến thức mới, như tạo ảnh dự báo thời tiết cho Hàng Châu ngày 21/7. Ngoài ra, model có thể tìm IP figures cụ thể và sáng tạo từ đó, ví dụ dựng cảnh Qi Baishi và Van Gogh giới thiệu Qwen-Image-3.0 trong livestream room.
Ý nghĩa với Dev
Qwen-Image-3.0 đáng theo dõi nếu team của bạn đang dùng image model cho thứ có cấu trúc, không phải ảnh trang trí.
Các use case thực tế:
- Tạo UI concept nhiều màn hình hoặc nhiều layer trong một prompt dài.
- Sinh infographic kỹ thuật, slide bài giảng, worksheet, đề thi có công thức.
- Tạo report hoặc newspaper-style PDF mockup có layout dày đặc.
- Chỉnh sửa ảnh bằng annotation tự nhiên, restoration hoặc bổ sung text vào ảnh.
- Kiểm thử pipeline multi-language visual content, nhất là khi ảnh phải chứa chữ thật.
Caveat lớn nhất là reliability. Với ảnh nhiều chữ, “trông có vẻ đúng” chưa đủ; cần OCR, review người hoặc test tự động để bắt lỗi ký tự, số liệu, công thức và label. Nếu đưa vào sản phẩm, hãy coi Qwen-Image-3.0 như một generator cần kiểm chứng, không phải nguồn sự thật cuối cùng.