Nhóm Qwen của Alibaba vào ngày 21 tháng 7 đã phát hành Qwen-Image-3.0, thế hệ thứ ba của mô hình tạo hình ảnh, hứa hẹn nội dung phong phú hơn, chi tiết hình ảnh chân thực và kiến ​​thức sâu sắc hơn những người tiền nhiệm. Sự ra mắt, được báo cáo bởi Tech in Asia và Unite.AI, đã thu hút sự chú ý đáng kể trong cộng đồng nhà phát triển, nơi thông báo đã xuất hiện trên trang nhất của Hacker News với hơn 300 lượt tán thành trong vòng vài giờ.

Mô hình mới được giới thiệu với khẩu hiệu "Nội dung phong phú, Chi tiết xác thực, Kiến thức sâu sắc" và nhằm mục đích tạo ra hình ảnh có bố cục phức tạp, một danh mục từ lâu đã thách thức hệ thống chuyển văn bản thành hình ảnh. Để biết thêm về bối cảnh cạnh tranh của AI tổng hợp, hãy theo dõi sự phát triển AI mới nhất của chúng tôi.

Những gì Qwen-Image-3.0 tuyên bố sẽ cải thiện

Theo Tech in Asia, Qwen-Image-3.0 được thiết kế đặc biệt để xử lý các bố cục phức tạp, loại bố cục đa thành phần kết hợp văn bản, đồ họa và các thành phần hình ảnh có cấu trúc trong một hình ảnh duy nhất. Đó là một bước tiến có ý nghĩa vượt ra ngoài khả năng tạo ảnh thực tế đơn giản mà các mẫu trước đó trong loạt sản phẩm này chủ yếu nhắm tới.

Dòng Qwen-Image đã phát triển nhanh chóng. Qwen-Image thế hệ đầu tiên tập trung vào việc hiển thị văn bản gốc, giải quyết vấn đề khét tiếng về các từ bị cắt xén hoặc sai chính tả bên trong các hình ảnh được tạo ra. Qwen-Image-2.0, thế hệ thứ hai, được đẩy mạnh vào lĩnh vực đồ họa thông tin chuyên nghiệp và thứ mà nhóm gọi là chủ nghĩa quang học tinh tế. Qwen-Image-3.0 mở rộng quỹ đạo đó hướng tới các bố cục phong phú hơn và kiến ​​thức thực tế hoặc ngữ cảnh sâu hơn được nhúng vào đầu ra được tạo ra.

Sự nhấn mạnh vào kiến ​​thức là đáng chú ý. Trong khi hầu hết các trình tạo hình ảnh tạo ra những cảnh hợp lý về mặt hình ảnh nhưng có thể chứa những thông tin không chính xác về mặt thực tế, thì Alibaba dường như đang định vị Qwen-Image-3.0 như một mô hình có thể hiểu được nội dung mà nó hiển thị chứ không chỉ các pixel.

Không có điểm chuẩn, không có trọng số — Chưa

Một chi tiết nhanh chóng thu hút sự chú ý là những gì Alibaba không công bố cùng với thông báo. Như Unite.AI đã báo cáo, Qwen-Image-3.0 đã được ra mắt mà không kèm theo điểm chuẩn hoặc trọng lượng mô hình có thể tải xuống. Điều đó trái ngược với các bản phát hành Qwen-Image trước đó, vốn đã đưa ra trọng số mở trên Ôm mặt và kèm theo các so sánh kỹ thuật chi tiết với các đối thủ cạnh tranh.

Sự thiếu sót đã gây ra nhiều phản ứng trái chiều. Trên Hacker News, những người bình luận lưu ý rằng nếu không có dữ liệu điểm chuẩn, rất khó để xác minh độc lập những cải tiến được tuyên bố của mô hình so với các đối thủ như hệ thống hình ảnh của OpenAI hoặc các sản phẩm của Google. Những người khác chỉ ra rằng Qwen có thành tích về việc phát hành trọng lượng sau thời gian giới thiệu ban đầu và việc thiếu lượt tải xuống ngay lập tức có thể chỉ phản ánh quá trình triển khai theo giai đoạn.

Quyết định giữ lại trọng lượng cũng mang một khía cạnh địa chính trị. Trong những tháng gần đây, Hoa Kỳ đã cân nhắc việc kiểm soát chặt chẽ hơn đối với các mô hình AI của Trung Quốc, với việc Bộ trưởng Tài chính Scott Bessent cảnh báo rằng Washington có thể trừng phạt Bắc Kinh vì cáo buộc trộm cắp mô hình AI. Trong bối cảnh đó, một số công ty AI Trung Quốc đã trở nên thận trọng hơn với các bản phát hành phiên bản mở, ngay cả khi phong trào nguồn mở rộng hơn tiếp tục có đà phát triển.

Một lĩnh vực đông đúc và cạnh tranh

Qwen-Image-3.0 bước vào thị trường tạo hình ảnh cạnh tranh khốc liệt. Hệ sinh thái riêng của Alibaba đã bao gồm nhiều mô hình hình ảnh và công ty phải đối mặt với các đối thủ trên nhiều mặt trận. Trong không gian mở, các mô hình như Krea 2 đã thể hiện khả năng sáng tạo mạnh mẽ. Trong không gian độc quyền, những công ty phương Tây lâu đời tiếp tục phát triển nhanh chóng cả về chất lượng và tốc độ.

Việc nhóm Qwen tập trung vào các bố cục phức tạp và kiến ​​thức nhúng cho thấy họ đang nhắm đến một phân khúc thị trường hơi khác: người dùng cần những hình ảnh được tạo ra không chỉ hấp dẫn về mặt hình ảnh mà còn mạch lạc về mặt cấu trúc và thực tế. Các trường hợp sử dụng như đồ họa thông tin, sơ đồ hướng dẫn, trực quan hóa dữ liệu và tài liệu tiếp thị có thương hiệu đều yêu cầu chính xác độ trung thực của bố cục và độ chính xác theo ngữ cảnh mà Qwen-Image-3.0 tuyên bố sẽ mang lại.

Trung Quốc tiếp tục thúc đẩy AI sáng tạo

Việc phát hành cũng phù hợp với mô hình rộng hơn của các công ty AI Trung Quốc vận chuyển các mô hình lớn với tốc độ nhanh chóng. Đầu tháng 7, Moonshot AI đã ra mắt Kimi K3, mô hình 28 nghìn tỷ tham số được coi là hệ thống AI có trọng lượng mở lớn nhất thế giới, trước khi tạm dừng đăng ký mới khi nhu cầu lấn át cơ sở hạ tầng điện toán của nó. Bản thân Alibaba đã phát triển mạnh mẽ trên cả mô hình ngôn ngữ và đa phương thức, với gia đình Qwen hiện bao gồm văn bản, mã, hình ảnh và tạo hình ảnh.

Tốc độ đó đã định hình lại bản đồ cạnh tranh toàn cầu. Như một phân tích được thảo luận rộng rãi trên Hacker News tuần này đã lập luận, chiến lược trọng lượng mở của Trung Quốc đang giành chiến thắng, thu hút các nhà phát triển và nhà nghiên cứu hướng tới các mô hình có sẵn miễn phí ngay cả khi các công ty Mỹ ngày càng hạn chế quyền truy cập vào các hệ thống có khả năng nhất của họ.

Cần chú ý điều gì

Các câu hỏi quan trọng hiện nay là khi nào Alibaba sẽ công bố kết quả tiêu chuẩn và liệu nó có tuân theo bản phát hành mở rộng hay không. Nếu Qwen-Image-3.0 cung cấp trọng lượng phù hợp với yêu cầu của nó, nó có thể gây áp lực lên các đối thủ cạnh tranh về cả chất lượng và khả năng tiếp cận. Nếu trọng số vẫn được giữ lại, các nhà phát triển sẽ phải cân nhắc những lời hứa tiếp thị của mô hình với việc không có bằng chứng xác minh.

Dù bằng cách nào, việc ra mắt nhấn mạnh ranh giới tạo hình ảnh đang chuyển động nhanh như thế nào. Độ trung thực của bố cục, chi tiết xác thực và kiến ​​thức được tích hợp hiện đang là chiến trường và Alibaba đã ra tín hiệu rằng họ có ý định đi đầu trong cuộc chiến đó.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →