Nhóm Qwen của Alibaba đã ra mắt Qwen3.8-Omni-Flash, một mô hình đa phương thức gốc thế hệ tiếp theo chấp nhận đầu vào văn bản, hình ảnh, âm thanh và video thông qua một cửa sổ ngữ cảnh 1 triệu mã thông báo. Bản phát hành được trình bày chi tiết trên blog chính thức của Qwen, đánh dấu nỗ lực mạnh mẽ nhất của nhóm nhằm biến âm thanh và video từ đầu vào thụ động thành phương tiện chính mà qua đó các tác nhân AI nhận thức và hành động trên thế giới.
Từ hiểu biết về phương tiện truyền thông đến hành động theo nó
Mục tiêu đã nêu của Qwen3.8-Omni-Flash không chỉ là khả năng hiểu phương tiện truyền thông tốt hơn. Theo nhóm Qwen, mô hình này được thiết kế để nâng cao các hệ thống đa phương thức từ "hiểu nội dung đa phương thức" đến "lập kế hoạch nhiệm vụ, công cụ gọi điện và hoàn thành công việc sáng tạo". Trong thực tế, điều đó có nghĩa là mô hình này hướng đến các quy trình công việc như chỉnh sửa video, tạo video ca nhạc, sản xuất và bình luận phim, tóm tắt bằng âm thanh-hình ảnh và các cuộc hội thoại bằng giọng nói theo thời gian thực.
Việc đóng khung tác nhân này tách biệt bản phát hành với các mô hình đa phương thức trước đó vốn xử lý âm thanh và video làm đầu vào để phiên âm hoặc mô tả. Qwen lập luận rằng âm thanh và video đang phát triển thành "phương tiện truyền thông cốt lõi mà qua đó các tác nhân hiểu được môi trường, lý do và thực hiện nhiệm vụ của họ" - một tuyên bố mà công ty ủng hộ bằng một loạt kết quả tiêu chuẩn tác nhân.
Những con số đằng sau việc phát hành
Qua 29 đánh giá trải rộng trên các tiêu chuẩn lý luận âm thanh, lý luận nghe nhìn và tác nhân nghe nhìn, Qwen cho biết điểm trung bình của mô hình này cải thiện hơn 25% so với phiên bản tiền nhiệm, Qwen3.5-Omni-Plus. Các kết quả tiêu đề được báo cáo trên blog Qwen bao gồm:
- Đạt được 36,5 điểm trên WildClawBench-MM và 22,3 điểm trên AgenticVBench, hai điểm chuẩn dành cho tác nhân nghe nhìn, cộng với số điểm 69,6 trên UniClawBench.
- Cải thiện 8,3 điểm trên LongAudioSpan và tăng 9,6 điểm trên OmniVideoBench để hiểu được âm thanh và video dạng dài.
- Tỷ lệ lỗi giảm đáng kể trong phiên âm cuộc họp nhiều người phát biểu: AliMeeting DER và cpWER của mô hình lần lượt giảm từ 88,11 và 89,61 xuống 3,35 và 17,18.
Về mặt cạnh tranh, Qwen so sánh trực tiếp với sản phẩm của Google: công ty tuyên bố hiệu suất nghe nhìn gần bằng Gemini 3.8 Flash và hiệu suất âm thanh tổng thể vượt xa nó. Việc xác minh độc lập những so sánh đó sẽ mất thời gian, nhưng tính đặc hiệu của các tuyên bố điểm chuẩn báo hiệu rằng Qwen coi mô hình này có tính cạnh tranh ở mức cao nhất của công việc đa phương thức.
Cửa sổ 1 triệu token dành cho hàng giờ truyền thông
Cửa sổ bối cảnh 1 triệu token thống nhất được cho là tính năng thiết thực nhất của bản phát hành. Vì âm thanh và video tiêu thụ mã thông báo nhanh hơn nhiều so với văn bản nên hầu hết các mô hình đa phương thức trong quá trình sản xuất chỉ xử lý được vài phút phương tiện mỗi lần. Cửa sổ ngữ cảnh gồm bảy con số cho phép mô hình lưu giữ hàng giờ bản ghi cuộc họp, đoạn video mở rộng hoặc tài liệu đa phương tiện lớn trong một phiên duy nhất mà không bị phân đoạn.
Qwen lưu ý rằng mô hình này duy trì hiệu suất văn bản có thể so sánh với mô hình chỉ có văn bản có cùng kích thước - giải quyết sự cân bằng chung trong đó việc đào tạo đa phương thức làm giảm khả năng ngôn ngữ thuần túy.
Giảm giá 98% cho đầu vào âm thanh
Giá cả là lĩnh vực mà Alibaba đang phải chịu nhiều áp lực nhất. Theo blog, giá API mỗi giờ đầu vào âm thanh đã giảm hơn 98% so với Qwen3.5-Omni-Plus, trong khi giá mỗi giờ đầu vào nghe nhìn giảm hơn 93%. Ghi chú về phương pháp của công ty cho biết giá theo giờ được ước tính gấp 30 lần chi phí đầu vào cho hai phút nguyên liệu nguồn, với đầu vào nghe nhìn được tính ở 720p và 1 khung hình mỗi giây.
Đối với các nhà phát triển xây dựng tác nhân thoại, trình tóm tắt cuộc họp hoặc quy trình phân tích phương tiện, chi phí đầu vào thường là hạn chế ràng buộc về quy mô. Việc giảm giá ở mức độ lớn sẽ thay đổi sản phẩm nào có hiệu quả kinh tế - động lực tương tự đã thúc đẩy làn sóng API suy luận văn bản giá rẻ đầu tiên.
Tính sẵn có và Hệ sinh thái
Qwen3.8-Omni-Flash hiện có sẵn trên Nền tảng AI Qianwen, với quyền truy cập API thông qua Alibaba Cloud Model Studio, bao gồm điểm cuối thời gian thực dành riêng cho các trường hợp sử dụng đàm thoại. Nhóm cũng đã xuất bản công cụ hỗ trợ nguồn mở trên GitHub, bao gồm khai thác đánh giá Qwen-Live-Harness và Qwen-MM-Plugins, giúp các nhà phát triển có điểm khởi đầu để xây dựng các tác nhân gốc đa phương tiện trên mô hình.
Việc ra mắt diễn ra lặng lẽ vào đầu tuần nhưng đã thu hút được sự chú ý đáng kể trong cộng đồng nhà phát triển trong những ngày gần đây, thu hút một cuộc thảo luận lớn trên Hacker News và tin tức từ các hãng công nghệ theo dõi hệ sinh thái mô hình mở.
Ý nghĩa của cuộc đua đa phương thức
Việc phát hành tiếp tục chiến lược của Alibaba trong việc kết hợp việc định giá mạnh mẽ với các tiêu chuẩn cạnh tranh trên toàn bộ dòng Qwen, vốn đã nhiều lần nằm trong số các dòng mô hình mở được tải xuống nhiều nhất trên toàn thế giới. Với Qwen3.8-Omni-Flash, công ty đang đặt cược rằng chiến trường tiếp theo không phải là trò chuyện bằng văn bản mà là các tác nhân có thể xem, nghe và hành động — chỉnh sửa cảnh quay, tóm tắt cuộc họp và tổ chức các cuộc trò chuyện bằng giọng nói theo thời gian thực dưới dạng một khả năng tích hợp duy nhất.
Đối với Google, nơi Gemini 3.8 Flash là điểm so sánh rõ ràng, thông điệp là biên giới đa phương thức không còn là cuộc đua song mã giữa các phòng thí nghiệm của Hoa Kỳ. Đối với các nhà phát triển, sự kết hợp giữa cửa sổ đa phương thức 1M mã thông báo và đầu vào âm thanh gần như miễn phí đã hạ thấp rào cản đối với một loại sản phẩm tác nhân nghe nhìn vốn không thực tế để phân phối trên quy mô lớn chỉ vài tháng trước.
Việc các tuyên bố về điểm chuẩn của Qwen có được giữ vững dưới sự đánh giá độc lập hay không sẽ định hình mức độ nghiêm túc của ngành đối với vụ đặt cược đó. Nhưng hướng đi rất rõ ràng: các nhóm xây dựng mô hình biên giới giờ đây coi tai và mắt — không chỉ là hộp văn bản — là giao diện mặc định cho các tác nhân AI.
Đi trước AI
Cuộc đua đa phương thức đang tăng tốc từng tuần. Để biết thêm tin tức mới về AI, phân tích chuyên sâu về các bản phát hành mô hình mới và thông tin về các công cụ định hình ngành, đọc thêm tin tức AI →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →