Nhóm Qwen của Alibaba đã phát hành Qwen3.8-Flash-Next vào thứ Tư, một mô hình hỗn hợp các chuyên gia đa phương thức đóng vai trò như một bản xem trước kiến ​​trúc của Qwen4 sắp ra mắt — và mang lại kết quả mà công ty cho biết đã đánh bại Qwen3.7-Plus lớn hơn nhiều với chi phí đào tạo chỉ bằng khoảng 1/9. Reuters, Bloomberg và The Decoding đều đưa tin về buổi ra mắt, điều này đặt sức nặng lên Hugging Face và ModelScope cùng ngày Z.ai xuất xưởng mô hình mở liền kề với biên giới của riêng mình. Theo dõi tin tức AI nóng hổi khi cuộc đua hạng cân mở tăng tốc.

Một kiến trúc mới thu nhỏ

Các đặc điểm kỹ thuật tiêu đề là hiệu quả. Qwen3.8-Flash-Next có tổng cộng 125 tỷ tham số nhưng chỉ kích hoạt 6 tỷ mỗi mã thông báo. Để so sánh, Qwen3.7-Plus — mô hình mà nó vượt trội hơn so với các điểm chuẩn được công bố của Alibaba — có tổng cộng 397 tỷ tham số với 17 tỷ lượt kích hoạt trên mỗi mã thông báo, gần gấp ba lần số lượng hoạt động của Flash-Next.

Phần thú vị nhất về mặt kỹ thuật là lớp nhúng N-gram mới mang 51 tỷ tham số. Lớp này lưu trữ các nhóm từ phổ biến dưới dạng các mục nhập độc lập trong cái mà Matthias Bastian của The Decoding mô tả như một loại "từ điển cụm từ", cung cấp thông tin cấp độ cụm từ vào phần đầu của mạng. Điều quan trọng là nó nằm trong RAM hệ thống thông thường chứ không phải trong bộ nhớ GPU đắt tiền, với mức mà nhóm Qwen gọi là chi phí bổ sung tương đối thấp — một cải tiến kiến ​​trúc dự kiến ​​sẽ được áp dụng vào Qwen4.

Mô hình này thực sự hỗ trợ cửa sổ ngữ cảnh 262.144 mã thông báo và mở rộng quy mô thành một triệu mã thông báo bằng cách sử dụng tiện ích mở rộng ngữ cảnh dài YaRN. Một báo cáo kỹ thuật được xuất bản trên GitHub.

Điểm chuẩn: mã hóa và công việc văn phòng

Điểm chuẩn của Alibaba so sánh Flash-Next với DeepSeek-V4-Flash (284 tỷ thông số, 13 tỷ hoạt động) và Claude Opus 4.6 (Tối đa) của Anthropic. Mặc dù cả hai đối thủ đều lớn hơn hoặc đắt hơn nhiều, Flash-Next vẫn dẫn đầu trong phần lớn các tác vụ được thử nghiệm, với mức tăng lớn nhất về mã hóa và năng suất văn phòng.

Về mã hóa tác nhân, Flash-Next đạt 58,7 điểm trên DeepSWE 1.1 và 62,5 trên SWE-bench Pro, đánh bại cả DeepSeek-V4-Flash và Claude Opus 4.6. Khoảng cách về các tác vụ văn phòng vẫn còn lớn hơn: 73,9 trên CoWorkBench so với 45,1 cho DeepSeek-V4-Flash và 55,7 trên JobBench — gần gấp đôi so với 27,6 của Qwen3.7-Plus. Lý luận khoa học được kết hợp chặt chẽ trên toàn lĩnh vực, với Flash-Next ở mức 91,7 trên GPQA Diamond và 91,9 trên LiveCodeBench v6. Claude Opus 4.6 chỉ xuất hiện trong Bài kiểm tra cuối cùng của Nhân loại, 40.0 đến 35.9 và đây là mô hình Anthropic cũ hơn từ tháng 2 năm 2026. Như mọi khi, điểm chuẩn được công bố và hiệu suất trong thế giới thực có thể khác nhau.

Áp lực về giá lên mọi đối thủ

Phiên bản sản xuất được cung cấp dưới dạng Qwen3.8-Flash thông qua QwenCloud, có giá 0,16 USD trên một triệu mã thông báo đầu vào và 0,47 USD trên một triệu mã thông báo đầu ra. Con số đó thậm chí còn thấp hơn cả GLM-5.3-Flash của Z.ai, được phát hành cùng ngày ở mức tương ứng là 0,15 USD và 0,50 USD — thực sự ngang bằng ở mức đáy thị trường.

Khoảng cách với đối thủ hàng đầu của Alibaba là rất lớn. Qwen3.8-Max, được giới thiệu vào đầu tháng 8 để cạnh tranh với Claude Opus 4.8, Gemini 3.1 Pro và GPT-5.6 Sol, có giá 2,00 USD trên một triệu mã thông báo đầu vào và 6,00 USD trên một triệu mã thông báo đầu ra. Flash-Next hoạt động ngay dưới sản phẩm hàng đầu, theo số liệu riêng của Alibaba, với mức giá gần bằng 1/12 cả đầu vào và đầu ra.

Ngữ cảnh dài sẽ bổ sung thêm giá trị thực tế ngoài bảng thông số kỹ thuật. Với 262.144 mã thông báo gốc, một yêu cầu có thể chứa một số kho lưu trữ mã lớn, bộ hợp đồng đầy đủ hoặc số giờ họp được phiên âm; được mở rộng lên một triệu mã thông báo với YaRN, việc phân tích toàn bộ kho văn bản trở nên khả thi mà không cần giàn giáo truy xuất. Đối với khối lượng công việc mã hóa tác nhân trong đó Flash-Next đăng điểm cao nhất — tìm và sửa lỗi một cách độc lập trong các dự án phần mềm thực — một cửa sổ lớn có nghĩa là ít lỗi quản lý ngữ cảnh hơn ở giữa tác vụ. Nhóm Qwen cũng đã xuất bản báo cáo kỹ thuật trên GitHub, mời gọi chính xác kiểu giám sát kiến ​​trúc độc lập mà các phòng thí nghiệm độc quyền tránh.

Tại sao bản phát hành này lại quan trọng

Qwen3.8-Flash-Next được hiểu rõ nhất là buổi thử trang phục công cộng cho Qwen4. Lớp nhúng N-gram, tỷ lệ tham số hoạt động mạnh mẽ và khả năng giảm tải RAM của các tham số cồng kềnh nhưng hiếm khi cần thiết đã phác thảo ra một triết lý thiết kế: di chuyển trí thông minh trên mỗi đô la, chứ không phải trí thông minh trên mỗi GPU. Việc huấn luyện một mô hình vượt trội Qwen3.7-Plus với chi phí bằng 1/9 chính xác là khả năng giúp cho các chu kỳ lặp lại nhanh chóng có giá cả phải chăng — và tốc độ lặp lại, hơn bất kỳ điểm chuẩn đơn lẻ nào, là yếu tố quyết định ai sẽ đứng đầu trong một năm kể từ bây giờ.

Sự xuất hiện cùng ngày của hai mẫu máy có trọng lượng mở liền kề biên giới từ các phòng thí nghiệm Trung Quốc – GLM-5.3-Flash của Z.ai và Flash-Next của Alibaba – cũng đánh dấu một sự thay đổi về nhịp độ, như FourWeekMBA đã quan sát. Các phòng thí nghiệm phương Tây vẫn giữ mức điểm chuẩn cao nhất, nhưng cấp trọng lượng mở hiện vận chuyển chất lượng gần như vượt trội hàng tuần, với mức giá thấp hơn nhiều.

Đối với các nhà phát triển, bài học rút ra thực tế rất đơn giản: chi phí của một mô hình đa phương thức, có bối cảnh dài, có khả năng lại giảm xuống, với trọng lượng có thể tải xuống như bảo hiểm cho bất kỳ nhà cung cấp nào. Đối với các đối thủ cạnh tranh, thông điệp này kém thoải mái hơn – giới hạn hiệu quả hiện đang di chuyển nhanh hơn mức giá thực tế có thể theo đuổi và Alibaba không có dấu hiệu chậm lại.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →