Phòng thí nghiệm nghiên cứu Qwen của Alibaba đã phát hành Qwen 3.8 27B vào thứ Sáu, một mô hình ngôn ngữ lớn có khả năng thị giác được cấp phép Apache 2.0, chạy trên một máy tính xách tay có cấu hình hợp lý — và, theo các tiêu chuẩn riêng của phòng thí nghiệm, vượt trội không chỉ so với phiên bản tiền nhiệm mà còn vượt trội so với mô hình đóng, một trong những mô hình mạnh nhất của Qwen gần đây vào tháng 5.
Việc phát hành đã trở thành một trong những lần ra mắt mẫu được thảo luận nhiều nhất trong tháng trong giới nhà phát triển. Một bài đánh giá thực tế được xuất bản vào Chủ nhật bởi Simon Willison, nhà nghiên cứu và blogger độc lập nổi tiếng về AI, đã được đưa lên trang nhất của Hacker News với hàng trăm lượt tán thành, trong đó độc giả tranh luận về khả năng của mô hình và cấu hình mặc định bất thường của nó. For more context on this story, see our ongoing more AI stories.
Có gì mới trong Qwen 3.8 27B
Mô hình này là mẫu mới nhất trong dòng sản phẩm có trọng lượng mở của Alibaba, xuất hiện vài tuần sau khi Qwen 3.8 2.4T-A95B lớn hơn nhiều được phát hành bởi các chuyên gia. Theo điểm chuẩn tự báo cáo của Qwen, mẫu 27B cho thấy mức tăng so với cả Qwen 3.6 27B và Qwen 3.7-Plus trọng lượng đóng — một mẫu, mặc dù có tên như vậy, nhưng là một trong những mẫu có hiệu suất mạnh nhất của Qwen ở mọi quy mô vào đầu năm nay.
Mô hình này hỗ trợ độ dài ngữ cảnh tối đa là 262.144 mã thông báo, xử lý thông tin đầu vào về tầm nhìn và cung cấp sự hỗ trợ chính thức cho tham số `reasoning_effort` giúp điều chỉnh độ sâu lý luận theo ba cấp độ: `xhigh`, `medium` và `low`.
Chính cài đặt đầu tiên đó — `xhigh`, mặc định của nhà sản xuất — đã trở thành tâm điểm của bản phát hành.
Vấn đề suy nghĩ quá mức
Willison, người đã thử nghiệm mô hình này trên MacBook Pro 128GB và NVIDIA DGX Spark bằng cách sử dụng bản dựng lượng tử hóa Q4_K_M 17GB của LM Studio, đã mô tả cài đặt mặc định là tạo ra "suy nghĩ quá mức một cách ngoạn mục".
Trong một ví dụ nổi bật, anh ấy đã yêu cầu người mẫu vẽ một SVG về một chú bồ nông đang đi xe đạp. Với nỗ lực suy luận `xhigh` mặc định, mô hình đã sử dụng 22.276 mã thông báo lý luận để tạo ra 3.223 mã thông báo đầu ra — một quá trình mất 21 phút trên phần cứng của anh ấy. Ông lưu ý rằng kết quả là "SVG bồ nông tốt nhất cho đến nay" mà ông có thể tạo ra với một mô hình chạy cục bộ, với hình dạng xe đạp chính xác, các chân ở cả hai bên khung và nền minh họa trang nhã.
Sự đánh đổi là hiển nhiên: 21 phút là thời gian chờ đợi không thực tế đối với hầu hết các nhiệm vụ. Việc chạy lại cùng một lời nhắc khi lý luận bị vô hiệu hóa sẽ tạo ra phản hồi trong 137 giây — dưới 1/10 thời gian — ở độ dài đầu ra tương tự.
Ngay cả những lời nhắc đơn giản tầm thường cũng kích hoạt hành vi. Được yêu cầu "vẽ một hình tròn", dấu vết lý luận của mô hình được mở bằng cách cân nhắc các tùy chọn bảng màu, kiểu dáng Bauhaus, các vòng xếp lớp và các phương pháp hoạt hình — vài phút cân nhắc cho một hình dạng yêu cầu một thẻ XML duy nhất.
Nhận định của Willison: mô hình này rất xuất sắc, nhưng cấu hình mặc định "hoàn toàn không phải là cách tốt để chạy mô hình, đặc biệt là trên phần cứng tiêu dùng". Người dùng có thể chuyển sang nỗ lực suy luận ở mức trung bình hoặc ở mức thấp hoặc vô hiệu hóa hoàn toàn tư duy mở rộng.
Động lực của AI địa phương
Bản phát hành nhấn mạnh khoảng cách về khả năng giữa các mô hình đám mây biên giới và các mô hình mở có thể chạy cục bộ đã thu hẹp nhanh như thế nào. Tệp 17GB chạy trên máy tính xách tay hiện tạo ra kết quả mà trong các tác vụ sáng tạo cụ thể có thể cạnh tranh với kết quả mà các mô hình quy mô trung tâm dữ liệu yêu cầu cách đây không lâu.
Nó cũng tiếp tục động lực mở rộng từ các phòng thí nghiệm Trung Quốc đã xác định năm 2026. Dòng Qwen của Alibaba nằm trong số các dòng mô hình được tải xuống nhiều nhất trên toàn cầu trong năm nay, cạnh tranh với các bản phát hành từ Meta, DeepSeek và Moonshot AI để giành được sự chia sẻ tư duy của nhà phát triển. Các kết quả điểm chuẩn độc lập cho Qwen 3.8 27B vẫn đang được tích lũy và Willison cảnh báo rõ ràng rằng các con số tự báo cáo của phòng thí nghiệm đang chờ xác minh của bên thứ ba.
Hướng dẫn thực tế cho người dùng
Đối với các nhà phát triển và những người đam mê đang xem xét mô hình này, sự đồng thuận đang nổi lên từ thử nghiệm ban đầu rất đơn giản: Qwen 3.8 27B là một lựa chọn mặc định mạnh mẽ cho khối lượng công việc AI cục bộ liên quan đến tầm nhìn hoặc tài liệu dài, nhưng nỗ lực lý luận cần được điều chỉnh cho phù hợp với nhiệm vụ. Phân tích phức tạp có thể biện minh cho `xhigh`; các câu hỏi hàng ngày và bản nháp nhanh sẽ nhanh hơn và rẻ hơn ở mức `trung bình` hoặc thấp hơn.
Người dùng chạy mô hình thông qua các công cụ như LM Studio cũng nên nâng cửa sổ ngữ cảnh mặc định từ 8.192 mã thông báo - Willison nhận thấy tư duy mở rộng của mô hình đã làm cạn kiệt ngân sách đó cho những vấn đề thậm chí còn trần tục trước khi anh tải nó với bối cảnh đầy đủ 262.144 mã thông báo.
Câu hỏi lớn hơn là bản phát hành báo hiệu điều gì về giai đoạn tiếp theo của cuộc đua mô hình mở: khi các mô hình kiểu lý luận trở thành chuẩn mực, các giá trị mặc định về cấu hình đang chuyển thành các quyết định về sản phẩm với những hậu quả thực sự về khả năng sử dụng — và mặc định `xhigh` của Qwen đã là ví dụ được thảo luận nhiều nhất.
Một cột mốc quan trọng cho các hạng cân mở
Việc phát hành cũng đánh dấu một cột mốc quan trọng về những gì mà các phòng thí nghiệm trọng lượng mở hiện có thể cung cấp ở quy mô nhỏ. Khả năng tầm nhìn, cửa sổ ngữ cảnh 262.144 mã thông báo và hiệu suất suy luận cạnh tranh trong một gói phù hợp với máy tính xách tay tiêu dùng là điều không thể tưởng tượng được trong mẫu được cấp phép Apache-2.0 hai năm trước. Đối với các nhà phát triển xây dựng các ứng dụng ưu tiên cục bộ — nơi quyền riêng tư, độ trễ hoặc hoạt động ngoại tuyến của dữ liệu loại trừ API đám mây — các tùy chọn thực tế sẽ tiếp tục được cải thiện với tốc độ nhanh chóng.
Thử nghiệm của Willison cũng nêu bật điểm trưởng thành của hệ sinh thái: công cụ xung quanh các mô hình cục bộ, từ tải xuống GGUF chỉ bằng một cú nhấp chuột của LM Studio đến các tham số lý luận có thể định cấu hình, đã đủ tiến bộ để việc điều chỉnh chiều sâu tư duy của mô hình giờ đây là một quyết định thông thường của người dùng chứ không phải là một bài tập nghiên cứu. Khi các tiêu chuẩn độc lập tích lũy trong những ngày tới, bức tranh về vị trí chính xác của Qwen 3.8 27B so với các đối thủ cạnh tranh mở và đóng của nó sẽ rõ nét hơn - nhưng sự đón nhận sớm cho thấy một sự gia nhập mạnh mẽ khác vào dòng đã đưa Alibaba trở thành một trong những nhà xuất bản mô hình mở có kết quả nhất trên thế giới.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →