Cerebras đã bổ sung Qwen 3.8 27B vào các điểm cuối công khai của nền tảng Suy luận Cerebras, trong đó mô hình trọng lượng mở chạy với tốc độ khoảng 1.500 mã thông báo mỗi giây, theo tài liệu danh mục mô hình của công ty. Danh sách này làm cho một trong những dòng mô hình mở được sử dụng rộng rãi nhất của Alibaba có sẵn với tốc độ nhanh hơn tốc độ phân phối trên máy chủ GPU thông thường.
Thông báo này đã thu hút sự chú ý ngay lập tức từ các nhà phát triển: câu chuyện đã thu thập được hơn 600 điểm trên Hacker News trong vòng một ngày, mức độ thu hút phản ánh nhu cầu suy luận nhanh, rẻ đã trở nên nóng như thế nào. Để có cái nhìn rộng hơn về thị trường suy luận, bộ phận tin tức AI mới nhất sẽ theo dõi mọi bản cập nhật nền tảng chính khi nó ra mắt.
Thông số kỹ thuật trên Catalog
Theo tài liệu của Cerebras, Qwen 3.8 27B mang 27 tỷ tham số và hỗ trợ 64K mã thông báo ngữ cảnh trên cấp miễn phí và 128K trên các cấp trả phí, chạy ở tốc độ khoảng 1.500 mã thông báo mỗi giây. Nó nằm cạnh mô hình GPT-OSS 120B trọng lượng mở của OpenAI, cùng danh mục liệt kê khoảng 3.000 mã thông báo mỗi giây với 65K bối cảnh ở cấp miễn phí và 131K ở cấp trả phí.
Cả hai mẫu đều có sẵn ở cấp độ dùng thử miễn phí và trả tiền theo mức sử dụng của Cerebras, tùy thuộc vào giới hạn tỷ lệ. Những khách hàng cần công suất dự trữ, thông lượng cao hơn hoặc SLA sản xuất sẽ được chuyển hướng đến việc cung cấp Điểm cuối chuyên dụng của công ty, tài liệu này cũng liệt kê là tuyến đường đến các dòng mô hình bổ sung ngoài hai dòng trên điểm cuối công cộng.
Các cửa sổ ngữ cảnh đáng được chú ý cùng với các số liệu về tốc độ. Sáu mươi bốn nghìn mã thông báo ở cấp miễn phí — và 128.000 ở cấp trả phí — đủ để chứa các cơ sở mã lớn, tài liệu dài hoặc bản ghi tác nhân mở rộng trong bộ nhớ cùng một lúc, điều này quan trọng đối với khối lượng công việc chính xác nơi việc giải mã nhanh mang lại hiệu quả. Tài liệu của Cerebras cũng bao gồm hướng dẫn tương thích OpenAI, giảm chi phí chuyển đổi cho các nhóm có mã hiện tại đã nhắm mục tiêu OpenAI SDK: về nguyên tắc, việc trỏ máy khách hiện tại đến điểm cuối Cerebras là thay đổi cấu hình chứ không phải viết lại.
Mô hình không được cắt tỉa, nén trong suốt
Một chi tiết đáng chú ý trong tài liệu là tiết lộ của Cerebras về cách nó xử lý việc nén mô hình. Công ty tuyên bố rằng tất cả các mô hình trên các điểm cuối công khai của nó đều là phiên bản gốc, chưa được chỉnh sửa và nó chỉ sử dụng lượng tử hóa chỉ trọng lượng có chọn lọc trong quá trình lưu trữ để duy trì chất lượng. Các lớp nhạy cảm luôn ở độ chính xác tối đa, các hoạt động kích hoạt, sự chú ý và bộ nhớ đệm KV vẫn không bị lượng tử hóa và quá trình khử lượng tử diễn ra nhanh chóng.
Cerebras cũng tiết lộ nghiên cứu của mình về các kỹ thuật cắt tỉa như REAP (Cắt tỉa kích hoạt chuyên gia theo trọng số bộ định tuyến): các biến thể được cắt tỉa được chia sẻ với cộng đồng nghiên cứu trên Ôm mặt nhưng không được cung cấp thông qua API công khai. Đối với các nhà phát triển chọn nơi chạy các mô hình mở, tính minh bạch về chính xác những gì đang được cung cấp là rõ ràng một cách bất thường.
Tại sao tốc độ mã thông báo lại quan trọng
Những con số thông lượng như thế này quan trọng nhất đối với khối lượng công việc mã hóa và tác nhân. Các ứng dụng xâu chuỗi hàng trăm lệnh gọi mô hình — tác nhân mã hóa, quy trình làm việc tự động, trợ lý thời gian thực — nhân độ trễ trên mỗi mã thông báo qua mỗi bước, do đó, sự khác biệt giữa 50 và 1.500 mã thông báo mỗi giây sẽ tạo thành một trải nghiệm khác biệt về mặt chất lượng. Các ứng dụng tương tác phát trực tiếp các lượt hoàn thành dài mang lại lợi ích rõ ràng nhất.
Sự đánh đổi là phạm vi. Một mô hình 27 tỷ tham số sẽ không phù hợp với các hệ thống tiên tiến trong các nhiệm vụ lý luận khó nhất và tài liệu riêng của Cerebras hướng khối lượng công việc sản xuất nặng nề sang công suất chuyên dụng. Nhưng đối với phần lớn các nhiệm vụ mà các mô hình mở cỡ trung bình đã đủ tốt — tóm tắt, phân loại, sử dụng công cụ, chỉnh sửa mã — tốc độ sẽ trở thành điểm khác biệt.
Ngoài ra còn có một kích thước giá mà các nhà phát triển sẽ cân nhắc. Các mô hình điểm cuối công khai có thể sử dụng được dưới dạng dùng thử miễn phí trước bất kỳ cam kết nào, điều này giúp cho việc đo điểm chuẩn đối với khối lượng công việc của chính nhóm về cơ bản không gặp trở ngại — một bước đi có chủ ý trái ngược với các hợp đồng doanh nghiệp yêu cầu các cuộc trò chuyện bán hàng trước khi mã thông báo đầu tiên được phân phối. Giới hạn tốc độ được ghi lại là hạn chế cần xem: quyền truy cập cấp miễn phí tồn tại để chứng minh tốc độ chứ không phải để chạy lưu lượng sản xuất.
Một khoảng thời gian bận rộn cho các mô hình mở
Việc bổ sung diễn ra trong thời gian đông đúc dành cho AI có trọng lượng mở. Phòng thí nghiệm IFM có trụ sở tại UAE vừa giới thiệu K2 Horizon, một nhóm được kết nối gồm sáu mô hình mở hoàn toàn và Meta tiếp tục lặp lại dòng Muse của mình để mã hóa và sử dụng tác nhân. Trong khi đó, hệ sinh thái mô hình mở ở Trung Quốc tiếp tục vận chuyển với tốc độ khiến chu kỳ phát hành bị nén trong toàn ngành.
Đối với các nhà phát triển, điều rút ra thực tế là ngăn xếp mô hình mở đang trưởng thành trên hai mặt cùng một lúc: khả năng, khi các mô hình cỡ trung thu hẹp khoảng cách với các sản phẩm hàng đầu trong các tác vụ hàng ngày và phục vụ kinh tế, khi các nhà cung cấp suy luận chuyên biệt cạnh tranh về tốc độ thô. Qwen 3.8 27B trên Cerebras là điểm dữ liệu cho cả hai xu hướng — một mô hình mở thế hệ hiện tại được cung cấp với tốc độ cực kỳ cao cách đây một năm, trên phần cứng được thiết kế riêng cho công việc.
Các nhà phát triển đánh giá nền tảng nên đánh giá khối lượng công việc của chính họ: tốc độ được công bố là số liệu trong danh mục, thông lượng trong thế giới thực phụ thuộc vào độ dài thời gian, tính đồng thời và cấu hình, đồng thời giới hạn tốc độ của bậc miễn phí sẽ bị ràng buộc trước khi tốc độ của nó đạt được.
Đi trước AI
Mọi bản phát hành mô hình, cập nhật nền tảng suy luận và khởi chạy công cụ dành cho nhà phát triển, đều được theo dõi khi nó diễn ra — đọc thêm tin tức AI →
