Cerebras và OpenAI đã mang đến cho thế giới cái nhìn đầu tiên về Chế độ cực nhanh, một tầng dịch vụ mới ra mắt đầu tiên trong API OpenAI và được hỗ trợ bởi phần cứng Cerebras. Theo thông báo của Cerebras được công bố vào ngày 13 tháng 8 năm 2026, GPT-5.6 Sol chạy trên Ultrafast cung cấp lên tới 750 mã thông báo đầu ra mỗi giây — mà không ảnh hưởng đến chất lượng.
Cấp độ này ban đầu được cung cấp cho một nhóm khách hàng được chọn, với quyền truy cập sẽ mở rộng theo thời gian. Thông báo do Joyce Er của Cerebras viết, coi việc cung cấp này là một giải pháp cho một sự đánh đổi đã xác định sự phát triển sản phẩm AI trong nhiều năm: các nhà xây dựng phải lựa chọn giữa tốc độ và trí thông minh, bởi vì các mô hình lớn hơn và thông minh hơn phải chịu chi phí tính toán và di chuyển dữ liệu cao hơn làm chậm thời gian phản hồi. Độc giả theo dõi cuộc đua tăng tốc các mô hình tiên phong có thể theo dõi những phát triển mới nhất trên AI Buzz Wire.
Chính xác thì tốc độ cực nhanh là bao nhiêu?
Bản thân con số thông lượng thô đã gây ấn tượng mạnh, nhưng Cerebras cũng cung cấp bối cảnh so sánh. Theo tốc độ đầu ra được báo cáo bởi Phân tích nhân tạo, một dịch vụ đo điểm chuẩn độc lập, GPT-5.6 Sol ở chế độ Ultrafast chạy:
- Nhanh hơn 11 lần so với Truyện ngụ ngôn 5
- Nhanh hơn gấp 5 lần so với Opus 4.8 ở chế độ Nhanh
Để kiểm tra rõ ràng tuyên bố này, Cerebras đã chạy mô hình này đối đầu với các đối thủ cạnh tranh phổ biến trên Bài kiểm tra cuối cùng của nhân loại (HLE), một tiêu chuẩn đầy thách thức bao gồm 2.500 câu hỏi thường chỉ có những người có bằng tiến sĩ trong các lĩnh vực như hóa học, kinh tế và văn học mới có thể trả lời được.
Kết quả: GPT-5.6 Sol trên Ultrafast đã trả lời tất cả 2.500 câu hỏi HLE trong 11 giờ 11 phút. Claude Fable 5 cần 78 giờ 27 phút — hơn ba ngày tính toán liên tục — để đi đến kết luận tương tự. Nói cách khác, Ultrafast đã vượt qua giới hạn kiến thức của con người chỉ trong một ngày làm việc, đạt được độ chính xác tương đương nhanh hơn gần 7 lần.
Cerebras lưu ý phương pháp đo điểm chuẩn của nó: GPT-5.6 Sol Ultrafast đã được thử nghiệm với Codex trên lý luận xhigh vào ngày 10 tháng 7, trong khi Claude Fable 5 đã được thử nghiệm với Claude Code trên lý luận xhigh từ ngày 13 đến ngày 15 tháng 7.
Khối lượng công việc trong thế giới thực, không chỉ là điểm chuẩn
Điểm chuẩn tốc độ có thể gây hiểu nhầm nếu chất lượng giảm sút trong quá trình thực hiện, đó là lý do tại sao Cerebras cũng nhấn mạnh kết quả trên GDP-Val, điểm chuẩn cho các nhiệm vụ công việc tri thức có giá trị kinh tế. Trên GDP-Val, Ultrafast mang lại tốc độ tăng tốc từ đầu đến cuối 5,6 lần mà không làm suy giảm chất lượng, theo các thử nghiệm mà Cerebras tiến hành vào ngày 31 tháng 7 năm 2026 bằng cách sử dụng GPT-5.6 Sol và GPT-5.6 Sol Ultrafast trên lý luận trung bình trong Codex.
Công ty cho biết GPT-5.6 Sol là mô hình tốt nhất của OpenAI dành cho các bản tóm tắt pháp lý, mô hình tài chính và báo cáo kỹ thuật – những lĩnh vực mà chất lượng đầu ra và thời gian xử lý đều mang lại hậu quả tài chính trực tiếp.
Tại sao tốc độ lại thay đổi phương trình tác nhân
Sự thay đổi mang tính hệ quả hơn có thể nằm ở cách thức hoạt động của các tác nhân AI. Suy luận nhanh hơn sẽ thay đổi những khả năng có thể xảy ra đối với các cá nhân và tổ chức, bởi vì các tác nhân có thể được đưa vào lộ trình quan trọng của các vấn đề mà mỗi giây đều có giá trị.
Rohan Varma, Sản phẩm tại OpenAI, cho biết trong một tuyên bố được trích dẫn trong thông báo: “Với GPT-5.6 Sol Ultrafast, Cerebras cho phép AI theo kịp cách bạn suy nghĩ, viết mã và cộng tác”. "Chúng tôi rất vui mừng được thấy quy trình làm việc và ứng dụng được biến đổi như thế nào nhờ suy luận cực nhanh."
Cerebras đã phác thảo một số tình huống có tính rủi ro cao trong đó việc tăng tốc là vấn đề quan trọng:
Ứng phó sự cố
Các công ty vận hành dịch vụ web có thể sử dụng Ultrafast để tìm ra nguyên nhân gốc rễ và giải quyết tình trạng ngừng hoạt động sản xuất, duy trì niềm tin của khách hàng, ngăn ngừa thất thoát doanh thu và tiết kiệm số phút ngừng hoạt động so với SLA của họ.###An ninh mạng
Trong các cuộc tấn công mạng có tính chất đối địch, có mức độ rủi ro cao, các nhóm bảo mật phải nhanh chóng phát hiện và ứng phó với các tác nhân xấu để ngăn chặn tổn thất thảm khốc — một nhiệm vụ mà độ trễ suy luận ảnh hưởng trực tiếp đến việc kiểm soát thiệt hại.
Năng suất của đại lý
Ultrafast cho phép các phương thức làm việc mới với tổng đài viên bằng cách cung cấp thông tin chi tiết và cập nhật theo thời gian thực, giảm nhu cầu chuyển đổi ngữ cảnh giữa các phiên song song.Jeffrey Wang, một nhà nghiên cứu tại OpenAI, cho biết trong thông báo: “Trong khi trước đây tôi có thể phải đợi vài phút để hoàn thành một nhiệm vụ, thì bây giờ nó hoàn thành trước khi tôi có cơ hội chuyển đổi ngữ cảnh. Nó giúp tôi làm việc hiệu quả hơn nhiều”.
Chiến lược đằng sau quan hệ đối tác
Đối với Cerebras, thỏa thuận này thể hiện một cột mốc quan trọng khác trong nỗ lực thương mại hóa khả năng tăng tốc quy mô wafer cho suy luận AI. Đối với OpenAI, Chế độ siêu nhanh bổ sung cấp tốc độ cao cấp vào API của nó tại thời điểm độ trễ suy luận đã trở thành yếu tố khác biệt mang tính cạnh tranh — đặc biệt đối với các ứng dụng tác nhân kết nối nhiều cuộc gọi mô hình lại với nhau, trong đó độ trễ mỗi cuộc gọi cộng dồn thành phút chờ đợi.
Các công ty coi cấp độ này là một lợi thế bền vững cho các tổ chức sử dụng AI biên giới để phản hồi nhanh chóng với thông tin đến, kết hợp xử lý Ultrafast cho công việc nhạy cảm với thời gian với xử lý tiêu chuẩn cho các nhiệm vụ hàng hóa có thể được song song trong nền.
Quyền truy cập đang được triển khai dần dần. Các nhà phát triển quan tâm có thể theo dõi tài liệu API OpenAI để biết tính khả dụng, vì Cerebras cho biết quyền truy cập sẽ mở rộng theo thời gian từ nhóm khách hàng được chọn ban đầu.
Đi trước AI
Để biết thêm thông tin về cuộc đua phần cứng và cơ sở hạ tầng đang định hình lại trí tuệ nhân tạo, hãy đánh dấu trang AI Buzz Wire và theo dõi nguồn cấp dữ liệu tin tức phần cứng AI của chúng tôi.
Đọc thêm tin tức về AI →