Cerebras Systems và OpenAI đã chia sẻ cái nhìn ban đầu về Chế độ cực nhanh, một tầng dịch vụ mới ra mắt đầu tiên trong API OpenAI và được hỗ trợ bởi công nghệ quy mô wafer của Cerebras. Sự hợp tác này cho phép GPT-5.6 Sol chạy với tốc độ lên tới 750 mã thông báo đầu ra mỗi giây, mang lại trí thông minh cấp cao nhất ở tốc độ thời gian thực. Để biết tin tức mới nhất về phần cứng AI, hãy truy cập AI Buzz Wire.
Loại bỏ sự đánh đổi giữa tốc độ và trí thông minh
Các nhà xây dựng AI từ lâu đã phải đối mặt với một sự đánh đổi cơ bản: khi các mô hình tăng quy mô và trí thông minh, chúng phải chịu chi phí tính toán và di chuyển dữ liệu cao hơn, làm chậm thời gian phản hồi. Các nhà phát triển buộc phải lựa chọn giữa việc chờ đợi kết quả chất lượng cao hoặc chấp nhận kết quả kém hơn trong thời gian ngắn hơn.
GPT-5.6 Sol ở Chế độ cực nhanh được thiết kế để giải quyết vấn đề nan giải này. Theo Cerebras, dịch vụ này chạy nhanh hơn 11 lần so với Claude Fable 5 của Anthropic và nhanh hơn 5 lần so với Opus 4.8 ở chế độ Nhanh, dựa trên tốc độ đầu ra được báo cáo bởi Phân tích nhân tạo.
Kỳ thi cuối cùng của nhân loại: Bài kiểm tra tốc độ
Cerebras đưa Ultrafast vào thử nghiệm với các mô hình cạnh tranh trong Bài kiểm tra cuối cùng của loài người (HLE), một tiêu chuẩn đầy thách thức bao gồm 2.500 câu hỏi thường chỉ những người có bằng tiến sĩ trong các lĩnh vực như hóa học, kinh tế và văn học mới có thể trả lời được.
Trong các đánh giá do Cerebras thực hiện, GPT-5.6 Sol ở Chế độ cực nhanh đã trả lời tất cả 2.500 câu hỏi HLE trong 11 giờ 11 phút. Claude Fable 5 cần 78 giờ 27 phút, hơn ba ngày tính toán liên tục để đi đến kết luận tương tự. Nói cách khác, Ultrafast xử lý giới hạn kiến thức của con người chỉ trong một ngày làm việc, đạt được độ chính xác tương đương nhanh hơn gần bảy lần.
Việc đo điểm chuẩn được Cerebras thực hiện bằng cách sử dụng GPT-5.6 Sol Ultrafast với Codex ở cài đặt lý luận cao vào ngày 10 tháng 7 và Claude Fable 5 với Claude Code trên cài đặt lý luận cao từ ngày 13 đến 15 tháng 7.
Tác động kinh doanh trong thế giới thực
Trên GDP-Val, một chuẩn mực cho các nhiệm vụ công việc tri thức có giá trị kinh tế, Ultrafast mang lại tốc độ tăng tốc toàn diện gấp 5,6 lần mà chất lượng không bị suy giảm. Điều này chứng tỏ khả năng suy luận nhanh hơn có thể đẩy nhanh công việc có giá trị kinh tế như thế nào mà không làm giảm chất lượng đầu ra.
Cerebras hình dung Ultrafast là một công cụ cho các tình huống mà mỗi giây đều quan trọng. Các công ty vận hành dịch vụ web có thể sử dụng công nghệ này để tìm ra nguyên nhân gốc rễ và giải quyết tình trạng ngừng sản xuất nhanh hơn, duy trì niềm tin của khách hàng và ngăn ngừa thất thoát doanh thu. Trong các tình huống an ninh mạng có mức độ rủi ro cao, các nhóm bảo mật có thể tận dụng Ultrafast để phát hiện và ứng phó nhanh chóng với các cuộc tấn công.
Công nghệ đằng sau tốc độ
Lợi thế về hiệu suất bắt nguồn từ kiến trúc Wafer-Scale Engine của Cerebras, được xây dựng có mục đích cho khối lượng công việc AI biên giới. Thách thức cốt lõi của suy luận biên giới nhanh là vấn đề di chuyển dữ liệu: trên GPU truyền thống, suy luận trên các mô hình lớn bị tắc nghẽn bởi băng thông bộ nhớ, vì trọng số mô hình phải được chuyển đi liên tục giữa bộ nhớ trên chip và bộ lưu trữ ngoài chip để tạo ra các mã thông báo liên tiếp.
Cerebras có một cách tiếp cận cơ bản khác. Mỗi con chip có kích thước bằng tấm wafer chứa 44 GB SRAM trực tiếp trên silicon. Trọng lượng mô hình vẫn ở trên chip và các mã thông báo không bị gián đoạn di chuyển qua các lớp mô hình được dẫn qua các tấm bán dẫn. Điều này giúp loại bỏ sự di chuyển dữ liệu không hiệu quả làm chậm quá trình suy luận dựa trên GPU và điều chỉnh quy mô một cách trơn tru theo kích thước mô hình, mở đường cho lợi thế tốc độ liên tục trên các mô hình tiên phong trong tương lai.
Tính sẵn có và Định vị Thị trường
GPT-5.6 Sol ở Chế độ cực nhanh hiện có sẵn ở dạng bản xem trước giới hạn cho một nhóm khách hàng chọn lọc, với quyền truy cập sẽ mở rộng theo thời gian khi công suất tăng lên. Cerebras mô tả sự hợp tác này sẽ thúc đẩy làn sóng đổi mới AI tiếp theo và nâng cao mức trần cho những gì các tổ chức có thể đạt được với AI phản ứng nhanh.
Sự hợp tác này đánh dấu một cột mốc quan trọng đối với Cerebras, công ty từ lâu đã theo đuổi điện toán quy mô wafer như một giải pháp thay thế cho thị trường phần cứng AI do GPU thống trị. Bằng cách hợp tác trực tiếp với OpenAI để tăng tốc một trong những mô hình tiên phong có khả năng nhất hiện có, Cerebras đang chứng minh rõ ràng rằng kiến trúc của nó mang lại lợi thế cạnh tranh thực sự cho khối lượng công việc suy luận tốc độ cao.
Khi các mô hình tiếp tục phát triển lớn hơn và thông minh hơn, khả năng phục vụ chúng ở tốc độ thời gian thực có thể trở thành yếu tố cạnh tranh quyết định trong thị trường cơ sở hạ tầng AI. Mối quan hệ hợp tác Cerebras-OpenAI báo hiệu rằng cuộc đua về tốc độ suy luận hiện cũng quan trọng như cuộc đua về trí thông minh của mô hình.
Đi trước AI
Để biết thêm tin tức về phần cứng AI, phân tích hiệu suất mô hình và sự phát triển của ngành, hãy đánh dấu trang AI Buzz Wire.
Đọc thêm tin tức về AI →