Cerebras đã giới thiệu CS-4, một hệ thống suy luận AI quy mô giá đỡ được xây dựng xung quanh bộ xử lý quy mô wafer WSE-3 Turbo mới, tuyên bố rằng máy này cung cấp khả năng suy luận nhanh hơn tới 30 lần so với các hệ thống dựa trên GPU khi công ty tự định vị mình là giải pháp thay thế tốc độ cho đế chế trung tâm dữ liệu của Nvidia.
Sự ra mắt, được công bố hôm thứ Ba và trình bày chi tiết trên các trang sản phẩm của công ty cũng như làn sóng đưa tin từ Reuters, Bloomberg và The Register, đánh dấu sự làm mới phần cứng quan trọng nhất của Cerebras kể từ khi ra mắt công chúng - và là thời điểm quan trọng đối với một công ty có cổ phiếu gặp khó khăn kể từ khi IPO. Các nhà đầu tư dường như đang chú ý: cổ phiếu của Cerebras (CBRS) tăng vọt sau thông tin này và Investor's Business Daily dẫn lời bình luận của CEO rằng thị trường suy luận AI đang "phát triển quá nhanh".
Đối với những độc giả đang theo dõi cuộc đua tăng tốc nhằm làm cho các mô hình AI phản hồi nhanh hơn, sự ra mắt CS-4 là một trong những câu chuyện phần cứng có hệ quả lớn nhất trong quý và nó diễn ra trong bối cảnh có những thay đổi lớn hơn trong phạm vi phủ sóng của ngành AI tiếp tục định hình lại bối cảnh điện toán.
Có gì bên trong CS-4
Thành phần tiêu biểu là WSE-3 Turbo, một phiên bản nâng cấp của Động cơ cân wafer cỡ đĩa ăn tối của Cerebras. Theo chuyên sâu kỹ thuật của The Register, WSE-3T không phải là silicon mới - nó vẫn giữ nguyên quy trình 5nm TSMC, diện tích khuôn 46.225 mm vuông, 4 nghìn tỷ bóng bán dẫn, 900.000 lõi và 44 GB SRAM trên wafer như WSE-3 hai năm tuổi.
Thay vào đó, Cerebras đã đạt được hiệu suất gấp đôi bằng cách đẩy mạnh con chip hiện có hơn nhiều. WSE-3T tăng gấp đôi khả năng tính toán của FP16 thưa thớt lên 250 petaFLOPS, tăng gấp đôi hiệu suất của FP16 dày đặc lên khoảng 25 petaFLOPS, tăng gấp đôi băng thông bộ nhớ lên 43,2 petabyte mỗi giây và tăng gấp đôi băng thông I/O lên 2,4 terabit mỗi giây. Register ước tính công ty hiện đang đạt xung nhịp silicon khoảng 2,8 GHz, tăng so với khoảng 1,4 GHz ở thế hệ trước.
Theo Cerebras, thủ thuật này là một hệ thống phân phối điện được thiết kế lại, chỉ cách bộ xử lý 0,5 mm - gần hơn khoảng 100 lần so với ~50 mm thông thường của bo mạch GPU thông thường. Khoảng cách gần đó gần như loại bỏ tình trạng mất điện ở cấp độ bo mạch và cho phép năng lượng tiếp cận tấm bán dẫn tăng gấp đôi, cho phép tần số hoạt động cao hơn nhờ việc tạo mã thông báo nhanh hơn.
Kiến trúc giá đỡ Nexus
Ngoài bản thân con chip, CS-4 còn giới thiệu cái mà Cerebras gọi là Kiến trúc nền tảng Nexus, thiết kế quy mô giá đỡ thực sự đầu tiên của nó và là câu trả lời trực tiếp cho các hệ thống giá đỡ NVL72 của Nvidia và Helios của AMD. Mỗi CS-4 có thể mang tối đa ba bộ xử lý WSE-3T được đặt trong "Ba lô quy mô wafer" khép kín — các gói 3D có thể gập tấm wafer, chuyển đổi năng lượng, làm mát trực tiếp bằng chất lỏng, I/O tốc độ cao và điều khiển thiết bị điện tử thành một cụm duy nhất với số lượng linh kiện ít hơn 50%.
Thiết kế mô-đun tách biệt lớp mạng, lớp làm mát và nguồn điện ổn định khỏi máy tính. Theo công ty, Cerebras PowerRack có thể được cài đặt và đủ tiêu chuẩn về cơ sở trước khi có bất kỳ máy tính nào đến và sau đó ba lô trượt vào vị trí — giảm thời gian triển khai từ vài ngày xuống vài giờ, theo công ty.
Tiêu thụ điện năng là đáng kể. Register ước tính khoảng 46 kW mỗi ba lô và tổng công suất tiêu thụ của hệ thống là từ 120 đến 140 kW — những con số bắt mắt tuy nhiên có vẻ thận trọng khi so sánh với các hệ thống giá đỡ 240 đến 250 kW mà AMD và Nvidia dự kiến sẽ xuất xưởng vào cuối năm nay.
Tắt Switch
Có lẽ sự lựa chọn thú vị nhất về mặt kỹ thuật là sự kết nối. Thay vì định tuyến lưu lượng từ wafer đến wafer thông qua các bộ chuyển mạch — cách tiếp cận mà AWS áp dụng cho máy gia tốc Trainium3 — Cerebras nối các chip của mình vào cấu trúc liên kết hình xuyến 2D nơi các wafer lân cận giao tiếp trực tiếp với nhau. Thiết kế này giảm độ trễ giữa các tấm wafer từ 5 micro giây xuống chỉ còn 2 và Cerebras cho biết lưới có thể hỗ trợ các mô hình lên tới 50 nghìn tỷ thông số, vượt xa mọi thứ hiện có.
Kết quả tốc độ thật đáng kinh ngạc. Trên một hệ thống CS-4 duy nhất, công ty đo điểm chuẩn Artificial Analysis đã đo được tới 4.400 mã thông báo mỗi giây cho mỗi người dùng trên gpt-oss-120b — gấp khoảng 12 lần so với ~350 mã thông báo mỗi giây của các dịch vụ suy luận dựa trên GPU nhanh nhất hiện nay. Cerebras cũng tuyên bố hệ thống này duy trì hơn 1.000 mã thông báo mỗi giây trên các mô hình vượt quá 10 nghìn tỷ thông số.
Chiến lược hợp tác phân tán
Đáng chú ý, Cerebras không còn cố gắng chạy toàn bộ đường dẫn suy luận trên silicon của chính nó nữa. Công ty đã hợp tác với AWS và AMD để giảm tải giai đoạn suy luận nhanh chóng chuyên sâu về điện toán lên các GPU Trainium XPU và Instinct, để các công cụ quy mô wafer của họ xử lý giai đoạn giải mã nhạy cảm với độ trễ, nơi dự trữ SRAM khổng lồ của họ tỏa sáng.
Việc ra mắt CS-4 cũng mở rộng sự hợp tác của Cerebras với OpenAI. Yahoo Finance đưa tin về việc ra mắt cùng với các mối quan hệ đối tác OpenAI và AMD mới nhằm tăng tốc suy luận AI - xây dựng trên chế độ Ultrafast mà các công ty đã giới thiệu trước đó vào tháng 8, mang GPT-5.6 Sol đến với người dùng với tốc độ lên tới 750 mã thông báo mỗi giây.
Hãy cẩn thận đằng sau những con số tiêu đề
Các nhà phân tích ngành kêu gọi thận trọng về các số liệu tiếp thị. Register lưu ý rằng tiêu đề 250 petaFLOPS của Cerebras phụ thuộc vào độ thưa thớt, điều này thường không mang lại lợi ích cho việc suy luận mô hình ngôn ngữ lớn và các số liệu về băng thông bộ nhớ cao nhất phần lớn chỉ mang tính lý thuyết vì WSE-3 thiếu khả năng tính toán để bão hòa SRAM của chính nó. Ấn phẩm cũng đặt câu hỏi tại sao Cerebras lại tăng gấp đôi hiệu suất thay vì tăng dung lượng SRAM, vốn không tăng trưởng đáng kể kể từ khi WSE-2 ra mắt cách đây 5 năm - một lựa chọn gây tò mò trong kỷ nguyên suy luận phân tán trong đó bộ tăng tốc giải mã được hưởng lợi nhiều nhất từ bộ nhớ.
Tuy nhiên, cơ hội thị trường là có thật. Khi các chatbot và đại lý AI yêu cầu thời gian phản hồi nhanh hơn bao giờ hết, tốc độ suy luận đã trở thành một điểm khác biệt mang tính cạnh tranh thực sự và Cerebras hiện đã chứng minh rằng nó có thể lặp lại công nghệ quy mô wafer độc đáo của mình theo nhịp thương mại.
Các lô hàng CS-4 đầu tiên sẽ bắt đầu trong quý này, với các hệ thống đầu tiên dự kiến sẽ xuất xưởng trước cuối tháng 9. Liệu điều đó có đủ để làm giảm sự thống trị của Nvidia hay không vẫn còn phải xem - nhưng lần đầu tiên sau một thời gian, suy luận AI nhanh nhất trong ngành có một địa chỉ mới.
Đi trước AI
Sự ra mắt phần cứng như CS-4 đã làm rung chuyển thị trường và xác định lại những gì hệ thống AI có thể làm. Đọc thêm tin tức AI để theo kịp mọi sự phát triển.
Khám phá thông tin mới nhất về AI →