AMD và Cerebras Systems vừa công bố mối quan hệ đối tác kỹ thuật để xây dựng một loại cơ sở hạ tầng suy luận AI mới, kết hợp nền tảng Helios quy mô giá đỡ của AMD với Công cụ quy mô wafer (WSE) của Cerebras trong một quy trình làm việc riêng lẻ. Được công bố tại sự kiện Advancing AI 2026 của AMD vào ngày 23 tháng 7 năm 2026, sự hợp tác này nhắm trực tiếp vào các tắc nghẽn về độ trễ và thông lượng đã khiến suy luận trở thành một trong những vấn đề tốn kém nhất trong kỷ nguyên AI sáng tạo. Để biết thông tin mới nhất về lĩnh vực đang phát triển nhanh chóng này của ngành, hãy theo dõi tin tức tin tức mới nhất về AI của chúng tôi.

Ý tưởng cốt lõi là ngừng buộc một con chip phải làm mọi thứ. Trong ngăn xếp suy luận truyền thống, một họ GPU duy nhất xử lý cả công việc điền trước nặng nề là xử lý lời nhắc và công việc tuần tự, tinh tế là tạo ra từng mã thông báo mới. Đó là sự thỏa hiệp, vì hai công việc này có những yêu cầu rất khác nhau. AMD và Cerebras lập luận rằng việc phân chia công việc, một kỹ thuật được gọi là suy luận phân tách, cho phép mỗi động cơ phát huy hết khả năng của mình.

Hai động cơ phân chia lao động như thế nào

Theo thông báo chính thức của AMD, AMD Helios sẽ đóng vai trò là công cụ thông lượng có hiệu suất cao, có thể mở rộng, dựa trên GPU AMD Instinct để xử lý nhanh chóng các lô đầu vào lớn. Trong khi đó, Cerebras Wafer-Scale Engine sẽ xử lý việc giải mã và tạo mã thông báo cực nhanh, độ trễ cực thấp. Chip của Cerebra được xây dựng trên toàn bộ tấm bán dẫn thay vì được chia thành từng khuôn riêng lẻ, mang lại cho chúng băng thông bộ nhớ trên chip khổng lồ, đặc biệt phù hợp để truyền phát mã thông báo mà không bị đình trệ.

Các công ty cho biết bằng cách kết hợp hai công cụ điện toán, giải pháp chung dự kiến ​​sẽ cung cấp số token mỗi giây trên mỗi watt cao hơn tới 5 lần, một số liệu đã trở thành thẻ điểm trung tâm cho kinh tế suy luận khi các nhà cung cấp cạnh tranh về cả tốc độ và chi phí năng lượng. Con số này đã được trích dẫn trong thông cáo báo chí của AMD và được báo cáo trên các cửa hàng bao gồm Tom's Hardware, Investing.com và Yahoo Tech.

Cú đánh vào sự thống trị của Nvidia

Sự hợp tác cũng là một tín hiệu chiến lược. Hệ sinh thái CUDA và dòng GPU của Nvidia hiện đang thống trị hoạt động đào tạo và suy luận AI, đồng thời những người thách thức ngày càng kết luận rằng việc đánh bại đối thủ đương nhiệm trên một kiến ​​trúc duy nhất là rất khó. Business Insider đưa ra thỏa thuận khi AMD nhắm vào Nvidia bằng cách đặt cược vào khả năng suy luận, giai đoạn điện toán AI dự kiến ​​​​sẽ phát triển nhanh nhất khi các mô hình chuyển từ giai đoạn phát triển sang sản xuất.

Đối với AMD, việc kết hợp với Cerebras sẽ mở rộng sức hấp dẫn của lộ trình Bản năng và Helios ngoài việc đào tạo. Đối với Cerebras, công ty giao dịch trên Nasdaq với mã CBRS cùng với AMD (NASDAQ: AMD), việc tích hợp với một nhà cung cấp máy gia tốc lớn sẽ mang lại cho công nghệ quy mô wafer của nó một con đường rõ ràng hơn trong việc triển khai đám mây và doanh nghiệp lớn. Cerebras có kế hoạch triển khai AMD Helios trong các trung tâm dữ liệu của riêng mình và các công ty hy vọng giải pháp chung sẽ có sẵn đầu tiên thông qua Cerebras Cloud vào nửa cuối năm 2026.

Tại sao việc phân chia lại quan trọng vào lúc này

Chi phí suy luận đã trở thành một điểm áp lực quyết định đối với ngành AI. Khi các mô hình phát triển lớn hơn và các ứng dụng yêu cầu phản hồi theo thời gian thực, chi phí tạo ra mỗi mã thông báo và độ trễ mà người dùng trải qua khi chờ đợi nó có thể xác định liệu một sản phẩm có khả thi hay không. Suy luận phân tách coi việc điền trước và giải mã là các khối lượng công việc riêng biệt có thể được chuyển đến phần cứng phù hợp nhất với từng khối lượng công việc, một triết lý thiết kế mà các công ty như Cerebras đã ủng hộ trong hơn một năm.

Thông báo của AMD-Cerebras cho thấy cách tiếp cận này đang chuyển từ một ý tưởng đột phá sang một kiến ​​trúc được ngành công nghiệp xác nhận. Bằng cách kết hợp một chuyên gia về thông lượng với một chuyên gia về độ trễ, hai công ty đang đánh cược rằng tương lai của suy luận không phải là một con chip thống trị tất cả mà là một hệ thống phối hợp gồm các công cụ chuyên dụng.

Xem gì

Một số câu hỏi vẫn còn. Con số gấp 5 lần số token mỗi giây mỗi watt là một kỳ vọng chứ không phải là điểm chuẩn của bên thứ ba và hiệu suất trong thế giới thực sẽ phụ thuộc vào các mô hình và khối lượng công việc cụ thể mà khách hàng chạy. Thông tin chi tiết về giá cả và tính khả dụng ngoài việc ra mắt Cerebras Cloud vẫn chưa được tiết lộ và không rõ khi nào giải pháp này có thể đến tay các nhà cung cấp đám mây khác.

Tuy nhiên, thỏa thuận này nhấn mạnh sự thay đổi lớn hơn trong phần cứng AI: giả định rằng một kiến ​​trúc GPU duy nhất sẽ phục vụ mọi giai đoạn của quy trình AI đang bị lung lay. Nếu AMD và Cerebras có thể đưa ra những tuyên bố về hiệu quả của họ thì suy luận phân tách có thể trở thành một phần tiêu chuẩn trong cách xây dựng các hệ thống AI lớn nhất.

Đi trước AI

Bối cảnh phần cứng AI đang được chia thành các phe chuyên biệt và những tác động về chi phí, tốc độ và sự cạnh tranh là rất lớn. Đọc thêm tin tức AI trên AI Buzz Wire để cập nhật mọi thỏa thuận, bản phát hành và điểm chuẩn lớn.