Intel đã khai mạc hội nghị Hot Chips năm nay bằng việc tìm hiểu sâu về Crescent Island, GPU trung tâm dữ liệu mà họ đang đặt cược cho giai đoạn tiếp theo của khối lượng công việc AI: suy luận tác nhân. Được trình bày bởi Kiến trúc sư trưởng Hệ thống AI doanh nghiệp Sumit Mohan và Intel Fellow Hong Jiang, buổi nói chuyện tập trung vào ba số liệu mà công ty cho biết sẽ xác định kỷ nguyên tác nhân - mã thông báo trên mỗi watt, dung lượng bộ nhớ lớn và ngăn xếp phần mềm mở.
Vấn đề thời gian. Nvidia đã sử dụng cùng một hội nghị để trình bày chi tiết về hệ thống quy mô giá đỡ Vera Rubin NVL72 của mình và mọi nhà cung cấp máy gia tốc tại Hot Chips 2026 hiện đang quảng bá hiệu quả thay vì hiệu suất đỉnh cao thô. Câu trả lời của Intel là một phần giúp hoán đổi công nghệ bộ nhớ mà các GPU AI chính thống sử dụng để lấy thứ gì đó rẻ hơn trên mỗi gigabyte và nó tạo ra những con số nổi bật. For more context on this story, see our ongoing more AI stories.
Thẻ PCIe 480GB ở công suất 350 Watts
Crescent Island là GPU PCIe công suất 350 watt, làm mát bằng không khí. Thẻ mang nhãn hiệu Intel có 160GB bộ nhớ LPDDR5X nhưng thiết kế này cho phép các đối tác của ODM xây dựng các biến thể có dung lượng lên tới 480GB trên bo mạch - gần gấp ba lần dung lượng của thẻ tăng tốc cao cấp thông thường và đủ để lưu trữ bộ nhớ đệm KV rất lớn cho khối lượng công việc tác nhân đa phiên và ngữ cảnh dài. Thiết kế bao gồm các loại dữ liệu từ FP4 và MXFP4 cho đến FP64.
Lựa chọn bộ nhớ là quyết định mang tính chiến lược trong sản phẩm. LPDDR5X đánh đổi băng thông để lấy dung lượng và chi phí, phù hợp với cấu hình khối lượng công việc suy luận trong đó các cửa sổ ngữ cảnh khổng lồ và vòng lặp lệnh gọi công cụ tiêu thụ dung lượng bộ nhớ nhiều hơn so với tính toán thô. Intel định hình toàn bộ thiết kế xung quanh "mã thông báo trên mỗi watt" - mang lại sản lượng hữu ích hơn trên mỗi đơn vị năng lượng thay vì giành chiến thắng khi so sánh FLOPS đỉnh.
Xe3P Silicon: 32 Nhân, 256 Động Cơ XMX
Về cơ bản, Crescent Island là kiến trúc Xe3P của Intel và Intel đã giới thiệu nó như một bước nhảy vọt về thế hệ so với thế hệ Xe2 dựa trên Battlemage. Trong đó Xe2 cung cấp 20 lõi Xe và mảng XMX tâm thu 4 độ sâu, thì Crescent Island mang đến 32 lõi Xe và mảng tâm thu 16 độ sâu, cung cấp tổng cộng 256 động cơ XMX.
Phần mở rộng Ma trận Xe thế hệ thứ ba bổ sung thêm thiết kế ma trận Xe mở rộng ba chiều với đồng phát hành chính xác FP4 và hỗ trợ FP64. Mỗi lõi Xe mang một tệp đăng ký chung 1MB và 512KB bộ đệm L1, với L2 hợp nhất 32 MB được chia sẻ trên toàn thiết bị. Một công cụ truyền thông có bốn bộ giải mã và bốn bộ mã hóa nằm cạnh nhau và toàn bộ SoC kết nối qua PCIe Gen5 x16 với sự hỗ trợ mở rộng quy mô trên cơ cấu chuyển mạch mở. Intel liệt kê công suất nhàn rỗi hoạt động từ 50 watt trở xuống ở trạng thái G0 và khoảng 10 watt ở trạng thái công suất thấp G8, đạt được thông qua các miền nguồn điện phân tán, bộ định tuyến mạng trên chip dựa trên gói với tính năng đo xung nhịp linh hoạt và đường ray DVFS độc lập dành cho đồ họa và phương tiện truyền thông.
Các tính năng RAS được mượn từ Playbook của máy chủ
Đối với bộ phận trung tâm dữ liệu, kỹ thuật đảm bảo độ tin cậy có thời gian thực hiện tương đương với thông lượng - một chủ đề mà Nvidia cũng dựa vào Vera Rubin. Crescent Island mang ECC và tính chẵn lẻ trên các cấu trúc bộ nhớ chính, kiểm tra lỗi trên mỗi bước nhảy của kết cấu kết nối nội bộ, ngoại tuyến trang động, sửa chữa sau gói cứng và Báo cáo lỗi nâng cao PCI Express. Intel cho biết sự kết hợp này giúp giảm thiểu tình trạng hỏng dữ liệu thầm lặng, chế độ lỗi quan trọng nhất đối với suy luận không giám sát trong thời gian dài.
Intel cũng định vị bộ phận này trong danh mục trải dài từ GPU máy trạm Arc Pro đến RDU SambaNova SN50 mà hãng mua lại, trong đó Crescent Island là trung tâm dữ liệu doanh nghiệp neo ở trên cùng. Công ty đã đưa ra một lộ trình kéo dài hơn sáu năm, coi GPU là một thiết kế thế hệ thứ ba trưởng thành chứ không phải là lần thử đầu tiên. Thẻ lần đầu tiên được ra mắt tại Computerx vào tháng 6; Hot Chips đã cung cấp chi tiết kiến trúc đằng sau nó.
Tại sao suy luận tác nhân lại ưa thích thiết kế này
Đối số về khối lượng công việc là phần thú vị nhất trong lời chào hàng của Intel. AI tác nhân - các mô hình gọi công cụ chuỗi, giữ ngữ cảnh mở lâu và phối hợp giữa CPU và GPU - đánh thuế độ trễ, dung lượng bộ nhớ và thông lượng hệ thống đồng thời, thay vì hồ sơ thông lượng hàng loạt của việc phân phát chatbot. Dung lượng bộ đệm KV dành cho các bối cảnh dài và các phiên đồng thời trong miền nén được tích hợp rõ ràng vào thiết kế SoC.
Khung đó cũng giải thích cho việc đặt cược LPDDR5X. Nếu làn sóng điện toán AI tiếp theo là các tác nhân ngốn bộ nhớ thay vì chạy đào tạo, thì thẻ 480 GB ở công suất 350 watt là giải pháp thay thế đáng tin cậy cho các bộ phận dựa trên HBM cao cấp - miễn là gói phần mềm mang lại. Sự nhấn mạnh của Intel vào cơ cấu ngăn xếp mở và chuyển mạch mở là nhằm thẳng vào những người mua cảnh giác với khả năng khóa nền tảng tích hợp của Nvidia.
Đảo Lưỡi liềm sẽ không thay thế các máy tăng tốc đào tạo đang thống trị các tiêu đề về AI và Intel cũng không tiết lộ giá cả cũng như tính khả dụng tại hội nghị. Nhưng như một tuyên bố về hướng mà Intel nghĩ rằng suy luận sẽ diễn ra - bộ nhớ béo, sức mạnh tinh gọn, kết cấu mở - đó là một trong những câu chuyện kiến trúc rõ ràng hơn về Hot Chips năm nay.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →