Nvidia đã đưa bộ tăng tốc suy luận tương tác Groq 3 LPX vào sản xuất hoàn chỉnh, công ty đã thông báo vào ngày 24 tháng 8 năm 2026 trong hội nghị Hot Chips. Con chip này, một phần mở rộng của nền tảng Vera Rubin của Nvidia, đã đạt kỷ lục 3.400 mã thông báo đầu ra mỗi giây trong điểm chuẩn Phân tích nhân tạo khi chạy mô hình Gemma 4 31B nguồn mở với cửa sổ ngữ cảnh 100.000 mã thông báo đang hoạt động — hiệu suất nhanh nhất từng được ghi nhận cho mô hình đó.
Sự ra mắt này đánh dấu cột mốc quan trọng nhất của sản phẩm từ thương vụ mua lại chuyên gia suy luận Groq trị giá 20 tỷ USD của Nvidia, một thỏa thuận mà công ty hiện đang chuyển sang tận dụng khi nhu cầu về suy luận có độ trễ thấp tăng cao. CNBC đưa tin rằng Nvidia cho biết các giá đỡ Groq đầu tiên sẽ trực tuyến trước cuối năm nay. Để biết thêm bối cảnh về câu chuyện này, hãy xem thông tin liên tục về ngành AI của chúng tôi.
Tại sao tốc độ tạo mã thông báo lại quan trọng
Hệ thống AI tác nhân — các chương trình suy luận, gọi công cụ, viết và kiểm tra mã cũng như lặp qua hàng trăm hoặc hàng nghìn bước suy luận — tạo ra khối lượng lớn mã thông báo đầu ra. Tốc độ mà các mã thông báo đó được tạo ra, được gọi là khả năng tương tác hoặc thông lượng giải mã, xác định tốc độ mà một tác nhân có thể hoàn thành từng bước công việc của mình.
Nvidia cho biết Groq 3 LPX cung cấp khả năng phản hồi nhanh hơn gấp 4 lần cho các tác nhân và khối lượng công việc nhạy cảm với độ trễ so với nền tảng thay thế gần nhất. Trong quá trình triển khai không đồng nhất, hệ thống Vera Rubin NVL72 xử lý việc nhập ngữ cảnh và tính toán điền trước, trong khi các đơn vị Groq 3 LPX xử lý giai đoạn tạo mã thông báo nhạy cảm với độ trễ.
Jensen Huang, người sáng lập và CEO của Nvidia, cho biết trong thông báo: “Suy luận là động lực tăng trưởng của AI”. "Vera Rubin mở rộng tầm nhìn đó với các cấu hình nhà máy AI được tối ưu hóa theo khối lượng công việc được thiết kế cho kỷ nguyên AI tác nhân, nâng cao ranh giới hiệu suất với LPX để tạo mã thông báo cực nhanh."
Bên trong phần cứng
Theo phân tích kỹ thuật của StorageReview, mỗi khay điện toán làm mát bằng chất lỏng 2U mang 16 LPU Groq 3 cùng với CPU chủ, logic mở rộng kết cấu và DRAM, cùng với DPU BlueField-4 hoặc card mạng ConnectX-9. Khay này có 32 liên kết quang chip-to-chip LPU và Ethernet 400Gb/s ở mặt trước.
Ở quy mô giá đỡ, việc triển khai Groq 3 LPX kết hợp tới 256 bộ tăng tốc LP30 được liên kết thông qua các kết nối chip-to-chip trực tiếp, tốc độ cao. Các giá đỡ này nằm trong cơ sở hạ tầng nhà máy Vera Rubin AI rộng hơn của Nvidia, được công ty mô tả là nền tảng mở rộng nhất từ trước đến nay: bảy chip riêng biệt trên năm cấu hình giá đỡ được xây dựng theo mục đích, bao gồm DPU BlueField-4, giá đỡ CPU Vera, bộ lưu trữ Vera BlueField-4 STX và mạng Ethernet Spectrum-6 SPX.
Nvidia cũng làm mới các tuyên bố về hiệu suất ở cấp nền tảng của mình, tuyên bố rằng Vera Rubin NVL72 cung cấp thông lượng mã thông báo trên mỗi megawatt lên tới 30 lần so với GB300 NVL72 trên khối lượng công việc mã hóa tác nhân 140.000 mã thông báo, với lợi thế mở rộng khi mục tiêu tương tác của mỗi người dùng tăng lên.
Điểm chuẩn có dấu hoa thị
Con số 3.400 token mỗi giây tiêu đề đi kèm với một cảnh báo đáng chú ý. Như StorageReview đã chỉ ra, kết quả của Nvidia được đo lường trên một điểm cuối riêng tư trước khi phát hành vào ngày 21 tháng 8, trong khi những con số cạnh tranh mà nó được so sánh đến từ các điểm cuối sản xuất không có máy chủ trực tiếp. Hiệu suất trong thế giới thực trên các dịch vụ thường có sẵn có thể khác với cấu hình điểm chuẩn lập kỷ lục.
Tuy nhiên, tổ chức đo điểm chuẩn độc lập Phân tích nhân tạo đã ghi nhận kết quả là kết quả nhanh nhất từng được đo cho Gemma 4 31B ở độ dài bối cảnh đó và tuyên bố cơ bản - rằng silicon được chế tạo có mục đích có thể tăng tốc đáng kể giai đoạn giải mã suy luận - phù hợp với cách ngành tái kiến trúc cho khối lượng công việc tác nhân.
Bắt đầu áp dụng đám mây
Nebius, đám mây AI có trụ sở tại Amsterdam, là nhà cung cấp đầu tiên cam kết triển khai Groq 3 LPX, dự định đưa nó vào Nebius Token Factory, nền tảng suy luận sản xuất của nó.
Danila Shtan, giám đốc công nghệ của Nebius cho biết: “Thế hệ là giai đoạn suy luận quyết định mức độ phản hồi thực sự của hệ thống AI và đó chính xác là những gì NVIDIA Groq 3 LPX được xây dựng để tăng tốc”. "Là đám mây AI đầu tiên đưa nó vào sản xuất thông qua Nebius Token Factory, chúng tôi đảm bảo rằng mỗi bước trong vòng lặp của tác nhân đều được cảm nhận ngay lập tức - thông qua cùng một API mà các nhà phát triển đang sử dụng mà không cần di chuyển sang ngăn xếp mới."
Nhà cung cấp suy luận Groq, hiện là thành viên của gia đình Nvidia, có kế hoạch trở thành một trong những người áp dụng nền tảng sớm nhất.
Bức tranh lớn hơn
Thông báo đầy đủ báo hiệu thị trường cơ sở hạ tầng AI đã chuyển hướng mạnh mẽ từ đào tạo sang suy luận như thế nào. Khi các doanh nghiệp chuyển ngân sách từ đào tạo trước mô hình thô sang lý luận theo thời gian thực và điều phối tác nhân tự trị, tính kinh tế của mã thông báo – tốc độ có thể được tạo ra và chi phí năng lượng – đã trở thành chiến trường cạnh tranh trung tâm.
Đối với Nvidia, Groq 3 LPX mở rộng khả năng bảo vệ nhượng quyền nhà máy AI của mình tại thời điểm mà silicon tùy chỉnh từ các nhà cung cấp đám mây cũng như các công ty khởi nghiệp đang theo đuổi cùng một khối lượng công việc suy luận tác nhân. Theo báo cáo của CNBC, các giá đỡ sẽ trực tuyến trong năm nay sẽ đưa hệ thống sản xuất đầu tiên đến tay khách hàng vài tháng sau khi thương vụ mua lại kết thúc - sự tích hợp nhanh chóng theo tiêu chuẩn ngành bán dẫn.
Công ty không tiết lộ giá cho các hệ thống mới. Groq 3 LPX sẽ được cung cấp khi nào và nếu có thông qua các đối tác đám mây AI, trong đó Nebius dự kiến sẽ là đối tác đầu tiên cung cấp quyền truy cập cho các nhà phát triển thông qua các điểm cuối API hiện có.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →