MLCommons đã công bố kết quả điểm chuẩn MLPerf Inference v6.1 vào ngày 16 tháng 9 năm 2026 và tiêu đề thuộc về nền tảng thế hệ tiếp theo của NVIDIA. Theo thông báo của NVIDIA, trong lần gửi bản xem trước đầu tiên, hệ thống Vera Rubin NVL72 đã cung cấp thông lượng gấp 3,7 lần so với hàng đầu GB300 NVL72 hiện tại của NVIDIA, một tín hiệu ban đầu về ý nghĩa của hệ thống kế nhiệm Blackwell Ultra đối với kinh tế suy luận AI.

Vera Rubin là nền tảng trung tâm dữ liệu tiếp theo của NVIDIA, được đặt tên theo nhà vật lý thiên văn, người đã cung cấp bằng chứng quan trọng về vật chất tối. Kết quả xem trước MLPerf là ​​dữ liệu hiệu suất được tổ chức độc lập, công khai đầu tiên cho hệ thống. For more context on this story, see our ongoing latest AI developments.

Những con số đằng sau màn ra mắt

NVIDIA đã gửi kết quả xem trước Vera Rubin NVL72 về hai khối lượng công việc đòi hỏi khắt khe nhất trong bộ v6.1: mô hình lý luận DeepSeek-R1 và mô hình ngôn ngữ thị giác Qwen3-VL.

Trên Qwen3-VL, Vera Rubin NVL72 mang lại thông lượng cao hơn tới 3,7 lần so với GB300 NVL72 trên các kịch bản ngoại tuyến, máy chủ và tương tác, chạy vLLM với khung suy luận nguồn mở Dynamo của NVIDIA. Trên DeepSeek-R1, sử dụng thư viện TensorRT-LLM của NVIDIA, thông lượng cao hơn tới 2,5 lần so với Flagship trước đó.

Cả hai số liệu đều đến từ đệ trình của chính NVIDIA tới Bộ phận kín của MLCommons, nghĩa là chúng được sản xuất theo các quy tắc đã được kiểm toán của MLPerf, mặc dù kết quả xem trước rõ ràng là những phép đo ban đầu về một nền tảng vẫn đang được tối ưu hóa.

Lợi nhuận được tạo ra như thế nào

NVIDIA cho rằng bước chuyển sang đồng thiết kế toàn diện trên phần cứng và phần mềm thay vì bất kỳ thành phần đơn lẻ nào.

Về mặt silicon, Vera Rubin mang đến Lõi Tensor nâng cao và Công cụ biến áp cập nhật giúp tăng tốc cả hai giai đoạn suy luận — giai đoạn điền trước nặng về tính toán và giai đoạn giải mã giới hạn bộ nhớ. Nền tảng này dựa trên độ chính xác của NVFP4, giúp thu nhỏ dung lượng bộ nhớ của trọng lượng mô hình, sự chú ý và bộ nhớ đệm KV, nâng cao thông lượng mà NVIDIA mô tả là giảm thiểu chất lượng đầu ra.

Về phía phần mềm, các nội dung gửi đã sử dụng phân phối phân tách, phân tách việc điền trước và giải mã thành các tác vụ khác nhau, cùng với sự song song của chuyên gia quy mô lớn để giữ cho các lớp hỗn hợp chuyên gia trong các mô hình như DeepSeek-R1 và Qwen3-VL được cung cấp đầy đủ công việc.

Sự kết nối là trụ cột thứ ba. Thiết kế giá đỡ NVL72 liên kết 72 GPU vào một miền mở rộng quy mô duy nhất bằng cách sử dụng NVLink và NVLink Switch thế hệ thứ sáu, mà NVIDIA cho biết mang lại tốc độ gói cao hơn 10 lần và độ trễ thấp hơn 3 lần so với Ethernet sẵn có — nền tảng giúp việc phân tách quy mô giá đỡ trở nên thiết thực.

GB300 cho thấy tỷ lệ gần như hoàn hảo

Flagship hiện tại đã có tin tức riêng ở vòng v6.1. Quá trình gửi DeepSeek-R1 của NVIDIA được mở rộng từ một giá đỡ GB300 NVL72 — 72 GPU — lên bốn giá đỡ, 288 GPU, đạt hiệu suất mở rộng 99% trong kịch bản ngoại tuyến, với thông lượng tăng gần tương ứng với phần cứng được thêm vào.

Hiệu quả mở rộng quy mô là một thước đo mà các nhà khai thác trung tâm dữ liệu theo dõi chặt chẽ vì nó quyết định liệu việc mua thêm phần cứng có thực sự mua được nhiều dung lượng hơn tương ứng hay không. Tỷ lệ gần như tuyến tính trên các giá đỡ cho thấy nút cổ chai ở quy mô này vẫn duy trì hiệu suất trên mỗi GPU thay vì giao tiếp giữa các giá.

Phần mềm tiếp tục gộp

Mô hình lặp lại trong các vòng MLPerf vẫn được duy trì: riêng cải tiến phần mềm đã mang lại hiệu suất cao hơn tới 1,6 lần trong các lần gửi v6.1 của NVIDIA so với v6.0 và công ty cho biết các tối ưu hóa tiếp tục được thực hiện sau thời hạn gửi v6.1, mang lại nhiều lợi ích hơn nữa.

Đối với người mua, hàm ý là một giá đỡ nhất định sẽ nhanh hơn trong suốt thời gian sử dụng mà không cần làm mới phần cứng - NVIDIA năng động đã từng lập luận rằng cơ sở được cài đặt của nó sẽ tăng giá thay vì giảm giá khi ngăn xếp phần mềm trưởng thành.

Khối lượng công việc tác nhân Định hình lại điểm chuẩn

Vòng v6.1 cũng phản ánh sự thay đổi về mục đích sử dụng suy luận. NVIDIA đã chỉ ra thử nghiệm xem trước trên điểm chuẩn AgentX của SemiAnalysis, được thiết kế dựa trên các tác nhân AI có khả năng suy luận, lập kế hoạch và hành động qua nhiều bước, trong đó Vera Rubin NVL72 cho biết Vera Rubin NVL72 mang lại hiệu suất gấp 30 lần so với GB300 NVL72.

MLCommons cũng đang chuẩn bị một điểm chuẩn dành riêng cho sự thay đổi này: điểm chuẩn MLPerf Endpoints sắp tới nhằm mục đích chuẩn hóa việc đo lường khối lượng công việc suy luận tác nhân mà các bài kiểm tra thông lượng truyền thống nắm bắt kém. Khi hoạt động suy luận chuyển từ trò chuyện một lần nhắc sang phiên tác nhân dài nhiều bước, độ trễ và tính nhất quán tương tác cũng quan trọng như mã thông báo thô mỗi giây — và các điểm chuẩn đang được xây dựng lại tương ứng.

Nebius và hệ sinh thái đến sớm

Nhà cung cấp đám mây Nebius cũng đã gửi kết quả xem trước Vera Rubin NVL72, được NVIDIA nhấn mạnh là bằng chứng về hiệu suất hệ sinh thái ban đầu mạnh mẽ. Việc gửi sớm của bên thứ ba thường là dấu hiệu cho thấy các hệ thống thế hệ tiếp theo đang chuyển từ lấy mẫu trong phòng thí nghiệm sang tính khả dụng rộng rãi hơn, mặc dù cả bài đăng của NVIDIA và bản phát hành của MLCommons đều không chỉ định thời gian có sẵn chung.

Tại sao nó quan trọng đối với kinh tế AI

NVIDIA định hình kết quả theo khía cạnh doanh thu: mỗi giá Vera Rubin NVL72 tạo ra nhiều mã thông báo hơn đáng kể, phục vụ nhiều người dùng hơn và giảm chi phí cho mỗi mã thông báo so với giá GB300 NVL72. Trong một ngành mà nhu cầu suy luận đang được thúc đẩy bởi các mô hình lý luận và khối lượng công việc của tác nhân tiêu thụ nhiều đơn đặt hàng điện toán cho mỗi truy vấn hơn so với trò chuyện đơn giản, thông lượng trên mỗi giá là con số xác định số lượng người dùng mà ngân sách trung tâm dữ liệu cố định có thể phục vụ.

Áp dụng những lưu ý thông thường: đây là những bài gửi của nhà cung cấp trong vòng xem trước, trên hai mẫu máy do NVIDIA chọn, với các tính năng tối ưu hóa vẫn đang được cập nhật. Nhưng hướng đi là rõ ràng. Cái nhìn đầu tiên của MLPerf về Vera Rubin cho thấy sự gia tăng hiệu suất đã xác định cơ sở hạ tầng AI kể từ năm 2023 không có dấu hiệu ổn định - và chu kỳ làm mới giá đỡ tiếp theo sẽ một lần nữa thiết lập lại tính kinh tế của việc phục vụ AI trên quy mô lớn.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →