MLCommons ngrilis asil benchmark MLPerf Inference v6.1 tanggal 16 September 2026, lan judhul kasebut kalebu platform generasi sabanjure NVIDIA. Ing kiriman pratinjau sing sepisanan, sistem Vera Rubin NVL72 ngirim nganti 3.7 kaping throughput saka kapal penggedhe GB300 NVL72 NVIDIA saiki, miturut woro-woro NVIDIA, minangka sinyal awal apa tegese penerus Blackwell Ultra kanggo ekonomi inferensi AI.
Vera Rubin minangka platform pusat data NVIDIA sabanjure, dijenengi kanggo ahli astrofisika sing nyedhiyakake bukti utama kanggo masalah peteng. Asil pratinjau MLPerf minangka data kinerja publik pisanan sing diatur sacara mandiri kanggo sistem kasebut. For more context on this story, see our ongoing latest AI developments.
Angka Konco Debut
NVIDIA ngirim asil pratinjau Vera Rubin NVL72 babagan rong beban kerja sing paling nuntut ing suite v6.1: model penalaran DeepSeek-R1 lan model basa visi Qwen3-VL.
Ing Qwen3-VL, Vera Rubin NVL72 ngirim nganti 3,7 kaping luwih dhuwur tinimbang GB300 NVL72 ing offline, server lan skenario interaktif, mlaku vLLM karo kerangka inferensi sumber terbuka Dynamo NVIDIA. Ing DeepSeek-R1, nggunakake perpustakaan TensorRT-LLM NVIDIA, throughput nganti 2.5 kaping luwih dhuwur tinimbang kapal penggedhe sadurunge.
Kaloro tokoh kasebut asale saka kiriman NVIDIA dhewe menyang Divisi Tertutup MLCommons, tegese padha diprodhuksi miturut aturan sing diaudit MLPerf, sanajan asil pratinjau kanthi jelas minangka pangukuran awal saka platform sing isih dioptimalake.
Carane Gain Dibangun
NVIDIA ngubungake lompat menyang desain co-tumpukan lengkap ing hardware lan piranti lunak tinimbang komponen siji.
Ing sisih silikon, Vera Rubin ndadekke Tensor Cores sing ditingkatake lan Mesin Transformer sing dianyari sing nyepetake loro tahapan inferensi - fase prefill-heavy komputasi lan fase decode terikat memori. Platform kasebut gumantung ing presisi NVFP4, sing nyuda jejak memori saka bobot model, perhatian lan cache KV, ngunggahake throughput karo apa sing digambarake NVIDIA minangka kualitas output minimal.
Ing sisih piranti lunak, kiriman kasebut nggunakake porsi sing dipisahake, sing misahake prefill lan decode menyang tugas sing beda-beda, bebarengan karo paralelisme ahli skala gedhe kanggo njaga campuran lapisan pakar ing model kaya DeepSeek-R1 lan Qwen3-VL kanthi kebak karya.
Interkoneksi minangka pilar katelu. Desain rak NVL72 ngubungake 72 GPU dadi domain skala siji kanthi nggunakake NVLink lan NVLink Switch generasi kaping enem, sing dikandhakake NVIDIA ngirim tarif paket 10 kaping luwih dhuwur lan latensi kaping 3 luwih murah tinimbang Ethernet sing ora ana rak - pondasi sing nggawe porsi sing dipisahake skala rak praktis.
GB300 Nuduhake Scaling Near-Sampurna
Kapal penggedhe saiki duwe warta dhewe ing babak v6.1. Pangiriman DeepSeek-R1 NVIDIA digawe saka rak siji GB300 NVL72 - 72 GPU - dadi papat rak, 288 GPU, entuk efisiensi skala 99 persen ing skenario offline, kanthi throughput sing meh padha karo hardware sing ditambahake.
Efisiensi skala minangka operator pusat data metrik sing diawasi kanthi teliti amarga nemtokake manawa tuku hardware luwih akeh tuku kapasitas sing luwih proporsional. Skala cedhak-linear ing rak nuduhake bottleneck ing skala iki tetep kinerja saben-GPU tinimbang komunikasi antar-rak.
Piranti Lunak Tansah Compounding
A pola ambalan ing MLPerf babak dianakaké maneh: dandan lunak piyambak dikirim munggah 1,6 kinerja kaping luwih ing NVIDIA v6.1 kiriman dibandhingake karo v6.0, lan perusahaan ngandika Optimizations terus kanggo nampa sawise deadline pengajuan v6.1, ngirim luwih hasil.
Kanggo para panuku, implikasi kasebut yaiku rak sing diwenehake bakal luwih cepet sajrone umure tanpa refresh hardware - NVIDIA dinamis wis digunakake kanggo mbantah manawa basis sing diinstal luwih dihargai tinimbang depresiasi nalika tumpukan piranti lunak wis diwasa.
Beban Kerja Agentik Nggawe Tolok ukur
Babak v6.1 uga nggambarake owah-owahan ing inferensi apa sing digunakake. NVIDIA nuding pratinjau tes ing benchmark AgentX SemiAnalysis, dirancang ing sekitar agen AI sing alasan, ngrancang lan tumindak ing pirang-pirang langkah, ing ngendi Vera Rubin NVL72 ngirim 30 kaping kinerja GB300 NVL72.
MLCommons uga nyiapake pathokan khusus kanggo owah-owahan iki: pathokan MLPerf Endpoints sing bakal teka tujuane kanggo nggawe standarisasi pangukuran beban kerja inferensi agen sing ora bisa ditampa dening tes throughput tradisional. Nalika inferensi pindhah saka obrolan siji-cepet menyang sesi agen multi-langkah sing dawa, latensi lan konsistensi interaktif penting kaya token mentah per detik - lan pathokan dibangun maneh.
Nebius lan Ekosistem Teka Awal
Panyedhiya awan Nebius uga ngirim asil pratinjau Vera Rubin NVL72, sing NVIDIA disorot minangka bukti kinerja ekosistem awal sing kuwat. Kiriman pihak katelu awal biasane minangka tandha manawa sistem generasi sabanjure pindhah saka sampling lab menyang kasedhiyan sing luwih akeh, sanajan kiriman NVIDIA utawa rilis MLCommons ora nemtokake wektu kasedhiyan umum.
Napa Penting kanggo Ekonomi AI
NVIDIA pigura asil ing istilah revenue: saben rak Vera Rubin NVL72 ngasilake token Ngartekno luwih, serves liyane kedhaftar lan murah biaya saben token relatif kanggo rak GB300 NVL72. Ing industri ing ngendi panjaluk inferensi didorong dening model pertimbangan lan beban kerja agen sing ngonsumsi pesenan kanthi ukuran luwih akeh saben pitakon tinimbang obrolan sing prasaja, throughput saben rak minangka nomer sing nemtokake jumlah pangguna sing bisa dilayani kanthi anggaran pusat data tetep.
Caveats biasane ditrapake: iki minangka kiriman vendor ing babak pratinjau, ing rong model sing dipilih dening NVIDIA, kanthi optimasi isih ndharat. Nanging arahe ora jelas. Pandangan pertama MLPerf ing Vera Rubin nuduhake pendakian kinerja sing wis nemtokake infrastruktur AI wiwit 2023 ora ana dataran tinggi - lan siklus refresh rak sabanjure bakal ngreset ekonomi layanan AI kanthi skala.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →