MLCommons a publié les résultats du benchmark MLPerf Inference v6.1 le 16 septembre 2026, et le titre appartenait à la plate-forme de nouvelle génération de NVIDIA. Dans sa toute première soumission en avant-première, le système Vera Rubin NVL72 a fourni un débit jusqu'à 3,7 fois supérieur à celui du produit phare actuel GB300 NVL72 de NVIDIA, selon l'annonce de NVIDIA, un premier signe de ce que le successeur de Blackwell Ultra signifiera pour l'économie de l'inférence de l'IA.
Vera Rubin est la prochaine plate-forme de centre de données de NVIDIA, du nom de l'astrophysicien qui a fourni des preuves clés de la matière noire. Les résultats de l'aperçu MLPerf sont les premières données de performances publiques et organisées de manière indépendante pour le système. Pour plus de contexte sur cette histoire, consultez notre plus d'articles sur l'IA.
Les chiffres derrière les débuts
NVIDIA a soumis les résultats préliminaires de Vera Rubin NVL72 sur deux des charges de travail les plus exigeantes de la suite v6.1 : le modèle de raisonnement DeepSeek-R1 et le modèle de langage de vision Qwen3-VL.
Sur Qwen3-VL, Vera Rubin NVL72 a fourni un débit jusqu'à 3,7 fois supérieur à celui du GB300 NVL72 dans des scénarios hors ligne, serveur et interactifs, en exécutant vLLM avec le cadre d'inférence open source Dynamo de NVIDIA. Sur DeepSeek-R1, utilisant la bibliothèque TensorRT-LLM de NVIDIA, le débit était jusqu'à 2,5 fois supérieur à celui du produit phare précédent.
Les deux chiffres proviennent des propres soumissions de NVIDIA à la division fermée de MLCommons, ce qui signifie qu'ils ont été produits selon les règles auditées de MLPerf, bien que les résultats de l'aperçu soient explicitement des mesures précoces d'une plate-forme encore en cours d'optimisation.
Comment les gains sont construits
NVIDIA attribue le saut à la co-conception full-stack sur le matériel et les logiciels plutôt qu'à un seul composant.
Du côté du silicium, Vera Rubin apporte des cœurs Tensor améliorés et un moteur de transformateur mis à jour qui accélèrent les deux étapes d'inférence : la phase de pré-remplissage gourmande en calcul et la phase de décodage liée à la mémoire. La plate-forme s'appuie sur la précision NVFP4, qui réduit l'empreinte mémoire des poids des modèles, de l'attention et du cache KV, augmentant ainsi le débit avec ce que NVIDIA décrit comme une perte minimale de qualité de sortie.
Du côté logiciel, les soumissions utilisaient un service désagrégé, qui sépare le pré-remplissage et le décodage en différentes tâches, ainsi qu'un parallélisme expert à grande échelle pour que le mélange de couches d'experts dans des modèles comme DeepSeek-R1 et Qwen3-VL soit pleinement alimenté en travail.
L'interconnexion est le troisième pilier. La conception du rack NVL72 relie 72 GPU dans un seul domaine évolutif à l'aide de NVLink et de NVLink Switch de sixième génération, qui, selon NVIDIA, offrent des débits de paquets 10 fois plus élevés et une latence 3 fois inférieure à celle d'Ethernet standard - la base qui rend pratique le service désagrégé à l'échelle du rack.
GB300 affiche une mise à l'échelle presque parfaite
Le produit phare actuel a eu ses propres nouveautés dans la version v6.1. La soumission DeepSeek-R1 de NVIDIA est passée d'un seul rack GB300 NVL72 (72 GPU) à quatre racks, 288 GPU, atteignant une efficacité de mise à l'échelle de 99 % dans le scénario hors ligne, avec un débit augmentant presque proportionnellement au matériel ajouté.
L'efficacité de la mise à l'échelle est une mesure que les opérateurs de centres de données surveillent de près, car elle détermine si l'achat de plus de matériel permet réellement d'acheter proportionnellement plus de capacité. Une mise à l'échelle quasi linéaire entre les racks suggère que le goulot d'étranglement à cette échelle reste les performances par GPU plutôt que la communication entre racks.
Le logiciel continue de s'aggraver
Un modèle récurrent dans les cycles MLPerf s'est encore maintenu : les améliorations logicielles à elles seules ont permis d'obtenir des performances jusqu'à 1,6 fois supérieures dans les soumissions v6.1 de NVIDIA par rapport à la v6.0, et la société affirme que les optimisations ont continué à arriver après la date limite de soumission de la v6.1, offrant ainsi des gains supplémentaires.
Pour les acheteurs, l'implication est qu'un rack donné devient plus rapide au cours de sa durée de vie sans actualisation matérielle – une dynamique NVIDIA avait l'habitude de faire valoir que sa base installée s'apprécie plutôt que de se déprécier à mesure que la pile logicielle mûrit.
Les charges de travail agentiques remodèlent les références
Le cycle v6.1 a également reflété un changement dans la raison pour laquelle l'inférence est utilisée. NVIDIA a souligné les tests préliminaires du benchmark AgentX de SemiAnalysis, conçu autour d'agents d'IA qui raisonnent, planifient et agissent en plusieurs étapes, où il indique que Vera Rubin NVL72 a fourni 30 fois les performances du GB300 NVL72.
MLCommons prépare également un benchmark dédié à ce changement : le prochain benchmark MLPerf Endpoints vise à standardiser la mesure des charges de travail d'inférence agentique que les tests de débit traditionnels capturent mal. À mesure que l’inférence passe d’une conversation à invite unique à de longues sessions d’agent en plusieurs étapes, la latence et la cohérence interactive comptent autant que les jetons bruts par seconde – et les références sont reconstruites en conséquence.
Nebius et l'écosystème arrivent tôt
Le fournisseur de cloud Nebius a également soumis les résultats préliminaires du Vera Rubin NVL72, que NVIDIA a soulignés comme preuve des solides performances de l'écosystème au début. Early third-party submissions are typically a sign that next-generation systems are moving from lab sampling toward broader availability, though neither NVIDIA's post nor MLCommons' release specifies general-availability timing.
Pourquoi c'est important pour l'économie de l'IA
NVIDIA présente les résultats en termes de revenus : chaque rack Vera Rubin NVL72 génère beaucoup plus de jetons, dessert plus d'utilisateurs et réduit le coût par jeton par rapport à un rack GB300 NVL72. Dans un secteur où la demande d'inférence est pilotée par des modèles de raisonnement et des charges de travail d'agent qui consomment des ordres de grandeur plus importants par requête que par simple chat, le débit par rack est le nombre qui détermine le nombre d'utilisateurs qu'un budget fixe de centre de données peut servir.
Les mises en garde habituelles s'appliquent : il s'agit de soumissions de fournisseurs lors d'un cycle de prévisualisation, sur deux modèles choisis par NVIDIA, avec des optimisations en cours d'arrivée. Mais la direction est sans ambiguïté. Le premier regard de MLPerf sur Vera Rubin suggère que l'augmentation des performances qui a défini l'infrastructure de l'IA depuis 2023 n'a pas de plateau en vue – et que le prochain cycle de rafraîchissement des racks réinitialisera à nouveau l'économie du service de l'IA à grande échelle.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →