Nvidia a mis en pleine production son accélérateur d'inférence interactif Groq 3 LPX, a annoncé la société le 24 août 2026, lors de la conférence Hot Chips. La puce, une extension de la plate-forme Vera Rubin de Nvidia, a fourni un record de 3 400 jetons de sortie par seconde lors de l'analyse comparative d'analyse artificielle tout en exécutant le modèle open source Gemma 4 31B avec une fenêtre contextuelle active de 100 000 jetons – la performance la plus rapide jamais enregistrée pour ce modèle.

Ce lancement marque l'étape la plus importante depuis l'acquisition par Nvidia du spécialiste de l'inférence Groq pour 20 milliards de dollars, un accord sur lequel la société s'apprête maintenant à capitaliser alors que la demande d'inférence à faible latence augmente. CNBC a rapporté que Nvidia avait annoncé que les premiers racks Groq seraient en ligne avant la fin de l'année. Pour plus de contexte sur cette histoire, consultez notre couverture continue de l'industrie de l'IA.

Pourquoi la vitesse de génération de jetons est importante

Les systèmes d'IA agentique (des programmes qui raisonnent, appellent des outils, écrivent et testent du code et itèrent sur des centaines ou des milliers d'étapes d'inférence) génèrent d'énormes volumes de jetons de sortie. La vitesse à laquelle ces jetons sont produits, appelée interactivité ou débit de décodage, détermine la rapidité avec laquelle un agent peut terminer chaque étape de son travail.

Nvidia affirme que Groq 3 LPX offre une réactivité 4 fois plus rapide pour les agents et les charges de travail sensibles à la latence que la plate-forme alternative la plus proche. Dans les déploiements hétérogènes, les systèmes Vera Rubin NVL72 gèrent l'ingestion de contexte et le calcul de pré-remplissage, tandis que les unités Groq 3 LPX traitent la phase de génération de jetons sensible à la latence.

"L'inférence est le moteur de croissance de l'IA", a déclaré Jensen Huang, fondateur et PDG de Nvidia, dans le communiqué. "Vera Rubin étend cette vision avec des configurations d'usine d'IA optimisées pour la charge de travail, conçues pour l'ère de l'IA agentique, repoussant les limites des performances avec LPX pour une génération ultrarapide de jetons."

À l'intérieur du matériel

Selon l'analyse technique de StorageReview, chaque plateau de calcul 2U refroidi par liquide contient seize LPU Groq 3 ainsi qu'un processeur hôte, une logique d'extension de structure et une DRAM, ainsi qu'un DPU BlueField-4 ou une carte réseau ConnectX-9. Le plateau comprend 32 liaisons optiques puce à puce LPU et Ethernet 400 Gb/s sur le panneau avant.

À l'échelle du rack, un déploiement Groq 3 LPX intègre jusqu'à 256 accélérateurs LP30 reliés via des interconnexions puce à puce directes à haut débit. Les racks s'intègrent dans l'infrastructure d'usine Vera Rubin AI plus large de Nvidia, que la société décrit comme sa plate-forme la plus complète jamais conçue : sept puces discrètes réparties sur cinq configurations de rack spécialement conçues, y compris les DPU BlueField-4, les racks CPU Vera, le stockage Vera BlueField-4 STX et le réseau Ethernet Spectrum-6 SPX.

Nvidia a également actualisé ses affirmations en matière de performances au niveau de la plate-forme, déclarant que le Vera Rubin NVL72 offre un débit de jetons par mégawatt jusqu'à 30 fois supérieur à celui du GB300 NVL72 sur une charge de travail de codage agent de 140 000 jetons, l'avantage s'élargissant à mesure que les objectifs d'interactivité par utilisateur augmentent.

Une référence avec un astérisque

Le chiffre principal de 3 400 jetons par seconde s’accompagne d’une mise en garde qui mérite d’être notée. Comme StorageReview l'a souligné, le résultat de Nvidia a été mesuré sur un point de terminaison privé en pré-version le 21 août, tandis que les chiffres concurrents auxquels il a été comparé proviennent de points de terminaison de production sans serveur en direct. Les performances réelles sur les services généralement disponibles peuvent différer de la configuration de référence record.

Néanmoins, l'organisation d'analyse comparative indépendante, Artificial Analysis, a enregistré le résultat comme le résultat le plus rapide jamais mesuré pour Gemma 4 31B dans cette longueur de contexte, et l'affirmation sous-jacente – selon laquelle le silicium spécialement conçu peut accélérer considérablement la phase de décodage de l'inférence – correspond à la façon dont l'industrie a réorganisé les charges de travail agents.

Début de l'adoption du cloud

Nebius, le cloud d'IA dont le siège est à Amsterdam, est le premier fournisseur à s'engager à déployer Groq 3 LPX, prévoyant de l'intégrer dans Nebius Token Factory, sa plateforme d'inférence de production.

"La génération est la phase d'inférence qui détermine la réactivité réelle d'un système d'IA, et c'est exactement ce pour quoi NVIDIA Groq 3 LPX est conçu pour accélérer", a déclaré Danila Shtan, directrice de la technologie chez Nebius. « En tant que premier cloud d'IA à le mettre en production via Nebius Token Factory, nous veillons à ce que chaque étape de la boucle d'un agent soit instantanée – grâce à la même API que les développeurs utilisent déjà, sans migration vers une nouvelle pile.

Le fournisseur d'inférence Groq, qui fait désormais partie de la famille Nvidia, prévoit d'être parmi les premiers à adopter la plateforme.

Vue d'ensemble

L’annonce de la pleine production montre à quel point le marché des infrastructures d’IA est passé de la formation à l’inférence. Alors que les entreprises déplacent leurs budgets de la pré-formation des modèles bruts vers le raisonnement en temps réel et l'orchestration autonome des agents, l'économie d'un jeton (à quelle vitesse il peut être généré et à quel coût énergétique) est devenue le principal champ de bataille concurrentiel.

Pour Nvidia, Groq 3 LPX étend la défense de sa franchise d'usine d'IA à un moment où le silicium personnalisé des fournisseurs de cloud et des startups poursuit les mêmes charges de travail d'inférence agentique. Les racks mis en ligne cette année, comme l'a rapporté CNBC, mettraient les premiers systèmes de production entre les mains des clients des mois après la clôture de l'acquisition – une intégration rapide par rapport aux normes de l'industrie des semi-conducteurs.

La société n'a pas divulgué les prix des nouveaux systèmes. Groq 3 LPX sera proposé selon la disponibilité par l'intermédiaire de partenaires cloud IA, Nebius devant être le premier à offrir l'accès aux développeurs via ses points de terminaison d'API existants.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →