Nvidia ha messo in piena produzione il suo acceleratore di inferenza interattiva Groq 3 LPX, ha annunciato la società il 24 agosto 2026 durante la conferenza Hot Chips. Il chip, un'estensione della piattaforma Vera Rubin di Nvidia, ha fornito un record di 3.400 token di output al secondo nel benchmarking di analisi artificiale durante l'esecuzione del modello open source Gemma 4 31B con una finestra di contesto attiva di 100.000 token: la prestazione più veloce mai registrata per quel modello.
Il lancio segna la pietra miliare di prodotto più significativa finora dall'acquisizione da 20 miliardi di dollari da parte di Nvidia dello specialista in inferenza Groq, un accordo che la società si sta ora muovendo per capitalizzare poiché la domanda di inferenza a bassa latenza aumenta. La CNBC ha riferito che Nvidia afferma che i primi rack Groq saranno online entro la fine dell'anno. Per ulteriori informazioni su questa storia, consulta la nostra copertura del settore dell'intelligenza artificiale in corso.
Perché la velocità di generazione dei token è importante
I sistemi di intelligenza artificiale agentica (programmi che ragionano, richiamano strumenti, scrivono e testano codice ed eseguono iterazioni su centinaia o migliaia di passaggi di inferenza) generano enormi volumi di token di output. La velocità con cui vengono prodotti questi token, nota come interattività o throughput di decodifica, determina la velocità con cui un agente può completare ogni fase del suo lavoro.
Nvidia afferma che Groq 3 LPX fornisce una reattività 4 volte più rapida per agenti e carichi di lavoro sensibili alla latenza rispetto alla piattaforma alternativa più vicina. Nelle distribuzioni eterogenee, i sistemi Vera Rubin NVL72 gestiscono l'inserimento del contesto e il calcolo della precompilazione, mentre le unità Groq 3 LPX elaborano la fase di generazione del token sensibile alla latenza.
"L'inferenza è il motore della crescita dell'intelligenza artificiale", ha affermato nell'annuncio Jensen Huang, fondatore e CEO di Nvidia. "Vera Rubin estende questa visione con configurazioni di fabbrica AI ottimizzate per il carico di lavoro progettate per l'era dell'intelligenza artificiale ad agenti, facendo avanzare la frontiera delle prestazioni con LPX per la generazione di token ultraveloce."
All'interno dell'hardware
Secondo l'analisi tecnica di StorageReview, ogni vassoio di elaborazione raffreddato a liquido 2U trasporta sedici LPU Groq 3 insieme a una CPU host, logica di espansione del tessuto e DRAM, oltre a una DPU BlueField-4 o una scheda di rete ConnectX-9. Il vassoio è dotato di 32 collegamenti ottici chip-to-chip LPU e Ethernet da 400 Gb/s sul pannello frontale.
Su scala rack, un'implementazione Groq 3 LPX incorpora fino a 256 acceleratori LP30 collegati tramite interconnessioni dirette chip-to-chip ad alta velocità. I rack si inseriscono nella più ampia infrastruttura di fabbrica AI Vera Rubin di Nvidia, che l'azienda descrive come la sua piattaforma più estesa di sempre: sette chip discreti in cinque configurazioni rack appositamente realizzate, tra cui DPU BlueField-4, rack CPU Vera, storage Vera BlueField-4 STX e rete Ethernet Spectrum-6 SPX.
Nvidia ha inoltre aggiornato le sue dichiarazioni sulle prestazioni a livello di piattaforma, affermando che Vera Rubin NVL72 offre fino a 30 volte il throughput di token per megawatt rispetto a GB300 NVL72 su un carico di lavoro di codifica agentic di 140.000 token, con un vantaggio che aumenta man mano che aumentano gli obiettivi di interattività per utente.
Un punto di riferimento con un asterisco
La cifra principale di 3.400 token al secondo comporta un avvertimento degno di nota. Come ha sottolineato StorageReview, il risultato di Nvidia è stato misurato su un endpoint privato pre-release il 21 agosto, mentre i numeri concorrenti con cui è stato confrontato provengono da endpoint di produzione serverless live. Le prestazioni nel mondo reale sui servizi generalmente disponibili potrebbero differire dalla configurazione del benchmark da record.
Tuttavia, l’organizzazione indipendente di benchmarking Artificial Analysis ha registrato il risultato come il più veloce mai misurato per Gemma 4 31B a quella lunghezza di contesto, e l’affermazione di fondo – che il silicio appositamente costruito può accelerare notevolmente la fase di decodifica dell’inferenza – è in linea con il modo in cui il settore ha riprogettato i carichi di lavoro degli agenti.
Inizia l'adozione del cloud
Nebius, il cloud AI con sede ad Amsterdam, è il primo fornitore a impegnarsi nell'implementazione di Groq 3 LPX, pianificando di portarlo in Nebius Token Factory, la sua piattaforma di inferenza di produzione.
"La generazione è la fase di inferenza che determina quanto sia effettivamente reattivo un sistema AI, ed è esattamente ciò per cui NVIDIA Groq 3 LPX è stato progettato per accelerare", ha affermato Danila Shtan, chief technology officer di Nebius. "Essendo il primo cloud AI che lo porta in produzione tramite Nebius Token Factory, ci stiamo assicurando che ogni passaggio del ciclo di un agente sembri istantaneo, attraverso le stesse API che gli sviluppatori stanno già utilizzando, senza migrazione a un nuovo stack."
Il fornitore di inferenze Groq, ora parte della famiglia Nvidia, prevede di essere tra i primi ad adottare la piattaforma.
Il quadro più ampio
L’annuncio della piena produzione segnala quanto bruscamente il mercato delle infrastrutture AI sia passato dalla formazione all’inferenza. Mentre le aziende spostano i budget dalla pre-formazione del modello grezzo al ragionamento in tempo reale e all’orchestrazione autonoma degli agenti, l’economia di un token – quanto velocemente può essere generato e a quale costo energetico – è diventata il campo di battaglia competitivo centrale.
Per Nvidia, Groq 3 LPX estende la difesa del suo franchising di fabbrica di intelligenza artificiale in un momento in cui il silicio personalizzato di fornitori di cloud e startup sta inseguendo gli stessi carichi di lavoro di inferenza degli agenti. I rack in arrivo quest'anno, come riportato dalla CNBC, metterebbero i primi sistemi di produzione nelle mani dei clienti mesi dopo la chiusura dell'acquisizione: una rapida integrazione secondo gli standard del settore dei semiconduttori.
La società non ha rivelato i prezzi per i nuovi sistemi. Groq 3 LPX sarà offerto in base alla disponibilità attraverso i partner cloud AI, con Nebius che dovrebbe essere il primo a offrire l'accesso agli sviluppatori attraverso i suoi endpoint API esistenti.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →