Nvidia har satt sin Groq 3 LPX interaktiva inferensaccelerator i full produktion, meddelade företaget den 24 augusti 2026 under Hot Chips-konferensen. Chipet, en förlängning av Nvidias Vera Rubin-plattform, levererade rekord med 3 400 output-tokens per sekund i artificiell analys-benchmarking samtidigt som den körde Gemma 4 31B-modellen med öppen källkod med ett aktivt 100 000-token kontextfönster - den snabbaste prestandan som någonsin registrerats för den modellen.

Lanseringen markerar den viktigaste produktmilstolpen hittills från Nvidias förvärv för 20 miljarder dollar av slutledningsspecialisten Groq, en affär som företaget nu går för att dra nytta av när efterfrågan på slutledningar med låg latens ökar. CNBC rapporterade att Nvidia säger att de första Groq-ställen kommer att vara online före årets slut. För mer sammanhang om den här historien, se vår pågående AI-industribevakning.

Varför Token Generation Speed spelar roll

Agentiska AI-system – program som resonerar, anropar verktyg, skriver och testar kod och upprepar hundratals eller tusentals slutledningssteg – genererar enorma volymer av utdatatokens. Den hastighet med vilken dessa tokens produceras, känd som interaktivitet eller avkodningsgenomströmning, avgör hur snabbt en agent kan slutföra varje steg i sitt arbete.

Nvidia säger att Groq 3 LPX ger 4 gånger snabbare respons för agenter och latenskänsliga arbetsbelastningar än den närmaste alternativa plattformen. I heterogena distributioner hanterar Vera Rubin NVL72-system kontextintag och prefill-beräkning, medan Groq 3 LPX-enheter bearbetar den latenskänsliga tokengenereringsfasen.

"Inferens är tillväxtmotorn för AI", sa Jensen Huang, grundare och VD för Nvidia, i tillkännagivandet. "Vera Rubin utökar den visionen med arbetsbelastningsoptimerade AI-fabrikskonfigurationer designade för en tidevarv av agent AI, och flyttar fram prestandagränsen med LPX för ultrasnabb tokengenerering."

Inuti hårdvaran

Enligt StorageReviews tekniska analys har varje 2U vätskekyld datorbricka sexton Groq 3 LPU:er tillsammans med en värd-CPU, tygexpansionslogik och DRAM, plus antingen en BlueField-4 DPU eller ett ConnectX-9-nätverkskort. Brickan har 32 LPU-chip-till-chip optiska länkar och 400 Gb/s Ethernet på frontpanelen.

I rackskala innehåller en Groq 3 LPX-installation upp till 256 LP30-acceleratorer sammanlänkade via höghastighets direkt chip-till-chip-kopplingar. Racken passar in i Nvidias bredare Vera Rubin AI-fabriksinfrastruktur, som företaget beskriver som sin mest omfattande plattform någonsin: sju diskreta chips över fem specialbyggda rackkonfigurationer, inklusive BlueField-4 DPU: er, Vera CPU-rack, Vera BlueField-4 STX-lagring och Spectrum-6 SPX Ethernet-nätverk.

Nvidia uppdaterade också sina prestandakrav på plattformsnivå, och angav att Vera Rubin NVL72 levererar upp till 30 gånger token-genomströmningen per megawatt jämfört med GB300 NVL72 på en 140 000 tokens agentkodningsarbetsbelastning, med fördelen som ökar när interaktivitetsmålen per användare ökar.

Ett riktmärke med en asterisk

Rubriken 3 400 tokens per sekund kommer med en varning värd att notera. Som StorageReview påpekade, mättes Nvidias resultat på en privat pre-release endpoint den 21 augusti, medan de konkurrerande siffrorna det jämfördes mot kom från live-serverlösa produktionsslutpunkter. Den verkliga prestandan på allmänt tillgängliga tjänster kan skilja sig från konfigurationen för rekordsättning av benchmark.

Ändå registrerade den oberoende benchmarkingorganisationen Artificiell analys resultatet som det snabbaste som någonsin uppmätts för Gemma 4 31B vid den kontextlängden, och det underliggande påståendet – att specialbyggt kisel dramatiskt kan påskynda avkodningsfasen av slutledning – stämmer överens med hur branschen har omarbetat för agentiska arbetsbelastningar.

Molnadoption börjar

Nebius, AI-molnet med huvudkontor i Amsterdam, är den första leverantören som åtar sig att distribuera Groq 3 LPX och planerar att ta in den i Nebius Token Factory, dess produktionsinferensplattform.

"Generation är den fas av slutledning som avgör hur lyhört ett AI-system faktiskt är, och det är precis vad NVIDIA Groq 3 LPX är byggd för att accelerera", säger Danila Shtan, teknikchef på Nebius. "Som det första AI-molnet som tar det till produktion via Nebius Token Factory, ser vi till att varje steg i en agents loop känns omedelbart – genom samma API som utvecklare redan använder, utan migrering till en ny stack."

Inferensleverantören Groq, nu en del av Nvidia-familjen, planerar att vara bland plattformens tidigaste användare.

Den större bilden

Meddelandet om full produktion signalerar hur kraftigt marknaden för AI-infrastruktur har svängt från träning till slutledning. När företag skiftar budgetar från förträning av råmodeller till realtidsresonemang och autonom agentorkestrering, har ekonomin för en token – hur snabbt den kan genereras och till vilken energikostnad – blivit den centrala konkurrenskraftiga slagfältet.

För Nvidia utökar Groq 3 LPX ett försvar av sin AI-fabriksfranchise i ett ögonblick då anpassat kisel från molnleverantörer och startups jagar samma agentiska slutledningsarbetsbelastningar. Rack som kommer online i år, som CNBC rapporterade, skulle sätta de första produktionssystemen i kundernas händer månader efter att förvärvet stängdes - en snabb integration av halvledarindustristandarder.

Företaget avslöjade inte priserna för de nya systemen. Groq 3 LPX kommer att erbjudas på en när-och-om-tillgänglig basis genom AI-molnpartners, med Nebius förväntas vara den första att erbjuda åtkomst till utvecklare genom sina befintliga API-slutpunkter.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →