Nvidia heeft zijn Groq 3 LPX interactieve inferentieversneller volledig in productie genomen, zo maakte het bedrijf op 24 augustus 2026 bekend tijdens de Hot Chips-conferentie. De chip, een uitbreiding van Nvidia's Vera Rubin-platform, leverde een recordaantal van 3.400 outputtokens per seconde in Artificial Analysis-benchmarking terwijl het open-source Gemma 4 31B-model draaide met een actief contextvenster van 100.000 tokens - de snelste prestatie ooit voor dat model.

De lancering markeert de belangrijkste productmijlpaal tot nu toe na Nvidia's overname van inferentiespecialist Groq ter waarde van $20 miljard, een deal waar het bedrijf nu op wil inspelen nu de vraag naar inferentie met lage latentie stijgt. CNBC meldde dat Nvidia zegt dat de eerste Groq-racks voor het einde van het jaar online zullen zijn. Voor meer context over dit verhaal, zie onze voortdurende AI-industrieverslaggeving.

Waarom de snelheid van tokengeneratie belangrijk is

Agentische AI-systemen – programma's die redeneren, tools aanroepen, code schrijven en testen en honderden of duizenden gevolgtrekkingsstappen doorlopen – genereren enorme hoeveelheden uitvoertokens. De snelheid waarmee deze tokens worden geproduceerd, bekend als interactiviteit of decoderingsdoorvoer, bepaalt hoe snel een agent elke stap van zijn werk kan voltooien.

Nvidia zegt dat Groq 3 LPX een vier keer snellere respons biedt voor agents en latentiegevoelige workloads dan het dichtstbijzijnde alternatieve platform. In heterogene implementaties verwerken Vera Rubin NVL72-systemen contextopname en prefill-berekeningen, terwijl Groq 3 LPX-eenheden de latentiegevoelige tokengeneratiefase verwerken.

"Inference is de groeimotor van AI", zei Jensen Huang, oprichter en CEO van Nvidia, in de aankondiging. "Vera Rubin breidt die visie uit met voor de werklast geoptimaliseerde AI-fabrieksconfiguraties die zijn ontworpen voor het tijdperk van agentische AI, en verleggen de prestatiegrens met LPX voor ultrasnelle tokengeneratie."

Binnenin de hardware

Volgens de technische analyse van StorageReview bevat elke 2U vloeistofgekoelde compute tray zestien Groq 3 LPU's naast een host-CPU, fabric-uitbreidingslogica en DRAM, plus een BlueField-4 DPU of een ConnectX-9-netwerkkaart. De lade is voorzien van 32 LPU chip-naar-chip optische links en 400Gb/s Ethernet op het voorpaneel.

Op rackschaal omvat een Groq 3 LPX-implementatie maximaal 256 LP30-accelerators die met elkaar zijn verbonden via snelle, directe chip-naar-chip-verbindingen. De racks passen in Nvidia's bredere Vera Rubin AI-fabrieksinfrastructuur, die het bedrijf beschrijft als het meest uitgebreide platform ooit: zeven afzonderlijke chips verdeeld over vijf speciaal gebouwde rackconfiguraties, waaronder BlueField-4 DPU's, Vera CPU-racks, Vera BlueField-4 STX-opslag en Spectrum-6 SPX Ethernet-netwerken.

Nvidia heeft ook zijn prestatieclaims op platformniveau vernieuwd en stelt dat Vera Rubin NVL72 tot 30 keer de tokendoorvoer per megawatt levert vergeleken met GB300 NVL72 op een agentische coderingswerklast van 140.000 tokens, waarbij het voordeel groter wordt naarmate de interactiviteitsdoelen per gebruiker stijgen.

Een benchmark met een asterisk

Het kopcijfer van 3.400 tokens per seconde komt met een voorbehoud dat het vermelden waard is. Zoals StorageReview opmerkte, werd het resultaat van Nvidia gemeten op een privé pre-release-eindpunt op 21 augustus, terwijl de concurrerende cijfers waarmee het werd vergeleken afkomstig waren van live serverloze productie-eindpunten. De prestaties in de praktijk op algemeen beschikbare services kunnen afwijken van de recordbenchmarkconfiguratie.

Toch registreerde de onafhankelijke benchmarkingorganisatie Artificial Analysis het resultaat als het snelste ooit gemeten voor Gemma 4 31B bij die contextlengte, en de onderliggende bewering – dat speciaal gebouwd silicium de decodeerfase van gevolgtrekking dramatisch kan versnellen – komt overeen met de manier waarop de industrie zich opnieuw heeft ingericht voor agentische werklasten.

Cloudadoptie begint

Nebius, de AI-cloud met het hoofdkantoor in Amsterdam, is de eerste provider die zich ertoe verbindt Groq 3 LPX in te zetten en van plan is deze in Nebius Token Factory, het productie-inferentieplatform, te brengen.

"Generatie is de fase van gevolgtrekking die bepaalt hoe responsief een AI-systeem feitelijk is, en dat is precies wat NVIDIA Groq 3 LPX is gebouwd om te versnellen", zegt Danila Shtan, chief technology officer van Nebius. “Als de eerste AI-cloud die het via Nebius Token Factory in productie brengt, zorgen we ervoor dat elke stap van de loop van een agent direct aanvoelt – via dezelfde API die ontwikkelaars al gebruiken, zonder migratie naar een nieuwe stack.”

Inference-provider Groq, nu onderdeel van de Nvidia-familie, is van plan een van de eerste gebruikers van het platform te zijn.

Het grotere geheel

De aankondiging van de volledige productie geeft aan hoe scherp de AI-infrastructuurmarkt is omgeslagen van training naar gevolgtrekking. Terwijl bedrijven hun budgetten verschuiven van pre-training van onbewerkte modellen naar real-time redeneren en autonome agent-orkestratie, is de economie van een token – hoe snel het kan worden gegenereerd en tegen welke energiekosten – het centrale concurrentiestrijdtoneel geworden.

Voor Nvidia breidt Groq 3 LPX de verdediging van zijn AI-fabrieksfranchise uit op een moment waarop op maat gemaakt silicium van zowel cloudproviders als startups dezelfde agentische gevolgtrekkingswerklasten najaagt. Racks die dit jaar online komen, zouden, zoals CNBC meldde, maanden na de overname de eerste productiesystemen in handen van klanten brengen – een snelle integratie volgens standaarden uit de halfgeleiderindustrie.

Het bedrijf heeft geen prijzen voor de nieuwe systemen bekendgemaakt. Groq 3 LPX zal worden aangeboden wanneer en wanneer beschikbaar via AI-cloudpartners, waarbij Nebius naar verwachting de eerste zal zijn die toegang biedt aan ontwikkelaars via de bestaande API-eindpunten.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →