Nvidia uvedla svůj interaktivní akcelerátor Groq 3 LPX do plné produkce, oznámila společnost 24. srpna 2026 během konference Hot Chips. Čip, rozšíření platformy Vera Rubin společnosti Nvidia, poskytl rekordních 3 400 výstupních tokenů za sekundu v benchmarkingu umělé analýzy při běhu open-source modelu Gemma 4 31B s aktivním kontextovým oknem 100 000 tokenů – nejrychlejší výkon, jaký kdy byl u tohoto modelu zaznamenán.

Uvedení na trh představuje dosud nejvýznamnější produktový milník od akvizice specialisty na inference Groq společností Nvidia v hodnotě 20 miliard dolarů, což je dohoda, kterou se společnost nyní snaží využít, protože poptávka po inferencích s nízkou latencí prudce vzrostla. CNBC uvedla, že Nvidia říká, že první stojany Groq budou online do konce roku. Další kontext k tomuto příběhu najdete v našem probíhajícím [oboru AI] (https://aibuzzwire.news).

Proč na rychlosti generování tokenů záleží

Agentické systémy umělé inteligence – programy, které uvažují, volají nástroje, píší a testují kód a iterují stovky nebo tisíce kroků odvození – generují obrovské objemy výstupních tokenů. Rychlost, jakou jsou tyto tokeny vytvářeny, známá jako interaktivita nebo propustnost dekódování, určuje, jak rychle může agent dokončit každý krok své práce.

Nvidia říká, že Groq 3 LPX poskytuje 4x rychlejší odezvu pro agenty a zátěže citlivé na latenci než nejbližší alternativní platforma. V heterogenních nasazeních se systémy Vera Rubin NVL72 starají o přijímání kontextu a výpočty předvyplnění, zatímco jednotky Groq 3 LPX zpracovávají fázi generování tokenů citlivou na latenci.

„Inference je motorem růstu AI,“ uvedl v oznámení Jensen Huang, zakladatel a generální ředitel společnosti Nvidia. "Vera Rubin rozšiřuje tuto vizi o tovární konfigurace umělé inteligence optimalizované pro pracovní zatížení navržené pro éru agentní umělé inteligence, čímž posouvá hranice výkonu s LPX pro ultrarychlé generování tokenů."

Uvnitř hardwaru

Podle technické analýzy společnosti StorageReview obsahuje každý 2U kapalinou chlazený výpočetní zásobník šestnáct Groq 3 LPU spolu s hostitelským CPU, logikou rozšíření tkaniny a DRAM, plus buď BlueField-4 DPU nebo síťovou kartu ConnectX-9. Zásobník obsahuje 32 optických spojů LPU mezi čipy a 400 Gb/s Ethernet na předním panelu.

V rackovém měřítku zahrnuje nasazení Groq 3 LPX až 256 akcelerátorů LP30 propojených prostřednictvím vysokorychlostního přímého propojení mezi čipy. Racky se zapojují do širší tovární infrastruktury AI Vera Rubin společnosti Nvidia, kterou společnost popisuje jako svou nejrozsáhlejší platformu vůbec: sedm diskrétních čipů v pěti účelových konfiguracích racků, včetně BlueField-4 DPU, Vera CPU rack, Vera BlueField-4 STX úložiště a Spectrum-6 SPX Ethernetové sítě.

Nvidia také aktualizovala svá tvrzení o výkonu na úrovni platformy a uvedla, že Vera Rubin NVL72 poskytuje až 30krát vyšší propustnost tokenů na megawatt ve srovnání s GB300 NVL72 při zátěži agentního kódování se 140 000 tokeny, přičemž výhoda se rozšiřuje s rostoucími cíli interaktivity na uživatele.

Benchmark s hvězdičkou

Titulek 3 400 tokenů za sekundu přichází s upozorněním, které stojí za zmínku. Jak upozornil StorageReview, výsledek Nvidie byl měřen na soukromém koncovém bodu před vydáním 21. srpna, zatímco konkurenční čísla, se kterými byla porovnána, pocházejí z živých produkčních koncových bodů bez serveru. Reálný výkon obecně dostupných služeb se může lišit od rekordní konfigurace benchmarku.

Nezávislá srovnávací organizace Artificial Analysis přesto zaznamenala výsledek jako nejrychlejší, jaký kdy byl naměřen pro Gemma 4 31B v této délce kontextu, a základní tvrzení – že účelově vytvořený křemík může dramaticky urychlit fázi dekódování vyvozování – je v souladu s tím, jak průmysl přepracoval architekturu pro agentní pracovní zátěže.

Adopce cloudu začíná

Nebius, cloud AI se sídlem v Amsterdamu, je prvním poskytovatelem, který se zavázal k nasazení Groq 3 LPX a plánuje jej zavést do Nebius Token Factory, své produkční inferenční platformy.

„Generování je fází inference, která určuje, jak citlivý je systém AI ve skutečnosti, a to je přesně to, co je NVIDIA Groq 3 LPX navržena tak, aby akcelerovala,“ řekla Danila Shtan, hlavní technologická ředitelka společnosti Nebius. „Jako první cloud s umělou inteligencí, který to přináší do výroby prostřednictvím Nebius Token Factory, zajišťujeme, aby každý krok smyčky agenta byl okamžitý – prostřednictvím stejného rozhraní API, které vývojáři již používají, bez migrace na nový zásobník.“

Poskytovatel inferencí Groq, který je nyní součástí rodiny Nvidia, plánuje patřit mezi první uživatele platformy.

Větší obrázek

Oznámení o plné produkci signalizuje, jak prudce se trh s infrastrukturou AI otočil od školení k závěru. Vzhledem k tomu, že podniky přesouvají rozpočty od předtréninku surového modelu k uvažování v reálném čase a autonomní orchestraci agentů, ekonomika tokenu – jak rychle jej lze generovat a za jakou cenu energie – se stala ústředním konkurenčním bojištěm.

Pro Nvidii rozšiřuje Groq 3 LPX obranu své tovární franšízy AI v okamžiku, kdy vlastní křemík od poskytovatelů cloudu a začínajících firem honí stejné pracovní zátěže agentního odvození. Jak oznámila CNBC, stojany, které budou letos online, předají zákazníkům první produkční systémy měsíce po uzavření akvizice – rychlá integrace podle standardů polovodičového průmyslu.

Cenu nových systémů společnost nezveřejnila. Groq 3 LPX bude nabízen na základě dostupnosti a dostupnosti prostřednictvím cloudových partnerů AI, přičemž se očekává, že Nebius bude první, kdo nabídne přístup vývojářům prostřednictvím svých stávajících koncových bodů API.

---

Stay Ahead of AI

Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →