Nvidia și-a pus acceleratorul de inferență interactiv Groq 3 LPX în plină producție, a anunțat compania pe 24 august 2026, în timpul conferinței Hot Chips. Cipul, o extensie a platformei Vera Rubin de la Nvidia, a furnizat un record de 3.400 de jetoane de ieșire pe secundă în analiză artificială în timp ce rulează modelul open-source Gemma 4 31B cu o fereastră de context activă de 100.000 de jetoane - cea mai rapidă performanță înregistrată vreodată pentru acel model.
Lansarea marchează cea mai importantă piatră de hotar de până acum în urma achiziției de către Nvidia a specialistului în inferență Groq, în valoare de 20 de miliarde de dolari, o afacere pe care compania se mișcă acum să-l valorifice pe măsură ce cererea de inferență cu latență scăzută crește. CNBC a raportat că Nvidia spune că primele rafturi Groq vor fi online înainte de sfârșitul anului. Pentru mai mult context asupra acestei povești, consultați [acoperirea industriei AI] (https://aibuzzwire.news).
De ce este importantă viteza de generare a jetoanelor
Sistemele de inteligență artificială agentică – programe care motivează, apelează instrumente, scriu și testează cod și repetă în sute sau mii de pași de inferență – generează volume enorme de jetoane de ieșire. Viteza cu care sunt produse acele jetoane, cunoscută sub numele de interactivitate sau decodare, determină cât de repede un agent poate finaliza fiecare pas al activității sale.
Nvidia spune că Groq 3 LPX oferă o capacitate de răspuns de 4 ori mai rapidă pentru agenți și sarcini de lucru sensibile la latență decât cea mai apropiată platformă alternativă. În implementările eterogene, sistemele Vera Rubin NVL72 se ocupă de asimilarea contextului și calculul pre-completare, în timp ce unitățile Groq 3 LPX procesează faza de generare a token-ului sensibilă la latență.
„Inferența este motorul de creștere al inteligenței artificiale”, a spus Jensen Huang, fondatorul și CEO-ul Nvidia, în anunț. „Vera Rubin extinde această viziune cu configurații din fabrică AI optimizate pentru volumul de muncă, concepute pentru era AI agentic, avansând frontiera performanței cu LPX pentru generarea de token-uri ultrarapide.”
În interiorul hardware-ului
Conform analizei tehnice a StorageReview, fiecare tavă de calcul 2U răcită cu lichid transportă șaisprezece LPU-uri Groq 3 alături de un procesor gazdă, logica de expansiune a fabricii și DRAM, plus un DPU BlueField-4 sau o placă de rețea ConnectX-9. Tava are 32 de conexiuni optice cip la cip LPU și Ethernet de 400 Gb/s pe panoul frontal.
La scară de rack, o implementare Groq 3 LPX încorporează până la 256 de acceleratoare LP30 conectate prin interconexiuni directe de mare viteză cip la cip. Rack-urile se încadrează în infrastructura mai largă a fabricii Vera Rubin AI a Nvidia, pe care compania o descrie ca fiind cea mai extinsă platformă de până acum: șapte cipuri discrete în cinci configurații de rack special create, inclusiv DPU-uri BlueField-4, rafturi CPU Vera, stocare Vera BlueField-4 STX și rețea Spectrum-6 SPX Ethernet.
Nvidia și-a actualizat, de asemenea, afirmațiile de performanță la nivel de platformă, declarând că Vera Rubin NVL72 oferă de până la 30 de ori mai mult debitul de token per megawatt, comparativ cu GB300 NVL72, pe o sarcină de lucru de codificare agentică de 140.000 de jetoane, avantajul crescând odată cu creșterea țintelor de interactivitate per utilizator.
Un punct de referință cu un asterisc
Cifra de titlu de 3.400 de jetoane pe secundă vine cu o avertizare demnă de remarcat. După cum a subliniat StorageReview, rezultatul Nvidia a fost măsurat pe un punct final privat de pre-lansare pe 21 august, în timp ce numerele concurente cu care a fost comparat provin de la punctele finale de producție live fără server. Performanța din lumea reală a serviciilor disponibile în general poate diferi de configurația de referință pentru stabilirea recordurilor.
Totuși, organizația independentă de analiză comparativă Artificial Analysis a înregistrat rezultatul ca fiind cel mai rapid măsurat vreodată pentru Gemma 4 31B la acea lungime de context, iar afirmația subiacentă - că siliciul special creat poate accelera dramatic faza de decodificare a inferenței - se aliniază cu modul în care industria a re-arhitectat sarcinile de lucru agentice.
Începe adopția în cloud
Nebius, cloud-ul AI cu sediul la Amsterdam, este primul furnizor care s-a angajat să implementeze Groq 3 LPX, plănuind să-l aducă în Nebius Token Factory, platforma sa de inferență de producție.
„Generarea este faza de inferență care determină cât de receptiv este de fapt un sistem AI și exact pentru asta este construit NVIDIA Groq 3 LPX pentru a accelera”, a declarat Danila Shtan, director de tehnologie al Nebius. „Fiind primul cloud AI care îl aduce în producție prin Nebius Token Factory, ne asigurăm că fiecare pas al buclei unui agent se simte instantaneu – prin același API pe care dezvoltatorii îl folosesc deja, fără a trece la o nouă stivă.”
Furnizorul de inferențe Groq, care acum face parte din familia Nvidia, plănuiește să fie printre primii care au adoptat platforma.
Imaginea de ansamblu
Anunțul de producție completă semnalează cât de puternic a evoluat piața infrastructurii AI de la instruire la inferență. Pe măsură ce întreprinderile schimbă bugetele de la modelul brut de pregătire preliminară la raționamentul în timp real și orchestrarea agenților autonomi, economia unui simbol - cât de repede poate fi generat și cu ce costuri de energie - a devenit câmpul de luptă competitiv central.
Pentru Nvidia, Groq 3 LPX extinde o apărare a francizei sale de fabrică AI într-un moment în care siliciul personalizat de la furnizorii de cloud și startup-urile urmărește aceleași sarcini de lucru de inferență agentică. Rackurile care vin online în acest an, după cum a raportat CNBC, ar pune primele sisteme de producție în mâinile clienților la câteva luni după încheierea achiziției - o integrare rapidă a standardelor industriei semiconductoarelor.
Compania nu a dezvăluit prețurile pentru noile sisteme. Groq 3 LPX va fi oferit când și dacă este disponibil prin partenerii cloud AI, Nebius fiind așteptat să fie primul care să ofere acces dezvoltatorilor prin punctele sale finale API existente.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citește mai multe știri AI →