Firma Nvidia uruchomiła pełną produkcję interaktywnego akceleratora wnioskowania Groq 3 LPX, ogłosiła 24 sierpnia 2026 roku podczas konferencji Hot Chips. Układ, stanowiący rozszerzenie platformy Vera Rubin firmy Nvidia, zapewnił rekordową prędkość 3400 tokenów wyjściowych na sekundę w testach porównawczych sztucznej analizy, działając na modelu Gemma 4 31B o otwartym kodzie źródłowym z aktywnym oknem kontekstowym na 100 000 tokenów — to najszybsza wydajność, jaką kiedykolwiek zarejestrowano dla tego modelu.
Wprowadzenie na rynek stanowi najważniejszy kamień milowy w dotychczasowej historii produktu od przejęcia przez firmę Nvidia firmy specjalizującej się w wnioskowaniu za 20 miliardów dolarów, a firma zamierza teraz wykorzystać tę transakcję w związku ze wzrostem zapotrzebowania na wnioskowanie o niskim opóźnieniu. CNBC podało, że Nvidia twierdzi, że pierwsze stojaki Groq będą dostępne w Internecie przed końcem roku. Więcej kontekstu tej historii znajdziesz w naszych bieżących reportażach z branży AI.
Dlaczego szybkość generowania tokenów ma znaczenie
Systemy agentycznej sztucznej inteligencji — programy, które rozumują, wywołują narzędzia, piszą i testują kod oraz wykonują iterację po setkach lub tysiącach kroków wnioskowania — generują ogromne ilości tokenów wyjściowych. Szybkość tworzenia tych tokenów, zwana interaktywnością lub przepustowością dekodowania, określa, jak szybko agent może ukończyć każdy etap swojej pracy.
Nvidia twierdzi, że Groq 3 LPX zapewnia 4 razy szybszą reakcję dla agentów i obciążeń wrażliwych na opóźnienia niż najbliższa alternatywna platforma. W przypadku wdrożeń heterogenicznych systemy Vera Rubin NVL72 obsługują pozyskiwanie kontekstu i wstępne obliczenia, podczas gdy jednostki Groq 3 LPX przetwarzają fazę generowania tokenu wrażliwego na opóźnienia.
„Inferencja jest motorem rozwoju sztucznej inteligencji” – stwierdził w ogłoszeniu Jensen Huang, założyciel i dyrektor generalny Nvidii. „Vera Rubin poszerza tę wizję o konfiguracje fabryczne AI zoptymalizowane pod kątem obciążenia pracą, zaprojektowane z myślą o erze agentycznej sztucznej inteligencji, przesuwając granicę wydajności dzięki LPX w celu ultraszybkiego generowania tokenów”.
Wewnątrz sprzętu
Według analizy technicznej StorageReview każda chłodzona cieczą taca obliczeniowa o wysokości 2U mieści szesnaście jednostek LPU Groq 3 wraz z procesorem hosta, logiką rozbudowy sieci i pamięcią DRAM, a także kartą sieciową BlueField-4 DPU lub ConnectX-9. Taca zawiera łącza optyczne typu chip-chip z 32 jednostkami LPU i złącze Ethernet 400 Gb/s na panelu przednim.
W skali szafy wdrożenie Groq 3 LPX obejmuje do 256 akceleratorów LP30 połączonych szybkimi, bezpośrednimi połączeniami między chipami. Szafy wpasowują się w szerszą infrastrukturę fabryczną Vera Rubin AI firmy Nvidia, którą firma opisuje jako najbardziej rozbudowaną platformę w historii: siedem dyskretnych chipów w pięciu specjalnie zaprojektowanych konfiguracjach szaf, w tym moduły DPU BlueField-4, szafy na procesory Vera, pamięć masowa Vera BlueField-4 STX i sieć Ethernet Spectrum-6 SPX.
Nvidia odświeżyła także swoje deklaracje dotyczące wydajności na poziomie platformy, stwierdzając, że Vera Rubin NVL72 zapewnia do 30 razy większą przepustowość tokena na megawat w porównaniu z GB300 NVL72 przy obciążeniu 140 000 tokenów agentycznym kodowaniem, przy czym przewaga zwiększa się wraz ze wzrostem celów w zakresie interaktywności poszczególnych użytkowników.
Test porównawczy z gwiazdką
Nagłówek 3400 tokenów na sekundę zawiera zastrzeżenie, na które warto zwrócić uwagę. Jak zauważył StorageReview, wynik Nvidii został zmierzony na prywatnym, przedpremierowym punkcie końcowym 21 sierpnia, podczas gdy konkurencyjne wyniki, z którymi został porównany, pochodziły z działających, bezserwerowych punktów końcowych. Rzeczywista wydajność w ogólnie dostępnych usługach może różnić się od rekordowej konfiguracji porównawczej.
Mimo to niezależna organizacja zajmująca się benchmarkingiem Sztuczna Analiza uznała wynik za najszybszy w historii dla Gemma 4 31B przy tej długości kontekstu, a leżące u jego podstaw twierdzenie – że specjalnie zbudowany krzem może radykalnie przyspieszyć fazę dekodowania wnioskowania – jest zgodne ze sposobem, w jaki branża zmienia architekturę pod kątem obciążeń agentowych.
Rozpoczyna się wdrażanie chmury
Nebius, chmura AI z siedzibą w Amsterdamie, jest pierwszym dostawcą, który zobowiązał się do wdrożenia Groq 3 LPX, planując wprowadzenie go do Nebius Token Factory, swojej platformy wnioskowania produkcyjnego.
„Generowanie to faza wnioskowania, która określa, jak faktycznie responsywny jest system AI, i właśnie to NVIDIA Groq 3 LPX ma przyspieszać” – powiedziała Danila Shtan, dyrektor ds. technologii w firmie Nebius. „Jako pierwsza chmura AI wprowadzająca ją do środowiska produkcyjnego za pośrednictwem Nebius Token Factory, dbamy o to, aby każdy krok pętli agenta był natychmiastowy — za pośrednictwem tego samego interfejsu API, z którego już korzystają programiści, bez konieczności migracji do nowego stosu”.
Dostawca wnioskowania Groq, będący obecnie częścią rodziny Nvidia, planuje znaleźć się wśród pierwszych użytkowników platformy.
Większy obraz
Ogłoszenie pełnej produkcji sygnalizuje, jak gwałtownie rynek infrastruktury sztucznej inteligencji przeszedł od szkolenia do wnioskowania. W miarę jak przedsiębiorstwa przesuwają budżety z wstępnego szkolenia surowych modeli na wnioskowanie w czasie rzeczywistym i autonomiczną orkiestrację agentów, ekonomika tokena – jak szybko można go wygenerować i jakim kosztem energii – stała się głównym polem konkurencyjnej bitwy.
W przypadku Nvidii Groq 3 LPX rozszerza obronę swojej franczyzy fabryki sztucznej inteligencji w momencie, gdy niestandardowe układy krzemowe od dostawców usług w chmurze i start-upów gonią za tymi samymi obciążeniami wnioskowania agentowego. Jak podaje CNBC, stojaki, które zostaną wprowadzone do sprzedaży w tym roku, pozwolą klientom oddać pierwsze systemy produkcyjne kilka miesięcy po zamknięciu przejęcia, co oznacza szybką integrację jak na standardy branży półprzewodników.
Firma nie ujawniła cen nowych systemów. Groq 3 LPX będzie oferowany w miarę dostępności za pośrednictwem partnerów zajmujących się chmurą sztucznej inteligencji, przy czym oczekuje się, że Nebius jako pierwszy zaoferuje programistom dostęp za pośrednictwem istniejących punktów końcowych API.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →