Nvidia запустила свій інтерактивний прискорювач виведення Groq 3 LPX у повне виробництво, компанія оголосила 24 серпня 2026 року під час конференції Hot Chips. Цей чіп, розширення платформи Vera Rubin від Nvidia, забезпечив рекордні 3400 вихідних токенів за секунду під час порівняльного аналізу штучного аналізу під час роботи моделі Gemma 4 31B з відкритим кодом і активним контекстним вікном у 100 000 токенів — найшвидша продуктивність, коли-небудь зафіксована для цієї моделі.

Запуск знаменує собою найважливішу віху продукту на сьогоднішній день після придбання Nvidia компанії Groq, що займається логічними висновками, за 20 мільярдів доларів. Ця угода компанія зараз намагається отримати вигоду, оскільки попит на логічні висновки з низькою затримкою зростає. CNBC повідомив, що Nvidia каже, що перші стелажі Groq будуть онлайн до кінця року. Щоб дізнатися більше про цю історію, перегляньте наш поточний висвітлення індустрії ШІ.

Чому швидкість генерації токенів важлива

Системи агентського штучного інтелекту — програми, які розуміють, викликають інструменти, пишуть і тестують код, а також повторюють сотні чи тисячі кроків висновку — генерують величезні обсяги вихідних маркерів. Швидкість, з якою створюються ці маркери, відома як інтерактивність або пропускна здатність декодування, визначає, наскільки швидко агент може завершити кожен крок своєї роботи.

Nvidia каже, що Groq 3 LPX забезпечує в 4 рази швидше реагування для агентів і робочих навантажень, чутливих до затримки, ніж найближча альтернативна платформа. У гетерогенних розгортаннях системи Vera Rubin NVL72 обробляють прийом контексту та обчислення попереднього заповнення, а пристрої Groq 3 LPX обробляють фазу генерації маркерів, чутливу до затримки.

«Висновок є рушієм зростання штучного інтелекту», — сказав Дженсен Хуанг, засновник і генеральний директор Nvidia в повідомленні. «Vera Rubin розширює це бачення за допомогою заводських конфігурацій штучного інтелекту, оптимізованих для робочого навантаження, розроблених для ери агентного штучного інтелекту, просуваючи межі продуктивності за допомогою LPX для надшвидкої генерації маркерів».

Всередині обладнання

Згідно з технічним аналізом StorageReview, кожен обчислювальний лоток 2U з рідинним охолодженням містить шістнадцять LPU Groq 3 разом із центральним процесором, логікою розширення мережі та DRAM, а також або BlueField-4 DPU, або мережеву карту ConnectX-9. Лоток оснащений 32 оптичними зв’язками LPU chip-to-chip і Ethernet 400 Гбіт/с на передній панелі.

У масштабі стійки розгортання Groq 3 LPX включає до 256 прискорювачів LP30, з’єднаних через високошвидкісні прямі з’єднання між мікросхемами. Стійки входять у ширшу заводську інфраструктуру Nvidia Vera Rubin AI, яку компанія описує як свою найрозгалуженішу платформу в історії: сім дискретних чіпів у п’яти спеціально створених конфігураціях стійок, включаючи DPU BlueField-4, стійки CPU Vera, сховище Vera BlueField-4 STX і мережу Ethernet Spectrum-6 SPX.

Nvidia також оновила свої заявки щодо продуктивності на рівні платформи, заявивши, що Vera Rubin NVL72 забезпечує до 30 разів більшу пропускну здатність токенів на мегават у порівнянні з GB300 NVL72 при робочому навантаженні з агентським кодуванням у 140 000 токенів, причому перевага збільшується в міру зростання цілей інтерактивності для кожного користувача.

Тест із зірочкою

Заголовна цифра 3400 токенів за секунду містить застереження, яке варто зауважити. Як зазначає StorageReview, результат Nvidia був виміряний на приватній кінцевій точці попереднього випуску 21 серпня, тоді як конкуруючі цифри, з якими він порівнювався, походять від живих безсерверних робочих кінцевих точок. Реальна продуктивність загальнодоступних служб може відрізнятися від рекордної еталонної конфігурації.

Тим не менш, незалежна організація бенчмаркінгу Artificial Analysis зафіксувала результат як найшвидший результат, який коли-небудь вимірювали для Gemma 4 31B за такої довжини контексту, і основне твердження — що спеціально створений кремній може значно прискорити фазу декодування логічного висновку — узгоджується з тим, як індустрія переробляла архітектуру для агентних робочих навантажень.

Розпочинається адаптація хмари

Nebius, штаб-квартира штучного інтелекту зі штаб-квартирою в Амстердамі, є першим постачальником, який зобов’язався розгорнути Groq 3 LPX і планує перенести його на Nebius Token Factory, свою платформу виробничого висновку.

«Генерація — це фаза висновків, яка визначає, наскільки чутливою є система штучного інтелекту, і це саме те, для прискорення якого розроблено NVIDIA Groq 3 LPX», — сказав Даніла Штан, головний технічний директор Nebius. «Як перша хмара штучного інтелекту, яка запускає його у виробництво через Nebius Token Factory, ми дбаємо про те, щоб кожен крок циклу агента відчувався миттєво — через той самий API, який уже використовують розробники, без переходу до нового стеку».

Постачальник логічних висновків Groq, який тепер є частиною сімейства Nvidia, планує стати одним із перших користувачів цієї платформи.

Більша картина

Оголошення про повне виробництво сигналізує про те, наскільки різко ринок інфраструктури ШІ повернувся від навчання до висновків. У міру того, як підприємства переходять у бюджети від попереднього навчання сирих моделей до міркувань у реальному часі та автономного керування агентами, економіка токена — як швидко його можна створити та за які витрати енергії — стала центральним полем конкурентної битви.

Для Nvidia Groq 3 LPX розширює захист своєї фабричної франшизи штучного інтелекту в той момент, коли користувацький кремнієвий процесор від хмарних провайдерів і стартапів однаково переслідує ті самі робочі навантаження агентського висновку. Як повідомляє CNBC, стійки, які з’являться в мережі цього року, передадуть клієнтам перші виробничі системи через кілька місяців після завершення придбання — швидка інтеграція за стандартами напівпровідникової промисловості.

Ціни на нові системи компанія не розкриває. Groq 3 LPX буде пропонуватися в разі наявності через хмарних партнерів зі штучним інтелектом. Очікується, що Nebius стане першим, хто запропонує доступ розробникам через свої існуючі кінцеві точки API.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →