Nvidia запустила в серийное производство интерактивный ускоритель вывода Groq 3 LPX, объявила компания 24 августа 2026 года во время конференции Hot Chips. Чип, являющийся расширением платформы Vera Rubin от Nvidia, обеспечил рекордную скорость вывода 3400 токенов в секунду при тестировании искусственного анализа при запуске модели Gemma 4 31B с открытым исходным кодом с активным контекстным окном на 100 000 токенов — это самая высокая производительность, когда-либо зафиксированная для этой модели.
Запуск знаменует собой наиболее важную веху продукта после приобретения Nvidia компании Groq, специализирующейся на выводах, за 20 миллиардов долларов. Сделка, которую компания сейчас пытается извлечь выгоду, поскольку спрос на логические выводы с малой задержкой резко растет. CNBC сообщил, что Nvidia заявляет, что первые стойки Groq появятся в сети до конца года. Дополнительную информацию об этой истории можно найти в нашем постоянном освещении об отрасли искусственного интеллекта.
Почему важна скорость генерации токенов
Агентические системы искусственного интеллекта — программы, которые рассуждают, вызывают инструменты, пишут и тестируют код, а также выполняют сотни или тысячи шагов вывода — генерируют огромные объемы выходных токенов. Скорость создания этих токенов, известная как интерактивность или пропускная способность декодирования, определяет, насколько быстро агент может выполнить каждый этап своей работы.
Nvidia утверждает, что Groq 3 LPX обеспечивает в 4 раза более высокую скорость реагирования для агентов и рабочих нагрузок, чувствительных к задержкам, чем ближайшая альтернативная платформа. В гетерогенных развертываниях системы Vera Rubin NVL72 обрабатывают прием контекста и вычисления предварительного заполнения, а устройства Groq 3 LPX обрабатывают фазу генерации токена, чувствительную к задержке.
«Вывод — это двигатель роста искусственного интеллекта», — заявил в заявлении Дженсен Хуанг, основатель и генеральный директор Nvidia. «Вера Рубин расширяет это видение с помощью фабричных конфигураций искусственного интеллекта, оптимизированных для рабочих нагрузок, разработанных для эпохи агентного искусственного интеллекта, расширяя границы производительности с помощью LPX для сверхбыстрой генерации токенов».
Внутри оборудования
Согласно техническому анализу StorageReview, каждый вычислительный лоток высотой 2U с жидкостным охлаждением содержит шестнадцать LPU Groq 3 вместе с главным процессором, логикой расширения коммутационной сети и DRAM, а также либо BlueField-4 DPU, либо сетевую карту ConnectX-9. Лоток оснащен 32 межчиповыми оптическими каналами LPU и Ethernet 400 Гбит/с на передней панели.
В масштабе стойки развертывание Groq 3 LPX включает до 256 ускорителей LP30, соединенных посредством высокоскоростных прямых межкристальных соединений. Стойки встраиваются в более широкую заводскую инфраструктуру Nvidia Vera Rubin AI, которую компания описывает как свою самую обширную платформу за всю историю: семь дискретных чипов в пяти специально созданных конфигурациях стоек, включая DPU BlueField-4, стойки для процессоров Vera, хранилище Vera BlueField-4 STX и сеть Spectrum-6 SPX Ethernet.
Nvidia также обновила свои заявления о производительности на уровне платформы, заявив, что Vera Rubin NVL72 обеспечивает до 30 раз большую пропускную способность токенов на мегаватт по сравнению с GB300 NVL72 при рабочей нагрузке агентного кодирования на 140 000 токенов, причем это преимущество увеличивается по мере роста показателей интерактивности для каждого пользователя.
Бенчмарк со звездочкой
Заголовок о цифре 3400 токенов в секунду имеет одну оговорку, на которую стоит обратить внимание. Как отмечает StorageReview, результат Nvidia был измерен на частной предварительной конечной точке 21 августа, в то время как конкурирующие показатели, с которыми он сравнивался, получены на работающих бессерверных конечных точках. Реальная производительность общедоступных сервисов может отличаться от рекордной конфигурации тестов.
Тем не менее, независимая организация по сравнительному анализу Artificial Analysis зафиксировала результат как самый быстрый из когда-либо измеренных для Gemma 4 31B при такой длине контекста, и лежащее в его основе утверждение о том, что специально созданный кремний может значительно ускорить этап декодирования вывода, согласуется с тем, как отрасль перестраивает архитектуру для агентных рабочих нагрузок.
Начинается внедрение облака
Nebius, облако искусственного интеллекта со штаб-квартирой в Амстердаме, является первым поставщиком, который взял на себя обязательство развернуть Groq 3 LPX и планирует внедрить его в Nebius Token Factory, свою производственную платформу вывода.
«Генерация — это этап вывода, который определяет, насколько на самом деле отзывчива система искусственного интеллекта, и это именно то, для ускорения чего создана NVIDIA Groq 3 LPX», — сказал Данила Штан, технический директор Nebius. «Будучи первым облаком искусственного интеллекта, которое запустило его в производство через Nebius Token Factory, мы следим за тем, чтобы каждый шаг цикла работы агента был мгновенным — через тот же API, который уже используют разработчики, без перехода на новый стек».
Поставщик логических выводов Groq, который теперь входит в семейство Nvidia, планирует стать одним из первых, кто внедрит платформу.
Общая картина
Объявление о полномасштабном производстве сигнализирует о том, насколько резко рынок инфраструктуры искусственного интеллекта перешел от обучения к выводу. Поскольку предприятия переносят бюджеты с предварительного обучения необработанной модели на рассуждения в реальном времени и автономную оркестровку агентов, экономика токена — насколько быстро он может быть сгенерирован и с какой стоимостью энергии — стала центральным полем конкурентной битвы.
Для Nvidia Groq 3 LPX расширяет защиту своей франшизы ИИ-фабрики в тот момент, когда специализированные микросхемы от облачных провайдеров и стартапов гоняются за одними и теми же рабочими нагрузками агентного вывода. Как сообщает CNBC, стойки, которые появятся в сети в этом году, передадут первые производственные системы в руки клиентов через несколько месяцев после закрытия сделки — быстрая интеграция по стандартам полупроводниковой промышленности.
Компания не раскрыла цены на новые системы. Groq 3 LPX будет предлагаться по мере доступности через партнеров по облачным технологиям искусственного интеллекта, при этом Nebius, как ожидается, будет первым, кто предложит доступ разработчикам через существующие конечные точки API.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →