A Nvidia colocou seu acelerador de inferência interativo Groq 3 LPX em plena produção, anunciou a empresa em 24 de agosto de 2026, durante a conferência Hot Chips. O chip, uma extensão da plataforma Vera Rubin da Nvidia, entregou um recorde de 3.400 tokens de saída por segundo em benchmarking de Análise Artificial enquanto executava o modelo Gemma 4 31B de código aberto com uma janela de contexto ativa de 100.000 tokens – o desempenho mais rápido já registrado para esse modelo.
O lançamento marca o marco de produto mais significativo desde a aquisição da especialista em inferência Groq pela Nvidia, por US$ 20 bilhões, um acordo que a empresa agora está se movendo para capitalizar à medida que a demanda por inferência de baixa latência aumenta. A CNBC informou que a Nvidia afirma que os primeiros racks Groq estarão online antes do final do ano. Para obter mais contexto sobre esta história, consulte nossa cobertura do setor de IA em andamento.
Por que a velocidade de geração de token é importante
Os sistemas Agentic AI – programas que raciocinam, chamam ferramentas, escrevem e testam códigos e iteram centenas ou milhares de etapas de inferência – geram enormes volumes de tokens de saída. A velocidade com que esses tokens são produzidos, conhecida como interatividade ou rendimento de decodificação, determina a rapidez com que um agente pode concluir cada etapa de seu trabalho.
A Nvidia afirma que o Groq 3 LPX oferece capacidade de resposta 4x mais rápida para agentes e cargas de trabalho sensíveis à latência do que a plataforma alternativa mais próxima. Em implantações heterogêneas, os sistemas Vera Rubin NVL72 lidam com ingestão de contexto e computação de pré-preenchimento, enquanto as unidades Groq 3 LPX processam a fase de geração de token sensível à latência.
“A inferência é o motor de crescimento da IA”, disse Jensen Huang, fundador e CEO da Nvidia, no anúncio. "Vera Rubin amplia essa visão com configurações de fábrica de IA otimizadas para carga de trabalho, projetadas para a era da IA de agente, avançando a fronteira de desempenho com LPX para geração ultrarrápida de tokens."
Dentro do Hardware
De acordo com a análise técnica da StorageReview, cada bandeja de computação refrigerada a líquido de 2U carrega dezesseis LPUs Groq 3 junto com uma CPU host, lógica de expansão de malha e DRAM, além de uma DPU BlueField-4 ou uma placa de rede ConnectX-9. A bandeja possui links ópticos chip a chip de 32 LPU e Ethernet de 400 Gb/s no painel frontal.
Em escala de rack, uma implantação Groq 3 LPX incorpora até 256 aceleradores LP30 conectados por meio de interconexões diretas de chip a chip de alta velocidade. Os racks se encaixam na infraestrutura de fábrica Vera Rubin AI mais ampla da Nvidia, que a empresa descreve como sua plataforma mais extensa de todos os tempos: sete chips discretos em cinco configurações de rack específicas, incluindo DPUs BlueField-4, racks de CPU Vera, armazenamento Vera BlueField-4 STX e rede Ethernet Spectrum-6 SPX.
A Nvidia também atualizou suas reivindicações de desempenho em nível de plataforma, afirmando que Vera Rubin NVL72 oferece até 30 vezes o rendimento de token por megawatt em comparação com GB300 NVL72 em uma carga de trabalho de codificação de agente de 140.000 tokens, com a vantagem aumentando à medida que as metas de interatividade por usuário aumentam.
Uma referência com um asterisco
O número da manchete de 3.400 tokens por segundo vem com uma ressalva digna de nota. Como o StorageReview apontou, o resultado da Nvidia foi medido em um endpoint privado de pré-lançamento em 21 de agosto, enquanto os números concorrentes com os quais foi comparado vêm de endpoints de produção sem servidor ativos. O desempenho no mundo real em serviços geralmente disponíveis pode diferir da configuração recorde do benchmark.
Ainda assim, a organização independente de benchmarking Artificial Analysis registrou o resultado como o mais rápido já medido para Gemma 4 31B nesse comprimento de contexto, e a afirmação subjacente – que o silício desenvolvido especificamente pode acelerar drasticamente a fase de decodificação da inferência – se alinha com a forma como a indústria tem re-arquitetado para cargas de trabalho de agente.
Começa a adoção da nuvem
Nebius, a nuvem de IA com sede em Amsterdã, é o primeiro fornecedor a se comprometer com a implantação do Groq 3 LPX, planejando trazê-lo para a Nebius Token Factory, sua plataforma de inferência de produção.
“A geração é a fase de inferência que determina o quão responsivo um sistema de IA realmente é, e é exatamente para isso que o NVIDIA Groq 3 LPX foi criado para acelerar”, disse Danila Shtan, diretora de tecnologia da Nebius. “Como a primeira nuvem de IA trazendo-o para produção por meio do Nebius Token Factory, estamos garantindo que cada etapa do ciclo de um agente pareça instantânea – por meio da mesma API que os desenvolvedores já estão usando, sem migração para uma nova pilha.”
O provedor de inferência Groq, agora parte da família Nvidia, planeja estar entre os primeiros a adotar a plataforma.
O panorama geral
O anúncio da produção completa sinaliza o quão acentuadamente o mercado de infraestrutura de IA mudou do treinamento para a inferência. À medida que as empresas transferem os orçamentos do pré-treinamento de modelo bruto para o raciocínio em tempo real e a orquestração de agentes autônomos, a economia de um token – quão rápido ele pode ser gerado e a que custo de energia – tornou-se o campo de batalha competitivo central.
Para a Nvidia, Groq 3 LPX estende a defesa de sua franquia de fábrica de IA em um momento em que o silício personalizado de provedores de nuvem e startups está perseguindo as mesmas cargas de trabalho de inferência de agente. Os racks que entrarão em operação este ano, conforme relatado pela CNBC, colocariam os primeiros sistemas de produção nas mãos dos clientes meses após o fechamento da aquisição – uma integração rápida para os padrões da indústria de semicondutores.
A empresa não divulgou os preços dos novos sistemas. Groq 3 LPX será oferecido quando e se estiver disponível por meio de parceiros de nuvem de IA, com a expectativa de que Nebius seja o primeiro a oferecer acesso aos desenvolvedores por meio de seus endpoints de API existentes.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →