Nvidia ha puesto su acelerador de inferencia interactivo Groq 3 LPX en plena producción, anunció la compañía el 24 de agosto de 2026, durante la conferencia Hot Chips. El chip, una extensión de la plataforma Vera Rubin de Nvidia, entregó un récord de 3.400 tokens de salida por segundo en pruebas comparativas de Análisis Artificial mientras ejecutaba el modelo Gemma 4 31B de código abierto con una ventana contextual activa de 100.000 tokens: el rendimiento más rápido jamás registrado para ese modelo.
El lanzamiento marca el hito de producto más importante hasta el momento desde la adquisición por parte de Nvidia del especialista en inferencia Groq, por 20 mil millones de dólares, un acuerdo que la compañía ahora está tratando de capitalizar a medida que aumenta la demanda de inferencia de baja latencia. CNBC informó que Nvidia dice que los primeros bastidores Groq estarán en línea antes de fin de año. Para obtener más contexto sobre esta historia, consulte nuestra cobertura de la industria de la IA en curso.
Por qué es importante la velocidad de generación de tokens
Los sistemas de IA agentes (programas que razonan, llaman a herramientas, escriben y prueban código e iteran a lo largo de cientos o miles de pasos de inferencia) generan enormes volúmenes de tokens de salida. La velocidad a la que se producen esos tokens, conocida como interactividad o rendimiento de decodificación, determina la rapidez con la que un agente puede completar cada paso de su trabajo.
Nvidia afirma que Groq 3 LPX proporciona una capacidad de respuesta 4 veces más rápida para agentes y cargas de trabajo sensibles a la latencia que la plataforma alternativa más cercana. En implementaciones heterogéneas, los sistemas Vera Rubin NVL72 manejan la ingesta de contexto y el cálculo previo al llenado, mientras que las unidades Groq 3 LPX procesan la fase de generación de tokens sensible a la latencia.
"La inferencia es el motor de crecimiento de la IA", dijo en el anuncio Jensen Huang, fundador y director ejecutivo de Nvidia. "Vera Rubin amplía esa visión con configuraciones de fábrica de IA optimizadas para cargas de trabajo diseñadas para la era de la IA agente, avanzando la frontera del rendimiento con LPX para la generación de tokens ultrarrápida".
Dentro del hardware
Según el análisis técnico de StorageReview, cada bandeja de computación de 2U refrigerada por líquido lleva dieciséis LPU Groq 3 junto con una CPU host, lógica de expansión de estructura y DRAM, además de una DPU BlueField-4 o una tarjeta de red ConnectX-9. La bandeja cuenta con enlaces ópticos de chip a chip de 32 LPU y Ethernet de 400 Gb/s en el panel frontal.
A escala de rack, una implementación Groq 3 LPX incorpora hasta 256 aceleradores LP30 vinculados a través de interconexiones directas de chip a chip de alta velocidad. Los bastidores se integran en la infraestructura más amplia de la fábrica de IA Vera Rubin de Nvidia, que la compañía describe como su plataforma más extensa hasta la fecha: siete chips discretos en cinco configuraciones de bastidor especialmente diseñadas, que incluyen DPU BlueField-4, bastidores de CPU Vera, almacenamiento Vera BlueField-4 STX y redes Ethernet Spectrum-6 SPX.
Nvidia también actualizó sus afirmaciones de rendimiento a nivel de plataforma, afirmando que Vera Rubin NVL72 ofrece hasta 30 veces el rendimiento de tokens por megavatio en comparación con GB300 NVL72 en una carga de trabajo de codificación agente de 140.000 tokens, y la ventaja se amplía a medida que aumentan los objetivos de interactividad por usuario.
Un punto de referencia con un asterisco
La cifra del titular de 3.400 tokens por segundo viene con una advertencia que vale la pena señalar. Como señaló StorageReview, el resultado de Nvidia se midió en un punto final privado de prelanzamiento el 21 de agosto, mientras que los números de la competencia con los que se comparó provienen de puntos finales de producción sin servidor en vivo. El rendimiento en el mundo real en servicios generalmente disponibles puede diferir de la configuración de referencia que establece récords.
Aún así, la organización independiente de evaluación comparativa Artificial Analysis registró el resultado como el más rápido jamás medido para Gemma 4 31B en esa longitud de contexto, y la afirmación subyacente (que el silicio diseñado específicamente puede acelerar dramáticamente la fase de decodificación de la inferencia) se alinea con la forma en que la industria ha estado reestructurando las cargas de trabajo agentes.
Comienza la adopción de la nube
Nebius, la nube de IA con sede en Ámsterdam, es el primer proveedor que se compromete a implementar Groq 3 LPX y planea incorporarlo a Nebius Token Factory, su plataforma de inferencia de producción.
"La generación es la fase de inferencia que determina qué tan sensible es realmente un sistema de IA, y eso es exactamente para lo que NVIDIA Groq 3 LPX está diseñado para acelerar", dijo Danila Shtan, directora de tecnología de Nebius. "Como la primera nube de IA que la lleva a producción a través de Nebius Token Factory, nos aseguramos de que cada paso del ciclo de un agente se sienta instantáneo, a través de la misma API que los desarrolladores ya están usando, sin migración a una nueva pila".
El proveedor de inferencia Groq, ahora parte de la familia Nvidia, planea estar entre los primeros en adoptar la plataforma.
El panorama más amplio
El anuncio de producción completa indica cuán bruscamente el mercado de infraestructura de IA ha pasado del entrenamiento a la inferencia. A medida que las empresas cambian sus presupuestos de la capacitación previa de modelos en bruto hacia el razonamiento en tiempo real y la orquestación de agentes autónomos, la economía de un token (qué tan rápido se puede generar y a qué costo de energía) se ha convertido en el campo de batalla competitivo central.
Para Nvidia, Groq 3 LPX extiende la defensa de su franquicia de fábrica de inteligencia artificial en un momento en que el silicio personalizado de proveedores de nube y nuevas empresas persigue las mismas cargas de trabajo de inferencia agente. Los bastidores que entrarán en funcionamiento este año, como informó CNBC, pondrían los primeros sistemas de producción en manos de los clientes meses después de que se cerrara la adquisición, una integración rápida según los estándares de la industria de semiconductores.
La empresa no reveló los precios de los nuevos sistemas. Groq 3 LPX se ofrecerá cuando y si esté disponible a través de socios de nube de IA, y se espera que Nebius sea el primero en ofrecer acceso a los desarrolladores a través de sus puntos finales API existentes.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →