AMD y Cerebras Systems han presentado una asociación técnica para construir un nuevo tipo de infraestructura de inferencia de IA, combinando la plataforma Helios a escala de rack de AMD con Wafer-Scale Engine (WSE) de Cerebras en un flujo de trabajo único y desagregado. Anunciada en el evento Advancing AI 2026 de AMD el 23 de julio de 2026, la colaboración apunta directamente a los cuellos de botella de latencia y rendimiento que han hecho de la inferencia uno de los problemas más costosos en la era de la IA generativa. Para conocer lo último sobre este sector de la industria en rápido movimiento, siga nuestra cobertura de últimas noticias sobre IA.
La idea central es dejar de obligar a un chip a hacer todo. En una pila de inferencia tradicional, una única familia de GPU maneja tanto el pesado trabajo previo al llenado de digerir un mensaje como el trabajo delicado y secuencial de generar cada nuevo token. Se trata de un compromiso, porque los dos trabajos tienen exigencias muy diferentes. AMD y Cerebras sostienen que dividir el trabajo, una técnica conocida como inferencia desagregada, permite que cada motor haga lo que mejor sabe hacer.
Cómo dividen el trabajo los dos motores
Según el anuncio oficial de AMD, AMD Helios servirá como motor de rendimiento escalable y de alto rendimiento, aprovechando las GPU AMD Instinct para procesar rápidamente grandes lotes de entrada. Mientras tanto, Cerebras Wafer-Scale Engine se encargará de la decodificación y generación de tokens ultrarrápidas y de latencia ultrabaja. Los chips de Cerebras están construidos sobre obleas enteras en lugar de cortados en troqueles individuales, lo que les proporciona un enorme ancho de banda de memoria en el chip que es particularmente adecuado para transmitir tokens sin detenerse.
Las compañías dicen que al combinar los dos motores de cómputo, se espera que la solución conjunta entregue hasta 5 veces más tokens por segundo por vatio, una métrica que se ha convertido en un cuadro de mando central para la economía de inferencia a medida que los proveedores compiten tanto en velocidad como en costos de energía. La cifra fue citada en el comunicado de prensa de AMD y reportada en medios como Tom's Hardware, Investing.com y Yahoo Tech.
Una oportunidad al dominio de Nvidia
La asociación es también una señal estratégica. El ecosistema CUDA de Nvidia y la línea de GPU dominan actualmente el entrenamiento y la inferencia de IA, y los rivales han llegado cada vez más a la conclusión de que vencer al titular en una sola arquitectura es difícil. Business Insider enmarcó el acuerdo como si AMD le diera una oportunidad a Nvidia al apostar por la inferencia, la fase de la computación de IA que se espera crezca más rápido a medida que los modelos pasan del desarrollo a la producción.
Para AMD, la asociación con Cerebras amplía el atractivo de su hoja de ruta Instinct y Helios más allá del entrenamiento. Para Cerebras, que cotiza en el Nasdaq con el símbolo CBRS junto con AMD (NASDAQ: AMD), la integración con un importante proveedor de aceleradores le da a su tecnología de escala de oblea un camino más claro hacia las implementaciones en la nube y en grandes empresas. Cerebras planea implementar AMD Helios en sus propios centros de datos y las compañías esperan que la solución conjunta esté disponible primero a través de Cerebras Cloud en la segunda mitad de 2026.
Por qué es importante la desagregación ahora
Los costos de inferencia se han convertido en un punto de presión decisivo para la industria de la IA. A medida que los modelos crecen y las aplicaciones exigen respuestas en tiempo real, el gasto de generar cada token y la latencia que experimentan los usuarios al esperarlo pueden determinar si un producto es viable. La inferencia desagregada trata el precarga y la decodificación como cargas de trabajo separadas que pueden enrutarse al hardware que mejor se adapta a cada una, una filosofía de diseño que empresas como Cerebras han defendido durante más de un año.
El anuncio de AMD-Cerebras sugiere que ese enfoque está pasando de una idea insurgente a una arquitectura respaldada por la industria. Al combinar un especialista en rendimiento con un especialista en latencia, las dos empresas apuestan a que el futuro de la inferencia no sea un chip que los gobierne a todos, sino un sistema coordinado de motores especializados.
Qué mirar
Quedan varias preguntas. La cifra de 5 veces tokens por segundo por vatio es una expectativa más que un punto de referencia de terceros, y el rendimiento en el mundo real dependerá de los modelos específicos y las cargas de trabajo que ejecuten los clientes. No se han revelado detalles sobre precios y disponibilidad más allá del lanzamiento de Cerebras Cloud, y no está claro cuándo la solución podría llegar a otros proveedores de nube.
Aún así, el acuerdo subraya un cambio más amplio en el hardware de IA: la suposición de que una única arquitectura de GPU servirá para cada etapa del proceso de IA se está desgastando. Si AMD y Cerebras pueden cumplir sus afirmaciones de eficiencia, la inferencia desagregada podría convertirse en una parte estándar de cómo se construyen los sistemas de IA más grandes.
Manténgase por delante de la IA
El panorama del hardware de IA se está dividiendo en campos especializados y las implicaciones para el costo, la velocidad y la competencia son enormes. Lea más noticias sobre IA en AI Buzz Wire para mantenerse al día con cada acuerdo, lanzamiento y punto de referencia importante.


