Cerebras ha presentado el CS-4, un sistema de inferencia de IA a escala de rack construido alrededor de su nuevo procesador WSE-3 Turbo a escala de oblea, afirmando que la máquina ofrece una inferencia hasta 30 veces más rápida que los sistemas basados ​​en GPU, mientras la compañía se posiciona como la alternativa de velocidad al imperio de centros de datos de Nvidia.

El lanzamiento, anunciado el martes y detallado en las páginas de productos de la compañía y en una ola de cobertura de Reuters, Bloomberg y The Register, marca la actualización de hardware más significativa de Cerebras desde que salió a bolsa, y un momento crucial para una compañía cuyas acciones han tenido problemas desde su IPO. Los inversores parecen estar prestando atención: las acciones de Cerebras (CBRS) subieron con la noticia, y el Investor's Business Daily citó un comentario del CEO de que el mercado de inferencia de IA está "creciendo muy rápido".

Para los lectores que siguen la carrera acelerada para hacer que los modelos de IA respondan más rápido, el lanzamiento de CS-4 es una de las historias de hardware más trascendentales del trimestre y llega en medio de cambios más amplios en la cobertura de la industria de la IA que continúan remodelando el panorama informático.

¿Qué hay dentro del CS-4?

El componente principal es el WSE-3 Turbo, una versión mejorada del Wafer Scale Engine del tamaño de un plato de Cerebras. Según el análisis técnico profundo de The Register, el WSE-3T no es un silicio nuevo: conserva el mismo proceso TSMC de 5 nm, un área de troquel de 46.225 milímetros cuadrados, 4 billones de transistores, 900.000 núcleos y 44 GB de SRAM en oblea que el WSE-3 de dos años.

En cambio, Cerebras logró duplicar el rendimiento presionando mucho más el chip existente. El WSE-3T duplica la computación escasa de FP16 a 250 petaFLOPS, duplica el rendimiento denso de FP16 a un estimado de 25 petaFLOPS, duplica el ancho de banda de la memoria a 43,2 petabytes por segundo y duplica el ancho de banda de E/S a 2,4 terabits por segundo. The Register estima que la compañía ahora está sincronizando el silicio a aproximadamente 2,8 GHz, frente a aproximadamente 1,4 GHz en la generación anterior.

El truco, según Cerebras, es un sistema de suministro de energía rediseñado que se encuentra a sólo 0,5 milímetros del procesador, aproximadamente 100 veces más cerca que los ~50 milímetros típicos de las placas GPU convencionales. Esa proximidad casi elimina la pérdida de energía a nivel de la placa y permite que llegue el doble de energía a la oblea, lo que permite frecuencias operativas más altas detrás de una generación de tokens más rápida.

La arquitectura del bastidor Nexus

Más allá del chip en sí, el CS-4 presenta lo que Cerebras llama la Arquitectura de Plataforma Nexus, su primer diseño verdadero a escala de rack y una respuesta directa a los sistemas de rack NVL72 de Nvidia y Helios de AMD. Cada CS-4 puede transportar hasta tres procesadores WSE-3T alojados en "mochilas a escala de oblea" autónomas: paquetes 3D que pliegan la oblea, la conversión de energía, la refrigeración líquida directa, las E/S de alta velocidad y la electrónica de control en un solo conjunto con un 50 % menos de componentes.

El diseño modular separa la capa estable de energía, refrigeración y red de la computación. Se puede instalar un Cerebras PowerRack y calificarlo para las instalaciones antes de que llegue cualquier cómputo, y luego las mochilas se deslizan en su lugar, lo que reduce el tiempo de implementación de días a horas, según la compañía.

El consumo de energía es sustancial. El Registro estima alrededor de 46 kW por mochila y un consumo total del sistema de 120 a 140 kW: cifras llamativas que, sin embargo, parecen conservadoras en comparación con los sistemas en rack de 240 a 250 kW que se espera que AMD y Nvidia envíen a finales de este año.

Matar el interruptor

Quizás la opción técnicamente más interesante sea la interconexión. En lugar de enrutar el tráfico de oblea a oblea a través de conmutadores (el enfoque que AWS adoptó para sus aceleradores Trainium3), Cerebras conecta sus chips en una topología de toro 2D donde las obleas vecinas se comunican directamente entre sí. El diseño reduce la latencia de oblea a oblea de cinco microsegundos a solo dos, y Cerebras dice que la malla puede admitir modelos de hasta 50 billones de parámetros, cómodamente más allá de cualquier cosa que exista actualmente.

Los resultados de velocidad son sorprendentes. En un solo sistema CS-4, la empresa de evaluación comparativa Artificial Analysis midió hasta 4400 tokens por segundo por usuario en gpt-oss-120b, aproximadamente 12 veces los ~350 tokens por segundo de los servicios de inferencia basados ​​en GPU más rápidos disponibles en la actualidad. Cerebras también afirma que el sistema soporta más de 1.000 tokens por segundo en modelos que superan los 10 billones de parámetros.

Una estrategia de asociación desagregada

En particular, Cerebras ya no intenta ejecutar todo el proceso de inferencia con su propio silicio. La compañía se ha asociado con AWS y AMD para descargar la etapa de inferencia de procesamiento rápido de computación intensiva en las GPU Trainium XPU e Instinct respectivamente, dejando que sus motores de escala de oblea se encarguen de la fase de decodificación sensible a la latencia donde brillan sus enormes reservas de SRAM.

El lanzamiento de CS-4 también amplía la colaboración de Cerebras con OpenAI. Yahoo Finance informó sobre la presentación junto con nuevas asociaciones entre OpenAI y AMD destinadas a acelerar la inferencia de IA, basándose en el modo ultrarrápido que las empresas introdujeron a principios de agosto, que llevó GPT-5.6 Sol a los usuarios a hasta 750 tokens por segundo.

Advertencias detrás de los números de los titulares

Los analistas de la industria recomiendan cierta cautela con las cifras de marketing. El Registro señala que el título de 250 petaFLOPS de Cerebras se basa en la escasez, que generalmente no beneficia la inferencia de modelos de lenguaje grandes, y que las cifras de ancho de banda de memoria máxima son en gran medida teóricas, ya que el WSE-3 carecía de la capacidad de cómputo para saturar su propia SRAM. La publicación también cuestionó por qué Cerebras duplicó el rendimiento en lugar de aumentar la capacidad de SRAM, que no ha crecido significativamente desde el lanzamiento del WSE-2 hace cinco años, una elección curiosa en una era de inferencia desagregada donde los aceleradores de decodificación se benefician más de la memoria.

Aún así, la oportunidad de mercado es real. A medida que los chatbots y agentes de IA exigen tiempos de respuesta cada vez más rápidos, la velocidad de inferencia se ha convertido en un verdadero diferenciador competitivo, y Cerebras ahora ha demostrado que puede iterar su tecnología no convencional a escala de oblea con una cadencia comercial.

Los primeros envíos de CS-4 comienzan este trimestre y se espera que los primeros sistemas estén en línea antes de finales de septiembre. Queda por ver si eso será suficiente para hacer mella en el dominio de Nvidia, pero por primera vez en mucho tiempo, la inferencia de IA más rápida de la industria tiene una nueva dirección.

Manténgase por delante de la IA

Los lanzamientos de hardware como el CS-4 mueven mercados y redefinen lo que pueden hacer los sistemas de IA. Lea más noticias sobre IA para mantenerse al día con cada desarrollo.

Explore la cobertura más reciente sobre IA →