Cerebras Systems y OpenAI han compartido un vistazo inicial al modo ultrarrápido, un nuevo nivel de servicio que se lanza por primera vez en la API de OpenAI y funciona con la tecnología de escala de oblea de Cerebras. La asociación permite que GPT-5.6 Sol se ejecute a hasta 750 tokens de salida por segundo, brindando inteligencia de vanguardia a velocidades en tiempo real. Para conocer las últimas novedades sobre hardware de IA, visite AI Buzz Wire.

Eliminando el equilibrio entre velocidad e inteligencia

Los creadores de IA se han enfrentado durante mucho tiempo a una compensación fundamental: a medida que los modelos aumentan en tamaño e inteligencia, incurren en mayores costos computacionales y de movimiento de datos, lo que ralentiza los tiempos de respuesta. Los desarrolladores se vieron obligados a elegir entre esperar resultados de alta calidad o aceptar resultados inferiores en menos tiempo.

GPT-5.6 Sol en modo ultrarrápido está diseñado para resolver este dilema. Según Cerebras, el servicio se ejecuta 11 veces más rápido que Claude Fable 5 de Anthropic y 5 veces más rápido que Opus 4.8 en modo Rápido, según las velocidades de salida informadas por Artificial Analysis.

El último examen de la humanidad: la prueba de velocidad

Cerebras puso a prueba Ultrafast contra modelos competidores en el último examen de la humanidad (HLE), un desafiante punto de referencia que consta de 2500 preguntas que normalmente solo pueden responder aquellos con doctorados en campos como química, economía y literatura.

En las evaluaciones realizadas por Cerebras, GPT-5.6 Sol en modo ultrarrápido respondió las 2500 preguntas de HLE en 11 horas y 11 minutos. Claude Fable 5 requirió 78 horas y 27 minutos, más de tres días de cálculo continuo, para llegar a las mismas conclusiones. En otras palabras, Ultrafast procesó la frontera del conocimiento humano en un solo día de trabajo, logrando una precisión comparable casi siete veces más rápido.

Cerebras realizó la evaluación comparativa utilizando GPT-5.6 Sol Ultrafast con Codex en configuraciones de razonamiento alto el 10 de julio, y Claude Fable 5 con Claude Code en configuraciones de razonamiento alto del 13 al 15 de julio.

Impacto empresarial en el mundo real

En GDP-Val, un punto de referencia para tareas de trabajo de conocimiento económicamente valiosas, Ultrafast entregó una aceleración de extremo a extremo 5,6 veces sin degradación de la calidad. Esto demuestra cómo una inferencia más rápida puede acelerar un trabajo económicamente valioso sin sacrificar la calidad del resultado.

Cerebras visualiza Ultrafast como una herramienta para escenarios donde cada segundo importa. Las empresas que operan servicios web podrían utilizar la tecnología para solucionar y abordar las interrupciones de producción más rápidamente, preservando la confianza del cliente y evitando la pérdida de ingresos. En situaciones de ciberseguridad de alto riesgo, los equipos de seguridad podrían aprovechar Ultrafast para detectar y responder a los ataques rápidamente.

La tecnología detrás de la velocidad

La ventaja de rendimiento proviene de la arquitectura Wafer-Scale Engine de Cerebras, que está diseñada específicamente para cargas de trabajo de IA de vanguardia. El desafío principal de la inferencia de frontera rápida es un problema de movimiento de datos: en las GPU tradicionales, la inferencia en modelos grandes se ve obstaculizada por el ancho de banda de la memoria, ya que los pesos de los modelos deben transferirse repetidamente entre la memoria en el chip y el almacenamiento fuera del chip para generar tokens sucesivos.

Cerebras adopta un enfoque fundamentalmente diferente. Cada chip del tamaño de una oblea contiene 44 GB de SRAM directamente en el silicio. Los pesos de los modelos permanecen en el chip y los tokens fluyen ininterrumpidamente a través de las capas del modelo canalizadas a través de obleas. Esto elimina el movimiento de datos ineficiente que ralentiza la inferencia basada en GPU y escala suavemente con el tamaño del modelo, allanando el camino para una ventaja de velocidad continua en futuros modelos de vanguardia.

Disponibilidad y Posicionamiento en el Mercado

GPT-5.6 Sol en modo ultrarrápido está actualmente disponible en una vista previa limitada para un grupo selecto de clientes, y el acceso se ampliará con el tiempo a medida que crezca la capacidad. Cerebras describe la asociación como impulsora de la próxima ola de innovación en IA y elevando el límite de lo que las organizaciones pueden lograr con una IA responsiva.

La colaboración representa un hito importante para Cerebras, que durante mucho tiempo ha buscado la computación a escala de oblea como una alternativa al mercado de hardware de IA dominado por GPU. Al asociarse directamente con OpenAI para acelerar uno de los modelos de frontera más capaces disponibles, Cerebras está demostrando firmemente que su arquitectura ofrece una ventaja competitiva genuina para cargas de trabajo de inferencia de alta velocidad.

A medida que los modelos siguen creciendo y volviéndose más inteligentes, la capacidad de atenderlos a velocidades en tiempo real podría convertirse en un factor competitivo definitorio en el mercado de infraestructura de IA. La asociación Cerebras-OpenAI indica que la carrera por la velocidad de inferencia es ahora tan importante como la carrera por la inteligencia modelo.

Manténgase por delante de la IA

Para obtener más noticias sobre hardware de IA, análisis de rendimiento de modelos y desarrollos de la industria, marque AI Buzz Wire.

Leer más noticias sobre IA →