Cerebras y OpenAI le han dado al mundo una visión anticipada del Modo ultrarrápido, un nuevo nivel de servicio que se lanza primero en la API de OpenAI y funciona con hardware de Cerebras. Según el anuncio de Cerebras publicado el 13 de agosto de 2026, GPT-5.6 Sol ejecutado en Ultrafast ofrece hasta 750 tokens de salida por segundo, sin comprometer la calidad.
El nivel está disponible inicialmente para un grupo selecto de clientes y el acceso se ampliará con el tiempo. El anuncio, escrito por Joyce Er de Cerebras, posiciona la oferta como una solución a un compromiso que ha definido el desarrollo de productos de IA durante años: los constructores tuvieron que elegir entre velocidad e inteligencia, porque los modelos más grandes e inteligentes incurren en costos computacionales y de movimiento de datos más altos que ralentizan los tiempos de respuesta. Los lectores que sigan la carrera para acelerar los modelos fronterizos pueden seguir los últimos desarrollos en AI Buzz Wire.
¿Qué tan rápido es exactamente ultrarrápido?
La cifra bruta de rendimiento es sorprendente por sí sola, pero Cerebras también proporcionó un contexto comparativo. Según las velocidades de salida informadas por Artificial Analysis, un servicio de evaluación comparativa independiente, GPT-5.6 Sol en modo ultrarrápido ejecuta:
- 11 veces más rápido que Fable 5
- 5 veces más rápido que Opus 4.8 en modo Rápido
Para poner a prueba la afirmación, Cerebras comparó el modelo cara a cara con competidores populares en el Último examen de la humanidad (HLE), un punto de referencia desafiante que consta de 2500 preguntas que generalmente solo pueden responder personas con doctorados en campos como química, economía y literatura.
El resultado: GPT-5.6 Sol en Ultrafast respondió las 2500 preguntas de HLE en 11 horas y 11 minutos. Claude Fable 5 necesitó 78 horas y 27 minutos (más de tres días de cálculo continuo) para llegar a las mismas conclusiones. En otras palabras, Ultrafast atravesó la frontera del conocimiento humano en un solo día de trabajo y logró una precisión comparable casi siete veces más rápida.
Cerebras destacó su metodología de evaluación comparativa: GPT-5.6 Sol Ultrafast se probó con Codex en razonamiento xhigh el 10 de julio, mientras que Claude Fable 5 se probó con Claude Code en razonamiento xhigh del 13 al 15 de julio.
Cargas de trabajo del mundo real, no sólo puntos de referencia
Los puntos de referencia de velocidad pueden ser engañosos si la calidad se degrada en el camino, razón por la cual Cerebras también destacó los resultados en GDP-Val, un punto de referencia para tareas de trabajo de conocimiento económicamente valiosas. En GDP-Val, Ultrafast entregó una aceleración de extremo a extremo de 5,6 veces sin degradación de la calidad, según las pruebas que Cerebras realizó el 31 de julio de 2026 utilizando GPT-5.6 Sol y GPT-5.6 Sol Ultrafast en razonamiento medio dentro del Codex.
La compañía dice que GPT-5.6 Sol es el mejor modelo de OpenAI hasta el momento para informes legales, modelos financieros e informes de ingeniería, dominios donde la calidad de la producción y el tiempo de respuesta tienen consecuencias financieras directas.
Por qué la velocidad cambia la ecuación del agente
El cambio más trascendental puede estar en la forma en que operan los agentes de IA. Una inferencia más rápida cambia lo que es posible para los individuos y las organizaciones, porque los agentes pueden ubicarse en el camino crítico de los problemas donde cada segundo cuenta.
"Con GPT-5.6 Sol Ultrafast, Cerebras habilita una IA que se mantiene al día con su forma de pensar, codificar y colaborar", dijo Rohan Varma, Producto de OpenAI, en un comunicado citado en el anuncio. "Estamos entusiasmados de ver cómo la inferencia ultrarrápida transforma los flujos de trabajo y las aplicaciones".
Cerebras describió varios escenarios de alto riesgo en los que la aceleración importa:
Respuesta al incidente
Las empresas que operan servicios web pueden utilizar Ultrafast para solucionar y abordar las interrupciones de producción, preservando la confianza del cliente, evitando la pérdida de ingresos y ahorrando minutos de tiempo de inactividad en sus acuerdos de nivel de servicio.Ciberseguridad
En los ciberataques adversarios y de alto riesgo, los equipos de seguridad deben detectar y responder rápidamente a los malos actores para contener pérdidas catastróficas, una tarea en la que la latencia de inferencia afecta directamente el control de daños.Productividad del agente
Ultrafast permite nuevos modos de trabajar con agentes al brindar información y actualizaciones en tiempo real, lo que reduce la necesidad de cambiar de contexto entre sesiones paralelas."Mientras que antes tenía que esperar un par de minutos para que terminara una tarea, ahora termina antes de que tenga la oportunidad de cambiar de contexto. Me hace mucho más productivo", dijo Jeffrey Wang, investigador de OpenAI, en el anuncio.
La estrategia detrás de la asociación
Para Cerebras, el acuerdo representa otro hito en su esfuerzo por comercializar la aceleración a escala de oblea para la inferencia de IA. Para OpenAI, el modo ultrarrápido agrega un nivel de velocidad premium a su API en un momento en que la latencia de inferencia se ha convertido en un diferenciador competitivo, particularmente para aplicaciones agentes que encadenan muchas llamadas de modelos, donde los retrasos por llamada se convierten en minutos de espera.
Las empresas enmarcan el nivel como una ventaja persistente para las organizaciones que utilizan IA de vanguardia para responder rápidamente a la información entrante, combinando el procesamiento ultrarrápido para trabajos urgentes con el procesamiento estándar para tareas básicas que pueden paralelizarse en segundo plano.
El acceso se está implementando gradualmente. Los desarrolladores interesados pueden monitorear la disponibilidad de la documentación de la API OpenAI, ya que Cerebras dice que el acceso se expandirá con el tiempo desde el grupo selecto inicial de clientes.
Manténgase por delante de la IA
Para obtener más cobertura sobre la carrera de hardware e infraestructura que está remodelando la inteligencia artificial, marque AI Buzz Wire y siga nuestro feed AI hardware news.
Leer más noticias sobre IA →