Cerebras et OpenAI ont donné au monde un aperçu du Ultrafast Mode, un nouveau niveau de service lancé en premier dans l'API OpenAI et alimenté par le matériel Cerebras. Selon l'annonce de Cerebras publiée le 13 août 2026, GPT-5.6 Sol fonctionnant sur Ultrafast fournit jusqu'à 750 jetons de sortie par seconde — sans compromis sur la qualité.
Le niveau est initialement disponible pour un groupe sélectionné de clients, avec un accès élargi au fil du temps. L'annonce, rédigée par Joyce Er de Cerebras, positionne l'offre comme une solution à un compromis qui définit le développement de produits d'IA depuis des années : les constructeurs devaient choisir entre vitesse et intelligence, car les modèles plus grands et plus intelligents entraînent des coûts de calcul et de déplacement de données plus élevés qui ralentissent les temps de réponse. Les lecteurs qui suivent la course à l'accélération des modèles pionniers peuvent suivre les derniers développements sur AI Buzz Wire.
Quelle est la vitesse ultrarapide, exactement ?
Le chiffre brut du débit est frappant en soi, mais Cerebras a également fourni un contexte comparatif. Selon les vitesses de sortie signalées par Artificial Analysis, un service d'analyse comparative indépendant, GPT-5.6 Sol en mode Ultrafast exécute :
- 11x plus rapide que Fable 5
- 5x plus rapide que l'Opus 4.8 en mode rapide
Pour tester cette affirmation, Cerebras a confronté le modèle à des concurrents populaires lors du Dernier examen de l'humanité (HLE), un test de référence difficile composé de 2 500 questions auxquelles seules les personnes titulaires d'un doctorat dans des domaines tels que la chimie, l'économie et la littérature doivent généralement répondre.
Le résultat : GPT-5.6 Sol sur Ultrafast a répondu aux 2 500 questions HLE en 11 heures et 11 minutes. Claude Fable 5 a eu besoin de 78 heures et 27 minutes, soit plus de trois jours de calcul continu, pour arriver aux mêmes conclusions. En d’autres termes, Ultrafast a franchi la frontière de la connaissance humaine en une seule journée de travail, atteignant une précision comparable près de 7 fois plus rapidement.
Cerebras a souligné sa méthodologie d'analyse comparative : GPT-5.6 Sol Ultrafast a été testé avec Codex sur un raisonnement xhigh le 10 juillet, tandis que Claude Fable 5 a été testé avec Claude Code sur un raisonnement xhigh du 13 au 15 juillet.
Charges de travail réelles, pas seulement des benchmarks
Les benchmarks de vitesse peuvent être trompeurs si la qualité se dégrade en cours de route, c'est pourquoi Cerebras a également mis en avant les résultats de GDP-Val, un benchmark pour les tâches de travail de connaissances à valeur économique. Sur GDP-Val, Ultrafast a fourni une accélération de bout en bout de 5,6x sans dégradation de la qualité, selon les tests effectués par Cerebras le 31 juillet 2026 en utilisant GPT-5.6 Sol et GPT-5.6 Sol Ultrafast sur un raisonnement moyen au sein du Codex.
La société affirme que GPT-5.6 Sol est le meilleur modèle d'OpenAI à ce jour pour les mémoires juridiques, les modèles financiers et les rapports d'ingénierie – des domaines où la qualité des résultats et les délais d'exécution ont tous deux des conséquences financières directes.
Pourquoi la vitesse modifie l'équation de l'agent
Le changement le plus conséquent pourrait concerner la manière dont les agents d’IA fonctionnent. Une inférence plus rapide change ce qui est possible pour les individus et les organisations, car les agents peuvent être placés sur le chemin critique des problèmes où chaque seconde compte.
"Avec GPT-5.6 Sol Ultrafast, Cerebras permet une IA qui suit la façon dont vous pensez, codez et collaborez", a déclaré Rohan Varma, produit chez OpenAI, dans une déclaration citée dans l'annonce. "Nous sommes ravis de voir comment les flux de travail et les applications sont transformés par l'inférence Ultrafast."
Cerebras a décrit plusieurs scénarios à enjeux élevés dans lesquels l’accélération est importante :
Réponse aux incidents
Les entreprises exploitant des services Web peuvent utiliser Ultrafast pour identifier et résoudre les pannes de production, en préservant la confiance des clients, en évitant les pertes de revenus et en économisant des minutes d'arrêt par rapport à leurs SLA.Cybersécurité
Lors de cyberattaques contradictoires aux enjeux élevés, les équipes de sécurité doivent détecter rapidement les acteurs malveillants et y répondre pour contenir les pertes catastrophiques – une tâche où la latence d’inférence affecte directement le contrôle des dégâts.Productivité des agents
Ultrafast permet de nouveaux modes de travail avec les agents en fournissant des informations et des mises à jour en temps réel, réduisant ainsi le besoin de changer de contexte entre les sessions parallèles."Alors qu'auparavant je devais attendre quelques minutes pour qu'une tâche se termine, elle se termine désormais pour moi avant même d'avoir la possibilité de changer de contexte. Cela me rend beaucoup plus productif", a déclaré Jeffrey Wang, chercheur à OpenAI, dans l'annonce.
La stratégie derrière le partenariat
Pour Cerebras, cet accord représente une nouvelle étape dans ses efforts visant à commercialiser l’accélération à l’échelle d’une tranche pour l’inférence de l’IA. Pour OpenAI, le mode Ultrafast ajoute un niveau de vitesse premium à son API à un moment où la latence d'inférence est devenue un différenciateur concurrentiel, en particulier pour les applications agentiques qui enchaînent de nombreux appels de modèle, où les retards par appel se transforment en minutes d'attente.
Les entreprises présentent ce niveau comme un avantage persistant pour les organisations qui utilisent l'IA de pointe pour répondre rapidement aux informations entrantes, en associant le traitement ultrarapide pour les travaux urgents à un traitement standard pour les tâches de base qui peuvent être parallélisées en arrière-plan.
L'accès se déploie progressivement. Les développeurs intéressés peuvent surveiller la disponibilité de la documentation de l'API OpenAI, car Cerebras indique que l'accès s'étendra au fil du temps à partir du groupe initial sélectionné de clients.
Gardez une longueur d'avance sur l'IA
Pour plus de couverture sur la course au matériel et aux infrastructures qui remodèle l'intelligence artificielle, ajoutez AI Buzz Wire à vos favoris et suivez notre flux AI hardware news.
Lire plus d'actualités sur l'IA →