Cerebras Systems et OpenAI ont partagé un premier aperçu du mode Ultrafast, un nouveau niveau de service lancé pour la première fois dans l'API OpenAI et alimenté par la technologie à l'échelle des tranches de Cerebras. Le partenariat permet à GPT-5.6 Sol de fonctionner jusqu'à 750 jetons de sortie par seconde, fournissant ainsi une intelligence de premier plan à des vitesses en temps réel. Pour les dernières nouvelles sur le matériel IA, visitez AI Buzz Wire.

Éliminer le compromis vitesse-intelligence

Les développeurs d’IA sont depuis longtemps confrontés à un compromis fondamental : à mesure que les modèles augmentent en taille et en intelligence, ils supportent des coûts de calcul et de déplacement de données plus élevés, ce qui ralentit les temps de réponse. Les développeurs ont été contraints de choisir entre attendre des résultats de haute qualité ou accepter des résultats inférieurs en moins de temps.

GPT-5.6 Sol en mode ultrarapide est conçu pour résoudre ce dilemme. Selon Cerebras, le service fonctionne 11 fois plus vite que Claude Fable 5 d'Anthropic et 5 fois plus vite que l'Opus 4.8 en mode rapide, sur la base des vitesses de sortie signalées par Artificial Analysis.

Le dernier examen de l'humanité : le test de vitesse

Cerebras a mis Ultrafast à l'épreuve par rapport à des modèles concurrents lors du dernier examen de l'humanité (HLE), un test de référence exigeant composé de 2 500 questions auxquelles seuls les titulaires de doctorats dans des domaines tels que la chimie, l'économie et la littérature doivent généralement répondre.

Lors des évaluations menées par Cerebras, GPT-5.6 Sol en mode ultrarapide a répondu aux 2 500 questions HLE en 11 heures et 11 minutes. Claude Fable 5 a nécessité 78 heures et 27 minutes, soit plus de trois jours de calcul continu, pour arriver aux mêmes conclusions. En d’autres termes, Ultrafast a traité la frontière de la connaissance humaine en une seule journée de travail, atteignant une précision comparable près de sept fois plus rapidement.

L'analyse comparative a été réalisée par Cerebras en utilisant GPT-5.6 Sol Ultrafast avec Codex sur des paramètres de raisonnement élevés le 10 juillet, et Claude Fable 5 avec Claude Code sur des paramètres de raisonnement élevés du 13 au 15 juillet.

Impact commercial réel

Sur GDP-Val, une référence pour les tâches de travail de connaissances à valeur économique, Ultrafast a fourni une accélération de bout en bout de 5,6 fois sans dégradation de la qualité. Cela démontre à quel point une inférence plus rapide peut accélérer un travail économiquement rentable sans sacrifier la qualité du résultat.

Cerebras envisage Ultrafast comme un outil pour les scénarios où chaque seconde compte. Les entreprises exploitant des services Web pourraient utiliser cette technologie pour identifier et résoudre plus rapidement les pannes de production, préservant ainsi la confiance des clients et évitant les pertes de revenus. Dans des situations de cybersécurité à enjeux élevés, les équipes de sécurité pourraient tirer parti d’Ultrafast pour détecter et répondre rapidement aux attaques.

La technologie derrière la vitesse

L'avantage en termes de performances provient de l'architecture Wafer-Scale Engine de Cerebras, spécialement conçue pour les charges de travail d'IA de pointe. Le principal défi de l'inférence rapide est un problème de mouvement des données : sur les GPU traditionnels, l'inférence sur de grands modèles est gênée par la bande passante mémoire, car les poids des modèles doivent être transférés à plusieurs reprises entre la mémoire sur puce et le stockage hors puce pour générer des jetons successifs.

Cerebras adopte une approche fondamentalement différente. Chaque puce de la taille d'une tranche contient 44 Go de SRAM directement sur le silicium. Les poids des modèles restent sur la puce et les jetons circulent sans interruption à travers les couches de modèles acheminées sur les tranches. Cela élimine le mouvement inefficace des données qui ralentit l'inférence basée sur le GPU et s'adapte en douceur à la taille du modèle, ouvrant la voie à un avantage continu en termes de vitesse sur les futurs modèles pionniers.

Disponibilité et positionnement sur le marché

GPT-5.6 Sol en mode ultrarapide est actuellement disponible dans une version préliminaire limitée pour un groupe sélectionné de clients, l'accès s'étendant au fil du temps à mesure que la capacité augmente. Cerebras décrit le partenariat comme alimentant la prochaine vague d'innovation en matière d'IA et rehaussant le plafond de ce que les organisations peuvent accomplir avec une IA réactive.

Cette collaboration représente une étape importante pour Cerebras, qui recherche depuis longtemps le calcul à l'échelle d'une tranche comme alternative au marché du matériel d'IA dominé par les GPU. En s'associant directement à OpenAI pour accélérer l'un des modèles frontières les plus performants disponibles, Cerebras démontre clairement que son architecture offre un véritable avantage concurrentiel pour les charges de travail d'inférence à haut débit.

À mesure que les modèles continuent de croître et de devenir plus intelligents, la capacité de les servir à des vitesses en temps réel pourrait devenir un facteur concurrentiel déterminant sur le marché des infrastructures d’IA. Le partenariat Cerebras-OpenAI signale que la course à la vitesse d’inférence est désormais aussi importante que la course à l’intelligence des modèles.

Gardez une longueur d'avance sur l'IA

Pour plus d'informations sur le matériel d'IA, l'analyse des performances des modèles et les développements du secteur, ajoutez AI Buzz Wire à vos favoris.

Lire plus d'actualités sur l'IA →