Cerebras Systems en OpenAI hebben een vroege blik gedeeld op de Ultrafast Mode, een nieuwe servicelaag die als eerste wordt gelanceerd in de OpenAI API en mogelijk wordt gemaakt door Cerebras-technologie op wafelschaal. Dankzij de samenwerking kan GPT-5.6 Sol met maximaal 750 uitvoertokens per seconde werken, waardoor intelligentie op grensniveau wordt geleverd met realtime snelheden. Ga voor het laatste AI-hardwarenieuws naar AI Buzz Wire.

Het elimineren van de afweging tussen snelheid en intelligentie

AI-bouwers hebben lange tijd te maken gehad met een fundamentele afweging: naarmate modellen groter en intelligenter worden, krijgen ze te maken met hogere reken- en dataverplaatsingskosten, waardoor de responstijden worden vertraagd. Ontwikkelaars werden gedwongen te kiezen tussen wachten op resultaten van hoge kwaliteit of het accepteren van inferieure resultaten in minder tijd.

GPT-5.6 Sol in ultrasnelle modus is ontworpen om dit dilemma op te lossen. Volgens Cerebras werkt de dienst 11 keer sneller dan Claude Fable van Anthropic, 5 en 5 keer sneller dan Opus 4.8 in de Fast-modus, gebaseerd op uitvoersnelheden gerapporteerd door Artificial Analysis.

Het laatste examen van de mensheid: de snelheidstest

Cerebras heeft Ultrafast op de proef gesteld met concurrerende modellen op Humanity's Last Exam (HLE), een uitdagende benchmark die bestaat uit 2.500 vragen die doorgaans alleen kunnen worden beantwoord door mensen die gepromoveerd zijn op gebieden als scheikunde, economie en literatuur.

In evaluaties uitgevoerd door Cerebras beantwoordde GPT-5.6 Sol in de Ultrafast-modus alle 2.500 HLE-vragen in 11 uur en 11 minuten. Claude Fable 5 had 78 uur en 27 minuten nodig, meer dan drie dagen continu rekenwerk, om tot dezelfde conclusies te komen. Met andere woorden, Ultrafast verwerkte de grenzen van de menselijke kennis in één werkdag en bereikte bijna zeven keer sneller een vergelijkbare nauwkeurigheid.

Benchmarking werd uitgevoerd door Cerebras met behulp van GPT-5.6 Sol Ultrafast met Codex op hoge redeneerinstellingen op 10 juli, en Claude Fable 5 met Claude Code op hoge redeneerinstellingen van 13 tot 15 juli.

Zakelijke impact in de echte wereld

Op GDP-Val, een benchmark voor economisch waardevolle kenniswerktaken, leverde Ultrafast een end-to-end versnelling van 5,6x zonder kwaliteitsverlies. Dit laat zien hoe snellere gevolgtrekkingen economisch waardevol werk kunnen versnellen zonder dat dit ten koste gaat van de uitvoerkwaliteit.

Cerebras ziet Ultrafast als een hulpmiddel voor scenario's waarin elke seconde ertoe doet. Bedrijven die webservices exploiteren, zouden de technologie kunnen gebruiken om productiestoringen sneller aan te pakken en aan te pakken, waardoor het vertrouwen van de klant behouden blijft en verloren inkomsten worden voorkomen. In cyberbeveiligingssituaties waar veel op het spel staat, kunnen beveiligingsteams Ultrafast gebruiken om aanvallen snel te detecteren en erop te reageren.

De technologie achter de snelheid

Het prestatievoordeel komt voort uit de Wafer-Scale Engine-architectuur van Cerebras, die speciaal is gebouwd voor grensverleggende AI-workloads. De kernuitdaging van fast frontier inference is een probleem met de verplaatsing van gegevens: op traditionele GPU's wordt de inferentie op grote modellen belemmerd door de geheugenbandbreedte, omdat modelgewichten herhaaldelijk moeten worden overgedragen tussen on-chip geheugen en off-chip opslag om opeenvolgende tokens te genereren.

Cerebras hanteert een fundamenteel andere aanpak. Elke chip ter grootte van een wafer bevat 44 GB SRAM rechtstreeks op het silicium. Modelgewichten blijven op de chip en tokens stromen ononderbroken door modellagen die over wafers zijn geleid. Dit elimineert de inefficiënte gegevensverplaatsing die GPU-gebaseerde inferentie vertraagt ​​en schaalt soepel mee met de modelgrootte, waardoor de weg wordt vrijgemaakt voor een aanhoudend snelheidsvoordeel op toekomstige grensmodellen.

Beschikbaarheid en marktpositionering

GPT-5.6 Sol in Ultrafast-modus is momenteel beschikbaar in een beperkte preview voor een selecte groep klanten, waarbij de toegang in de loop van de tijd wordt uitgebreid naarmate de capaciteit groeit. Cerebras beschrijft het partnerschap als het aandrijven van de volgende golf van AI-innovatie en het verhogen van het plafond voor wat organisaties kunnen bereiken met responsieve AI.

De samenwerking betekent een belangrijke mijlpaal voor Cerebras, dat al lange tijd wafer-scale computing nastreeft als alternatief voor de GPU-gedomineerde AI-hardwaremarkt. Door rechtstreeks samen te werken met OpenAI om een ​​van de meest capabele frontier-modellen die beschikbaar zijn te versnellen, maakt Cerebras een sterk argument dat zijn architectuur een echt concurrentievoordeel biedt voor snelle inferentieworkloads.

Naarmate modellen groter en intelligenter worden, kan het vermogen om ze met realtime snelheden te bedienen een bepalende concurrentiefactor worden op de AI-infrastructuurmarkt. Het Cerebras-OpenAI-partnerschap geeft aan dat de race om inferentiesnelheid nu net zo belangrijk is als de race om modelintelligentie.

Blijf AI een stap voor

Voor meer AI-hardwarenieuws, analyse van modelprestaties en ontwikkelingen in de sector kunt u een bladwijzer maken voor AI Buzz Wire.

Lees meer AI-nieuws →