Cerebras en OpenAI hebben de wereld een eerste blik gegeven op Ultrafast Mode, een nieuwe servicelaag die als eerste wordt gelanceerd in de OpenAI API en wordt aangedreven door Cerebras-hardware. Volgens de Cerebras-aankondiging die op 13 augustus 2026 werd gepubliceerd, levert GPT-5.6 Sol op Ultrafast tot 750 uitvoertokens per seconde — zonder concessies te doen aan de kwaliteit.
Het niveau is in eerste instantie beschikbaar voor een selecte groep klanten, waarbij de toegang in de loop van de tijd wordt uitgebreid. De aankondiging, geschreven door Joyce Er van Cerebras, positioneert het aanbod als een oplossing voor een afweging die de ontwikkeling van AI-producten jarenlang heeft gedefinieerd: bouwers moesten kiezen tussen snelheid en intelligentie, omdat grotere en slimmere modellen hogere reken- en dataverplaatsingskosten met zich meebrengen die de responstijden vertragen. Lezers die de race volgen om grensmodellen te versnellen, kunnen de nieuwste ontwikkelingen volgen op [AI Buzz Wire] (https://aibuzzwire.news).
Hoe snel is ultrasnel precies?
Het ruwe doorvoercijfer is op zichzelf al opvallend, maar Cerebras leverde ook een vergelijkende context. Volgens uitvoersnelheden gerapporteerd door Artificial Analysis, een onafhankelijke benchmarkingservice, draait GPT-5.6 Sol in Ultrafast-modus:
- 11x sneller dan Fabel 5
- 5x sneller dan Opus 4.8 in de snelle modus
Om de bewering te onderbouwen, voerde Cerebras het model uit tegen populaire concurrenten op Humanity's Last Exam (HLE), een uitdagende benchmark die bestaat uit 2.500 vragen die doorgaans alleen beantwoord kunnen worden door mensen die gepromoveerd zijn op gebieden als scheikunde, economie en literatuur.
Het resultaat: GPT-5.6 Sol op Ultrafast beantwoordde alle 2.500 HLE-vragen in 11 uur en 11 minuten. Claude Fable 5 had 78 uur en 27 minuten nodig (meer dan drie dagen continu rekenwerk) om tot dezelfde conclusies te komen. Met andere woorden: Ultrafast heeft in één werkdag de grenzen van de menselijke kennis overschreden en een vergelijkbare nauwkeurigheid bijna 7x sneller bereikt.
Cerebras merkte zijn benchmarkingmethodologie op: GPT-5.6 Sol Ultrafast werd op 10 juli getest met Codex op xhigh-redenering, terwijl Claude Fable 5 werd getest met Claude Code op xhigh-redenering van 13 tot 15 juli.
Werklasten uit de echte wereld, niet alleen benchmarks
Snelheidsbenchmarks kunnen misleidend zijn als de kwaliteit gaandeweg achteruitgaat. Daarom heeft Cerebras ook de resultaten benadrukt van GDP-Val, een benchmark voor economisch waardevolle kenniswerktaken. Op GDP-Val leverde Ultrafast een 5,6x end-to-end versnelling zonder kwaliteitsverlies, volgens tests die Cerebras op 31 juli 2026 uitvoerde met GPT-5.6 Sol en GPT-5.6 Sol Ultrafast op medium redenering binnen Codex.
Het bedrijf zegt dat GPT-5.6 Sol OpenAI's beste model tot nu toe is voor juridische instructies, financiële modellen en technische rapporten – domeinen waar uitvoerkwaliteit en doorlooptijd beide directe financiële gevolgen hebben.
Waarom snelheid de agentvergelijking verandert
De meer consequente verschuiving kan te maken hebben met de manier waarop AI-agenten opereren. Snellere gevolgtrekkingen veranderen wat mogelijk is voor individuen en organisaties, omdat agenten op het kritieke pad van problemen kunnen worden geplaatst waar elke seconde telt.
"Met GPT-5.6 Sol Ultrafast maakt Cerebras AI mogelijk die gelijke tred houdt met hoe je denkt, codeert en samenwerkt", zegt Rohan Varma, Product bij OpenAI, in een verklaring die in de aankondiging wordt geciteerd. "We zijn enthousiast om te zien hoe workflows en applicaties worden getransformeerd door Ultrafast-inferentie."
Cerebras schetste verschillende scenario’s met hoge inzet waarbij de versnelling ertoe doet:
Reactie op incidenten
Bedrijven die webservices exploiteren, kunnen Ultrafast gebruiken om productiestoringen te achterhalen en aan te pakken, het vertrouwen van de klant te behouden, omzetverlies te voorkomen en downtime-minuten te besparen ten opzichte van hun SLA's.Cyberbeveiliging
Bij vijandige cyberaanvallen met hoge inzet moeten beveiligingsteams snel kwaadwillige actoren detecteren en erop reageren om catastrofale verliezen te beperken – een taak waarbij de latentie van gevolgtrekkingen rechtstreeks van invloed is op de schadebeheersing.Productiviteit van agenten
Ultrafast maakt nieuwe manieren van werken met agenten mogelijk door realtime inzichten en updates te leveren, waardoor de noodzaak voor contextwisseling tussen parallelle sessies wordt verminderd."Waar ik voorheen misschien een paar minuten moest wachten voordat een taak was voltooid, is deze nu voor mij klaar voordat ik zelfs maar de kans heb om van context te wisselen. Het maakt me veel productiever", zegt Jeffrey Wang, een onderzoeker bij OpenAI, in de aankondiging.
De strategie achter het partnerschap
Voor Cerebras betekent de deal een nieuwe mijlpaal in haar inspanningen om versnelling op wafelschaal voor AI-inferentie te commercialiseren. Voor OpenAI voegt Ultrafast Mode een premium snelheidsniveau toe aan de API op een moment waarop inferentielatentie een concurrentiedifferentiator is geworden – vooral voor agentische toepassingen die veel modeloproepen aan elkaar koppelen, waarbij vertragingen per oproep oplopen tot minuten wachten.
De bedrijven beschouwen de laag als een aanhoudend voordeel voor organisaties die grensverleggende AI gebruiken om snel te reageren op binnenkomende informatie, waarbij ultrasnelle verwerking voor tijdgevoelig werk wordt gecombineerd met standaardverwerking voor standaardtaken die op de achtergrond kunnen worden geparallelliseerd.
Toegang wordt geleidelijk uitgerold. Geïnteresseerde ontwikkelaars kunnen de OpenAI API-documentatie controleren op beschikbaarheid, aangezien Cerebras zegt dat de toegang in de loop van de tijd zal uitbreiden van de aanvankelijke selecte groep klanten.
Blijf AI een stap voor
Voor meer berichtgeving over de hardware- en infrastructuurrace die kunstmatige intelligentie hervormt, kunt u een bladwijzer maken voor AI Buzz Wire en onze AI-hardwarenieuws feed volgen.
Lees meer AI-nieuws →