Cerebras Systems och OpenAI har delat en tidig titt på Ultrafast Mode, en ny tjänstenivå som lanseras först i OpenAI API och drivs av Cerebras wafer-scale-teknologi. Samarbetet gör det möjligt för GPT-5.6 Sol att köras med upp till 750 utdata-tokens per sekund, vilket ger gränsöverskridande intelligens i realtidshastigheter. För de senaste nyheterna om AI-hårdvara, besök AI Buzz Wire.
Eliminerar avvägningen mellan hastighet och intelligens
AI-byggare har länge stått inför en grundläggande kompromiss: när modeller skalas upp i storlek och intelligens, ådrar de sig högre beräknings- och dataöverföringskostnader, vilket saktar ner svarstiderna. Utvecklare tvingades välja mellan att vänta på resultat av hög kvalitet eller att acceptera sämre resultat på kortare tid.
GPT-5.6 Sol på Ultrafast Mode är designad för att lösa detta dilemma. Enligt Cerebras går tjänsten 11 gånger snabbare än Anthropics Claude Fable 5 och 5 gånger snabbare än Opus 4.8 i snabbläge, baserat på utgångshastigheter som rapporterats av artificiell analys.
Mänsklighetens sista examen: Hastighetstestet
Cerebras satte Ultrafast på prov mot konkurrerande modeller på Humanity's Last Exam (HLE), ett utmanande riktmärke som består av 2 500 frågor som vanligtvis endast kan besvaras av dem som har doktorerat inom områden som kemi, ekonomi och litteratur.
I utvärderingar utförda av Cerebras svarade GPT-5.6 Sol på Ultrafast Mode på alla 2 500 HLE-frågor på 11 timmar och 11 minuter. Claude Fable 5 krävde 78 timmar och 27 minuter, mer än tre dagars kontinuerlig beräkning, för att komma fram till samma slutsatser. Med andra ord, Ultrafast bearbetade gränsen för mänsklig kunskap på en enda arbetsdag och uppnådde jämförbar noggrannhet nästan sju gånger snabbare.
Benchmarking utfördes av Cerebras med GPT-5.6 Sol Ultrafast med Codex på höga resonemangsinställningar den 10 juli och Claude Fable 5 med Claude Code på höga resonemangsinställningar från 13 till 15 juli.
Verkliga affärseffekter
På GDP-Val, ett riktmärke för ekonomiskt värdefulla kunskapsarbetsuppgifter, levererade Ultrafast en 5,6x end-to-end speedup utan kvalitetsförsämring. Detta visar hur snabbare slutledning kan påskynda ekonomiskt värdefullt arbete utan att ge avkall på utskriftskvaliteten.
Cerebras ser Ultrafast som ett verktyg för scenarier där varje sekund är viktig. Företag som driver webbtjänster skulle kunna använda tekniken för att orsaka och åtgärda produktionsavbrott snabbare, bevara kundernas förtroende och förhindra förlorade intäkter. I cybersäkerhetssituationer med hög insats kan säkerhetsteam utnyttja Ultrafast för att snabbt upptäcka och svara på attacker.
Tekniken bakom hastigheten
Prestandafördelen härrör från Cerebras Wafer-Scale Engine-arkitektur, som är specialbyggd för frontier AI-arbetsbelastningar. Kärnutmaningen med snabb gränsinferens är ett problem med datarörelser: på traditionella GPU:er är slutledningar på stora modeller flaskhalsade av minnesbandbredd, eftersom modellvikter upprepade gånger måste överföras mellan on-chip-minne och off-chip-lagring för att generera successiva tokens.
Cerebras tar ett fundamentalt annorlunda tillvägagångssätt. Varje chip i waferstorlek har 44 GB SRAM direkt på kislet. Modellvikter förblir på chipet och tokens flödar oavbrutet genom modelllager som rör sig över wafers. Detta eliminerar den ineffektiva datarörelsen som saktar ner GPU-baserad slutledning och skalas smidigt med modellstorlek, vilket banar väg för en fortsatt hastighetsfördel på framtida gränsmodeller.
Tillgänglighet och marknadspositionering
GPT-5.6 Sol på ultrasnabbt läge är för närvarande tillgänglig i en begränsad förhandsvisning för en utvald grupp kunder, med åtkomst som utökas med tiden när kapaciteten växer. Cerebras beskriver partnerskapet som att driva nästa våg av AI-innovation och höja taket för vad organisationer kan åstadkomma med responsiv AI.
Samarbetet representerar en betydande milstolpe för Cerebras, som länge har strävat efter wafer-scale computing som ett alternativ till den GPU-dominerade AI-hårdvarumarknaden. Genom att samarbeta direkt med OpenAI för att accelerera en av de mest kapabla frontiermodellerna som finns, gör Cerebras ett starkt argument för att dess arkitektur erbjuder en verklig konkurrensfördel för höghastighets slutledningsarbetsbelastningar.
När modellerna fortsätter att växa sig större och mer intelligenta, kan möjligheten att betjäna dem i realtidshastigheter bli en avgörande konkurrensfaktor på marknaden för AI-infrastruktur. Cerebras-OpenAI-samarbetet signalerar att kapplöpningen om inferenshastighet nu är lika viktig som kapplöpningen om modellintelligens.
Ligg före AI
För fler nyheter om AI-hårdvara, analys av modellprestanda och branschutveckling, bokmärk AI Buzz Wire.
Läs mer AI-nyheter →