Cerebras har tagit av sig CS-4, ett AI-inferenssystem i rackskala byggt kring sin nya WSE-3 Turbo wafer-scale-processor, och hävdar att maskinen levererar upp till 30 gånger snabbare slutledning än GPU-baserade system eftersom företaget positionerar sig som hastighetsalternativet till Nvidias datacenterimperium.

Lanseringen, som tillkännagavs på tisdagen och detaljerad över företagets produktsidor och en våg av bevakning från Reuters, Bloomberg och The Register, markerar Cerebras viktigaste hårdvaruuppdatering sedan börsnoteringen – och ett avgörande ögonblick för ett företag vars aktie har kämpat sedan börsintroduktionen. Investerare verkar vara uppmärksamma: aktierna i Cerebras (CBRS) steg på nyheterna, och Investors Business Daily citerade vd-kommentaren att AI-marknaden "växer så snabbt."

För läsare som följer den accelererande kapplöpningen för att få AI-modeller att reagera snabbare är lanseringen av CS-4 en av kvartalets mest följdriktiga hårdvaruhistorier, och den landar mitt i bredare förändringar i AI-branschens täckning som fortsätter att omforma datorlandskapet.

Vad finns inuti CS-4

Huvudkomponenten är WSE-3 Turbo, en uppgraderad version av Cerebras Wafer Scale Engine i mattallrikstorlek. Enligt The Registers tekniska djupdykning är WSE-3T inte nytt kisel – den behåller samma TSMC 5nm-process, 46 225 kvadratmillimeter formarea, 4 biljoner transistorer, 900 000 kärnor och 44 GB on-wafer SRAM som den två år gamla WSE-3.

Istället uppnådde Cerebras sin fördubbling av prestanda genom att pressa det befintliga chippet mycket hårdare. WSE-3T fördubblar gles FP16-beräkning till 250 petaFLOPS, fördubblar tät FP16-prestanda till uppskattningsvis 25 petaFLOPS, fördubblar minnesbandbredden till 43,2 petabyte per sekund och fördubblar I/O-bandbredden till 2,4 terabit per sekund. Registret uppskattar att företaget nu klockar kislet till cirka 2,8 GHz, upp från cirka 1,4 GHz i föregående generation.

Tricket, enligt Cerebras, är ett omdesignat kraftleveranssystem som sitter bara 0,5 millimeter från processorn - ungefär 100 gånger närmare än de ~50 millimeter som är typiska för konventionella GPU-kort. Den närheten eliminerar nästan strömförluster på kortnivå och tillåter dubbelt så mycket kraft att nå wafern, vilket möjliggör de högre driftsfrekvenserna bakom snabbare tokengenerering.

Nexus Rack-arkitekturen

Utöver själva chippet introducerar CS-4 vad Cerebras kallar Nexus Platform Architecture, dess första riktiga rack-skala design och ett direkt svar på Nvidias NVL72 och AMD:s Helios racksystem. Varje CS-4 kan bära upp till tre WSE-3T-processorer inrymda i fristående "Wafer-Scale Backpacks" — 3D-paket som viker wafern, kraftomvandling, direkt vätskekylning, höghastighets I/O och styrelektronik till en enda enhet med 50 % färre komponenter.

Den modulära designen separerar det stabila kraft-, kylnings- och nätverkslagret från datorn. En Cerebras PowerRack kan installeras och anläggningskvalificeras innan någon dator anländer, och ryggsäckarna glider sedan på plats – vilket minskar drifttiden från dagar till timmar, enligt företaget.

Strömförbrukningen är betydande. Registret uppskattar cirka 46 kW per ryggsäck och en total systemdragning på 120 till 140 kW – iögonfallande siffror som ändå ser konservativa ut bredvid 240 till 250 kW racksystemen AMD och Nvidia förväntas levereras senare i år.

Killing the Switch

Det kanske mest tekniskt intressanta valet är sammankopplingen. Istället för att dirigera wafer-to-wafer-trafik genom switchar – tillvägagångssättet som AWS antog för sina Trainium3-acceleratorer – kopplar Cerebras sina chips in i en 2D-torustopologi där närliggande wafers pratar direkt med varandra. Designen minskar wafer-to-wafer latens från fem mikrosekunder till bara två, och Cerebras säger att nätet kan stödja modeller med upp till 50 biljoner parametrar, bekvämt utöver allt som finns för närvarande.

Hastighetsresultaten är slående. På ett enda CS-4-system mätte benchmarkingföretaget Artificiell analys upp till 4 400 tokens per sekund per användare på gpt-oss-120b - ungefär 12 gånger de ~350 tokens per sekund av de snabbaste GPU-baserade slutledningstjänsterna som finns tillgängliga idag. Cerebras hävdar också att systemet upprätthåller mer än 1 000 tokens per sekund på modeller som överstiger 10 biljoner parametrar.

En disaggregerad partnerskapsstrategi

Noterbart är att Cerebras inte längre försöker köra hela slutledningsledningen på sitt eget kisel. Företaget har samarbetat med AWS och AMD för att ladda ner det beräkningsintensiva promptbearbetningsstadiet av slutledning till Trainium XPU:er respektive Instinct GPU:er, och lämnar dess wafer-skalamotorer att hantera den latenskänsliga avkodningsfasen där deras enorma SRAM-reserver lyser.

Lanseringen av CS-4 förlänger också Cerebras samarbete med OpenAI. Yahoo Finance rapporterade avslöjandet tillsammans med nya OpenAI- och AMD-partnerskap som syftar till att påskynda AI-inferens – med utgångspunkt i det ultrasnabba läget som företagen introducerade tidigare i augusti, vilket gav GPT-5.6 Sol till användare med upp till 750 tokens per sekund.

Varningar bakom rubriksiffrorna

Branschanalytiker manar till viss försiktighet med marknadsföringssiffrorna. Registret noterar att Cerebras rubrik 250 petaFLOPS förlitar sig på sparsitet, vilket i allmänhet inte gynnar stora språkmodellinferenser, och att siffror för toppminnesbandbredd till stor del är teoretiska eftersom WSE-3 saknade beräkningen för att mätta sitt eget SRAM. Publikationen ifrågasatte också varför Cerebras fördubblade prestanda snarare än att öka SRAM-kapaciteten, som inte har vuxit på ett meningsfullt sätt sedan WSE-2 lanserades för fem år sedan - ett märkligt val i en tid av disaggregerad slutledning där avkodningsacceleratorer drar mest nytta av minnet.

Ändå är marknadsmöjligheten reell. Eftersom AI-chatbotar och -agenter kräver allt snabbare svarstider, har slutledningshastigheten blivit en verklig konkurrenskraftig skillnad, och Cerebras har nu visat att den kan iterera sin okonventionella wafer-skala-teknik på en kommersiell kadens.

De första CS-4-leveranserna börjar detta kvartal, med de första systemen som förväntas vara online före slutet av september. Huruvida det räcker för att skada Nvidias dominans återstår att se - men för första gången på ett tag har den snabbaste AI-inferensen i branschen en ny adress.

Ligg före AI

Hårdvarulanseringar som CS-4 flyttar marknader och omdefinierar vad AI-system kan göra. Läs mer AI-nyheter för att hålla jämna steg med varje utveckling.

Utforska den senaste AI-bevakningen →