Cerebras heeft de CS-4 onthuld, een AI-inferentiesysteem op rackschaal gebouwd rond zijn nieuwe WSE-3 Turbo-processor op waferschaal, en beweert dat de machine tot 30 keer snellere inferentie levert dan op GPU gebaseerde systemen, aangezien het bedrijf zichzelf positioneert als het snelheidsalternatief voor het datacenter-imperium van Nvidia.

De lancering, dinsdag aangekondigd en gedetailleerd beschreven op de productpagina's van het bedrijf en een golf van berichtgeving door Reuters, Bloomberg en The Register, markeert de belangrijkste hardwarevernieuwing van Cerebras sinds de beursgang – en een cruciaal moment voor een bedrijf waarvan de aandelen het moeilijk hebben sinds de beursintroductie. Beleggers lijken op te letten: de aandelen van Cerebras (CBRS) stegen op het nieuws, en Investor's Business Daily citeerde het commentaar van de CEO dat de markt voor AI-inferentie "zo snel groeit".

Voor lezers die de toenemende race volgen om AI-modellen sneller te laten reageren, is de lancering van CS-4 een van de meest consequente hardwareverhalen van het kwartaal, en het landt te midden van bredere verschuivingen in de dekking van de AI-industrie die het computerlandschap blijven hervormen.

Wat zit er in de CS-4

Het belangrijkste onderdeel is de WSE-3 Turbo, een verbeterde versie van Cerebras' Wafer Scale Engine ter grootte van een bord. Volgens de technische diepgaande analyse van The Register is de WSE-3T geen nieuw silicium; hij behoudt hetzelfde TSMC 5 nm-proces, 46.225 vierkante millimeter matrijsoppervlak, 4 biljoen transistors, 900.000 cores en 44 GB on-wafer SRAM als de twee jaar oude WSE-3.

In plaats daarvan bereikte Cerebras een verdubbeling van de prestaties door de bestaande chip veel harder te duwen. De WSE-3T verdubbelt de spaarzame FP16-computercapaciteit tot 250 petaFLOPS, verdubbelt de dichte FP16-prestaties tot naar schatting 25 petaFLOPS, verdubbelt de geheugenbandbreedte tot 43,2 petabytes per seconde en verdubbelt de I/O-bandbreedte tot 2,4 terabits per seconde. Het Register schat dat het bedrijf het silicium nu op ongeveer 2,8 GHz klokt, vergeleken met ongeveer 1,4 GHz in de vorige generatie.

De truc is volgens Cerebras een opnieuw ontworpen stroomafgiftesysteem dat zich op slechts 0,5 millimeter van de processor bevindt – ongeveer 100 keer dichterbij dan de ~50 millimeter die typisch is voor conventionele GPU-borden. Die nabijheid elimineert vrijwel het stroomverlies op bordniveau en zorgt ervoor dat twee keer zoveel stroom de wafer kan bereiken, waardoor de hogere werkfrequenties achter een snellere tokengeneratie mogelijk worden.

De Nexus Rack-architectuur

Naast de chip zelf introduceert de CS-4 wat Cerebras de Nexus Platform Architecture noemt, het eerste echte rack-scale ontwerp en een direct antwoord op Nvidia's NVL72 en AMD's Helios racksystemen. Elke CS-4 kan maximaal drie WSE-3T-processors bevatten, ondergebracht in op zichzelf staande "Wafer-Scale Backpacks" - 3D-pakketten die de wafer, stroomconversie, directe vloeistofkoeling, snelle I/O en besturingselektronica vouwen in een enkele assemblage met 50% minder componenten.

Het modulaire ontwerp scheidt de stabiele stroom-, koeling- en netwerklaag van de computer. Een Cerebras PowerRack kan worden geïnstalleerd en gekwalificeerd voordat er een computer arriveert, waarna de rugzakken op hun plaats schuiven, waardoor de implementatietijd volgens het bedrijf van dagen naar uren wordt teruggebracht.

Het stroomverbruik is aanzienlijk. Het Register schat ongeveer 46 kW per rugzak en een totaal systeemverbruik van 120 tot 140 kW – opvallende cijfers die er toch conservatief uitzien naast de racksystemen van 240 tot 250 kW die AMD en Nvidia naar verwachting later dit jaar zullen uitbrengen.

De schakelaar uitschakelen

Misschien wel de technisch meest interessante keuze is de interconnect. In plaats van het wafer-naar-wafer-verkeer via schakelaars te routeren – de aanpak die AWS hanteerde voor zijn Trainium3-versnellers – verbindt Cerebras zijn chips met een 2D-torustopologie waar aangrenzende wafers rechtstreeks met elkaar praten. Het ontwerp brengt de latentie van wafer tot wafer terug van vijf microseconden naar slechts twee, en Cerebras zegt dat de mesh modellen van maximaal 50 biljoen parameters kan ondersteunen, comfortabel meer dan alles wat momenteel bestaat.

De snelheidsresultaten zijn opvallend. Op een enkel CS-4-systeem heeft benchmarkingbedrijf Artificial Analysis tot 4.400 tokens per seconde per gebruiker gemeten op gpt-oss-120b – ongeveer 12 keer de ~350 tokens per seconde van de snelste GPU-gebaseerde inferentiediensten die momenteel beschikbaar zijn. Cerebras beweert ook dat het systeem meer dan 1.000 tokens per seconde ondersteunt op modellen die de 10 biljoen parameters overschrijden.

Een opgesplitste partnerschapsstrategie

Met name probeert Cerebras niet langer de gehele inferentiepijplijn op zijn eigen silicium te laten draaien. Het bedrijf is een partnerschap aangegaan met AWS en AMD om de rekenintensieve promptverwerkingsfase van inferentie over te dragen aan respectievelijk Trainium XPU's en Instinct GPU's, waarbij de motoren op waferschaal de latentiegevoelige decodeerfase moeten afhandelen waarin hun enorme SRAM-reserves schitteren.

De lancering van CS-4 verlengt ook de samenwerking van Cerebras met OpenAI. Yahoo Finance rapporteerde de onthulling naast nieuwe OpenAI- en AMD-partnerschappen gericht op het versnellen van AI-inferentie – voortbouwend op de Ultrafast-modus die de bedrijven eerder in augustus introduceerden, die GPT-5.6 Sol naar gebruikers bracht met maximaal 750 tokens per seconde.

Voorbehoud achter de kopnummers

Industrieanalisten dringen aan op enige voorzichtigheid ten aanzien van de marketingcijfers. Het Register merkt op dat Cerebras' headline 250 petaFLOPS afhankelijk is van spaarzaamheid, wat over het algemeen niet ten goede komt aan de gevolgtrekking van grote taalmodellen, en dat de piekgeheugenbandbreedtecijfers grotendeels theoretisch zijn, aangezien de WSE-3 niet over de rekenkracht beschikte om zijn eigen SRAM te verzadigen. De publicatie vroeg zich ook af waarom Cerebras de prestaties verdubbelde in plaats van de SRAM-capaciteit te vergroten, die niet noemenswaardig is gegroeid sinds de WSE-2 vijf jaar geleden werd gelanceerd – een merkwaardige keuze in een tijdperk van gedesaggregeerde gevolgtrekkingen waarin decodeerversnellers het meeste profiteren van het geheugen.

Toch zijn de marktkansen reëel. Omdat AI-chatbots en -agenten steeds snellere responstijden eisen, is de snelheid van inferentie een echte concurrentiedifferentiator geworden, en Cerebras heeft nu aangetoond dat het zijn onconventionele technologie op waferschaal kan herhalen op een commerciële cadans.

De eerste CS-4-leveringen beginnen dit kwartaal en de eerste systemen worden vóór eind september online verwacht. Of dat genoeg is om de dominantie van Nvidia aan te tasten valt nog te bezien – maar voor het eerst sinds lange tijd heeft de snelste AI-gevolgtrekking in de branche een nieuw adres.

Blijf AI een stap voor

Hardware-lanceringen zoals de CS-4 verplaatsen markten en herdefiniëren wat AI-systemen kunnen doen. Lees meer AI-nieuws om op de hoogte te blijven van elke ontwikkeling.

Ontdek de nieuwste AI-dekking →