AMD en Cerebras Systems hebben een technisch partnerschap onthuld om een ​​nieuw soort AI-inferentie-infrastructuur te bouwen, waarbij AMD's rack-scale Helios-platform wordt gecombineerd met de Wafer-Scale Engine (WSE) van Cerebras in één enkele, opgesplitste workflow. Aangekondigd tijdens AMD's Advancing AI 2026-evenement op 23 juli 2026, richt de samenwerking zich rechtstreeks op de latentie- en doorvoerknelpunten die gevolgtrekking tot een van de duurste problemen in het generatieve AI-tijdperk hebben gemaakt. Voor het laatste nieuws over deze snel veranderende hoek van de industrie kunt u ons breaking AI news volgen.

Het kernidee is om te stoppen met het dwingen van één chip om alles te doen. In een traditionele inferentiestapel verzorgt één enkele GPU-familie zowel het zware werk van het vooraf invullen van een prompt als het delicate, opeenvolgende werk van het genereren van elk nieuw token. Dat is een compromis, omdat de twee banen heel verschillende eisen stellen. AMD en Cerebras beweren dat het splitsen van het werk, een techniek die bekend staat als gedesaggregeerde inferentie, ervoor zorgt dat elke engine kan doen waar hij het beste in is.

Hoe de twee motoren de arbeid verdelen

Volgens de officiële aankondiging van AMD zal AMD Helios dienen als de krachtige, schaalbare throughput-engine, die gebruikmaakt van AMD Instinct GPU's om grote hoeveelheden invoer snel te verwerken. De Cerebras Wafer-Scale Engine kan ondertussen ultrasnelle decodering en tokengeneratie met ultralage latentie verwerken. De chips van Cerebras zijn gebouwd op hele wafers in plaats van opgedeeld in individuele chipjes, waardoor ze een enorme geheugenbandbreedte op de chip hebben die bijzonder geschikt is om tokens uit te streamen zonder te haperen.

De bedrijven zeggen dat door het combineren van de twee rekenmachines de gezamenlijke oplossing naar verwachting tot 5x hogere tokens per seconde per watt zal opleveren, een maatstaf die een centrale scorekaart is geworden voor inferentie-economie, aangezien providers concurreren op zowel snelheid als energiekosten. Het cijfer werd aangehaald in het persbericht van AMD en gerapporteerd via onder meer Tom's Hardware, Investing.com en Yahoo Tech.

Een kans op de dominantie van Nvidia

Het partnerschap is ook een strategisch signaal. Het CUDA-ecosysteem en GPU-assortiment van Nvidia domineren momenteel de AI-training en gevolgtrekking, en uitdagers zijn steeds vaker tot de conclusie gekomen dat het moeilijk is om de gevestigde exploitant frontaal te verslaan op één enkele architectuur. Business Insider formuleerde de deal toen AMD een poging deed om Nvidia te bestormen door te wedden op gevolgtrekking, de fase van AI-computing die naar verwachting het snelst zal groeien naarmate modellen van ontwikkeling naar productie gaan.

Voor AMD vergroot de combinatie met Cerebras de aantrekkingskracht van zijn Instinct- en Helios-roadmap buiten training. Voor Cerebras, dat naast AMD (NASDAQ: AMD) op de Nasdaq handelt onder de ticker CBRS (NASDAQ: AMD), geeft de integratie met een grote acceleratorleverancier zijn technologie op waferschaal een duidelijker pad naar grote ondernemingen en cloudimplementaties. Cerebras is van plan AMD Helios in zijn eigen datacenters in te zetten, en de bedrijven verwachten dat de gezamenlijke oplossing in de tweede helft van 2026 als eerste beschikbaar zal zijn via Cerebras Cloud.

Waarom disaggregatie nu belangrijk is

Inferentiekosten zijn een bepalend drukpunt geworden voor de AI-industrie. Naarmate modellen groter worden en applicaties realtime reacties vereisen, kunnen de kosten van het genereren van elk token en de latentie die gebruikers ervaren bij het wachten daarop, bepalen of een product levensvatbaar is. Bij gedesaggregeerde inferentie worden prefill en decodering beschouwd als afzonderlijke werklasten die kunnen worden gerouteerd naar de hardware die het beste bij elkaar past, een ontwerpfilosofie waar bedrijven als Cerebras al meer dan een jaar voor pleiten.

De aankondiging van AMD-Cerebras suggereert dat de aanpak evolueert van een opstandig idee naar een door de industrie onderschreven architectuur. Door een doorvoerspecialist te koppelen aan een latentiespecialist, wedden de twee bedrijven erop dat de toekomst van inferentie niet één chip is die ze allemaal regeert, maar een gecoördineerd systeem van gespecialiseerde motoren.

Wat te kijken

Er blijven nog een aantal vragen bestaan. Het cijfer van 5x tokens per seconde per watt is eerder een verwachting dan een benchmark van derden, en de prestaties in de praktijk zullen afhangen van de specifieke modellen en workloads die klanten gebruiken. Prijs- en beschikbaarheidsgegevens na de lancering van Cerebras Cloud zijn niet bekendgemaakt en het is onduidelijk wanneer de oplossing andere cloudproviders zou kunnen bereiken.

Toch onderstreept de deal een bredere verschuiving in AI-hardware: de veronderstelling dat een enkele GPU-architectuur elke fase van de AI-pijplijn zal bedienen, begint te wankelen. Als AMD en Cerebras hun efficiëntieclaims kunnen waarmaken, zou gedesaggregeerde gevolgtrekking een standaardonderdeel kunnen worden van de manier waarop de grootste AI-systemen worden gebouwd.

Blijf AI een stap voor

Het AI-hardwarelandschap splitst zich op in gespecialiseerde kampen, en de gevolgen voor de kosten, snelheid en concurrentie zijn enorm. Lees meer AI-nieuws op AI Buzz Wire om op de hoogte te blijven van elke grote deal, release en benchmark.