AMD e Cerebras Systems hanno svelato una partnership tecnica per costruire un nuovo tipo di infrastruttura di inferenza AI, combinando la piattaforma Helios rack-scale di AMD con Wafer-Scale Engine (WSE) di Cerebras in un unico flusso di lavoro disaggregato. Annunciata all'evento Advancing AI 2026 di AMD il 23 luglio 2026, la collaborazione mira direttamente ai colli di bottiglia in termini di latenza e throughput che hanno reso l'inferenza uno dei problemi più costosi nell'era dell'intelligenza artificiale generativa. For the latest on this fast-moving corner of the industry, follow our breaking AI news coverage.
The core idea is to stop forcing one chip to do everything. In uno stack di inferenza tradizionale, una singola famiglia di GPU gestisce sia il pesante lavoro di precompilazione della digestione di un prompt sia il delicato lavoro sequenziale di generazione di ogni nuovo token. That is a compromise, because the two jobs have very different demands. AMD and Cerebras argue that splitting the work, a technique known as disaggregated inference, lets each engine do what it is best at.
Come i due motori si dividono il lavoro
Secondo l'annuncio ufficiale di AMD, AMD Helios fungerà da motore di throughput scalabile e ad alte prestazioni, attingendo alle GPU AMD Instinct per elaborare rapidamente grandi batch di input. The Cerebras Wafer-Scale Engine, meanwhile, will handle ultra-fast, ultra-low-latency decode and token generation. I chip di Cerebras sono costruiti su interi wafer anziché suddivisi in singoli die, offrendo loro un'enorme larghezza di banda di memoria su chip che è particolarmente adatta allo streaming di token senza stallo.
Le aziende affermano che combinando i due motori di calcolo, la soluzione congiunta dovrebbe fornire token al secondo per watt fino a 5 volte più alti, una metrica che è diventata una scorecard centrale per l’economia dell’inferenza poiché i fornitori competono sia sulla velocità che sui costi energetici. The figure was cited in AMD's press release and reported across outlets including Tom's Hardware, Investing.com, and Yahoo Tech.
Un colpo al dominio di Nvidia
La partnership è anche un segnale strategico. L'ecosistema CUDA di Nvidia e la gamma di GPU attualmente dominano l'addestramento e l'inferenza dell'intelligenza artificiale, e gli sfidanti sono sempre più giunti alla conclusione che battere l'operatore storico a testa alta su una singola architettura è difficile. Business Insider ha inquadrato l'accordo mentre AMD tentava di colpire Nvidia scommettendo sull'inferenza, la fase dell'informatica basata sull'intelligenza artificiale che dovrebbe crescere più rapidamente man mano che i modelli passano dallo sviluppo alla produzione.
For AMD, pairing with Cerebras broadens the appeal of its Instinct and Helios roadmap beyond training. Per Cerebras, che è quotato al Nasdaq con il ticker CBRS insieme ad AMD (NASDAQ: AMD), l'integrazione con un importante fornitore di acceleratori offre alla sua tecnologia su scala wafer un percorso più chiaro verso le grandi imprese e le implementazioni cloud. Cerebras prevede di implementare AMD Helios nei propri data center e le aziende prevedono che la soluzione congiunta sarà disponibile prima tramite Cerebras Cloud nella seconda metà del 2026.
Perché la disaggregazione è importante adesso
Inference costs have become a defining pressure point for the AI industry. Man mano che i modelli diventano più grandi e le applicazioni richiedono risposte in tempo reale, la spesa per la generazione di ciascun token e la latenza sperimentata dagli utenti nell’attesa possono determinare se un prodotto è fattibile. L'inferenza disaggregata tratta la precompilazione e la decodifica come carichi di lavoro separati che possono essere instradati all'hardware più adatto a ciascuno, una filosofia di progettazione che aziende come Cerebras sostengono da oltre un anno.
The AMD-Cerebras announcement suggests that approach is moving from an insurgent idea to an industry-endorsed architecture. Abbinando uno specialista del throughput con uno specialista della latenza, le due società scommettono che il futuro dell'inferenza non sarà un chip che li domini tutti, ma un sistema coordinato di motori specializzati.
Cosa guardare
Rimangono diverse domande. La cifra di 5 token al secondo per watt è un'aspettativa piuttosto che un benchmark di terze parti e le prestazioni nel mondo reale dipenderanno dai modelli specifici e dai carichi di lavoro eseguiti dai clienti. I dettagli sui prezzi e sulla disponibilità oltre il lancio di Cerebras Cloud non sono stati divulgati e non è chiaro quando la soluzione potrebbe raggiungere altri fornitori di servizi cloud.
Tuttavia, l’accordo sottolinea un cambiamento più ampio nell’hardware AI: il presupposto che una singola architettura GPU servirà ogni fase della pipeline AI si sta logorando. Se AMD e Cerebras riuscissero a mantenere le loro dichiarazioni di efficienza, l’inferenza disaggregata potrebbe diventare una parte standard del modo in cui vengono costruiti i più grandi sistemi di intelligenza artificiale.
Stai al passo con l'intelligenza artificiale
Il panorama dell’hardware AI si sta dividendo in campi specializzati e le implicazioni in termini di costi, velocità e concorrenza sono enormi. Leggi altre notizie sull'AI su AI Buzz Wire per restare aggiornato su ogni importante accordo, rilascio e benchmark.


