Společnosti AMD a Cerebras Systems odhalily technické partnerství pro vybudování nového druhu inferenční infrastruktury AI, která kombinuje platformu AMD Helios v rackovém měřítku s Wafer-Scale Engine (WSE) od Cerebras v jediném, rozděleném pracovním postupu. Spolupráce, která byla oznámena na akci AMD Advancing AI 2026 dne 23. července 2026, se přímo zaměřuje na úzká místa latence a propustnosti, díky nimž se z inference stal jeden z nejdražších problémů v éře generativní umělé inteligence. Chcete-li získat nejnovější informace o tomto rychle se rozvíjejícím rohu tohoto odvětví, sledujte naše nejnovější zprávy o AI.
Základní myšlenkou je přestat nutit jeden čip dělat všechno. V tradičním inferenčním zásobníku jediná rodina GPU zvládá jak náročnou práci s předvyplněním při zpracování výzvy, tak jemnou sekvenční práci při generování každého nového tokenu. To je kompromis, protože obě práce mají velmi odlišné požadavky. AMD a Cerebras tvrdí, že rozdělení práce, technika známá jako disagregovaná inference, umožňuje každému motoru dělat to, v čem je nejlepší.
Jak si dva motory rozdělují práci
Podle oficiálního oznámení AMD bude AMD Helios sloužit jako vysoce výkonný motor s škálovatelnou propustností využívající GPU AMD Instinct k rychlému zpracování velkých dávek vstupu. Cerebras Wafer-Scale Engine si mezitím poradí s ultra rychlým dekódováním s ultra nízkou latencí a generováním tokenů. Čipy Cerebras jsou postaveny na celých waferech, spíše než na kostičky na jednotlivých matricích, což jim dává obrovskou šířku pásma paměti na čipu, která je zvláště vhodná pro streamování tokenů bez zastavení.
Společnosti uvádějí, že spojením dvou výpočetních enginů se očekává, že společné řešení přinese až 5x vyšší počet tokenů za sekundu na watt, což je metrika, která se stala ústředním ukazatelem pro ekonomiku odvození, protože poskytovatelé soutěží jak v rychlosti, tak v nákladech na energii. Toto číslo bylo citováno v tiskové zprávě AMD a hlášeno napříč prodejnami včetně Tom's Hardware, Investing.com a Yahoo Tech.
Výstřel na dominanci Nvidie
Partnerství je také strategickým signálem. Ekosystém CUDA a sestava GPU společnosti Nvidia v současné době dominují školení a vyvozování umělé inteligence a vyzyvatelé stále více docházejí k závěru, že porazit stávajícího výrobce přímo na jedné architektuře je obtížné. Business Insider zarámoval dohodu jako AMD, která střílela na Nvidii tím, že vsadila na inferenci, fázi AI computingu, která podle očekávání poroste nejrychleji s tím, jak se modely přesunou z vývoje do výroby.
Pro AMD rozšíří spárování s Cerebras přitažlivost jeho plánu Instinct a Helios za hranice školení. Pro Cerebras, který obchoduje na Nasdaq pod tickerem CBRS spolu s AMD (NASDAQ: AMD), integrace s hlavním dodavatelem akcelerátorů dává jeho technologii wafer-scale jasnější cestu do velkých podniků a cloudových nasazení. Cerebras plánuje nasazení AMD Helios ve svých vlastních datových centrech a společnosti očekávají, že společné řešení bude dostupné nejprve prostřednictvím Cerebras Cloud ve druhé polovině roku 2026.
Proč teď záleží na dezagregaci
Náklady na odvození se staly určujícím tlakem pro průmysl AI. Jak se modely rozrůstají a aplikace vyžadují odezvy v reálném čase, náklady na generování každého tokenu a latence, kterou uživatelé zažívají při čekání na něj, mohou určit, zda je produkt životaschopný. Disagregated inference zachází s předvyplněním a dekódováním jako se samostatnými pracovními zátěžemi, které lze nasměrovat na hardware, který se nejlépe hodí ke každému, což je filozofie designu, kterou společnosti jako Cerebras prosazují již více než rok.
Oznámení AMD-Cerebras naznačuje, že přístup se posouvá od povstalecké myšlenky k architektuře podporované průmyslem. Spojením specialisty na propustnost se specialistou na latenci obě společnosti sázejí na to, že budoucnost inference není jeden čip, který je bude řídit všem, ale koordinovaný systém specializovaných motorů.
Na co se dívat
Zbývá několik otázek. Hodnota 5x tokenů za sekundu na watt je spíše očekáváním než benchmarkem třetí strany a skutečný výkon bude záviset na konkrétních modelech a pracovních zátěžích, které zákazníci používají. Podrobnosti o cenách a dostupnosti po uvedení Cerebras Cloud nebyly zveřejněny a není jasné, kdy by se řešení mohlo dostat k dalším poskytovatelům cloudu.
Dohoda však podtrhuje širší posun v hardwaru umělé inteligence: předpoklad, že jediná architektura GPU bude obsluhovat každou fázi potrubí AI, se třepe. Pokud AMD a Cerebras dokážou splnit svá tvrzení o efektivitě, mohla by se dezagregovaná inference stát standardní součástí toho, jak se budují největší systémy umělé inteligence.
Udržujte si náskok před AI
Hardwarové prostředí AI se dělí na specializované tábory a důsledky pro cenu, rychlost a konkurenci jsou obrovské. Přečtěte si další zprávy o AI na AI Buzz Wire, abyste drželi krok s každou velkou dohodou, vydáním a benchmarkem.


