Firmy AMD i Cerebras Systems ogłosiły partnerstwo techniczne w celu zbudowania nowego rodzaju infrastruktury wnioskowania AI, łączącej platformę AMD Helios do montażu w szafie z silnikiem Wafer-Scale Engine (WSE) firmy Cerebras w jednym, zdezagregowanym przepływie pracy. Współpraca, ogłoszona 23 lipca 2026 r. na wydarzeniu AMD Advancing AI 2026, ma bezpośrednio na celu wyeliminowanie wąskich gardeł w zakresie opóźnień i przepustowości, które sprawiły, że wnioskowanie stało się jednym z najkosztowniejszych problemów w erze generatywnej sztucznej inteligencji. Aby otrzymywać najświeższe informacje na temat tej szybko zmieniającej się branży, śledź nasze najnowsze wiadomości dotyczące sztucznej inteligencji.

Podstawową ideą jest zaprzestanie zmuszania jednego chipa do robienia wszystkiego. W tradycyjnym stosie wnioskowania pojedyncza rodzina procesorów graficznych obsługuje zarówno ciężką pracę przed wypełnieniem polegającą na przetwarzaniu podpowiedzi, jak i delikatną, sekwencyjną pracę polegającą na generowaniu każdego nowego tokena. Jest to kompromis, ponieważ te dwa stanowiska mają bardzo różne wymagania. AMD i Cerebras argumentują, że dzielenie pracy – technika znana jako wnioskowanie zdezagregowane – pozwala każdemu silnikowi robić to, w czym jest najlepszy.

Jak dwa silniki dzielą pracę

Zgodnie z oficjalnym ogłoszeniem AMD, AMD Helios będzie służyć jako wysokowydajny, skalowalny silnik przepustowości, wykorzystujący procesory graficzne AMD Instinct do szybkiego przetwarzania dużych partii danych wejściowych. Z kolei silnik Cerebras Wafer-Scale Engine obsłuży ultraszybkie dekodowanie i generowanie tokenów przy bardzo małych opóźnieniach. Chipy Cerebras są zbudowane na całych płytkach, a nie pokrojone w pojedyncze kostki, co zapewnia im ogromną przepustowość pamięci na chipie, która szczególnie dobrze nadaje się do przesyłania strumieniowego tokenów bez opóźnień.

Firmy twierdzą, że dzięki połączeniu dwóch silników obliczeniowych wspólne rozwiązanie ma zapewnić do 5 razy większą liczbę tokenów na sekundę na wat, co stało się główną kartą wyników w ekonomii wnioskowania, ponieważ dostawcy konkurują zarówno pod względem szybkości, jak i kosztów energii. Dane te przytoczono w komunikacie prasowym AMD i podano w takich punktach sprzedaży, jak Tom's Hardware, Investing.com i Yahoo Tech.

Próba dominacji Nvidii

Partnerstwo jest także sygnałem strategicznym. Ekosystem CUDA firmy Nvidia i oferta procesorów graficznych dominują obecnie w szkoleniu i wnioskowaniu w zakresie sztucznej inteligencji, a pretendenci coraz częściej dochodzą do wniosku, że pokonanie dominującej firmy w oparciu o pojedynczą architekturę jest trudne. Business Insider ujął tę transakcję jako moment, w którym AMD rzuca wyzwanie Nvidii, stawiając na wnioskowanie, czyli fazę obliczeń AI, która według przewidywań będzie najszybciej rozwijać się w miarę przechodzenia modeli od fazy rozwojowej do produkcji.

Dla AMD połączenie z Cerebras poszerza atrakcyjność planu działania Instinct i Helios poza szkolenia. W przypadku Cerebras, która jest notowana na giełdzie Nasdaq pod symbolem CBRS obok AMD (NASDAQ: AMD), integracja z głównym dostawcą akceleratorów zapewnia jej technologii w skali płytki jaśniejszą drogę do wdrożeń w dużych przedsiębiorstwach i chmurach. Cerebras planuje wdrożyć AMD Helios we własnych centrach danych, a firmy spodziewają się, że wspólne rozwiązanie będzie dostępne najpierw za pośrednictwem Cerebras Cloud w drugiej połowie 2026 roku.

Dlaczego dezagregacja ma teraz znaczenie

Koszty wnioskowania stały się decydującym punktem nacisku dla branży sztucznej inteligencji. W miarę jak modele stają się coraz większe, a aplikacje wymagają odpowiedzi w czasie rzeczywistym, koszt generowania każdego tokena i opóźnienia, jakich doświadczają użytkownicy podczas oczekiwania na niego, mogą określić, czy produkt będzie opłacalny. Dezagregowane wnioskowanie traktuje wstępne wypełnianie i dekodowanie jako oddzielne obciążenia, które można skierować do sprzętu najlepiej dopasowanego do każdego z nich, zgodnie z filozofią projektowania, którą firmy takie jak Cerebras propagują od ponad roku.

Ogłoszenie AMD-Cerebras sugeruje, że podejście odchodzi od powstańczego pomysłu do architektury popieranej przez branżę. Łącząc specjalistę ds. przepustowości ze specjalistą ds. opóźnień, obie firmy zakładają, że przyszłością wnioskowania nie będzie jeden chip, który będzie rządził nimi wszystkimi, ale skoordynowany system wyspecjalizowanych silników.

Co obejrzeć

Pozostaje kilka pytań. Wartość 5-krotności tokenów na sekundę na wat jest oczekiwaniem, a nie punktem odniesienia innej firmy, a rzeczywista wydajność będzie zależeć od konkretnych modeli i obciążeń obsługiwanych przez klientów. Szczegóły dotyczące cen i dostępności poza wprowadzeniem Cerebras Cloud nie zostały ujawnione i nie jest jasne, kiedy rozwiązanie może dotrzeć do innych dostawców usług w chmurze.

Mimo to umowa podkreśla szerszą zmianę w sprzęcie AI: założenie, że pojedyncza architektura procesora graficznego będzie obsługiwać każdy etap potoku AI, kruszy się. Jeśli AMD i Cerebras zdołają spełnić swoje deklaracje dotyczące wydajności, zdezagregowane wnioskowanie może stać się standardową częścią budowy największych systemów sztucznej inteligencji.

Wyprzedź sztuczną inteligencję

Krajobraz sprzętu AI dzieli się na wyspecjalizowane obozy, co ma ogromne konsekwencje dla kosztów, szybkości i konkurencji. Przeczytaj więcej aktualności o sztucznej inteligencji w AI Buzz Wire, aby być na bieżąco z każdą większą transakcją, wydaniem i testem porównawczym.