Cerebras podsumowała CS-4, system wnioskowania AI przeznaczony do montażu w szafie serwerowej, zbudowany w oparciu o nowy procesor waflowy WSE-3 Turbo, twierdząc, że maszyna zapewnia do 30 razy szybsze wnioskowanie niż systemy oparte na procesorach graficznych, ponieważ firma pozycjonuje się jako szybka alternatywa dla imperium centrów danych Nvidii.
Premiera, ogłoszona we wtorek i szczegółowo opisana na stronach produktów firmy oraz fala doniesień z Reuters, Bloomberg i The Register, oznacza najbardziej znaczącą odświeżenie sprzętu Cerebras od czasu wejścia na giełdę i kluczowy moment dla firmy, której akcje notują problemy od czasu jej debiutu giełdowego. Wydaje się, że inwestorzy zwracają na to uwagę: po tej wiadomości akcje Cerebras (CBRS) wzrosły, a dziennik Investor's Business Daily zacytował komentarz dyrektora generalnego, że rynek wnioskowania o sztucznej inteligencji „rośnie tak szybko”.
Dla czytelników śledzących przyspieszający wyścig o szybsze reagowanie modeli sztucznej inteligencji, premiera CS-4 jest jedną z najważniejszych historii sprzętu w tym kwartale i pojawia się w okresie szerszych zmian w zasięgu branży sztucznej inteligencji, które w dalszym ciągu zmieniają krajobraz obliczeniowy.
Co jest w środku CS-4
Głównym komponentem jest WSE-3 Turbo, ulepszona wersja silnika waflowego wielkości talerza obiadowego firmy Cerebras. Według analizy technicznej The Register WSE-3T nie jest nowym krzemem — zastosowano w nim ten sam proces technologiczny TSMC 5 nm, powierzchnię matrycy o powierzchni 46 225 milimetrów kwadratowych, 4 biliony tranzystorów, 900 000 rdzeni i 44 GB pamięci SRAM na płytce, co dwuletni WSE-3.
Zamiast tego Cerebras osiągnął podwojenie wydajności, znacznie mocniej obciążając istniejący układ. WSE-3T podwaja rzadkie obliczenia FP16 do 250 petaFLOPS, podwaja wydajność gęstego FP16 do szacunkowych 25 petaFLOPS, podwaja przepustowość pamięci do 43,2 petabajtów na sekundę i podwaja przepustowość we/wy do 2,4 terabajta na sekundę. The Register szacuje, że firma taktuje obecnie krzem z częstotliwością około 2,8 GHz, w porównaniu z około 1,4 GHz w poprzedniej generacji.
Według Cerebrasa cały trik polega na przeprojektowanym systemie zasilania, który znajduje się zaledwie 0,5 milimetra od procesora — czyli mniej więcej 100 razy bliżej niż ~50 milimetrów typowo dla konwencjonalnych płyt GPU. Ta bliskość prawie eliminuje straty mocy na poziomie płytki i umożliwia dotarcie do płytki dwukrotnie większej mocy, umożliwiając wyższe częstotliwości robocze i szybsze generowanie tokenów.
Architektura stojaka Nexus
Poza samym chipem, CS-4 wprowadza to, co Cerebras nazywa architekturą platformy Nexus, swoją pierwszą konstrukcję w skali stojakowej i bezpośrednią odpowiedź na systemy stelażowe Nvidia NVL72 i AMD Helios. Każdy CS-4 może pomieścić do trzech procesorów WSE-3T umieszczonych w samodzielnych „plecakach waflowych” — pakietach 3D, które składają się z płytki, konwersji mocy, bezpośredniego chłodzenia cieczą, szybkich wejść/wyjść i elektroniki sterującej w jeden zespół z o 50% mniejszą liczbą komponentów.
Modułowa konstrukcja oddziela stabilną warstwę zasilania, chłodzenia i sieci od obliczeń. Cerebras PowerRack można zainstalować i zakwalifikować w placówce przed przybyciem jakichkolwiek komputerów, a następnie wsunąć plecaki na miejsce, co według firmy skraca czas wdrożenia z dni do godzin.
Zużycie energii jest znaczne. The Register szacuje, że plecak zużywa około 46 kW, a całkowity pobór mocy przez system wynosi od 120 do 140 kW — liczby przyciągające wzrok, które mimo wszystko wyglądają konserwatywnie w porównaniu z systemami stelażowymi o mocy od 240 do 250 kW, które AMD i Nvidia mają dostarczyć jeszcze w tym roku.
Zabijanie przełącznika
Być może najciekawszym technicznie wyborem jest interkonekt. Zamiast kierować ruch między płytkami przez przełączniki – podejście AWS przyjęte w akceleratorach Trainium3 – Cerebras łączy swoje chipy w topologię torusa 2D, w której sąsiadujące płytki komunikują się bezpośrednio ze sobą. Konstrukcja zmniejsza opóźnienie między płytkami z pięciu mikrosekund do zaledwie dwóch, a Cerebras twierdzi, że siatka może obsługiwać modele o parametrach do 50 bilionów parametrów, czyli znacznie wykraczających poza wszystko, co obecnie istnieje.
Wyniki prędkości są uderzające. W jednym systemie CS-4 firma zajmująca się benchmarkingiem Artificial Analysis zmierzyła do 4400 tokenów na sekundę na użytkownika na gpt-oss-120b — czyli około 12 razy więcej niż ~350 tokenów na sekundę w przypadku najszybszych dostępnych obecnie usług wnioskowania opartych na GPU. Cerebras twierdzi również, że system obsługuje ponad 1000 tokenów na sekundę w modelach przekraczających 10 bilionów parametrów.
Zdezagregowana strategia partnerstwa
Warto zauważyć, że Cerebras nie próbuje już uruchamiać całego potoku wnioskowania na własnym krzemie. Firma nawiązała współpracę z AWS i AMD w celu przeniesienia wymagającego dużej mocy obliczeniowej etapu szybkiego przetwarzania wnioskowania odpowiednio na procesory graficzne Trainium XPU i Instinct, pozostawiając swoim silnikom waflowym obsługę fazy dekodowania wrażliwej na opóźnienia, w której błyszczą ogromne rezerwy SRAM.
Premiera CS-4 rozszerza także współpracę Cerebras z OpenAI. Yahoo Finance poinformowało o premierze wraz z nowymi partnerstwami OpenAI i AMD, których celem jest przyspieszenie wnioskowania AI — w oparciu o wprowadzony przez firmy wcześniej w sierpniu tryb Ultrafast, który zapewnił użytkownikom GPT-5.6 Sol z szybkością do 750 tokenów na sekundę.
Zastrzeżenia zawarte w nagłówkach
Analitycy branżowi zalecają ostrożność w odniesieniu do danych marketingowych. The Register zauważa, że główny procesor Cerebras o wartości 250 petaFLOPS opiera się na rzadkości, która generalnie nie sprzyja wnioskowaniu z modelu dużego języka, oraz że dane dotyczące szczytowej przepustowości pamięci są w dużej mierze teoretyczne, ponieważ WSE-3 nie posiadała mocy obliczeniowej wystarczającej do nasycenia własnej pamięci SRAM. W publikacji kwestionowano również, dlaczego Cerebras podwoiła wydajność, zamiast zwiększać pojemność pamięci SRAM, która nie wzrosła znacząco od czasu wprowadzenia na rynek WSE-2 pięć lat temu – ciekawy wybór w erze zdezagregowanego wnioskowania, w której akceleratory dekodowania czerpią największe korzyści z pamięci.
Mimo to szansa rynkowa jest realna. Ponieważ chatboty i agenci wykorzystujący sztuczną inteligencję wymagają coraz krótszego czasu reakcji, szybkość wnioskowania stała się prawdziwym wyróżnikiem konkurencyjnym, a firma Cerebras udowodniła, że może iterować swoją niekonwencjonalną technologię w skali płytki w rytmie komercyjnym.
Pierwsze dostawy CS-4 rozpoczną się w tym kwartale, a pierwsze systemy będą dostępne online przed końcem września. Nie wiadomo, czy to wystarczy, aby osłabić dominację Nvidii – ale po raz pierwszy od jakiegoś czasu najszybsze w branży wnioskowanie AI ma nowy adres.
Wyprzedź sztuczną inteligencję
Premiery sprzętu, takie jak CS-4, poruszają rynki i na nowo definiują możliwości systemów AI. Przeczytaj więcej aktualności na temat sztucznej inteligencji, aby być na bieżąco z każdym rozwojem.
Poznaj najnowszy zasięg sztucznej inteligencji →