Cerebras a dezvăluit CS-4, un sistem de inferență AI la scară de rack construit în jurul noului său procesor WSE-3 Turbo la scară wafer, susținând că aparatul oferă o inferență de până la 30 de ori mai rapidă decât sistemele bazate pe GPU, deoarece compania se poziționează ca alternativă de viteză la imperiul centrului de date al Nvidia.
Lansarea, anunțată marți și detaliată pe paginile de produse ale companiei și un val de acoperire de la Reuters, Bloomberg și The Register, marchează cea mai importantă reîmprospătare hardware a Cerebras de la intrarea în bursă – și un moment esențial pentru o companie ale cărei acțiuni au avut probleme de la IPO. Investitorii par să acorde atenție: acțiunile Cerebras (CBRS) au crescut la știri, iar Investor's Business Daily a citat comentariul CEO-ului conform căruia piața de inferență AI „crește atât de repede”.
Pentru cititorii care urmăresc cursa accelerată pentru a face modelele AI să răspundă mai rapid, lansarea CS-4 este una dintre cele mai importante povești hardware ale trimestrului și aterizează pe fondul unor schimbări mai ample în acoperirea industriei AI care continuă să remodeleze peisajul de calcul.
Ce este în interiorul CS-4
Componenta principală este WSE-3 Turbo, o versiune îmbunătățită a motorului Wafer Scale de la Cerebras. Conform analizei tehnice profunde a The Register, WSE-3T nu este siliciu nou - păstrează același proces TSMC de 5 nm, 46.225 de milimetri pătrați suprafață, 4 trilioane de tranzistori, 900.000 de nuclee și 44 GB de SRAM pe wafer ca și WSE-3 vechi de doi ani.
În schimb, Cerebras și-a dublat performanța împingând mult mai mult cip existent. WSE-3T dublează calculul slab FP16 la 250 petaFLOPS, dublează performanța densă FP16 la aproximativ 25 petaFLOPS, dublează lățimea de bandă a memoriei la 43,2 petaocteți pe secundă și dublează lățimea de bandă I/O la 2,4 terabiți pe secundă. The Register estimează că acum compania tacizează siliciul la aproximativ 2,8 GHz, în creștere față de aproximativ 1,4 GHz în generația anterioară.
Trucul, conform Cerebras, este un sistem de livrare a energiei reproiectat, care se află la doar 0,5 milimetri de procesor - de aproximativ 100 de ori mai aproape decât cei ~50 de milimetri tipici plăcilor GPU convenționale. Această proximitate aproape elimină pierderea de putere la nivel de placă și permite de două ori mai multă putere să ajungă la wafer, permițând frecvențe de operare mai mari în spatele unei generări mai rapide de token.
Arhitectura Rack-ului Nexus
Dincolo de cip în sine, CS-4 introduce ceea ce Cerebras numește Nexus Platform Architecture, primul său design adevărat la scară de rack și un răspuns direct la sistemele de rack Nvidia NVL72 și Helios de la AMD. Fiecare CS-4 poate transporta până la trei procesoare WSE-3T găzduite în „Rucsacuri Wafer-Scale” – pachete 3D care pliază placa, conversie de putere, răcire directă cu lichid, I/O de mare viteză și electronice de control într-un singur ansamblu cu 50% mai puține componente.
Designul modular separă stratul stabil de putere, răcire și rețea de calcul. Un Cerebras PowerRack poate fi instalat și calificat de instalație înainte de sosirea oricărei calculatoare, iar rucsacii alunecă apoi la locul lor - reducând timpul de implementare de la zile la ore, potrivit companiei.
Consumul de energie este substanțial. Registrul estimează aproximativ 46 kW per rucsac și un consum total de sistem de 120 până la 140 kW - cifre atrăgătoare, care, totuși, arată conservatoare lângă sistemele de rack de 240 până la 250 kW AMD și Nvidia sunt de așteptat să fie livrate în cursul acestui an.
Uciderea comutatorului
Poate cea mai interesantă alegere din punct de vedere tehnic este interconectarea. În loc să direcționeze traficul de la wafer-la-wafer prin comutatoare - abordarea adoptată de AWS pentru acceleratoarele Trainium3 - Cerebras își conectează cipurile într-o topologie de torus 2D în care waferele învecinate vorbesc direct între ele. Designul reduce latența dintre napolitane la cinci microsecunde la doar două, iar Cerebras spune că rețeaua poate suporta modele de până la 50 de trilioane de parametri, confortabil peste orice există în prezent.
Rezultatele vitezei sunt izbitoare. Pe un singur sistem CS-4, firma de benchmarking Artificial Analysis a măsurat până la 4.400 de jetoane pe secundă per utilizator pe gpt-oss-120b - de aproximativ 12 ori mai mult decât ~350 de jetoane pe secundă ale celor mai rapide servicii de inferență bazate pe GPU disponibile astăzi. Cerebras susține, de asemenea, că sistemul susține mai mult de 1.000 de jetoane pe secundă pe modele care depășesc 10 trilioane de parametri.
O strategie de parteneriat dezagregată
În special, Cerebras nu mai încearcă să ruleze întreaga conductă de inferență pe propriul siliciu. Compania a încheiat un parteneriat cu AWS și AMD pentru a descărca etapa de procesare promptă a inferenței intensivă în calcul pe Trainium XPU și, respectiv, pe GPU-urile Instinct, lăsând motoarele sale la scară wafer să se ocupe de faza de decodificare sensibilă la latență, unde rezervele lor masive de SRAM strălucesc.
Lansarea CS-4 extinde, de asemenea, colaborarea Cerebras cu OpenAI. Yahoo Finance a raportat dezvăluirea alături de noile parteneriate OpenAI și AMD menite să accelereze inferența AI – bazându-se pe modul Ultrarapid pe care companiile l-au introdus la începutul lunii august, care a adus GPT-5.6 Sol utilizatorilor cu până la 750 de jetoane pe secundă.
Avertismente din spatele numerelor de titlu
Analiștii din industrie îndeamnă la prudență cu privire la cifrele de marketing. Registrul notează că titlul Cerebras 250 petaFLOPS se bazează pe dispersitate, care, în general, nu beneficiază de inferența modelului de limbaj mare, și că cifrele de vârf ale lățimii de bandă a memoriei sunt în mare parte teoretice, deoarece WSE-3 nu avea capacitatea de a-și satura propria SRAM. Publicația a pus la îndoială și de ce Cerebras a dublat performanța în loc să crească capacitatea SRAM, care nu a crescut semnificativ de la lansarea WSE-2 în urmă cu cinci ani - o alegere curioasă într-o eră a inferenței dezagregate în care acceleratoarele de decodare beneficiază cel mai mult de pe urma memoriei.
Totuși, oportunitatea de piață este reală. Pe măsură ce chatbot-urile și agenții AI solicită timpi de răspuns din ce în ce mai rapizi, viteza de inferență a devenit un adevărat diferențietor competitiv, iar Cerebras a demonstrat acum că își poate repeta tehnologia neconvențională la scară wafer la o cadență comercială.
Primele livrări de CS-4 încep în acest trimestru, primele sisteme fiind așteptate online înainte de sfârșitul lunii septembrie. Rămâne de văzut dacă acest lucru este suficient pentru a afecta dominația Nvidia – dar pentru prima dată după ceva timp, cea mai rapidă inferență AI din industrie are o nouă adresă.
Rămâi înaintea AI
Lansările de hardware precum CS-4 mută piețele și redefinește ceea ce pot face sistemele AI. Citește mai multe știri AI pentru a ține pasul cu fiecare dezvoltare.
Explorați cea mai recentă acoperire AI →