Cerebras stáhla obal z CS-4, rackového systému umělé inteligence postaveného na jeho novém WSE-3 Turbo wafer-scale procesoru a tvrdí, že stroj poskytuje až 30krát rychlejší odvození než systémy založené na GPU, protože se společnost staví jako rychlostní alternativa k impériu datových center Nvidia.

Uvedení na trh, oznámené v úterý a podrobně popsané na produktových stránkách společnosti a vlně pokrytí agenturami Reuters, Bloomberg a The Register, představuje nejvýznamnější aktualizaci hardwaru Cerebras od doby, kdy byla zveřejněna – a klíčový okamžik pro společnost, jejíž akcie se od svého IPO potýkaly s problémy. Zdá se, že investoři věnují pozornost: akcie Cerebras (CBRS) podle zpráv prudce vzrostly a Investor's Business Daily citoval komentář generálního ředitele, že trh s AI „roste tak rychle“.

Pro čtenáře, kteří sledují zrychlující se závod o rychlejší odezvu modelů s umělou inteligencí, je uvedení CS-4 jedním z nejzásadnějších hardwarových příběhů čtvrtletí a zapadá do širších změn v pokrytí odvětví AI, které nadále přetvářejí výpočetní prostředí.

Co je uvnitř CS-4

Hlavní komponentou je WSE-3 Turbo, vylepšená verze motoru Cerebras o velikosti talíře. Podle technického hlubokého ponoru The Register není WSE-3T novým křemíkem – zachovává si stejný 5nm proces TSMC, plochu matrice 46 225 čtverečních milimetrů, 4 biliony tranzistorů, 900 000 jader a 44 GB on-wafer SRAM jako dva roky starý WSE-3.

Místo toho Cerebras dosáhl zdvojnásobení výkonu tím, že zatlačil na stávající čip mnohem tvrději. WSE-3T zdvojnásobuje řídký výpočet FP16 na 250 petaFLOPS, zdvojnásobuje hustý výkon FP16 na odhadovaných 25 petaFLOPS, zdvojnásobuje šířku pásma paměti na 43,2 petabajtů za sekundu a zdvojnásobuje šířku I/O pásma na 2,4 terabitů za sekundu. Register odhaduje, že společnost nyní taktová křemík na zhruba 2,8 GHz, oproti přibližně 1,4 GHz v předchozí generaci.

Trik podle Cerebras spočívá v přepracovaném systému dodávky energie, který sedí pouhých 0,5 milimetru od procesoru – zhruba 100krát blíže než ~50 milimetrů typických pro běžné desky GPU. Tato blízkost téměř eliminuje ztrátu výkonu na úrovni desky a umožňuje dosáhnout waferu dvakrát tolik energie, což umožňuje vyšší provozní frekvence za rychlejší generování tokenů.

Architektura stojanu Nexus

Kromě samotného čipu představuje CS-4 to, co Cerebras nazývá Nexus Platform Architecture, svůj první skutečný rackový design a přímou odpověď na rackové systémy Nvidia NVL72 a AMD Helios. Každý CS-4 může nést až tři procesory WSE-3T umístěné v samostatných „Wafer-Scale Backpacks“ – 3D balíčcích, které skládají wafer, konverzi energie, přímé kapalinové chlazení, vysokorychlostní I/O a řídicí elektroniku do jediné sestavy s o 50 % méně komponent.

Modulární design odděluje stabilní napájení, chlazení a síťovou vrstvu od výpočetní. Cerebras PowerRack lze nainstalovat a kvalifikovat pro zařízení dříve, než dorazí jakýkoli výpočet, a batohy se poté zasunou na místo, což zkracuje dobu nasazení ze dnů na hodiny, podle společnosti.

Spotřeba energie je značná. Register odhaduje kolem 46 kW na batoh a celkový systémový odběr 120 až 140 kW – poutavá čísla, která nicméně vypadají konzervativně vedle 240 až 250 kW rackových systémů AMD a Nvidia se očekává dodání koncem tohoto roku.

Killing the Switch

Snad technicky nejzajímavější volbou je propojení. Spíše než směrování provozu mezi wafery přes přepínače – přístup, který AWS přijal pro své akcelerátory Trainium3 – Cerebras spojuje své čipy do 2D torusové topologie, kde sousední wafery spolu přímo mluví. Design zkracuje latenci mezi wafery z pěti mikrosekund na pouhé dvě a Cerebras říká, že síť může podporovat modely až 50 bilionů parametrů, pohodlně nad rámec toho, co v současnosti existuje.

Výsledky rychlosti jsou ohromující. Na jediném systému CS-4 naměřila srovnávací společnost Artificial Analysis až 4 400 tokenů za sekundu na uživatele na gpt-oss-120b – zhruba 12krát více než ~350 tokenů za sekundu oproti nejrychlejším dnes dostupným inferenčním službám založeným na GPU. Cerebras také tvrdí, že systém udržuje více než 1 000 tokenů za sekundu na modelech přesahujících 10 bilionů parametrů.

Strategie disagregovaného partnerství

Je pozoruhodné, že Cerebras se již nesnaží provozovat celý inferenční kanál na svém vlastním křemíku. Společnost navázala partnerství s AWS a AMD, aby přenesla výpočetně náročnou fázi rychlého zpracování na procesory Trainium XPU a Instinct GPU, v tomto pořadí, a ponechala své wafer-scale motory, aby zvládly fázi dekódování citlivou na latenci, kde září jejich obrovské rezervy SRAM.

Uvedení CS-4 také rozšiřuje spolupráci Cerebras s OpenAI. Společnost Yahoo Finance oznámila odhalení spolu s novými partnerstvími OpenAI a AMD zaměřenými na urychlení vyvozování AI – staví na režimu Ultrafast, který společnosti představily dříve v srpnu a který uživatelům přinesl GPT-5.6 Sol rychlostí až 750 tokenů za sekundu.

Upozornění za čísly titulků

Průmysloví analytici nabádají k určité opatrnosti ohledně marketingových údajů. Registr poznamenává, že titulek Cerebras 250 petaFLOPS se spoléhá na vzácnost, která obecně neprospívá odvození velkého jazykového modelu, a že údaje o maximální šířce pásma paměti jsou z velké části teoretické, protože WSE-3 postrádal výpočetní kapacitu k nasycení vlastní SRAM. Publikace také zpochybňovala, proč Cerebras zdvojnásobil výkon spíše než zvýšil kapacitu SRAM, která se od uvedení WSE-2 před pěti lety významně nezvýšila – což je zvláštní volba v éře disagregovaných závěrů, kdy akcelerátory dekódování nejvíce těží z paměti.

Přesto je tržní příležitost reálná. Vzhledem k tomu, že chatboti a agenti AI vyžadují stále rychlejší doby odezvy, rychlost odvození se stala skutečným konkurenčním odlišovatelem a společnost Cerebras nyní prokázala, že může svou nekonvenční technologii wafer-scale komerční kadenci opakovat.

První dodávky CS-4 začínají v tomto čtvrtletí, přičemž první systémy se očekávají online do konce září. Zda to stačí k narušení dominance Nvidie, se teprve uvidí – ale poprvé po nějaké době má nejrychlejší AI v tomto odvětví novou adresu.

Udržujte si náskok před AI

Uvedení hardwaru, jako je CS-4, posouvá trhy a nově definuje, co systémy AI dokážou. Přečtěte si další zprávy o AI, abyste drželi krok s každým vývojem.

Prozkoumejte nejnovější pokrytí AI →