Cerebras зняла обгортку з CS-4, стелажної системи висновків штучного інтелекту, побудованої на новому процесорі пластинчастого масштабу WSE-3 Turbo, стверджуючи, що машина забезпечує до 30 разів швидше висновків, ніж системи на основі GPU, оскільки компанія позиціонує себе як швидкісну альтернативу імперії центрів обробки даних Nvidia.

Запуск, оголошений у вівторок і детально описаний на сторінках продуктів компанії та в хвилі висвітлення Reuters, Bloomberg і The Register, знаменує собою найважливіше оновлення апаратного забезпечення Cerebras з моменту виходу на біржу — і ключовий момент для компанії, акції якої зазнали труднощів після IPO. Інвестори, схоже, звернули увагу: акції Cerebras (CBRS) підскочили після цієї новини, а Investor's Business Daily процитував коментар генерального директора про те, що ринок штучного інтелекту «росте дуже швидко».

Для читачів, які відслідковують прискорену гонку за швидшим реагуванням моделей штучного інтелекту, запуск CS-4 є однією з найбільш важливих історій про апаратне забезпечення кварталу, і це відбувається на тлі ширших змін у охопленні галузі штучного інтелекту, які продовжують змінювати обчислювальний ландшафт.

Що всередині CS-4

Головним компонентом є WSE-3 Turbo, оновлена версія Wafer Scale Engine від Cerebras розміром із обідню тарілку. Відповідно до детального технічного аналізу The Register, WSE-3T не є новим кремнієм — він зберіг той самий 5-нм техпроцес TSMC, площу кристала 46 225 квадратних міліметрів, 4 трильйони транзисторів, 900 000 ядер і 44 ГБ SRAM на пластині, що й WSE-3 дворічної давності.

Натомість Cerebras досяг подвоєння продуктивності, натиснувши на існуючий чіп значно сильніше. WSE-3T подвоює розріджені обчислення FP16 до 250 петаФЛОПС, подвоює продуктивність щільного FP16 до приблизно 25 петаФЛОПС, подвоює пропускну здатність пам’яті до 43,2 петабайт на секунду та подвоює пропускну здатність введення/виведення до 2,4 терабіт на секунду. За оцінками Register, компанія зараз працює на тактовій частоті кремнію приблизно на 2,8 ГГц, порівняно з приблизно 1,4 ГГц у попередньому поколінні.

За словами Cerebras, хитрість полягає в переробленій системі живлення, яка розташована всього на 0,5 міліметра від процесора — приблизно в 100 разів ближче, ніж ~50 міліметрів, типових для звичайних графічних плат. Така близькість майже усуває втрати потужності на рівні плати та дозволяє вдвічі більше енергії досягати пластини, що забезпечує вищі робочі частоти за швидшою генерацією маркерів.

Архітектура Nexus Rack

Окрім самого чіпа, CS-4 представляє те, що Cerebras називає платформною архітектурою Nexus, її першу справжню стійкову конструкцію та пряму відповідь на стійкові системи NVL72 Nvidia та Helios від AMD. Кожен CS-4 може перевозити до трьох процесорів WSE-3T, розміщених у автономних «Wafer-Scale Backpacks» — 3D-пакетах, які складають пластину, перетворення живлення, пряме рідинне охолодження, високошвидкісний ввід/вивід та керуючу електроніку в єдину збірку з на 50% меншою кількістю компонентів.

Модульна конструкція відокремлює рівень стабільного живлення, охолодження та мережі від комп’ютера. Cerebras PowerRack можна встановити та перевірити на об’єкті до надходження будь-яких обчислень, а потім рюкзаки засунуть на місце, скорочуючи час розгортання з днів до годин, за словами компанії.

Енергоспоживання суттєве. Регістр оцінює близько 46 кВт на рюкзак і загальне споживання системи від 120 до 140 кВт — привертають увагу цифри, які, тим не менш, виглядають консервативно поряд зі стійковими системами від 240 до 250 кВт, які AMD і Nvidia, як очікується, поставлять пізніше цього року.

Вбивство Switch

Можливо, найцікавішим технічно вибором є інтерконнект. Замість того, щоб маршрутизувати трафік між пластинами через комутатори — підхід, прийнятий AWS для своїх прискорювачів Trainium3 — Cerebras підключає свої чіпи до 2D-торової топології, де сусідні пластини спілкуються безпосередньо одна з одною. Конструкція скорочує затримку між пластинами з п’яти мікросекунд до двох, і Cerebras каже, що сітка може підтримувати моделі до 50 трильйонів параметрів, що значно перевищує будь-які існуючі наразі.

Результати швидкості вражають. На одній системі CS-4 компанія Artificial Analysis виміряла до 4400 токенів на секунду на користувача на gpt-oss-120b — це приблизно в 12 разів більше, ніж у ~350 токенів на секунду, ніж у найшвидших доступних сьогодні служб висновків на основі GPU. Cerebras також стверджує, що система підтримує понад 1000 токенів на секунду на моделях, параметри яких перевищують 10 трильйонів.

Дезагрегована стратегія партнерства

Примітно, що Cerebras більше не намагається запустити весь конвеєр висновків на власному кремнії. Компанія співпрацює з AWS і AMD, щоб перенести інтенсивну обчислювальну операцію швидкої обробки на процесори Trainium XPU і графічні процесори Instinct відповідно, залишивши механізми масштабування пластин для обробки фази декодування, чутливої ​​до затримки, де сяють їхні величезні резерви SRAM.

Запуск CS-4 також розширює співпрацю Cerebras з OpenAI. Yahoo Finance повідомила про відкриття поряд із новими партнерствами OpenAI та AMD, спрямованими на прискорення висновків штучного інтелекту — на базі ультрашвидкого режиму, який компанії представили раніше в серпні, який надав користувачам GPT-5.6 Sol зі швидкістю до 750 токенів на секунду.

Застереження за цифрами заголовка

Галузеві аналітики закликають бути обережними щодо маркетингових цифр. Реєстр зазначає, що заголовок Cerebras 250 petaFLOPS покладається на розрідженість, яка, як правило, не сприяє висновку про велику мовну модель, і що значення максимальної пропускної здатності пам’яті є переважно теоретичними, оскільки WSE-3 не вистачало обчислень для насичення власної SRAM. Публікація також поставила під сумнів, чому Cerebras подвоїв продуктивність, а не збільшив ємність SRAM, яка суттєво не зросла з моменту запуску WSE-2 п’ять років тому — цікавий вибір в епоху дезагрегованих висновків, коли прискорювачі декодування найбільше виграють від пам’яті.

Тим не менш, ринкові можливості реальні. Оскільки чат-боти та агенти зі штучним інтелектом вимагають все більш швидкого часу відповіді, швидкість висновку стала справжньою конкурентоспроможною відмінністю, і Cerebras тепер продемонстрував, що може повторити свою нетрадиційну технологію вафельного масштабу в комерційному темпі.

Перші поставки CS-4 почнуться в цьому кварталі, а перші системи очікуються онлайн до кінця вересня. Чи буде цього достатньо, щоб послабити домінування Nvidia, ще належить з’ясувати, але вперше за деякий час найшвидший штучний інтелект в галузі отримав нову адресу.

Будьте попереду ШІ

Запуск апаратного забезпечення, як-от CS-4, змінює ринки та переосмислює можливості систем ШІ. Читайте більше новин ШІ, щоб бути в курсі всіх розробок.

Ознайомтеся з останніми матеріалами про AI →