Cerebras представила CS-4, стоечную систему вывода искусственного интеллекта, построенную на базе нового процессора WSE-3 Turbo, утверждая, что машина обеспечивает до 30 раз более быстрый вывод, чем системы на базе графических процессоров, поскольку компания позиционирует себя как скоростная альтернатива империи центров обработки данных Nvidia.

Запуск, объявленный во вторник и подробно описанный на страницах продуктов компании, а также волна репортажей со стороны Reuters, Bloomberg и The Register, знаменует собой самое значительное обновление аппаратного обеспечения Cerebras с момента выхода на биржу — и поворотный момент для компании, акции которой испытывают трудности после IPO. Инвесторы, похоже, обратили на это внимание: акции Cerebras (CBRS) выросли на этой новости, а Investor's Business Daily процитировала комментарий генерального директора о том, что рынок выводов ИИ «растет так быстро».

Для читателей, следящих за ускоряющейся гонкой за ускорением реагирования моделей ИИ, запуск CS-4 является одной из наиболее важных историй об аппаратном обеспечении квартала, и он происходит на фоне более широких изменений в сфере ИИ-индустрии, которые продолжают менять вычислительную среду.

Что внутри CS-4

Главным компонентом является WSE-3 Turbo, модернизированная версия двигателя Cerebras Wafer Scale Engine размером с обеденную тарелку. Согласно техническому обзору The Register, WSE-3T не является новым кремнием — он сохраняет тот же 5-нм техпроцесс TSMC, площадь кристалла 46 225 квадратных миллиметров, 4 триллиона транзисторов, 900 000 ядер и 44 ГБ SRAM на пластине, что и WSE-3 двухлетней давности.

Вместо этого Cerebras добилась удвоения производительности за счет значительного усовершенствования существующего чипа. WSE-3T удваивает производительность разреженных вычислений FP16 до 250 петафлопс, удваивает производительность плотных вычислений FP16 примерно до 25 петафлопс, удваивает пропускную способность памяти до 43,2 петабайт в секунду и удваивает пропускную способность ввода-вывода до 2,4 терабит в секунду. По оценкам Register, компания сейчас работает на частоте примерно 2,8 ГГц по сравнению с примерно 1,4 ГГц в предыдущем поколении.

Хитрость, по мнению Cerebras, заключается в переработанной системе подачи питания, которая расположена всего в 0,5 миллиметра от процессора — примерно в 100 раз ближе, чем ~50 миллиметров, типичных для обычных плат графического процессора. Такая близость практически исключает потери мощности на уровне платы и позволяет вдвое большему количеству энергии достигать пластины, что обеспечивает более высокие рабочие частоты и более быструю генерацию токенов.

Архитектура стойки Nexus

Помимо самого чипа, CS-4 представляет то, что Cerebras называет архитектурой платформы Nexus, свою первую по-настоящему стоечную конструкцию и прямой ответ на стоечные системы Nvidia NVL72 и AMD Helios. Каждый CS-4 может нести до трех процессоров WSE-3T, размещенных в автономных «вафельных рюкзаках» — 3D-корпусах, которые складывают пластину, преобразование энергии, прямое жидкостное охлаждение, высокоскоростной ввод-вывод и управляющую электронику в единую сборку с на 50% меньшим количеством компонентов.

Модульная конструкция отделяет стабильное питание, охлаждение и сетевой уровень от вычислительных ресурсов. По словам компании, Cerebras PowerRack можно установить и протестировать на объекте до прибытия каких-либо вычислительных устройств, а затем рюкзаки встанут на место, что сокращает время развертывания с дней до часов, по данным компании.

Потребление электроэнергии существенное. По оценкам Register, мощность каждого рюкзака составляет около 46 кВт, а общая потребляемая мощность системы составляет от 120 до 140 кВт — привлекательные цифры, которые, тем не менее, выглядят консервативно по сравнению со стоечными системами мощностью 240–250 кВт, которые AMD и Nvidia, как ожидается, поставят позднее в этом году.

Уничтожение переключателя

Пожалуй, наиболее технически интересный вариант — это межсоединение. Вместо маршрутизации трафика между пластинами через коммутаторы (подход, который AWS использовал для своих ускорителей Trainium3), Cerebras подключает свои чипы к топологии 2D-тора, где соседние пластины напрямую общаются друг с другом. Такая конструкция сокращает задержку между пластинами с пяти микросекунд до двух, и Церебрас утверждает, что сетка может поддерживать модели с числом до 50 триллионов параметров, что значительно превосходит все, что существует в настоящее время.

Результаты по скорости впечатляют. В одной системе CS-4 компания Artificial Analysis измерила до 4400 токенов в секунду на пользователя на gpt-oss-120b — примерно в 12 раз больше, чем ~350 токенов в секунду в самых быстрых службах вывода на основе графического процессора, доступных сегодня. Cerebras также утверждает, что система поддерживает более 1000 токенов в секунду на моделях, параметры которых превышают 10 триллионов.

Дезагрегированная стратегия партнерства

Примечательно, что Cerebras больше не пытается запустить весь конвейер вывода на собственном кристалле. Компания заключила партнерские отношения с AWS и AMD, чтобы переложить этап оперативной обработки данных с интенсивными вычислениями на процессоры Trainium XPU и графические процессоры Instinct соответственно, оставив своим механизмам масштаба пластины обрабатывать чувствительную к задержке фазу декодирования, где сияют их огромные резервы SRAM.

Запуск CS-4 также расширяет сотрудничество Cerebras с OpenAI. Yahoo Finance сообщила об открытии нового партнерства OpenAI и AMD, направленного на ускорение вывода ИИ — на основе сверхбыстрого режима, который компании представили ранее в августе, который предоставил пользователям GPT-5.6 Sol со скоростью до 750 токенов в секунду.

Предостережения, скрывающиеся за заголовками цифр

Отраслевые аналитики призывают к осторожности в отношении маркетинговых показателей. The Register отмечает, что заявленные Cerebras заявленные 250 петафлопс основаны на разреженности, которая, как правило, не дает преимуществ для вывода больших языковых моделей, и что значения пиковой пропускной способности памяти в основном являются теоретическими, поскольку WSE-3 не хватало вычислительных ресурсов для насыщения собственной SRAM. В публикации также задан вопрос, почему Cerebras удвоила производительность, а не увеличила емкость SRAM, которая существенно не выросла с момента запуска WSE-2 пять лет назад — любопытный выбор в эпоху дезагрегированного вывода, когда ускорители декодирования больше всего выигрывают от памяти.

Тем не менее, рыночные возможности реальны. Поскольку чат-боты и агенты искусственного интеллекта требуют все более быстрого реагирования, скорость вывода стала по-настоящему конкурентным преимуществом, и компания Cerebras теперь продемонстрировала, что может повторять свою нетрадиционную технологию масштаба пластины с коммерческой скоростью.

Первые поставки CS-4 начнутся в этом квартале, а запуск первых систем ожидается до конца сентября. Достаточно ли этого, чтобы подорвать доминирование Nvidia, еще неизвестно, но впервые за долгое время самый быстрый вывод ИИ в отрасли получил новый адрес.

Будьте впереди ИИ

Запуск аппаратного обеспечения, такого как CS-4, меняет рынки и дает новое определение возможностям систем искусственного интеллекта. Читайте больше новостей об искусственном интеллекте, чтобы быть в курсе всех событий.

Изучите последние новости об искусственном интеллекте →