Cerebras Systems и OpenAI поделились первым взглядом на сверхбыстрый режим, новый уровень услуг, впервые запускаемый в API OpenAI и основанный на технологии Cerebras в масштабе пластины. Партнерство позволяет GPT-5.6 Sol работать со скоростью до 750 токенов в секунду, обеспечивая интеллектуальную работу на переднем уровне со скоростью в реальном времени. Чтобы узнать последние новости об оборудовании искусственного интеллекта, посетите [AI Buzz Wire] (https://aibuzzwire.news).
Устранение компромисса между скоростью и интеллектом
Разработчики ИИ уже давно столкнулись с фундаментальным компромиссом: по мере увеличения размера и интеллекта моделей они несут более высокие затраты на вычисления и перемещение данных, что замедляет время отклика. Разработчики были вынуждены выбирать между ожиданием получения качественных результатов или принятием худших результатов за меньшее время.
GPT-5.6 Sol в сверхбыстром режиме призван решить эту дилемму. По данным Cerebras, сервис работает в 11 раз быстрее, чем Claude Fable 5 от Anthropic, и в 5 раз быстрее, чем Opus 4.8 в быстром режиме, основываясь на скорости вывода, сообщенной Artificial Analysis.
Последний экзамен человечества: тест на скорость
Компания Cerebras протестировала Ultrafast против конкурирующих моделей на «Последнем экзамене человечества» (HLE), сложном тесте, состоящем из 2500 вопросов, на которые обычно могут ответить только те, кто имеет докторскую степень в таких областях, как химия, экономика и литература.
По оценкам Cerebras, GPT-5.6 Sol в сверхбыстром режиме ответил на все 2500 вопросов HLE за 11 часов и 11 минут. Чтобы прийти к тем же выводам, Claude Fable 5 потребовалось 78 часов и 27 минут, более трёх дней непрерывных вычислений. Другими словами, Ultrafast обработала передовой уровень человеческих знаний за один рабочий день, достигнув сопоставимой точности почти в семь раз быстрее.
Бенчмаркинг проводился компанией Cerebras с использованием GPT-5.6 Sol Ultrafast с Codex на высоких настройках логики 10 июля и Claude Fable 5 с Claude Code на высоких настройках логики с 13 по 15 июля.
Влияние на реальный бизнес
В GDP-Val, эталоне для экономически ценных задач интеллектуального труда, Ultrafast обеспечил сквозное ускорение в 5,6 раза без ухудшения качества. Это демонстрирует, как более быстрый вывод может ускорить экономически ценную работу без ущерба для качества результатов.
Cerebras рассматривает Ultrafast как инструмент для сценариев, где важна каждая секунда. Компании, предоставляющие веб-сервисы, могли бы использовать эту технологию для более быстрого выявления и устранения сбоев в производстве, сохраняя доверие клиентов и предотвращая потерю доходов. В ситуациях, когда ставки в кибербезопасности высоки, группы безопасности могут использовать Ultrafast для быстрого обнаружения атак и реагирования на них.
Технология, лежащая в основе скорости
Преимущество в производительности обусловлено архитектурой Cerebras Wafer-Scale Engine, специально созданной для передовых рабочих нагрузок искусственного интеллекта. Основной проблемой быстрого граничного вывода является проблема перемещения данных: на традиционных графических процессорах вывод для больших моделей ограничен пропускной способностью памяти, поскольку веса моделей должны многократно передаваться между встроенной памятью и внешним хранилищем для генерации последовательных токенов.
Cerebras использует принципиально иной подход. Каждый чип размером с пластину содержит 44 ГБ SRAM непосредственно на кристалле. Веса моделей остаются на кристалле, а токены бесперебойно проходят через уровни модели, передаваемые по конвейерам между пластинами. Это устраняет неэффективное перемещение данных, которое замедляет вывод на основе графического процессора, и плавно масштабируется в зависимости от размера модели, открывая путь к постоянному преимуществу в скорости для будущих передовых моделей.
Доступность и позиционирование на рынке
GPT-5.6 Sol в сверхбыстром режиме в настоящее время доступен в виде ограниченной предварительной версии для избранной группы клиентов, причем доступ будет расширяться со временем по мере роста емкости. Церебрас описывает это партнерство как движущую силу следующей волны инноваций в области искусственного интеллекта и повышение потолка того, чего организации могут достичь с помощью адаптивного искусственного интеллекта.
Это сотрудничество представляет собой важную веху для компании Cerebras, которая уже давно занимается разработкой вычислений в масштабе пластины в качестве альтернативы рынку оборудования для искусственного интеллекта, где доминируют графические процессоры. Сотрудничая напрямую с OpenAI для ускорения одной из самых эффективных передовых моделей, Cerebras убедительно доказывает, что ее архитектура предлагает подлинное конкурентное преимущество для высокоскоростных рабочих нагрузок вывода.
Поскольку модели продолжают становиться больше и умнее, способность обслуживать их в режиме реального времени может стать определяющим конкурентным фактором на рынке инфраструктуры искусственного интеллекта. Партнерство Cerebras-OpenAI сигнализирует о том, что гонка за скорость вывода теперь так же важна, как и гонка за модельный интеллект.
Будьте впереди ИИ
Чтобы узнать больше о новостях об оборудовании искусственного интеллекта, анализе производительности моделей и отраслевых разработках, добавьте в закладки AI Buzz Wire.
Подробнее новости AI →