Cerebras Systems і OpenAI поділилися раннім поглядом на режим Ultrafast Mode, новий рівень послуг, який вперше запускається в API OpenAI і працює на основі технології пластинчастого масштабу Cerebras. Партнерство дозволяє GPT-5.6 Sol працювати зі швидкістю до 750 вихідних токенів на секунду, надаючи інтелектуальні дані на передовому рівні зі швидкістю в реальному часі. Для отримання останніх новин про апаратне забезпечення ШІ відвідайте AI Buzz Wire.

Усунення компромісу швидкість-інтелект

Конструктори штучного інтелекту вже давно стикаються з фундаментальним компромісом: коли моделі збільшуються в розмірі та інтелекті, вони несуть вищі витрати на обчислення та переміщення даних, уповільнюючи час відгуку. Розробники були змушені вибирати між очікуванням високоякісних результатів або прийняттям нижчих результатів за менший час.

GPT-5.6 Sol у надшвидкому режимі призначений для вирішення цієї дилеми. Відповідно до Cerebras, служба працює в 11 разів швидше, ніж Claude Fable 5 від Anthropic, і в 5 разів швидше, ніж Opus 4.8 у швидкому режимі, виходячи зі швидкості виведення, повідомленої Artificial Analysis.

Останній іспит людства: тест на швидкість

Cerebras випробовує Ultrafast проти конкуруючих моделей на Останньому іспиті Humanity's Exam (HLE), складному тесті, що складається з 2500 запитань, на які зазвичай відповідають лише ті, хто має докторський ступінь у таких галузях, як хімія, економіка та література.

В оцінках, проведених Cerebras, GPT-5.6 Sol у надшвидкому режимі відповів на всі 2500 запитань HLE за 11 годин 11 хвилин. Claude Fable 5 знадобилося 78 годин і 27 хвилин, більше трьох днів безперервних обчислень, щоб дійти тих самих висновків. Іншими словами, Ultrafast обробив передовий рівень людських знань за один робочий день, досягнувши порівнянної точності майже в сім разів швидше.

Порівняльний аналіз проводився Cerebras за допомогою GPT-5.6 Sol Ultrafast із Codex із високими параметрами міркування 10 липня та Claude Fable 5 із Claude Code із високими налаштуваннями міркування з 13 по 15 липня.

Реальний вплив на бізнес

На GDP-Val, еталоні для економічно цінних робочих завдань, Ultrafast забезпечив наскрізне прискорення в 5,6 раза без погіршення якості. Це демонструє, як швидший висновок може прискорити економічно цінну роботу без шкоди для якості результату.

Cerebras передбачає Ultrafast як інструмент для сценаріїв, де кожна секунда має значення. Компанії, які керують веб-сервісами, можуть використовувати цю технологію для швидшого виявлення та усунення збоїв у виробництві, зберігаючи довіру клієнтів і запобігаючи втраті прибутку. У ситуаціях, пов’язаних з кібербезпекою з великими ставками, служби безпеки можуть використовувати Ultrafast для швидкого виявлення та реагування на атаки.

Технологія, що стоїть за швидкістю

Перевага продуктивності пов’язана з архітектурою Wafer-Scale Engine від Cerebras, спеціально розробленою для передових робочих навантажень ШІ. Основною проблемою швидкого граничного висновку є проблема переміщення даних: на традиційних графічних процесорах логічний висновок на великих моделях обмежений пропускною здатністю пам’яті, оскільки вагові коефіцієнти моделі потрібно неодноразово передавати між внутрішньою пам’яттю та зовнішнім сховищем для генерації послідовних маркерів.

Cerebras використовує принципово інший підхід. Кожен чіп розміром з пластину містить 44 ГБ SRAM безпосередньо на кремнії. Вагові коефіцієнти моделі залишаються на чіпі, а токени безперервно проходять через шари моделі, конвеєрні через пластини. Це усуває неефективне переміщення даних, яке уповільнює висновок на основі графічного процесора, і плавно масштабується відповідно до розміру моделі, прокладаючи шлях для постійної переваги швидкості майбутніх передових моделей.

Доступність і позиціонування на ринку

GPT-5.6 Sol у надшвидкому режимі наразі доступний у обмеженій попередній версії для вибраної групи клієнтів, доступ розширюється з часом у міру зростання ємності. Cerebras описує партнерство як стимулювання наступної хвилі інновацій штучного інтелекту та підвищення межі того, чого організації можуть досягти за допомогою адаптивного штучного інтелекту.

Ця співпраця є важливою віхою для Cerebras, яка вже давно шукає обчислення в масштабі пластин як альтернативу ринку обладнання ШІ, на якому домінує GPU. Завдяки безпосередньому партнерству з OpenAI для прискорення однієї з найпотужніших доступних передових моделей Cerebras доводить, що її архітектура пропонує справжню конкурентну перевагу для високошвидкісних робочих навантажень.

Оскільки моделі продовжують зростати та ставати все більш інтелектуальними, здатність обслуговувати їх у режимі реального часу може стати визначальним фактором конкурентоспроможності на ринку інфраструктури ШІ. Партнерство Cerebras-OpenAI свідчить про те, що гонка за швидкістю логічного висновку тепер така ж важлива, як і гонка за інтелектом моделі.

Будьте попереду ШІ

Щоб дізнатися більше про апаратне забезпечення AI, аналіз продуктивності моделі та галузеві розробки, додайте закладку AI Buzz Wire.

Читати більше новин AI →