Cerebras і OpenAI дали світові ранній погляд на Ultrafast Mode, новий рівень послуг, який запускається в OpenAI API і працює на апаратному забезпеченні Cerebras. Відповідно до оголошення Cerebras, опублікованого 13 серпня 2026 року, GPT-5.6 Sol, що працює на Ultrafast, забезпечує до 750 вихідних токенів за секунду — без компромісів у якості.

Рівень спочатку доступний для вибраної групи клієнтів, з часом доступ розширюється. Оголошення, написане Джойс Ер з Cerebras, позиціонує пропозицію як вирішення компромісу, який роками визначав розробку продуктів штучного інтелекту: розробникам доводилося вибирати між швидкістю та інтелектом, оскільки більші та розумніші моделі несуть вищі витрати на обчислення та переміщення даних, що сповільнює час відгуку. Читачі, які слідкують за прискоренням передових моделей, можуть стежити за останніми розробками на AI Buzz Wire.

Наскільки швидким є надшвидкий?

Необроблена пропускна здатність сама по собі вражає, але Cerebras також надав порівняльний контекст. Згідно зі швидкістю виведення, повідомленою Artificial Analysis, незалежною службою порівняльного аналізу, GPT-5.6 Sol у режимі Ultrafast працює:

  • 11 разів швидше, ніж Fable 5
  • У 5 разів швидше, ніж Opus 4.8 у швидкому режимі

Щоб перевірити це твердження, Cerebras порівняла модель із популярними конкурентами на Humanity's Last Exam (HLE), складному тесті, що складається з 2500 запитань, на які зазвичай відповідають лише люди, які мають докторський ступінь у таких галузях, як хімія, економіка та література.

Результат: GPT-5.6 Sol на Ultrafast відповів на всі 2500 запитань HLE за 11 годин 11 хвилин. Claude Fable 5 знадобилося 78 годин і 27 хвилин — більше трьох днів безперервних обчислень — щоб дійти тих самих висновків. Іншими словами, Ultrafast опрацював кордон людських знань за один робочий день, досягнувши порівнянної точності майже в 7 разів швидше.

Cerebras відзначив свою методологію порівняльного аналізу: GPT-5.6 Sol Ultrafast було протестовано з Codex на xhigh аргументації 10 липня, тоді як Claude Fable 5 було протестовано з Claude Code на xhigh міркуваннях 13–15 липня.

Реальні робочі навантаження, а не лише тести

Порівняльні показники швидкості можуть вводити в оману, якщо попутно погіршується якість, тому Cerebras також виділив результати GDP-Val, еталонного показника для економічно цінних завдань, пов’язаних із знаннями. На GDP-Val Ultrafast забезпечив 5,6-кратне наскрізне прискорення без погіршення якості, згідно з тестами, проведеними Cerebras 31 липня 2026 року з використанням GPT-5.6 Sol і GPT-5.6 Sol Ultrafast на середньому міркуванні в Codex.

Компанія каже, що GPT-5.6 Sol є найкращою моделлю OpenAI для юридичних матеріалів, фінансових моделей та інженерних звітів — областей, де якість результату та час виконання мають прямі фінансові наслідки.

Чому швидкість змінює рівняння агента

Більш серйозні зміни можуть відбутися в тому, як працюють агенти ШІ. Швидший висновок змінює те, що можливо для окремих осіб і організацій, оскільки агентів можна поставити на критичний шлях проблем, де кожна секунда на рахунку.

«Завдяки GPT-5.6 Sol Ultrafast Cerebras забезпечує ШІ, який не відстає від того, як ви думаєте, кодуєте та співпрацюєте», — сказав Рохан Варма, продукт OpenAI, у заяві, цитованій в повідомленні. «Ми раді бачити, як робочі процеси та додатки трансформуються за допомогою ультрашвидкого висновку».

Cerebras окреслив кілька сценаріїв з високими ставками, де прискорення має значення:

Реагування на інцидент

Компанії, які надають веб-сервіси, можуть використовувати Ultrafast для виявлення та усунення збоїв у виробництві, збереження довіри клієнтів, запобігання втраті доходу та економія хвилин простою відповідно до їхніх SLA.

Кібербезпека

У змагальних кібератаках із високими ставками команди безпеки повинні швидко виявляти зловмисників і реагувати на них, щоб стримувати катастрофічні втрати — завдання, де затримка висновку безпосередньо впливає на контроль збитків.

Продуктивність агента

Ultrafast забезпечує нові режими роботи з агентами, надаючи інформацію та оновлення в реальному часі, зменшуючи потребу в контекстному перемиканні між паралельними сеансами.

«Якщо раніше мені, можливо, доводилося чекати кілька хвилин, поки завдання завершиться, тепер воно завершується для мене ще до того, як я навіть маю можливість перемкнути контекст. Це робить мене набагато продуктивнішим», — сказав Джеффрі Ван, дослідник OpenAI, в повідомленні.

Стратегія партнерства

Для Cerebras ця угода являє собою ще одну віху в її спробах комерціалізувати прискорення масштабу пластини для висновків ШІ. Для OpenAI режим Ultrafast Mode додає високошвидкісний рівень до його API в той момент, коли затримка висновку стала конкурентоспроможною відмінністю — особливо для агентських програм, які об’єднують багато викликів моделі, де затримки кожного виклику перетворюються на хвилини очікування.

Компанії створюють цей рівень як постійну перевагу для організацій, які використовують передовий штучний інтелект для швидкого реагування на вхідну інформацію, поєднуючи надшвидку обробку для швидкої роботи зі стандартною обробкою для товарних завдань, які можна розпаралелювати у фоновому режимі.

Доступ розгортається поступово. Зацікавлені розробники можуть стежити за доступністю документації OpenAI API, оскільки Cerebras каже, що доступ з часом розшириться з початкової вибраної групи клієнтів.

Будьте попереду ШІ

Щоб дізнатися більше про перегони апаратного забезпечення та інфраструктури, які змінюють структуру штучного інтелекту, додайте закладку AI Buzz Wire і слідкуйте за нашою стрічкою Новини апаратного забезпечення AI.

Читати більше новин AI →