OpenAI запустила GPT-Live, нову серію голосових моделей для ChatGPT, які можуть слухати та говорити одночасно, що відзначає найсуттєвішу переробку компанією розмовного голосового досвіду на сьогоднішній день. У випуску використовується те, що OpenAI описує як повнодуплексну архітектуру, що дозволяє користувачам переривати, говорити та розмовляти з помічником так, як каже компанія, це схоже на справжній телефонний дзвінок.
Запуск відбувається разом із ширшим розгортанням сімейства моделей GPT-5.6 від OpenAI цього тижня та є поштовхом до того, щоб зробити найважливіші новини штучного інтелекту про голосові інтерфейси не схожими на керування машиною, а більше на чат з людиною.
Чим GPT-Live відрізняється
Традиційні голосові помічники працюють у напівдуплексному режимі: ви говорите, потім зупиняєтеся, потім система обробляє ваш запит і відповідає. Черговість жорстка. GPT-Live руйнує цей шаблон за допомогою повнодуплексної обробки аудіо, тобто модель може чути вас, поки вона ще говорить. Це дозволяє природні переривання, виправлення посередині речення та накладення розмови — те, що люди сприймають як належне, але голосовий штучний інтелект історично стикався з цим.
За даними Reuters, моделі GPT-Live слухають і говорять одночасно — можливість, яка вже давно є мішенню для сфери голосового штучного інтелекту. Цей підхід усуває незручні паузи та примусове чергування, які визначали попередні версії голосового режиму ChatGPT.
Примітна технічна деталь: коли GPT-Live стикається зі складними запитаннями, він передає їх на GPT-5.5 у фоновому режимі. Голосова модель обробляє потік розмови в режимі реального часу, тоді як більша модель аргументації працює над складнішими завданнями за кадром, а потім повертає відповідь. Відповідно до OpenAI, такий розподіл праці суттєво покращує якість відповіді без шкоди для чутливості, що робить розмову в реальному часі природною.
Наявність і ціна
OpenAI розгортає нові моделі голосу на двох рівнях:
- GPT-Live-1 — повна модель, тепер доступна платним абонентам ChatGPT (плани Plus, Pro і Team).
- GPT-Live-1 mini — менша, полегшена версія, доступна для безкоштовних облікових записів ChatGPT.
Запуск також включає веб-пошук безпосередньо в голосову розмову. Як повідомляє Search Engine Journal, GPT-Live інтегрує живий пошук у голос ChatGPT, тож користувачі можуть запитувати про поточні події чи інформацію, що швидко змінюється, і отримувати відповіді, засновані на свіжих веб-результатах, не перемикаючи режими.
Конкурентний голосовий ринок ШІ
GPT-Live приземляється у дедалі переповненому голосовому штучному інтелекті. Google просуває свої голосові функції на базі Gemini в Android і продукті Gemini Live, тоді як Apple продовжує переробляти Siri навколо великих мовних моделей. Anthropic, головний конкурент OpenAI, зосередив свої останні зусилля на агентному кодуванні та моделях міркувань, а не на голосі.
Повнодуплексний підхід – це те, куди, схоже, рухається ширша галузь. Дозволяючи одночасно слухати та говорити, GPT-Live зменшує затримку та усуває єдину найбільшу скаргу користувачів на голосових помічників: очікування. Перехід на GPT-5.5 для складних запитів також є сигналом того, що OpenAI розглядає голос не як урізаний інтерфейс, а як вхідні двері до своїх найбільш потужних моделей.
Чому це важливо
Голос протягом багатьох років розглядався як допоміжний, керований командами інтерфейс — хороший для налаштування таймерів і перевірки погоди, менш корисний для тонкої розмови. GPT-Live робить ставку на те, що вузьким місцем був не інтелект моделі, а інтерфейс: примушування людей говорити ізольованими вибухами.
Якщо повнодуплексна розмова працює надійно в масштабі, це змінює те, як люди взаємодіють із штучним інтелектом на телефонах, в автомобілях, на розумних колонках і, зрештою, на переносних пристроях. Це також викликає відомі занепокоєння — щодо згоди в пристроях, які постійно прослуховують, щодо реалістичності синтетичних голосів і щодо того, чи більш природна розмова змушує користувачів надмірно довіряти відповідям ШІ.
OpenAI не описує конкретних заходів безпеки для GPT-Live, окрім існуючої політики вмісту, хоча інтеграція пошуку означає, що модель тепер може передавати живу інформацію в голос, який користувачам може бути важче критично оцінити, ніж текст, який вони можуть прокручувати назад.
Що буде далі
Наразі GPT-Live — це спочатку функція ChatGPT, а потім продукт для розробників. Справжнє випробування відбудеться з доступом до API, коли програми сторонніх розробників, платформи обслуговування клієнтів і виробники апаратного забезпечення зможуть підключити повнодуплексне спілкування до своїх власних продуктів. Тоді ж OpenAI зіткнеться з ціновим тиском з боку дешевших голосових моделей з відкритим вихідним кодом і конкурентів, які прагнуть відповідати цій функції.
Одночасний запуск із публічним випуском GPT-5.6 свідчить про те, що OpenAI розглядає голос і міркування як дві половини однієї стратегії: потужна модель, яка думає, у поєднанні з інтерфейсом, який дозволяє вам спілкуватися з нею, як із колегою.
Будьте попереду ШІ
Щоб постійно отримувати інформацію про випуск моделей, голосовий штучний інтелект та все, що формує галузь, слідкуйте за останніми розробками штучного інтелекту на AI Buzz Wire.
Читати більше новин AI →



