OpenAI запустила GPT-Live, новую серию голосовых моделей для ChatGPT, которые могут одновременно слушать и говорить, что ознаменовало наиболее значительный пересмотр компании в области разговорной голосовой связи на сегодняшний день. В выпуске используется то, что OpenAI описывает как полнодуплексную архитектуру, позволяющую пользователям прерывать, разговаривать и разговаривать с помощником так, как, по словам компании, это похоже на настоящий телефонный звонок.

Запуск происходит одновременно с более широким развертыванием OpenAI семейства моделей GPT-5.6 на этой неделе и представляет собой толчок к тому, чтобы последние новости искусственного интеллекта о голосовых интерфейсах ощущались не как управление машиной, а как общение с человеком.

Что отличает GPT-Live от других

Традиционные голосовые помощники работают в полудуплексном режиме: вы говорите, затем прекращаете, затем система обрабатывает ваш запрос и отвечает. Очередность жесткая. GPT-Live разрушает этот шаблон с помощью полнодуплексной обработки звука, что означает, что модель может слышать вас, пока она еще говорит. Это позволяет естественные прерывания, исправления в середине предложения и перекрывающийся разговор — тот вид обмена туда-сюда, который люди воспринимают как должное, но с которым голосовой ИИ исторически боролся.

По данным Reuters, модели GPT-Live слушают и говорят одновременно — возможность, которая уже давно является целью в области голосового искусственного интеллекта. Этот подход устраняет неловкие паузы и вынужденную очередность, которые были характерны для более ранних версий голосового режима ChatGPT.

Примечательная техническая деталь: когда GPT-Live сталкивается со сложными вопросами, он передает их GPT-5.5 в фоновом режиме. Модель голоса управляет потоком разговора в режиме реального времени, в то время как более крупная модель рассуждения работает за кулисами над более сложными задачами, а затем возвращает ответ. Такое разделение труда, по мнению OpenAI, радикально улучшает качество ответа, не жертвуя при этом оперативностью, благодаря которой общение в реальном времени кажется естественным.

Наличие и цены

OpenAI внедряет новые голосовые модели на двух уровнях:

  • GPT-Live-1 — полная модель, доступная теперь платным подписчикам ChatGPT (планы Plus, Pro и Team).
  • GPT-Live-1 mini — уменьшенная и облегченная версия, доступная для бесплатных учетных записей ChatGPT.

По словам OpenAI, скоро появится доступ через API, который позволит разработчикам встраивать полнодуплексную голосовую связь в свои собственные приложения. Компания еще не опубликовала подробные цены на API.

Благодаря этому запуску веб-поиск будет добавлен непосредственно в голосовой разговор. Как сообщает Search Engine Journal, GPT-Live интегрирует живой поиск в голосовой ChatGPT, поэтому пользователи могут задавать вопросы о текущих событиях или быстро меняющейся информации и получать ответы, основанные на свежих веб-результатах, без переключения режимов.

Конкурентоспособный рынок голосового ИИ

GPT-Live попадает во все более насыщенную среду голосового искусственного интеллекта. Google внедряет свои голосовые функции на базе Gemini в Android и свой продукт Gemini Live, в то время как Apple продолжает перерабатывать Siri с учетом больших языковых моделей. Anthropic, главный конкурент OpenAI, в последнее время сосредоточил свои усилия на агентном кодировании и моделях рассуждения, а не на голосе.

Полнодуплексный подход – это то направление, в котором движется отрасль в целом. Обеспечивая одновременное прослушивание и разговор, GPT-Live сокращает задержку и устраняет самую большую жалобу пользователей на голосовые помощники: ожидание. Переход на GPT-5.5 для сложных запросов также является сигналом о том, что OpenAI рассматривает голосовую связь не как урезанный интерфейс, а как входную дверь к своим наиболее функциональным моделям.

Почему это важно

Голос в течение многих лет рассматривался как второстепенный интерфейс, управляемый командами: он хорош для установки таймеров и проверки погоды, но менее полезен для тонкого разговора. GPT-Live делает ставку на то, что узким местом не является интеллект модели, а интерфейс: заставить людей говорить изолированными очередями.

Если полнодуплексный разговор будет надежно работать в больших масштабах, это изменит то, как люди взаимодействуют с ИИ на телефонах, в автомобилях, на интеллектуальных колонках и, в конечном итоге, на носимых устройствах. Это также вызывает знакомые опасения — по поводу согласия в устройствах, которые всегда слушают, по поводу реалистичности синтетических голосов и по поводу того, приводит ли более естественный разговор пользователей к чрезмерному доверию к ответам ИИ.

OpenAI не детализировала конкретные меры безопасности для GPT-Live, помимо существующих политик в отношении контента, хотя интеграция с поиском означает, что модель теперь может передавать живую информацию в голос, который пользователям может быть сложнее критически оценить, чем текст, который они могут прокрутить обратно.

Что будет дальше

На данный момент GPT-Live — это в первую очередь функция ChatGPT, а затем продукт для разработчиков. Настоящее испытание наступит с доступом к API, когда сторонние приложения, платформы обслуживания клиентов и производители оборудования смогут подключить полнодуплексный диалог к ​​своим собственным продуктам. Именно тогда OpenAI столкнется с ценовым давлением со стороны более дешевых голосовых моделей с открытым исходным кодом и со стороны конкурентов, стремящихся соответствовать этой функции.

Одновременный запуск с публичной версией GPT-5.6 предполагает, что OpenAI рассматривает голос и рассуждения как две половины одной и той же стратегии: мощная модель, которая думает, в сочетании с интерфейсом, который позволяет вам разговаривать с ней, как с коллегой.

Будьте впереди ИИ

Чтобы постоянно освещать выпуски моделей, голосовой искусственный интеллект и все, что формирует отрасль, следите за последними разработками в области искусственного интеллекта на сайте AI Buzz Wire.

Подробнее новости AI →