Як повідомила компанія в середу, як повідомляє TechCrunch, OpenAI додає функції голосових агентів у мобільний додаток ChatGPT, дозволяючи користувачам запускати реальну роботу — складати документи, підсумовувати електронні листи, створювати презентації — просто розмовляючи.

Розгортання поширюється на можливості смартфонів, які OpenAI раніше пропонував на настільному комп’ютері, і це відбувається, оскільки голос стає одним із найшвидше зростаючих способів взаємодії користувачів із помічниками ШІ для виконання складних завдань.

Що абоненти можуть робити голосом

Підписники Plus і Pro зможуть використовувати вкладку «Робота» в мобільному додатку ChatGPT, щоб створювати документи, чернетки електронних листів або підсумовувати повідомлення Slack голосом. Той самий голосовий процес охоплює більш важкі роботи, які вже підтримує вкладка «Робота», наприклад створення сайтів, створення презентацій, використання хмарного браузера та копання у фінансовій області ChatGPT.

Користувачі Free and Go отримують більш вузьку частину оновлення, отримуючи можливість працювати з плагінами та підключеними програмами.

OpenAI сказав, що голосові розмови тепер створюватимуть більш насичений текстовий вихід, і користувачі зможуть плавно перемикатися між голосовим і текстовим режимами. Мабуть, найпрактичніше доповнення для людей, які жонглюють поїздками на роботу та робочим столом: розмову, розпочату на ходу, можна відновити пізніше в програмі для настільного комп’ютера.

Шлях від GPT-Live до мобільних агентів

Оновлення є мобільним розділом історії, яку OpenAI розпочав у липні, коли запустив GPT-Live, свою нову розмовну модель, а пізніше підключив її до настільного додатка, щоб користувачі могли виконувати завдання на вкладці «Робочі» та створювати програми на вкладці «Кодекс» голосом. Оголошення в середу закриває цикл, переносячи те саме голосове виконання завдань на телефони.

Чому голосові агенти на мобільних пристроях важливі

Зрушення відображає те, як змінюються моделі використання. Більше користувачів звертаються до голосу, щоб віддавати команди помічникам зі штучним інтелектом для виконання складних завдань, і телефон є місцем, де ці команди виконуються найприродніше — між зустрічами, у машині чи поза клавіатурою.

Досі найпотужніші агентські функції в ChatGPT існували на комп’ютері. Користувачі, які хотіли, щоб ChatGPT створив презентацію або запустив багатоетапне дослідницьке завдання, мали бути за своїм комп’ютером і вводити інструкції на вкладці «Робота». Мобільний додаток, незважаючи на всю його популярність, здебільшого був поверхнею для спілкування. Оновлення в середу руйнує цю відмінність: телефон стає законним місцем для початку основної роботи з голосовим каналом як інтерфейсом.

Поділ підписки

Розгортання також посилює межі між рівнями підписки ChatGPT. Абоненти Plus і Pro — плани, які вже мають найвищі ліміти використання та доступ до найпотужніших моделей OpenAI — отримують повну голосову вкладку «Робоча», включаючи створення документів, написання електронних листів і підведення підсумків у Slack. Вони також можуть створювати сайти, створювати презентації, використовувати хмарний браузер і отримувати доступ до фінансової області ChatGPT, і все це голосом.

Користувачі Free and Go отримують більш обмежений набір можливостей, зосереджених на плагінах і підключених програмах. Цей рівень відповідає звичній для OpenAI моделі: перевірте можливість на настільному комп’ютері, а потім запустіть мобільну версію, найцінніші функції якої спонукають користувачів до платних планів. Для OpenAI цей крок поглиблює рів навколо його платних рівнів у той момент, коли конкуренти агресивно залицяються до тих самих користувачів.

Як це порівнюється з підходом Anthropic

Конкурентний фон тут має значення. TechCrunch зазначає, що Anthropic нещодавно спростив передачу між мобільним і настільним комп’ютером для своїх користувачів і об’єднав інтерфейси Cowork і Chat в один досвід. OpenAI, навпаки, все ще зберігає роздільність чату та робочих областей — навмисне розділення продукту, яке дозволяє відокремити випадкові розмови від робочого простору, де знаходяться файли, проекти та інструменти.

Дві компанії фактично проводять протилежні експерименти з розробки робочого процесу AI-assistant. Об’єднаний інтерфейс Anthropic робить ставку на те, що користувачі хочуть мати єдину уніфіковану поверхню, яка слідує за ними на всіх пристроях. OpenAI робить ставку на те, що чат і структуровані робочі простори задовольняють різні потреби та мають залишатися відмінними, а голос виступає як сполучна тканина — починайте завдання, розмовляючи з мобільного, уточнюйте його за допомогою клавіатури на робочому столі.

Що дивитися далі

Наступне очевидне питання полягає в тому, як далеко переміщаються голосові агенти від вкладки «Робота». Інтеграція OpenAI з настільним комп’ютером уже досягла Codex, його інструменту для створення додатків, і мобільний паритет перетворить телефони на повноцінні поверхні для розробки. Час для цього OpenAI не оголосив.

Також невирішеним є питання надійності. Голосові завдання Agentic — складання, підсумовування, перегляд — передбачають багатоетапне виконання, де помилки поповнюються, а мобільні середовища додають переривання та перемикання контексту. Ранній досвід користувача визначить, чи стане голосова робота щоденною звичкою чи залишиться лише демонстраційною функцією.

У будь-якому випадку, напрямок руху зрозумілий: помічник, який відповідав на запитання голосом два роки тому, тепер повинен завершити завдання до того, як ви дійдете до свого столу. З оновленням у середу мобільні користувачі OpenAI можуть почати це завдання з речення — і підібрати його на більшому екрані, коли вони прийдуть.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →