Google запустив Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking, пару моделей живого діалогу, які компанія описує як найдосконалішу на сьогодні для природної голосової розмови. Розгортання моделей почалося 15 вересня в Gemini API, Google AI Studio, Search Live, Gemini Live і Google Workspace, з корпоративним доступом у приватному попередньому перегляді через Gemini Enterprise.

Оголошення надійшло від Тома Оуянга, головного інженера, і Маліні Джаганатана, члена технічного персоналу, які написали від імені Gemini Audio Team. Він розширює сімейство Gemini 3.8, яке дебютувало на початку цього місяця з моделями Flash і Flash Cyber, і знаменує собою найагресивніший поштовх Google до мультимодальної голосової допомоги в режимі реального часу — ринку, де голосовий режим OpenAI і хвиля мовних стартапів конкурують за один і той самий випадок щоденного використання.

Запуск вписується в надзвичайну переповнену лінійку моделей Google; Висвітлення [останніх розробок штучного інтелекту] (https://aibuzzwire.news) показує, що компанія наразі постачала багаторазово протягом кількох тижнів, борючись із конкурентами щодо цін, кодування, а тепер і голосу.

Створено для розмов у реальному часі

Те, що відрізняє моделі Live від стандартної моделі чату з підключеним мікрофоном, це затримка та стан. Документація Live API від Google описує інтерфейс із низькою затримкою, який обробляє безперервні потоки аудіо, зображень і тексту через з’єднання WebSocket із збереженням стану, приймаючи необроблений PCM-аудіо 16 кГц, зображення JPEG зі швидкістю до одного кадру за секунду та текст, а також повертаючи голосовий звук у реальному часі.

Моделі обробляють візуальні дані майже в режимі реального часу, дозволяючи помічнику бачити те, що бачить користувач — демонстраційні відео від Google показують, як Gemini 3.8 Live керує сеансом навчання співробітника за допомогою візуального контексту, гри в шахи майже в реальному часі та створення повних бізнес-планів і спеціальних наборів маркетингових інструментів за допомогою природної мови. Моделі також можуть автоматично виявляти 97 підтримуваних мов і переходити між ними під час розмови, без налаштування користувача.

Можливо, найважливіше для практичного використання: моделі виконують інструменти та виклики API у фоновому режимі, поки триває розмова, підтверджуючи запити та підтримуючи діалог до завершення завдань. Це перетворює помічника зі строго почергового респондента на щось ближче до агента, який випадково розмовляє.

Цифри, які рекламує Google

Google повідомляє, що розширене мислення Gemini 3.8 Live Extended Thinking зайняло найвищу загальну позицію за індексом якості синтезу мовлення від Artificial Analysis із результатом 82,6. Щодо виконання агентськими завданнями, компанія наводить 68,6% за тестом τ-Voice та 35,1% за оцінкою τ-Voice-банкінгу Sierra, а також 97,7% за Big Bench Audio.

Це власні цифри Google, і незалежна перевірка займе час, але претензія на вершину діаграми Artificial Analysis, якщо вона витримає, поставить Google попереду оптимізованих для мовлення пропозицій від OpenAI і спеціалізованих голосових компаній AI щодо загальної якості розмов. Google також стверджує, що Extended Thinking підтримує висококонкурентоспроможну ціну, неявно відкидаючи ціновий тиск, який визначив покоління 3.8.

На весь аудіофайл, створений моделями, нанесено водяний знак SynthID, непомітний водяний знак Google, тому мова, згенерована штучним інтелектом, залишається помітною — це гарантія відповідності та захисту від дезінформації, яка стає стандартом для генеративних продуктів Google.

Де ви можете це використовувати

Наявність відрізняється між двома моделями. Gemini 3.8 Live доступний для всіх у Search Live, режимі візуального пошуку Google у реальному часі. Extended Thinking доступний у Gemini Live, у Документах для підписників Google AI Pro та Ultra через Workspace, а також у Gmail і Keep для всіх користувачів Google.

Розробники отримують моделі через Gemini API і Google AI Studio, і Google каже, що Live API вже використовується платформами, включаючи Agora, Fishjam, LiveKit, Pipecat, Vercel і Vision Agents, для створення голосових інтерфейсів на основі інфраструктури реального часу Google. Salesforce, Genspark і Lumeris названі партнерами по запуску нових моделей.

Переповнений голосовий ринок ШІ

Голос стає полем битви інтерфейсів 2026 року, тому що саме там штучний інтелект нарешті втікає з клавіатури. Модель, яка може бачити, слухати, перемикати мови та запускати інструменти під час розмови, конкурує не з іншими чат-ботами, а з телефонним дзвінком, лінією підтримки клієнтів та персональним помічником.

Перевагою Google є розповсюдження: пошук, Android, Workspace і Chrome дають моделям Live встановлену базу, з якою не може зрівнятися конкурент. Компанія робить ставку на те, що присутність у кожному куточку дня користувача — тепер із найкращими моделями голосу — матиме більше значення, ніж будь-яка перемога в одному тесті. Конкуренти отримають свій шанс відповісти, але Google чітко дав зрозуміти, що голос, який колись був демонстраційною функцією, тепер став першокласним продуктом.

Для розробників повідомлення є таким же прямим. Публікуючи точні формати введення, документуючи виконання інструментів у фоновому режимі та заповнюючи екосистему платформами Live API, Google намагається зробити свій стек основою за замовчуванням для будь-кого, хто створює голосові інтерфейси — від ботів служби підтримки клієнтів до портативних помічників. Незалежно від того, чи витримають вимоги щодо якості Gemini 3.8 Live під час незалежного тестування, гра доступності вже в русі.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →