Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, пару моделей живого диалога, которые компания называет наиболее продвинутыми для естественного голосового общения. Модели начали внедряться 15 сентября в Gemini API, Google AI Studio, Search Live, Gemini Live и Google Workspace с корпоративным доступом в частной предварительной версии через Gemini Enterprise.

Объявление поступило от Тома Оуяна, главного инженера, и Малини Джаганатана, члена технического персонала, написавших от имени команды Gemini Audio. Он расширяет семейство Gemini 3.8, которое дебютировало ранее в этом месяце с моделями Flash и Flash Cyber, и знаменует собой самый агрессивный рывок Google в сторону мультимодальной голосовой помощи в реальном времени — рынка, где голосовой режим OpenAI и волна речевых стартапов конкурируют за один и тот же вариант повседневного использования.

Запуск вписывается в чрезвычайно насыщенный период модельного ряда Google; Освещение последних разработок в области искусственного интеллекта показывает, что компания уже неоднократно осуществляла поставки в течение нескольких недель, борясь с конкурентами в ценообразовании, кодировании, а теперь и в голосовой связи.

Создан для общения в реальном времени

Что отличает модели Live от стандартной модели чата с подключенным микрофоном, так это задержка и состояние. В документации Google Live API описан интерфейс с малой задержкой, который обрабатывает непрерывные потоки аудио, изображений и текста через соединение WebSocket с отслеживанием состояния, принимает необработанный звук PCM с частотой 16 кГц, изображения JPEG со скоростью до одного кадра в секунду и текст, а также возвращает разговорный звук в режиме реального времени.

Модели обрабатывают визуальный ввод почти в реальном времени, позволяя помощнику видеть то, что видит пользователь — демонстрационные видеоролики Google показывают, как Gemini 3.8 Live проводит адаптацию сотрудника с использованием визуального контекста, играет в шахматы почти в реальном времени и строит полные бизнес-планы и специальные маркетинговые инструменты с помощью естественной речи. Модели также могут автоматически определять 97 поддерживаемых языков и переключаться между ними в середине разговора, без необходимости переключения пользователем настроек.

Возможно, самое важное для практического использования: модели выполняют инструменты и вызовы API в фоновом режиме, пока продолжается диалог, подтверждая запросы и поддерживая диалог до завершения задач. Это превращает помощника из строго пошагового респондента в нечто вроде говорящего агента.

Цифры, которые рекламирует Google

Google сообщает, что Gemini 3.8 Live Extended Thinking заняла первое место в рейтинге качества речи в речи искусственного анализа с баллом 82,6. При выполнении агентских задач компания показывает 68,6% по тесту τ-Voice и 35,1% по оценке Sierra τ-Voice-banking, а также 97,7% по тесту Big Bench Audio.

Это собственные данные Google, и независимая проверка займет время, но претензия на вершину рейтинга Искусственного анализа, если она подтвердится, поставит Google впереди оптимизированных для речи предложений от OpenAI и компаний, специализирующихся на голосовом искусственном интеллекте, по общему качеству разговора. Google также заявляет, что Extended Thinking поддерживает очень конкурентоспособную цену, что является неявным намеком на ценовое давление, которое определило поколение 3.8.

Все аудио, генерируемые моделями, помечаются водяными знаками SynthID, незаметным водяным знаком Google, поэтому речь, сгенерированная искусственным интеллектом, остается обнаруживаемой — это защита от соответствия требованиям и дезинформации, которая становится стандартом для генеративных продуктов Google.

Где вы можете это использовать

Доступность этих двух моделей различается. Gemini 3.8 Live доступен всем в Search Live, режиме визуального поиска Google в реальном времени. Расширенное мышление доступно в Gemini Live, в Документах для подписчиков Google AI Pro и Ultra через Workspace, а также в Gmail и Keep для всех пользователей Google.

Разработчики получают модели через Gemini API и Google AI Studio. Google сообщает, что Live API уже используется такими платформами, как Agora, Fishjam, LiveKit, Pipecat, Vercel и Vision Agents, для создания голосовых интерфейсов поверх инфраструктуры Google в реальном времени. Salesforce, Genspark и Lumeris названы партнерами по запуску новых моделей.

Переполненный рынок голосового ИИ

Голос становится полем битвы за интерфейсы в 2026 году, потому что именно здесь ИИ наконец-то ускользает от клавиатуры. Модель, которая может видеть, слушать, переключать языки и запускать инструменты во время разговора, конкурирует не с другими чат-ботами, а с телефонным звонком, линией поддержки клиентов и личным помощником.

Преимуществом Google является распространение: Search, Android, Workspace и Chrome дают моделям Live установленную базу, с которой не может сравниться ни один конкурент. Компания делает ставку на то, что присутствие в каждом уголке дня пользователя — теперь с лучшими моделями голоса — будет иметь большее значение, чем любая отдельная победа в тестах. Конкуренты получат шанс ответить, но Google ясно дал понять, что голосовая функция, когда-то демонстрационная, теперь является первоклассной линейкой продуктов.

Для разработчиков послание столь же прямое. Публикуя точные форматы ввода, документируя выполнение фоновых инструментов и внедряя в экосистему платформы Live API, Google пытается сделать свой стек основой по умолчанию для всех, кто создает голосовые интерфейсы — от ботов поддержки клиентов до портативных помощников. Независимо от того, подтвердятся ли заявления о качестве Gemini 3.8 Live в ходе независимого тестирования, вопрос доступности уже идет.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →