Google запустил Gemini 3.5 Transcribe, новую модель преобразования речи в текст, созданную для транскрипции в реальном времени, которая автоматически распознает более 85 языков и по ходу дела совершенствует вывод, удаляя слова-вставки и исправляя словесные запинки без предварительного запроса.

Запуск позиционирует речевой стек Google как прямого конкурента на быстрорастущем рынке транскрипции, где точность и задержка все больше определяют, какие сервисы разработчики используют для звонков, встреч, субтитров и голосовых интерфейсов. Подробнее об этой истории — в нашем новости об ИИ.

Что может сделать модель

Согласно объявлению Google, освещение которого было опубликовано The Decoder, Gemini 3.5 Transcribe выходит далеко за рамки преобразования произнесенных слов в текст:

  • Автоматическое определение языка на более чем 85 языках без необходимости настройки.
Удаление слов-вставок, устранение «хм», «ух» и подобных неточностей.
  • Исправление оговорок, позволяющее получить читаемую прозу, а не дословный шум.
  • Автономное форматирование текста, включая пунктуацию и структуру.

Компания сообщает о коэффициенте ошибок в словах 4,0% для потокового аудио и 2,6% для записанного звука, а также сокращении задержки примерно на 70% по сравнению с его предшественником Chirp 3 — существенный запас в сценариях с субтитрами в реальном времени, где задержка прерывает разговор.

Два интерфейса для двух задач

Разработчики получают доступ через два различных интерфейса прикладного программирования:

Live API — `gemini-3.5-transcribe-live`

Обеспечивает потоковую передачу в реальном времени с очень низкой задержкой, ориентируясь на живые субтитры, голосовые агенты и интерактивных помощников, где время отклика имеет наибольшее значение.

API взаимодействий — `gemini-3.5-transcribe`

Обрабатывает записанный звук и возвращает расшифровки с указанием имени докладчика и временными метками — рабочий процесс, типичный для встреч, интервью, подкастов и пост-продакшена для СМИ.

Помимо транскрипции, модель поддерживает вызов функций, то есть она может делегировать последующие задачи другим моделям семейства Gemini — например, запуск запроса на создание изображения или поиск в Интернете на основе сказанного во время сеанса. Это превращает механизм расшифровки в управляемый уровень интерфейса для приложений с голосовым управлением.

Уже доставляется в продукты Google

Модель уже доступна для разработчиков в Google AI Studio и на Gemini Enterprise Agent Platform. Google также внедрил его в потребительские поверхности: Gboard на Android использует его через внутренний компонент под названием Rambler для диктовки, приложение Gemini на macOS применяет его для голосового ввода, а затем планируется интеграция с Chrome.

Это распределение имеет значение. Распознавание речи сохраняет свои масштабы, а встраивание модели в клавиатуры, настольные приложения и браузеры ставит ее перед миллиардами входных взаимодействий ежедневно — одновременно обеспечивая циклы оценки, необходимые для предотвращения падения частоты ошибок в зависимости от акцентов, диалектов и шумной среды.

Конкурентные ставки в сфере речевого ИИ

Транскрипция незаметно стала полем конкурентной борьбы между передовыми лабораториями и специализированными поставщиками. Точное понимание речи с малой задержкой — это входной билет для агентских продуктов, которые действуют на основе голосовых команд, аналитики корпоративных совещаний, функций специальных возможностей и автоматизации многоязычного обслуживания клиентов.

Сочетая агрессивное улучшение задержки с самокорректирующимся выводом, Google делает ставку на то, что разработчики предпочитают расшифровки, которые читаются как отредактированный текст, а не необработанный фонетический захват, обменивая строгую дословную точность на удобство использования. Командам, которым нужны точные записи, например юридическим или медицинским расшифровщикам, все равно могут потребоваться дословные режимы; для всех остальных практическая разница между тем, чтобы услышать кого-то и понять его, продолжает сужаться.

Поскольку Gemini 3.5 Transcribe теперь общедоступен в AI Studio и корпоративных инструментах, первым значимым тестом станут показатели внедрения от разработчиков голосовых агентов — сегмент рынка растет достаточно быстро, что даже постепенное повышение точности приводит к значительным решениям о переключении.

Почему задержка — настоящее поле битвы

Частота ошибок попадает в заголовки газет, но задержка незаметно определяет, какие продукты являются жизнеспособными. Механизм транскрипции, обеспечивающий наложение живых субтитров, должен идти в ногу с разговором, иначе зрители оторвутся. Голосовой агент, согласующий звонок в службу поддержки клиентов, не может сделать неловкую паузу, пока его речевой уровень не догонит его. Сообщенный Google о 70-процентном сокращении задержки по сравнению с Chirp 3 нацелен именно на этот разрыв — сокращение расстояния между говорящим, заканчивающим предложение, и последующими системами, действующими на него.

Для агентных приложений это усложняется: каждый этап устного диалога включает в себя распознавание, рассуждение и ответ. Сокращение миллисекунд на этапе распознавания дает разработчикам возможность потратиться на более эффективные и более медленные модели рассуждения, не нарушая бюджет времени разговора.

Дословный компромисс

Один из вариантов дизайна заслуживает внимания. По умолчанию Gemini 3.5 Transcribe контролирует вывод: слова-вставки исчезают, ошибки исправляются, а форматирование применяется автоматически. Для большинства бизнес-применений — протоколов, субтитров, архивов с возможностью поиска — это именно то, что нужно пользователям.

Но некоторые рабочие процессы зависят от стенографических записей. Юридические показания, проверки соблюдения требований и журналистская проверка фактов иногда требуют точного знания того, что было сказано, включая колебания. Организациям в регулируемых отраслях потребуется ясность в отношении того, какая часть сглаживания является необязательной и настраиваемой, прежде чем мигрировать чувствительные конвейеры на новую модель. Документация Google и параметры API эффективно определят, где находится грань дословного и доработанного для отрасли.

Многоязычный след в виде рва

Охват более 85 языков с автоматическим определением — это не просто пункт контрольного списка функций. Многоязычный охват концентрирует ценность на рынках, где конкуренты исторически отстают: региональные акценты, переключение кода между языками в середине предложения и языки с ограниченными ресурсами — все это наказывает моделей, узко обученных на корпусах с большим количеством английского языка.

Для глобальных предприятий, имеющих центры поддержки в десятках стран, единая модель, обеспечивающая определение языка, прозрачно снижает сложность интеграции — один конвейер вместо множества конфигураций для каждого рынка. В сочетании с распространением через миллиарды установок Android Gboard Google позиционирует многоязычность качества транскрипции как инфраструктуру, а не как возможность премиум-класса.

Что посмотреть

Три сигнала покажут, изменит ли Gemini 3.5 Transcribe долю рынка или просто повысит ожидания: миграция разработчиков в сторонние тесты в ближайшие месяцы; насколько быстро конкуренты соответствуют показателям задержки, а не заявленной точности; и вызовут ли перехватчики функций волну голосовых агентов, изначально созданных на Gemini. Запуск уже начался, и ценовые уровни AI Studio должны сделать эксперименты достаточно дешевыми, чтобы затраты на переключение упали практически до нуля.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →