Google запустил Gemini 3.5 Transcribe, новую модель преобразования речи в текст, созданную для транскрипции в реальном времени, которая автоматически распознает более 85 языков и по ходу дела совершенствует вывод, удаляя слова-вставки и исправляя словесные запинки без предварительного запроса.
Запуск позиционирует речевой стек Google как прямого конкурента на быстрорастущем рынке транскрипции, где точность и задержка все больше определяют, какие сервисы разработчики используют для звонков, встреч, субтитров и голосовых интерфейсов. Подробнее об этой истории — в нашем новости об ИИ.
Что может сделать модель
Согласно объявлению Google, освещение которого было опубликовано The Decoder, Gemini 3.5 Transcribe выходит далеко за рамки преобразования произнесенных слов в текст:
- Автоматическое определение языка на более чем 85 языках без необходимости настройки.
- Исправление оговорок, позволяющее получить читаемую прозу, а не дословный шум.
- Автономное форматирование текста, включая пунктуацию и структуру.
Компания сообщает о коэффициенте ошибок в словах 4,0% для потокового аудио и 2,6% для записанного звука, а также сокращении задержки примерно на 70% по сравнению с его предшественником Chirp 3 — существенный запас в сценариях с субтитрами в реальном времени, где задержка прерывает разговор.
Два интерфейса для двух задач
Разработчики получают доступ через два различных интерфейса прикладного программирования:
Live API — `gemini-3.5-transcribe-live`
Обеспечивает потоковую передачу в реальном времени с очень низкой задержкой, ориентируясь на живые субтитры, голосовые агенты и интерактивных помощников, где время отклика имеет наибольшее значение.API взаимодействий — `gemini-3.5-transcribe`
Обрабатывает записанный звук и возвращает расшифровки с указанием имени докладчика и временными метками — рабочий процесс, типичный для встреч, интервью, подкастов и пост-продакшена для СМИ.Помимо транскрипции, модель поддерживает вызов функций, то есть она может делегировать последующие задачи другим моделям семейства Gemini — например, запуск запроса на создание изображения или поиск в Интернете на основе сказанного во время сеанса. Это превращает механизм расшифровки в управляемый уровень интерфейса для приложений с голосовым управлением.
Уже доставляется в продукты Google
Модель уже доступна для разработчиков в Google AI Studio и на Gemini Enterprise Agent Platform. Google также внедрил его в потребительские поверхности: Gboard на Android использует его через внутренний компонент под названием Rambler для диктовки, приложение Gemini на macOS применяет его для голосового ввода, а затем планируется интеграция с Chrome.
Это распределение имеет значение. Распознавание речи сохраняет свои масштабы, а встраивание модели в клавиатуры, настольные приложения и браузеры ставит ее перед миллиардами входных взаимодействий ежедневно — одновременно обеспечивая циклы оценки, необходимые для предотвращения падения частоты ошибок в зависимости от акцентов, диалектов и шумной среды.
Конкурентные ставки в сфере речевого ИИ
Транскрипция незаметно стала полем конкурентной борьбы между передовыми лабораториями и специализированными поставщиками. Точное понимание речи с малой задержкой — это входной билет для агентских продуктов, которые действуют на основе голосовых команд, аналитики корпоративных совещаний, функций специальных возможностей и автоматизации многоязычного обслуживания клиентов.
Сочетая агрессивное улучшение задержки с самокорректирующимся выводом, Google делает ставку на то, что разработчики предпочитают расшифровки, которые читаются как отредактированный текст, а не необработанный фонетический захват, обменивая строгую дословную точность на удобство использования. Командам, которым нужны точные записи, например юридическим или медицинским расшифровщикам, все равно могут потребоваться дословные режимы; для всех остальных практическая разница между тем, чтобы услышать кого-то и понять его, продолжает сужаться.
Поскольку Gemini 3.5 Transcribe теперь общедоступен в AI Studio и корпоративных инструментах, первым значимым тестом станут показатели внедрения от разработчиков голосовых агентов — сегмент рынка растет достаточно быстро, что даже постепенное повышение точности приводит к значительным решениям о переключении.
Почему задержка — настоящее поле битвы
Частота ошибок попадает в заголовки газет, но задержка незаметно определяет, какие продукты являются жизнеспособными. Механизм транскрипции, обеспечивающий наложение живых субтитров, должен идти в ногу с разговором, иначе зрители оторвутся. Голосовой агент, согласующий звонок в службу поддержки клиентов, не может сделать неловкую паузу, пока его речевой уровень не догонит его. Сообщенный Google о 70-процентном сокращении задержки по сравнению с Chirp 3 нацелен именно на этот разрыв — сокращение расстояния между говорящим, заканчивающим предложение, и последующими системами, действующими на него.
Для агентных приложений это усложняется: каждый этап устного диалога включает в себя распознавание, рассуждение и ответ. Сокращение миллисекунд на этапе распознавания дает разработчикам возможность потратиться на более эффективные и более медленные модели рассуждения, не нарушая бюджет времени разговора.
Дословный компромисс
Один из вариантов дизайна заслуживает внимания. По умолчанию Gemini 3.5 Transcribe контролирует вывод: слова-вставки исчезают, ошибки исправляются, а форматирование применяется автоматически. Для большинства бизнес-применений — протоколов, субтитров, архивов с возможностью поиска — это именно то, что нужно пользователям.
Но некоторые рабочие процессы зависят от стенографических записей. Юридические показания, проверки соблюдения требований и журналистская проверка фактов иногда требуют точного знания того, что было сказано, включая колебания. Организациям в регулируемых отраслях потребуется ясность в отношении того, какая часть сглаживания является необязательной и настраиваемой, прежде чем мигрировать чувствительные конвейеры на новую модель. Документация Google и параметры API эффективно определят, где находится грань дословного и доработанного для отрасли.
Многоязычный след в виде рва
Охват более 85 языков с автоматическим определением — это не просто пункт контрольного списка функций. Многоязычный охват концентрирует ценность на рынках, где конкуренты исторически отстают: региональные акценты, переключение кода между языками в середине предложения и языки с ограниченными ресурсами — все это наказывает моделей, узко обученных на корпусах с большим количеством английского языка.
Для глобальных предприятий, имеющих центры поддержки в десятках стран, единая модель, обеспечивающая определение языка, прозрачно снижает сложность интеграции — один конвейер вместо множества конфигураций для каждого рынка. В сочетании с распространением через миллиарды установок Android Gboard Google позиционирует многоязычность качества транскрипции как инфраструктуру, а не как возможность премиум-класса.
Что посмотреть
Три сигнала покажут, изменит ли Gemini 3.5 Transcribe долю рынка или просто повысит ожидания: миграция разработчиков в сторонние тесты в ближайшие месяцы; насколько быстро конкуренты соответствуют показателям задержки, а не заявленной точности; и вызовут ли перехватчики функций волну голосовых агентов, изначально созданных на Gemini. Запуск уже начался, и ценовые уровни AI Studio должны сделать эксперименты достаточно дешевыми, чтобы затраты на переключение упали практически до нуля.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →