Google запустив Gemini 3.5 Transcribe, нову модель перетворення мовлення в текст, створену для транскрипції в реальному часі, яка автоматично розпізнає понад 85 мов і попутно вдосконалює вихідні дані, видаляючи слова-заповнювачі та виправляючи словесні спотикання без запиту.

Запуск позиціонує мовний стек Google як прямого конкурента на швидко зростаючому ринку транскрипції, де точність і затримка дедалі більше вирішують, які сервіси використовуватимуть розробники для дзвінків, зустрічей, субтитрів і голосових інтерфейсів. For more context on this story, see our ongoing more AI stories.

Що може зробити модель

Відповідно до оголошення Google, висвітлення якого опублікувало The Decoder, Gemini 3.5 Transcribe виходить далеко за рамки перетворення вимовлених слів у текст:

  • Автоматичне визначення мови для понад 85 мов без необхідності налаштування
  • Видалення слів-заповнювачів, прибирання «гм», «ух» і подібних недомовок
  • Виправлення помилок, створюючи читабельну прозу, а не дослівний шум
  • Автономне форматування тексту, включаючи пунктуацію та структуру

Компанія повідомляє про частоту помилок у словах 4,0 відсотка для потокового аудіо та 2,6 відсотка для записаного аудіо, а також зменшення затримки приблизно на 70 відсотків порівняно з його попередником, Chirp 3 — суттєвий запас у сценаріях живих субтитрів, де затримка перериває розмови.

Два інтерфейси для двох завдань

Розробники отримують доступ через два різні інтерфейси програмування додатків:

Live API — `gemini-3.5-transcribe-live`

Обслуговує потокове передавання в реальному часі з дуже низькою затримкою, орієнтуючись на живі субтитри, голосові агенти та інтерактивні помічники, де час відповіді має найбільше значення.

API взаємодії — `gemini-3.5-transcribe`

Обробляє записане аудіо та повертає стенограми з атрибуцією доповідача та мітками часу — робочий процес, типовий для зустрічей, інтерв’ю, подкастів і медіа-постпродакшну.

Крім транскрипції, модель підтримує виклик функцій, тобто вона може делегувати подальші завдання іншим моделям у сімействі Gemini — наприклад, ініціювати запит на створення зображення або веб-пошук на основі того, що було сказано під час сеансу. Це перетворює механізм розшифровки на рівень керованого інтерфейсу для голосових програм.

Уже доставляється через продукти Google

Сьогодні модель доступна для розробників у Google AI Studio та на Gemini Enterprise Agent Platform. Google також підключив його до споживчих поверхонь: Gboard на Android використовує його через внутрішній компонент під назвою Rambler для диктування, додаток Gemini на macOS застосовує його для голосового введення, а також планується інтеграція з Chrome.

Цей розподіл має значення. Розпізнавання мовлення зберігає свої масштаби, а вбудовування цієї моделі в клавіатури, програми для настільних комп’ютерів і браузери ставить її перед мільярдами вхідних взаємодій щодня — водночас забезпечуючи цикли оцінки, необхідні для запобігання зниженню частоти помилок через акценти, діалекти та шумне середовище.

Конкурентні ставки в мовному штучному інтелекті

Транскрипція тихо стала полем боротьби між передовими лабораторіями та спеціалізованими постачальниками. Точне розуміння мовлення з низькою затримкою є вхідним квитком для агентських продуктів, які діють за голосовими командами, інтелектуальними функціями корпоративних зустрічей, функціями доступності та автоматизацією багатомовного обслуговування клієнтів.

Поєднуючи агресивні покращення затримки з самовиправляючим виводом, Google робить ставку на те, що розробники віддають перевагу транскриптам, які читаються як відредагований текст, а не необробленому фонетичному запису, обмінюючи сувору дослівну точність на зручність використання. Команди, які потребують точних записів, як-от юридичні чи медичні транскриптори, все ще можуть забажати дослівних режимів; для всіх інших практична різниця між почути когось і зрозуміти їх продовжує звужуватися.

Оскільки Gemini 3.5 Transcribe тепер доступний в AI Studio та корпоративних інструментах, першим значущим тестом будуть показники впровадження від розробників голосових агентів — сегмент ринку зростає досить швидко, щоб навіть поступове підвищення точності перетворювалося на значні рішення про перемикання.

Чому затримка є справжнім полем битви

Рівень помилок потрапляє в заголовки, але затримка тихо визначає, які продукти є життєздатними. Механізм транскрипції, що подає накладення живих субтитрів, має йти в ногу з розмовою, інакше глядачі відключаються. Голосовий агент, який обговорює дзвінок служби підтримки клієнтів, не може зробити незграбну паузу, поки його мовний рівень наздоганяє. Повідомлення Google про 70-відсоткове скорочення затримки порівняно з Chirp 3 спрямоване саме на цей розрив — скорочення відстані між мовцем, який закінчує речення, і системами, що діють на нього.

Для агентських застосувань це доповнюється: кожен поворот усного діалогу передбачає розпізнавання, міркування та відповідь. Зменшення мілісекунд від етапу розпізнавання дає розробникам можливість витратити на більш ефективні — і повільніші — моделі міркувань, не порушуючи бюджети часу розмови.

Компроміс Verbatim

Один варіант дизайну заслуговує на увагу. За замовчуванням Gemini 3.5 Transcribe керує виведенням: слова-заповнювачі зникають, спотикання виправляються, а форматування застосовується автоматично. Для більшості бізнес-використань — хвилини, титри, архіви з можливістю пошуку — це саме те, чого хочуть користувачі.

Але певні робочі процеси залежать від дослівних записів. Юридичні показання, перевірки відповідності та журналістська перевірка фактів іноді вимагають точного знання сказаного, включаючи вагання. Організації в регульованих галузях потребуватимуть чіткості щодо того, яка частина згладжування є необов’язковою та налаштовуваною, перш ніж переносити чутливі конвеєри на нову модель. Документація Google і параметри API ефективно встановлять, де дослівно чи відшліфовано стоїть лінія для галузі.

Багатомовний слід як рів

Охоплення понад 85 мов із автоматичним виявленням — це не просто пункт контрольного списку функцій. Багатомовне охоплення зосереджує цінність на ринках, де конкуренти історично відстають: регіональні акценти, перемикання кодів між мовами в середині речення та мови з низьким ресурсом – усе це карає моделі, які вузько навчаються на англомовних корпусах.

Для глобальних підприємств, які мають центри підтримки в десятках країн, єдина модель прозорого визначення мови зменшує складність інтеграції — один конвеєр замість багатьох конфігурацій для кожного ринку. У поєднанні з розповсюдженням Gboard через мільярди інсталяцій Android Google позиціонує багатомовність із якістю транскрибування як інфраструктуру, а не преміум-можливість.

Що подивитися

Три сигнали покажуть, чи Gemini 3.5 Transcribe змінить частку ринку чи просто підвищить очікування: міграція розробників у сторонніх тестах протягом найближчих місяців; як швидко конкуренти відповідають цифрам затримки, а не заявам про точність; і чи породжують гачки виклику функцій хвилю голосових агентів, створених нативно на Gemini. Запуск вже опублікований, і рівні ціноутворення через AI Studio мають зробити експерименти настільки дешевими, що витрати на перехід зменшаться майже до нуля.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →