Протягом 48 годин цього тижня Google тихо випустив два значні оновлення моделі Gemini, і обидва призначені безпосередньо для розробників, які створюють робочі програми. Відповідно до офіційного блогу Google, Gemini 3.5 Transcribe, представлений 26 серпня, є найточнішою моделлю компанії на сьогоднішній день, що забезпечує перетворення мови в текст. Gemini Omni 1.1 Flash, анонсований 27 серпня, надає професійні засоби керування генеративним відео, включаючи розширення сцени до 40 секунд і масштабування до 4K. Обидві моделі доступні через Gemini API у Google AI Studio та Gemini Enterprise Agent Platform.

Gemini 3.5 Транскрибувати: перетворення мовлення в текст, яке прибирає за собою For more context on this story, see our ongoing more AI stories.

Що відрізняє Gemini 3.5 Transcribe від звичайного розпізнавання мовлення, за словами Google, це те, що він перетворює необроблений аудіо безпосередньо в відшліфований форматований текст, а не в необроблений стенограму. Модель справляється з фоновим шумом, складним жаргоном і розбіжністю — вона видаляє слова-заповнювачі, як-от «мм» і «ах», усуває самовиправлення, наприклад «давайте зустрінемося у вівторок — ні, середа», і автоматично форматує вихідні дані.

Порівняльні цифри, наведені Google, примітні. Згідно з результатами штучного аналізу, модель досягає середнього рівня помилок у словах (WER) 4,0 відсотка для сценаріїв потокового використання та 2,6 відсотка для непотокового аудіо. У багатомовному тесті FLEURS для найпопулярніших мов він показує 5,50 відсотка WER у потоковому режимі та 5,04 відсотка без потокового передавання, покращуючи попередню модель транскрипції Google, Chirp 3. Час до остаточної транскрипції покращується на 70 відсотків порівняно з Chirp 3, знову ж таки, як виміряно за допомогою штучного аналізу.

Модель поставляється в двох варіантах для двох робочих процесів. Для живих додатків `gemini-3.5-transcribe-live` забезпечує безперервне двонаправлене потокове передавання із субсекундною затримкою через Live API, орієнтуючись на голосові агенти та субтитри в реальному часі. Для записаного аудіо — зустрічей, журналів викликів, архівів — `gemini-3.5-transcribe` пропонує атрибуцію до трьох доповідачів (з підтримкою більшої кількості в експериментальному режимі) і мітки часу на рівні слів через Interactions API.

Інші можливості включають автоматичне виявлення та транскрипцію для більш ніж 85 мов із обробкою акценту та діалекту, а також підтримку спеціального словника, щоб модель адаптувалася до спеціалізованого жаргону та унікального написання. Google також надав модельним очам свого роду: за допомогою виклику функцій він може делегувати завдання, як-от створення зображень або аналіз файлів, іншим моделям Gemini — ця функція наразі доступна в додатку Gemini на macOS.

Gemini Omni 1.1 Flash: генерація відео збільшує часову шкалу

Другий запуск стосується найпоширенішої скарги щодо відео ШІ: управління. Gemini Omni 1.1 Flash — це оновлення, орієнтоване на виробництво, яке робить генеративне відео керованим так, як не було його попередників. Менеджери продуктів Google DeepMind Аніш Нангія та Аліса Фортін описують випуск як такий, що робить Omni 1.1 «готовим до виробництва для професійного використання».

Розширення сцени – це функція заголовка. Тепер розробники можуть безперешкодно генерувати кадри з наявного кліпу, при цьому модель аналізує до 10 секунд попереднього контексту — стрибок у порівнянні з попередніми моделями, які посилалися лише на останню секунду. Відео можна подовжувати з кроком у 10 секунд до загальної тривалості 40 секунд, покращуючи візуальну узгодженість і дотримання оповіді для довших історій.

Оновлення також додає інтерполяцію першого та останнього кадрів, дозволяючи розробникам вказувати початкові та кінцеві кадри для створення плавних, навмисних рухів камери та переходів між знімками. Для доставки готові проекти можна збільшити до роздільної здатності 4K, а режим попереднього перегляду 360p дозволяє творцям швидко та дешево переглядати підказки, перш ніж приступити до остаточного рендерингу.

Від API до повсякденних поверхонь

Google також використовує обидві моделі у своїх споживчих продуктах, у чому проявляється його перевага в розповсюдженні. На Android нова функція «Rambler» у Gboard використовує транскрибування 3.5, щоб перетворювати вимовлені думки на добре відформатований текст, одночасно фільтруючи слова-заповнювачі — користувачі можуть навіть редагувати голосом. Модель також підтримує диктування в додатку Gemini на macOS, працює разом із контекстом екрана в Google Antigravity та інтегрується в Chrome.

Для розробників два запуски сприймаються як одна стратегія: Google переміщує Gemini з чат-бота, з яким ви розмовляєте, в інфраструктуру, яка бачить, чує та створює медіа. Завдяки OpenAI, ElevenLabs і когорті відеостартапів, які конкурують на тій самій території, 2,6-відсотковий рівень помилок у словах і 40-секундні зв’язні сцени є першою заявкою Google на виробничі робочі навантаження, які фактично приносять дохід — голосові агенти, конвеєри субтитрів і творчі інструменти. Розробники можуть почати створювати обидві моделі в Google AI Studio вже сьогодні.

Чому частота помилок у словах все ще має значення

Частота помилок у словах звучить як академічна статистика, але у виробництві це різниця між голосовим продуктом, який працює, і тим, що розчаровує. Кожне неправильно зрозуміле висловлювання в голосовому агенті порушує завдання: неправильно прослуханий ідентифікатор замовлення викликає невдалий пошук, спотворена адреса надсилає пакунок не в те місто. Ось чому розрив між 2,6 відсотками WER для непотокового аудіо та високими однозначними показниками, які були звичайними поколінням моделей тому, утворює різницю на порядок у зручності використання.

Різниця між двома режимами, про яку повідомляє Google, також має значення для архітекторів. Потокова транскрипція — показник WER 4,0 відсотка — замінює певну точність на затримку до секунди, яка потрібна для інтерактивних випадків використання, таких як живі голосові агенти. Пакетна транскрипція записаного аудіо виконується повільніше, але досягає 2,6 відсотка, тому аналітика після виклику та обробка архіву можуть дозволити собі бути більш вимогливими. Рішення Google представити обидві моделі як окремі кінцеві точки моделі, а не одне регульоване налаштування, підтверджує, що розробники створюють різні продукти з обох сторін цього компромісу.

Багаторівневий робочий процес для виробництва відео

Оновлення Omni 1.1 Flash так само прагматично дивиться на те, як насправді відбувається творча робота. Ітерація з генеративним відео була дорогою: кожен швидкий експеримент означав повне рендеринг. Новий режим попереднього перегляду 360p відокремлює дослідження від доставки, дозволяючи творцям дешево переходити між оперативними варіаціями та платити лише за збільшення 4K на знімках, які витримали перегляд.

Механіка розширення сцени вирішує проблему узгодженості, через яку штучний інтелект тримає відео в гетто розміром із кліп. Аналізуючи 10 секунд попереднього контексту замість лише останнього кадру, модель може продовжити сцену з кроком у 10 секунд до 40 секунд, зберігаючи узгодженість персонажів, освітлення та візуального стилю. У поєднанні з інтерполяцією першого та останнього кадру, яка дає редакторам детерміновані контрольні точки, маркери входу та виходу працюють у звичайному монтажі, створені штучним інтелектом кадри починають вписуватися в реальні конвеєри пост-продакшну, а не замінювати їх повною мірою.

Конкурсна картина

Обидва запуски позиціонують Google як інфраструктуру, а не пункт призначення. У мовленні Google змагається зі спеціалізованими постачальниками транскрипції та голосовими пакетами своїх хмарних конкурентів, об’єднавши найсучаснішу точність у Gemini API, який уже використовують розробники. У відео він конкурує на ринку, переповненому добре фінансованими стартапами, наголошуючи на контролі та інтеграції робочого процесу, а не на простому видовищі.

Перевага розподілу може бути вирішальним фактором. Та сама модель транскрипції, яку розробники можуть викликати з Gemini API, уже підтримує диктування Gboard Rambler на Android, програму Gemini на macOS, Google Antigravity та Chrome — це означає, що Google може амортизувати розробку моделі через мільярди взаємодій користувачів, одночасно збираючи різноманітні аудіо з реального світу, які постійно вдосконалюють її. Для розробників, які обирають стек для мовлення чи відео у 2026 році, цей маховик тепер є частиною презентації.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →