На этой неделе Google незаметно выпустил два значительных обновления модели Gemini в течение 48 часов, и оба нацелены непосредственно на разработчиков, создающих производственные приложения. Согласно официальному блогу Google, Gemini 3.5 Transcribe, представленная 26 августа, является самой точной моделью преобразования речи в текст на сегодняшний день. Gemini Omni 1.1 Flash, анонсированный 27 августа, обеспечивает профессиональный уровень управления генеративным видео, включая расширение сцены до 40 секунд и масштабирование до 4K. Обе модели доступны через Gemini API в Google AI Studio и через платформу Gemini Enterprise Agent.

Gemini 3.5 Transcribe: преобразование речи в текст, которое убирает за собой Подробнее об этой истории — в нашем больше статей об ИИ.

По словам Google, Gemini 3.5 Transcribe отличается от обычного распознавания речи тем, что он преобразует необработанный звук непосредственно в отшлифованный, отформатированный текст, а не в необработанную расшифровку. Модель самостоятельно обрабатывает фоновый шум, сложный жаргонизм и устранение искажений речи — она удаляет слова-вставки, такие как «хм» и «ах», разрешает самоисправления, такие как «давайте встретимся во вторник — нет, в среду», и автоматически форматирует выходные данные.

Показатели тестов, приведенные Google, заслуживают внимания. По данным искусственного анализа, модель достигает средней частоты ошибок в словах (WER) 4,0 процента для сценариев использования потоковой передачи и 2,6 процента для непотоковое аудио. В многоязычном тесте FLEURS для основных языков он показывает WER 5,50 процента в потоковом режиме и 5,04 процента в режиме без потоковой передачи, что лучше предыдущей модели транскрипции Google, Chirp 3. Время окончательной транскрипции улучшается на 70 процентов по сравнению с Chirp 3, опять же по данным искусственного анализа.

Модель поставляется в двух вариантах для двух рабочих процессов. Для живых приложений gemini-3.5-transcribe-live обеспечивает непрерывную двунаправленную потоковую передачу с задержкой менее секунды через Live API, ориентированную на голосовых агентов и субтитры в реальном времени. Для записанного аудио — собраний, журналов вызовов, архивов — gemini-3.5-transcribe предлагает атрибуцию говорящего до трех говорящих (с поддержкой большего числа в экспериментальном режиме) и временные метки на уровне слов через Interactions API.

Другие возможности включают автоматическое обнаружение и транскрипцию на более чем 85 языках с обработкой акцентов и диалектов, а также поддержку пользовательского словаря, благодаря чему модель адаптируется к специализированному жаргону и уникальному написанию. Google также наделил модель своеобразными глазами: посредством вызова функций она может делегировать такие задачи, как генерация изображений или анализ файлов, другим моделям Gemini — функция, которая в настоящее время доступна в приложении Gemini на macOS.

Gemini Omni 1.1 Flash: создание видео увеличивает временную шкалу

Второй запуск посвящен самой распространенной жалобе на видео с ИИ: контролю. Gemini Omni 1.1 Flash — это обновление, ориентированное на производство, которое обеспечивает управление генеративным видео так, как не было у его предшественников. Менеджеры по продуктам Google DeepMind Аниш Нангиа и Алиса Фортин описывают этот выпуск как «готовый к профессиональному использованию Omni 1.1».

Расширение сцены — это особенность заголовка. Теперь разработчики могут продолжать беспрепятственно создавать кадры из существующего клипа, при этом модель анализирует до 10 секунд предыдущего контекста — скачок по сравнению с предыдущими моделями, которые ссылались только на последнюю секунду. Видео можно увеличивать с шагом 10 секунд до общей продолжительности 40 секунд, что улучшает визуальную последовательность и последовательность повествования для более длинных историй.

Обновление также добавляет интерполяцию первого и последнего кадра, позволяя разработчикам указывать начальный и конечный кадры для создания плавных, продуманных движений камеры и переходов между кадрами. Готовые проекты можно масштабировать до разрешения 4K, а режим предварительного просмотра 360p позволяет создателям быстро и дешево обрабатывать подсказки, прежде чем переходить к окончательному рендерингу.

От API к повседневным поверхностям

Google также внедряет обе модели в свои потребительские продукты, и в этом проявляется ее преимущество в распространении. На Android новая функция «Rambler» в Gboard использует 3.5 Transcribe для преобразования произнесенных мыслей в хорошо отформатированный текст с фильтрацией слов-вставок — пользователи могут даже вносить изменения голосом. Эта модель также обеспечивает диктовку в приложении Gemini на macOS, работает вместе с контекстом экрана в Google Antigravity и интегрируется в Chrome.

Для разработчиков эти два запуска воспринимаются как одна стратегия: Google превращает Gemini из чат-бота, с которым вы общаетесь, в инфраструктуру, которая видит, слышит и производит медиа. Учитывая, что OpenAI, ElevenLabs и группа видеостартапов, конкурирующих на той же территории, коэффициент ошибок в словах в 2,6% и связные сцены длительностью 40 секунд — это первая заявка Google на производственные рабочие нагрузки, которые действительно приносят доход — голосовые агенты, конвейеры субтитров и креативные инструменты. Разработчики могут начать создавать обе модели в Google AI Studio уже сегодня.

Почему процент ошибок в словах все еще важен

Частота ошибок в словах звучит как академическая статистика, но в производстве это разница между работающим голосовым продуктом и разочаровывающим. Каждое неверно понятое слово в голосовом агенте нарушает задачу: пропущенный идентификатор заказа приводит к неудачному поиску, искаженный адрес отправляет посылку не в тот город. Вот почему разрыв между WER в 2,6 процента для непотоковое аудио и высокими однозначными показателями, которые были обычным явлением поколение моделей назад, приводит к разнице в удобстве использования на порядок.

Различие между двумя режимами, о которых сообщил Google, также важно для архитекторов. Потоковая транскрипция (показатель WER 4,0 процента) меняет некоторую точность на задержку в доли секунды, которую требуют интерактивные сценарии использования, такие как живые голосовые агенты. Пакетная транскрипция записанного аудио выполняется медленнее, но достигает 2,6 процента, поэтому аналитика после звонка и обработка архива могут быть более требовательными. Решение Google представить обе модели как отдельные конечные точки, а не одну настраиваемую настройку, подтверждает, что разработчики создают разные продукты по обе стороны этого компромисса.

Многоуровневый рабочий процесс для производства видео

Обновление Omni 1.1 Flash столь же прагматично описывает то, как на самом деле происходит творческая работа. Итерация генеративного видео обходилась дорого: каждый быстрый эксперимент означал полный рендеринг. Новый режим предварительного просмотра в разрешении 360p отделяет исследование от доставки, позволяя создателям дешево переключаться между быстрыми вариантами и платить только за масштабирование до 4K только тех кадров, которые выдержали проверку.

Механика расширения сцен решает проблему согласованности, из-за которой видео ИИ удерживается в гетто размером с клип. Анализируя 10 секунд предыдущего контекста, а не только последний кадр, модель может расширить сцену с шагом 10 секунд до 40 секунд, сохраняя при этом единообразие персонажей, освещения и визуального стиля. В сочетании с интерполяцией первого и последнего кадра, которая дает монтажерам детерминированные контрольные точки, а также то, как работают маркеры начала и конца при обычном монтаже, отснятый материал, созданный ИИ, начинает вписываться в реальные конвейеры постобработки, а не полностью заменять их.

Конкурентная картина

Оба запуска позиционируют Google как инфраструктуру, а не пункт назначения. По сути, Google бросает вызов специализированным поставщикам транскрипции и голосовым стекам своих облачных конкурентов, объединяя современную точность с Gemini API, который уже используют его разработчики. В сфере видео компания конкурирует на рынке, переполненном хорошо финансируемыми стартапами, делая упор на контроль и интеграцию рабочих процессов, а не на чистое зрелище.

Преимущество распределения может стать решающим фактором. Та же самая модель транскрипции, которую разработчики могут вызывать из Gemini API, уже используется в диктовке Rambler Gboard на Android, приложении Gemini на macOS, Google Antigradity и Chrome. Это означает, что Google может амортизировать разработку модели за счет миллиардов пользовательских взаимодействий, одновременно собирая разнообразный реальный звук, который продолжает ее улучшать. Для разработчиков, выбирающих речевой или видеостек в 2026 году, этот маховик теперь является частью презентации.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →