谷歌本周在 48 小时内悄然发布了两次重要的 Gemini 模型更新,这两次更新都直接针对构建生产应用程序的开发人员。据谷歌官方博客称,Gemini 3.5 Transcribe 于 8 月 26 日推出,是该公司迄今为止最精确的语音到文本模型。 Gemini Omni 1.1 Flash 于 8 月 27 日发布,为生成视频带来专业级控制,包括长达 40 秒的场景扩展和 4K 升级。这两种模型都可以通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 获得。

Gemini 3.5 Transcribe:语音转文本,自动清理 更多相关背景,请参阅我们的AI新闻

谷歌表示,Gemini 3.5 Transcribe 与传统语音识别的区别在于,它将原始音频直接转换为精美的格式化文本,而不是原始转录。该模型可以原生处理背景噪音、复杂的行话和不流畅的清理——它会删除“ums”和“ahs”等填充词,解决“让我们星期二见面——不,星期三”等自我更正,并自动格式化输出。

谷歌引用的基准数据值得注意。根据人工分析的测量,该模型在流媒体用例中的平均字错误率 (WER) 为 4.0%,在非流媒体音频中为 2.6%。在跨顶级语言的 FLEURS 多语言基准测试中,它在流式传输模式下的 WER 为 5.50%,在非流式传输模式下的 WER 为 5.04%,改进了 Google 之前的转录模型 Chirp 3。与 Chirp 3 相比,最终转录时间缩短了 70%,同样通过人工分析进行测量。

该模型有两种变体,适用于两个工作流程。对于实时应用程序,“gemini-3.5-transcribe-live”通过 Live API 提供亚秒级延迟的连续双向流,针对语音代理和实时字幕。对于录制的音频(会议、通话记录、档案),“gemini-3.5-transcribe”可通过交互 API 提供最多三个发言者的发言者归属(在实验模式下支持更多发言者)和字级时间戳。

其他功能包括跨超过 85 种语言的自动检测和转录,以及口音和方言处理,以及自定义词汇支持,以便模型适应专业术语和独特的拼写。谷歌还为模型提供了某种形式的眼睛:通过函数调用,它可以将图像生成或文件分析等任务委托给其他 Gemini 模型——macOS 上的 Gemini 应用程序目前提供了该功能。

Gemini Omni 1.1 Flash:视频生成延长了时间线

第二次发布解决了有关人工智能视频最常见的抱怨:控制。 Gemini Omni 1.1 Flash 是一个以生产为中心的更新,它使生成视频能够以其前身所不具备的方式进行操控,Google DeepMind 产品经理 Anish Nangia 和 Alisa Fortin 将该版本描述为使 Omni 1.1 “为专业用途做好生产准备”。

场景延伸是头条特征。开发人员现在可以继续从现有剪辑无缝生成素材,该模型可以分析长达 10 秒的先前上下文,这与之前仅参考最后一秒的模型相比是一个飞跃。视频可以以 10 秒为增量延长,累计长度可达 40 秒,从而提高较长故事的视觉一致性和叙事依从性。

该更新还添加了第一帧和最后一帧插值,让开发人员可以指定开始帧和结束帧,以创建平滑、深思熟虑的相机移动和镜头之间的过渡。在交付时,完成的项目可以升级到 4K 分辨率,而 360p 预览模式可以让创作者在提交最终渲染之前快速、廉价地迭代提示。

从 API 到日常表面

谷歌还将这两种模式融入其消费产品中,这就是其分销优势的体现。在 Android 上,Gboard 中的新“Rambler”功能使用 3.5 Transcribe 将口头想法转换为格式良好的文本,同时过滤填充词 - 用户甚至可以通过语音进行编辑。该模型还为 macOS 上的 Gemini 应用程序中的听写提供支持,与 Google Antigravity 中的屏幕上下文一起工作,并且正在集成到 Chrome 中。

对于开发者来说,这两次发布被视为一种策略:谷歌正在将 Gemini 从一个与你交谈的聊天机器人推向可以看到、听到和生成媒体的基础设施。随着 OpenAI、ElevenLabs 和一群视频初创公司在同一领域竞争,2.6% 的单词错误率和 40 秒的连贯场景是 Google 对实际产生收入的制作工作负载(语音代理、字幕管道和创意工具)的开标。开发人员现在就可以在 Google AI Studio 中开始使用这两种模型进行构建。

为什么单词错误率仍然很重要

单词错误率听起来像是一项学术统计数据,但在生产中,它是一个有效的语音产品和一个令人沮丧的语音产品之间的区别。语音代理中的每一个被误解的话语都会破坏一项任务:听错的订单 ID 会触发失败的查找,乱码的地址会将包裹发送到错误的城市。这就是为什么非流媒体音频 2.6% 的 WER 与上一代模型常见的高个位数速率之间的差距,在可用性方面造成了数量级的差异。

谷歌报告的两种模式之间的区别对于建筑师来说也很重要。流式转录(4.0% 的 WER 数字)以一定的准确性换取亚秒级延迟,这是实时语音代理等交互式用例所需要的。录制音频的批量转录运行速度较慢,但​​达到 2.6%,这就是为什么通话后分析和存档处理可以承受更高要求的原因。谷歌决定将两者公开为单独的模型端点,而不是一个可调整的设置,这承认开发人员在这种权衡的任一侧构建了不同的产品。

视频制作的分层工作流程

Omni 1.1 Flash 更新对于创意工作的实际发生方式也同样务实。生成视频的迭代成本很高:每个提示实验都意味着完整的渲染。新的 360p 预览模式将探索与交付分开,让创作者能够以低廉的成本循环浏览各种即时变化,并且只需为通过审查的镜头支付 4K 升级费用。

场景扩展机制解决了 AI 视频在剪辑大小的贫民区中存在的一致性问题。通过分析 10 秒的先前上下文而不是仅分析最终帧,该模型可以将场景以 10 秒的增量延长至 40 秒,同时保持角色、灯光和视觉风格一致。结合第一帧和最后一帧插值(为剪辑师提供确定性控制点、传统剪辑中进出标记的工作方式),人工智能生成的镜头开始适应真正的后期制作流程,而不是批量替换它们。

竞争格局

这两次发布都将谷歌定位为基础设施而不是目的地。在语音方面,谷歌正在通过将最先进的准确性捆绑到开发人员已经使用的 Gemini API 中,与专业转录供应商及其云竞争对手的语音堆栈展开竞争。在视频领域,它通过强调控制和工作流程集成而不是原始景观来在充斥着资金雄厚的初创公司的市场中竞争。

分销优势可能是决定因素。开发人员可以从 Gemini API 调用的相同转录模型已经为 Android 上的 Gboard Rambler 听写、macOS 上的 Gemini 应用程序、Google Antigravity 和 Chrome 提供支持,这意味着 Google 可以在数十亿用户交互中分摊模型开发,同时收集各种真实世界的音频来不断改进它。对于 2026 年选择语音或视频堆栈的开发人员来说,飞轮现在已成为宣传的一部分。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →