谷歌推出了 Gemini 3.5 Transcribe,这是一种专为实时转录而构建的新语音到文本模型,可自动识别超过 85 种语言,并一路打磨输出,无需询问即可删除填充词并纠正口头错误。

此次发布将谷歌的语音堆栈定位为快速增长的转录市场的直接挑战者,在该市场中,准确性和延迟越来越多地决定开发人员在通话、会议、字幕和语音界面中采用哪些服务。 更多相关背景,请参阅我们的AI新闻

模型可以做什么

根据 Google 的公告(The Decoder 发布了相关报道),Gemini 3.5 Transcribe 远远超出了将口语单词转换为文本的范围:

  • 自动语言检测跨越 85 多种语言,无需配置
  • 删除填充词,清理“嗯”、“呃”和类似的不流畅之处
  • 纠正口误,产生可读的散文而不是逐字的噪音
  • 自主文本格式,包括标点符号和结构

该公司报告称,流音频的字错误率为 4.0%,录制音频的字错误率为 2.6%,同时与其前身 Chirp 3 相比,延迟减少了约 70%,这在延迟中断对话的实时字幕场景中是一个很大的优势。

两个接口执行两项任务

开发人员可以通过两个不同的应用程序编程接口进行访问:

Live API — `gemini-3.5-transcribe-live`

以非常低的延迟处理实时流媒体,针对响应时间最重要的实时字幕、语音代理和交互式助手。

交互 API — `gemini-3.5-transcribe`

处理录制的音频并返回带有演讲者归属和时间戳的文字记录 - 这是会议、采访、播客和媒体后期制作的典型工作流程。

除了转录之外,该模型还支持函数调用,这意味着它可以将后续任务委托给 Gemini 系列中的其他模型,例如根据会话期间所说的内容触发图像生成请求或网络搜索。这将转录引擎变成了语音驱动应用程序的可控接口层。

已在 Google 产品中发货

该模型现已在 Google AI Studio 和面向开发人员的 Gemini Enterprise Agent Platform 中上线。谷歌还将其连接到消费者界面:Android 上的 Gboard 通过名为 Rambler 的内部组件使用它进行听写,macOS 上的 Gemini 应用程序将其应用于语音输入,Chrome 集成也将随之而来。

这种分配很重要。语音识别赢得了规模,并将模型嵌入键盘、桌面应用程序和浏览器中,使其每天面临数十亿次输入交互,同时提供所需的评估循环,以保持跨口音、方言和嘈杂环境的错误率下降。

语音人工智能领域的竞争优势

转录已悄然成为前沿实验室和专业供应商之间的竞争战场。准确、低延迟的语音理解是代理产品的入场券,这些产品可根据语音命令、企业会议智能、辅助功能和多语言客户服务自动化进行操作。

通过将积极的延迟改进与自我纠正输出相结合,谷歌押注开发人员更喜欢读起来像编辑文本的文字记录,而不是原始语音捕获——用严格的逐字保真度来换取可用性。需要准确记录的团队(例如法律或医疗转录员)可能仍然需要逐字记录模式;对于其他人来说,倾听某人的声音和理解他们之间的实际差异继续缩小。

随着 Gemini 3.5 Transcribe 现在在 AI Studio 和企业工具中普遍可用,第一个有意义的测试将是语音代理开发人员的采用指标——这个细分市场增长得足够快,即使增量的准确性增益也会转化为相当大的切换决策。

为什么延迟是真正的战场

错误率成为头条新闻,但延迟却悄然决定了哪些产品可行。提供实时字幕叠加的转录引擎需要跟上对话的节奏,否则观众就会脱离。与客户支持电话进行协商的语音代理不能在其语音层跟上时尴尬地暂停。谷歌报告称,相对于 Chirp 3,延迟减少了 70%,正是针对这一差距——缩短了说话者说完一句话和下游系统对其采取行动之间的距离。

对于代理应用来说,这很复杂:口头对话的每一轮都涉及识别、推理和响应。识别阶段的毫秒数缩短为开发者提供了空间,可以在不违反会话时间预算的情况下,将钱花在能力更强、速度更慢的推理模型上。

逐字权衡

一种设计选择值得仔细审查。默认情况下,Gemini 3.5 Transcribe 会管理输出:填充词消失、错误得到纠正,并自动应用格式。对于大多数商业用途——会议记录、字幕、可搜索档案——这正是用户想要的。

但某些工作流程依赖于逐字记录。法律证词、合规审查和新闻事实核查有时需要准确了解所说内容,包括犹豫。在将敏感管道迁移到新模型之前,受监管行业的组织希望清楚有多少平滑是可选和可配置的。 Google 的文档和 API 参数将有效地为行业确定逐字逐句与完善的界限。

多语言足迹作为护城河

通过自动检测覆盖 85 多种语言不仅仅是一个功能清单项。多语言覆盖将价值集中在竞争对手历来落后的市场上:地方口音、句子中间的语言之间的代码转换以及资源匮乏的语言都会惩罚仅在英语为主的语料库上训练的模型。

对于在数十个国家/地区运行支持中心的全球企业来说,处理语言检测的单一模型可以透明地降低集成复杂性 - 一个管道而不是许多每个市场的配置。结合通过 Gboard 的数十亿 Android 安装进行分发,谷歌将转录质量的多语言能力定位为基础设施,而不是高级功能。

看什么

三个信号将表明 Gemini 3.5 Transcribe 是否改变了市场份额,还是仅仅提高了预期:未来几个月开发人员迁移到第三方基准测试;竞争对手匹配延迟数字而不是准确性声明的速度有多快;以及函数调用挂钩是否会催生一波在 Gemini 上原生构建的语音优先代理浪潮。该产品现已上线,通过 AI Studio 进行定价应该会使实验变得足够便宜,从而使转换成本几乎降至零。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →