谷歌推出了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这两个实时对话模型被该公司描述为迄今为止最先进的自然语音对话模型。这些模型于 9 月 15 日开始在 Gemini API、Google AI Studio、Search Live、Gemini Live 和 Google Workspace 上推出,企业可以通过 Gemini Enterprise 进行私人预览访问。

该消息由首席工程师 Tom Ouyang 和技术人员 Malini Jaganathan 代表 Gemini Audio 团队撰写。它扩展了本月早些时候推出的 Flash 和 Flash Cyber​​ 型号的 Gemini 3.8 系列,标志着 Google 迄今为止最积极地进军实时、多模式语音辅助领域——在这个市场上,OpenAI 的语音模式和一波语音初创公司正在争夺同样的日常使用场景。

此次发布符合谷歌产品线极其拥挤的趋势。对最新人工智能发展的报道显示,该公司在定价、编码和现在的语音方面与竞争对手展开竞争,在几周内多次发货。

专为实时对话而打造

Live 模型与带有麦克风的标准聊天模型的区别在于延迟和状态。 Google 的 Live API 文档描述了一种低延迟接口,可通过有状态的 WebSocket 连接处理连续的音频、图像和文本流,接受原始 16kHz PCM 音频、每秒高达一帧的 JPEG 图像和文本,并实时返回语音音频。

这些模型近乎实时地处理视觉输入,让助手看到用户所看到的内容——谷歌的演示视频显示,Gemini 3.8 Live 使用视觉上下文指导员工入职会议,近乎实时地下棋,并通过自然语音构建完整的业务计划和定制营销工具包。该模型还可以在对话过程中自动检测并在 97 种支持的语言之间进行转换,而无需用户切换设置。

也许对于实际使用来说最重要的是:模型在对话继续的同时在后台执行工具和 API 调用,确认请求并在任务完成时保持对话继续进行。这使得助手从严格的回合制受访者变成了更接近于碰巧说话的代理。

谷歌吹捧的数字

谷歌报告称,Gemini 3.8 Live Extended Thinking 以 82.6 分的成绩在人工分析的语音到语音质量指数中名列前茅。在代理任务完成方面,该公司在 τ-Voice 基准测试中得分为 68.6%,在 Sierra 的 τ-Voice-banking 评估中得分为 35.1%,在 Big Bench Audio 中得分为 97.7%。

这些是谷歌自己报告的数据,独立验证需要时间——但如果其在人工分析图表中名列前茅,那么谷歌将在整体对话质量方面领先于 OpenAI 和专门的语音人工智能公司的语音优化产品。谷歌还表示,Extend Thinking 保持了极具竞争力的价格点,这隐含着对 3.8 代产品面临的价格压力的认可。

这些模型生成的所有音频都带有 SynthID(谷歌难以察觉的水印)水印,因此人工智能生成的语音仍然可以检测到——这是一种合规性和错误信息保护措施,正在成为谷歌生成产品的标准。

你可以在哪里使用它

两种型号的可用性有所不同。 Gemini 3.8 Live 可供所有人使用 Search Live(Google 的实时视觉搜索模式)。扩展思维可在 Gemini Live 中使用,通过 Workspace 在 Google AI Pro 和 Ultra 订阅者的文档中使用,在 Gmail 和 Keep 中为所有 Google 用户提供。

开发人员通过 Gemini API 和 Google AI Studio 获取模型,Google 表示 Live API 已被 Agora、Fishjam、LiveKit、Pipecat、Vercel 和 Vision Agents 等平台使用,在 Google 的实时基础设施之上构建语音驱动的界面。 Salesforce、Genspark 和 Lumeris 被指定为新模型的发布合作伙伴。

拥挤的语音人工智能市场

语音正在成为 2026 年的界面战场,因为它是人工智能最终摆脱键盘的地方。能够在说话时看、听、切换语言和运行工具的模型不是与其他聊天机器人竞争,而是与电话、客户支持热线和个人助理竞争。

谷歌的优势在于分销:搜索、Android、Workspace 和 Chrome 为 Live 型号提供了无可比拟的安装基础。该公司押注,现在拥有最好的语音模型,出现在用户一天中的每个角落,将比任何单一的基准测试胜利更重要。竞争对手将有机会做出回应,但谷歌已经明确表示,曾经是演示功能的语音现在已成为一流的产品线。

对于开发人员来说,这个信息同样是直接的。通过发布精确的输入格式、记录后台工具的执行情况以及使用 Live API 平台为生态系统播种,谷歌正试图使其堆栈成为任何构建语音界面的人的默认基础——从客户支持机器人到可穿戴助手。无论 Gemini 3.8 Live 的质量声明在独立测试中是否成立,可用性测试已经开始。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →