OpenAI 推出了 GPT-Live,这是 ChatGPT 的一系列新语音模型,可以同时听和说,标志着该公司迄今为止对其会话语音体验最重大的改革。该版本使用 OpenAI 所描述的全双工架构,允许用户打断助手、与助手交谈,该公司称这种方式感觉就像真正的电话通话。
此次发布与 OpenAI 本周更广泛地推出 GPT-5.6 模型系列同时发布,代表着一种努力,旨在让有关语音界面的人工智能突发新闻感觉不像在指挥机器,而更像是与人聊天。
是什么让 GPT-Live 与众不同
传统的语音助手以半双工模式运行:您说话,然后停止,然后系统处理您的请求并做出响应。轮流是严格的。 GPT-Live 通过全双工音频处理打破了这种模式,这意味着模型可以在说话时听到您的声音。这使得自然打断、句子中的更正和重叠对话成为可能——人类认为这是理所当然的,但语音人工智能在历史上一直在努力解决这种来回问题。
据路透社报道,GPT-Live 模型可以同时听和说——这种功能长期以来一直是语音人工智能领域的目标。该方法消除了早期版本的 ChatGPT 语音模式所定义的尴尬停顿和强制轮流。
一个值得注意的技术细节:当 GPT-Live 遇到复杂问题时,它会将这些问题交给后台的 GPT-5.5。语音模型实时处理对话流,而更大的推理模型则在幕后处理更困难的任务,然后反馈答案。 OpenAI 表示,这种分工极大地提高了响应质量,同时又不牺牲使实时对话感觉自然的响应能力。
供货情况和定价
OpenAI 正在分两层推出新的语音模型:
- GPT-Live-1 — 完整模型,现已向付费 ChatGPT 订阅者提供(Plus、Pro 和 Team 计划)。
- GPT-Live-1 mini — 一个更小、更轻的版本,可供免费 ChatGPT 帐户使用。
OpenAI 表示,API 访问即将推出,这将允许开发人员在自己的应用程序中构建全双工语音。该公司尚未公布该 API 的详细定价。
此次发布还将网络搜索直接带入语音对话中。据《搜索引擎杂志》报道,GPT-Live 将实时搜索集成到 ChatGPT 语音中,因此用户可以询问当前事件或快速变化的信息,并根据最新的网络结果获得答案,而无需切换模式。
竞争激烈的语音人工智能市场
GPT-Live 进入了日益拥挤的语音 AI 领域。谷歌一直在 Android 及其 Gemini Live 产品上推广由 Gemini 驱动的语音功能,而苹果则继续围绕大型语言模型重新设计 Siri。 OpenAI 的主要竞争对手 Anthropic 最近将其工作重点放在代理编码和推理模型上,而不是语音上。
全双工方法似乎是更广泛的行业的发展方向。通过允许同时听和说,GPT-Live 减少了延迟,并消除了用户对语音助手最大的抱怨:等待。将复杂查询移交给 GPT-5.5 也是一个信号,表明 OpenAI 并不将语音视为精简的界面,而是将其视为通向其最强大模型的前门。
为什么它很重要
多年来,语音一直被视为次要的、命令驱动的界面——适合设置计时器和检查天气,但对于细致的对话不太有用。 GPT-Live 的赌注是,瓶颈从来不是模型的智能,而是“界面”:迫使人类以孤立的突发方式说话。
如果全双工对话能够大规模可靠地运行,它将改变人们在手机、汽车、智能扬声器以及最终可穿戴设备上与人工智能交互的方式。它还引发了人们熟悉的担忧——关于始终监听的设备中的同意、合成声音的真实性,以及更自然的对话是否会导致用户过度信任人工智能的答案。
除了现有的内容政策之外,OpenAI 尚未详细说明 GPT-Live 的具体安全措施,尽管搜索集成意味着该模型现在可以将实时信息提取为语音,而用户可能比可以滚动浏览的文本更难进行批判性评估。
接下来会发生什么
目前,GPT-Live 首先是 ChatGPT 功能,其次是开发者产品。真正的考验将随着 API 访问而到来,届时第三方应用程序、客户服务平台和硬件制造商可以将全双工对话插入自己的产品中。到那时,OpenAI 也将面临来自更便宜的开源语音模型和渴望匹配该功能的竞争对手的定价压力。
与 GPT-5.6 公开发布同时发布表明 OpenAI 将语音和推理视为同一策略的两个部分:一个强大的思考模型,与一个让你像同事一样与之交谈的界面。
保持人工智能领先地位
如需持续报道模型发布、语音 AI 以及塑造行业的一切内容,请关注 AI Buzz Wire 的最新 AI 发展。
阅读更多人工智能新闻 →



