据 TechCrunch 报道,该公司周三宣布,OpenAI 正在为 ChatGPT 移动应用程序带来基于语音的代理功能,让用户只需通过交谈即可触发实际工作——起草文档、总结电子邮件、构建演示文稿。
此次推出扩展到了 OpenAI 之前在桌面上提供的智能手机功能,并且随着语音成为用户与 AI 助手交互以完成复杂任务的增长最快的方式之一,该功能也随之推出。
订阅者可以通过语音做什么
Plus 和 Pro 订阅者将能够使用 ChatGPT 移动应用程序中的“工作”选项卡来创建文档、起草电子邮件或通过语音总结 Slack 消息。相同的语音工作流程涵盖了“工作”选项卡已经支持的更繁重的工作,例如构建网站、创建演示文稿、使用云浏览器以及挖掘 ChatGPT 的财务领域。
Free 和 Go 用户获得的更新范围较小,能够使用插件和连接的应用程序。
OpenAI 表示,语音对话现在将产生更丰富的文本输出,用户可以在语音和文本模式之间流畅地切换。对于兼顾通勤和桌面的人们来说,这也许是最实用的补充:在旅途中开始的对话可以稍后在桌面应用程序上恢复。
从 GPT-Live 到移动代理之路
这次更新是 OpenAI 于 7 月份开始的故事的移动章节,当时它推出了新的对话模型 GPT-Live,后来将其连接到桌面应用程序中,以便用户可以完成“工作”选项卡任务并通过语音在 Codex 选项卡中构建应用程序。周三的公告通过将相同的语音驱动任务执行带到手机上来结束循环。
为什么移动语音代理很重要
这种转变反映了使用模式的变化。越来越多的用户开始使用语音向人工智能助手发出命令来执行复杂的任务,而手机是这些命令最自然发生的地方——在会议之间、在车里或远离键盘。
到目前为止,ChatGPT 中最强大的代理功能都存在于桌面上。希望 ChatGPT 构建演示文稿或运行多步骤研究任务的用户需要在计算机前,在“工作”选项卡中输入指令。尽管这款移动应用程序很受欢迎,但它主要是一个对话界面。周三的更新打破了这种区别:手机成为开始实质性工作的合法场所,以语音通道作为界面。
订阅分割
此次推出还加深了 ChatGPT 订阅级别之间的界限。 Plus 和 Pro 订阅者(这些计划已经具有最高的使用限制并可以访问 OpenAI 最强大的模型)可以获得完整的语音驱动的工作选项卡体验,包括文档创建、电子邮件起草和 Slack 摘要。他们还可以构建网站、创建演示文稿、使用云浏览器并访问 ChatGPT 的财务区域,所有这些都通过语音进行。
Free 和 Go 用户获得的功能更加有限,以插件和连接的应用程序为中心。这种分层遵循 OpenAI 熟悉的模式:证明桌面上的功能,然后推出移动版本,其最有价值的功能推动用户转向付费计划。对于 OpenAI 来说,在竞争对手积极争取相同用户之际,此举加深了其付费等级的护城河。
它与 Anthropic 的方法相比如何
竞争背景在这里很重要。 TechCrunch 指出,Anthropic 最近为其用户提供了移动设备和桌面设备之间的更轻松切换,并将其 Cowork 和 Chat 界面合并为一种体验。相比之下,OpenAI 仍然将聊天和工作区分开——这是一种有意的产品划分,使随意的对话与文件、项目和工具所在的工作区区分开来。
两家公司在人工智能辅助工作流程设计方面实际上进行了相反的实验。 Anthropic 的合并界面押注于用户想要一个跨设备跟随他们的统一界面。 OpenAI 的赌注是,聊天和结构化工作空间可以满足不同的需求,并且应该保持独特,语音充当结缔组织——通过在移动设备上交谈来启动任务,通过桌面上的键盘来完善它。
接下来看什么
下一个明显的问题是语音代理距离“工作”选项卡有多远。 OpenAI 的桌面集成已经扩展到其应用程序构建工具 Codex,而移动平价将把手机变成完整的开发界面。 OpenAI 尚未宣布具体时间。
同样悬而未决的问题是可靠性。代理语音任务(起草、总结、浏览)涉及多步骤执行,其中错误会加剧,并且移动环境会增加中断和上下文切换。早期的用户体验将决定语音驱动的工作是否成为日常习惯或仍然是演示友好的功能。
不管怎样,前进的方向是明确的:两年前通过语音回答问题的助手现在预计会在你到达办公桌前完成任务。通过周三的更新,OpenAI 的移动用户可以用一句话开始这项任务,并在到达时在更大的屏幕上选择它。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →