据 Engadget 报道,Meta 于周一推出了一种新的音频人工智能模型,该模型可以区分多个说话者并实时转录多种语言,此举将推动该公司更深入地进入日益拥挤的语音人工智能市场。 The Information 首先报道了音频模型的发布,而 9to5Mac 则详细介绍了一款配套产品——Muse Voice Transcribe,为 Mac 带来了实时语音听写功能。
这两个版本的发布表明,Meta 正在将语音视为其人工智能堆栈的一流输入,而不是事后的想法。实时转录可以处理重叠的说话者、对话中的语言切换和系统范围的听写,这些功能将语音从新颖的功能转变为日常使用的界面。 更多相关背景,请参阅我们的AI最新动态。
一种模型,多种声音,多种语言
据 Engadget 报道,该模型的主要功能是实时区分多个说话者和多种语言的能力。这种组合同时解决了实际转录中的两个最困难的问题:说话者分类(弄清楚谁说了什么)和多语言识别,即对话在不同语言之间不间断地漂移。
大多数现有的转录管道将这些视为单独的阶段:首先,二值化模型分割说话者,然后识别模型转录每个片段。将它们融合到一个实时模型中,使该技术适用于实时用例——会议、采访、客户电话、实时翻译叠加——在这些用例中,等待后处理就达不到目的。
Muse Voice Transcribe 为每个 Mac 应用程序带来听写功能
除了该模型之外,Meta 还推出了适用于 macOS 的 Muse Voice Transcribe。据 9to5Mac 报道,该工具提供了跨 Mac 应用程序运行的实时语音听写功能——实际上是一个系统范围的听写层,而不是一个独立的应用程序。 Gadget Review 的报道称其为每个 Mac 应用程序带来了实时听写功能。
该设计对于采用很重要。听写工具的生死存亡取决于摩擦:如果用户必须从单独的窗口中复制文本,他们就会停止使用它。在系统级别工作意味着光标闪烁的任何地方都可以进行语音输入——电子邮件、代码编辑器、消息应用程序、文档——这正是最成功的听写工具赢得受众的方式。
Mac 的发布也标志着 Meta 的重要领域。该公司的人工智能工作集中在其移动应用程序、Meta AI 助手以及 Llama 系列和 Muse 系列模型上。为苹果平台提供一款完善的桌面生产力工具,让 Meta 能够直接接触到它一直难以接触到的专业用户群,并与平台上已建立的听写和转录实用程序展开竞争。
拥挤的领域,速度越来越快
Meta 正在进入一个在过去两年里重新定价和重新设计的市场。 OpenAI 的 Whisper 开源模型为可访问的多语言转录设定了基准,该公司的付费 GPT Transcribe API 在价格上削弱了大部分商业市场。与此同时,谷歌也在朝着同一方向努力推进:涵盖数十种语言的实时转录模型已经向开发人员推出,正如我们在谷歌发布其 85 种语言的实时语音转录模型时所报道的那样。
在这种背景下,差异化已经从原始准确性(领先者在标准基准测试中彼此聚集在噪音中)转向了实际细节:延迟、扬声器处理、语言之间的代码切换、定价以及模型运行的位置。 Meta 强调实时多说话者同步识别和多语言识别,正是针对这些实际细节。
为什么语音突然变得具有战略意义
这个时机并非偶然。语音正在成为人工智能代理的默认界面,而拥有音频层(捕获、转录、理解、响应)的公司控制着助理体验的最自然切入点。 Meta 已经公开了其对人工智能眼镜和可穿戴设备的雄心,其中语音本质上是唯一实用的输入。快速、准确、移动的音频模型是该路线图的基础设施。
还有企业角度。会议、支持电话和现场工作会产生大量多发言者音频,组织希望这些音频可搜索且可操作。在对话发生时可靠转录的模型(标记说话者并处理语言,无需手动配置)是演示和产品之间的区别。
实时转录除了方便之外还有其他好处。实时字幕使聋哑和听力障碍用户可以轻松观看会议、课堂和广播,而即时多语言字幕则降低了国际团队的语言障碍。当转录速度足够快以跟上自然语音的步伐并且足够强大以同时跟踪多个说话者时,这些辅助功能就不再是特殊的住宿,而是成为日常工具中内置的默认设置。
Meta 尚未在最初报道中公布定价或完整的可用性详细信息。但方向是明确无误的:长期以来被视为商品的人工智能堆栈的音频层,现在已成为平台战争的前线,而 Meta 已决定为此而战。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →
