谷歌 DeepMind 推出了 SL2T,这是一种旨在将手语翻译成文本的人工智能模型,首先在该公司的新款 Pixel 11 智能手机系列上推出。该模型以“将手语人工智能交到用户手中”为口号推出,标志着迄今为止将实时手语理解引入主流消费设备的最引人注目的尝试之一。

这一消息是在谷歌 Pixel 11 发布会上发布的,该公司展示了一套由 Gemini 驱动的新功能。其中,手语翻译作为一个明显的无障碍里程碑脱颖而出,将手机的前置摄像头变成聋哑用户和不懂手语的人之间的桥梁。

设备上的手语到文本

根据 DeepMind 以及 Engadget 和 Android Authority 的报道,SL2T 可以直接在 Pixel 11 设备上将手语转录成文本。该功能首次在 Google 旗舰折叠手机 Pixel 11 Pro Fold 上首次亮相,该公司将其定位为新功能的展示。

Digital Trends 将此次发布描述为“聋哑用户与不懂手语的人交流的新方式”,将 SL2T 视为日常对话的实用工具,而不是纯粹的实验性演示。这个想法很简单,但功能强大:聋哑用户对着手机打手势,模型解释手势,然后显示生成的文本供听力正常的对话伙伴阅读。

在设备上运行模型,而不是将视频发送到云端,对隐私和可靠性都有有意义的影响。手语对话是亲密的,并且通常包含敏感信息,并且避免云往返可以将这些数据保留在手机上。它还允许该功能在连接较差的情况下工作。

为什么手语是一个人工智能难题

手语比简单地识别手形要复杂得多。完整的手语,例如美国手语(ASL),使用手势、面部表情、身体姿势和空间运动来传达意思,并且它们有自己的与口语不同的语法。仅跟踪手部的模型会错过签名者所说的大部分内容。

这就是手语翻译落后于语音识别的原因。在有限的功耗和内存预算内,构建一个可以在手机上实时解释丰富的签名通信的系统,是一个真正的工程挑战。 DeepMind 尚未发布有关 SL2T 架构或基准性能的完整技术细节,该公司在其公告中强调面向用户的体验而不是原始指标。

值得注意的是,公开细节有限。对准确率、支持的手语和延迟的独立验证将决定 SL2T 是可靠的日常工具还是仍需要成熟的早期功能。目前,DeepMind 自己的公告和多份技术出版物的证实证实了该模型的存在,并且正在消费级硬件上发布。

无障碍作为 AI 战场

随着辅助功能已成为人工智能实验室和设备制造商之间日益明显的竞争舞台,SL2T 出现了。实时字幕、盲人用户的图像描述以及现在的手语翻译不再被定位为利基附加组件,而是被定位为展示设备上人工智能实用价值的标题功能。

对于谷歌来说,将 SL2T 与 Pixel 11 的发布联系起来有两个目的。它为新硬件提供了竞争对手手机所缺乏的独特功能,并强化了这样的信息:谷歌的人工智能助手 Gemini 正在从根本上融入操作系统。 Pixel 11 Pro Fold 拥有更大的内屏,自然成为向桌子对面的对话伙伴展示功能的首选。

手语人工智能的未来之路

对于失聪和听力障碍群体来说,更大的问题是 SL2T 是否能够扩展到单一设备和有限的手语之外。美国手语可能是发布的重点,但全球有数百种手语,每种都有自己的结构和地区差异。对于美国手语手语者来说效果很好的模型对于英国手语、Auslan 或 LSF 的用户来说可能没什么用处。

DeepMind 有着从缩小范围到扩大规模的记录,就像它对 AlphaFold 及其天气模型等系统所做的那样。如果 SL2T 遵循这种模式,那么 Pixel 11 的首次亮相只是一个开局,而不是一个成品。聋哑用户的社区反馈将决定接下来的内容,他们最有能力判断翻译是否准确和自然。

目前,手语翻译在大众市场手机上的出现是值得注意的一步。这表明,人工智能理解口语的能力和理解手语的能力之间长期存在的差距可能最终开始缩小,一次一个设备。

AI Buzz Wire 的突发新闻报道 上了解最新的模型发布和 AI 发展。

保持人工智能领先地位

从手语到超级智能——关注 AI Buzz Wire 上发布的每一个模型 阅读更多人工智能新闻 →