OpenAI 的 GPT-6 Astra 可能在编码方面遇到了用户信任问题,但在新的机器人基准测试中,它发布的数据让研究人员谈论了质的飞跃。在 StationeryBench(一项围绕普通桌面物体进行的测试)上,Astra 完全完成了 100 项任务中的 7 项,而与之对比的 Ai2 的 MolmoAct2 模型则完成了零项。
The Decoder 描述的基准测试让这两个模型在五个桌面对象任务中相互竞争——打开记号笔、倒出回形针,或者在两个机器人手臂之间传递一把尺子。两种模型都在 200 次试验中控制相同的双臂 YAM 机器人,这种控制设计旨在将模型能力与硬件差异隔离开来。所有结果、视频和代码均已发布在 GitHub 上。如需更多此类研究报道,请查看我们的 AI 新闻中心。
研究人员称,这是一个“阶跃变化”
康奈尔大学和谷歌 DeepMind 的人工智能研究员 Yoav Artzi 称 Astra 的性能是“空间推理的阶跃变化”——这种语言基准测试结果很少能获得。在尚未发布的 REMAP 基准测试中,Astra 达到了接近人类水平的准确度,尽管 Artzi 指出“即使 Astra 也无法达到人类在其他场景下的水平”。
Astra 的进度中位数达到 46 分(满分 100 分),而 MolmoAct2 的得分为 12 分——这一差距比总体完成数字所显示的更为重要。机器人任务根据部分进展和完全成功进行评分,将竞争对手的中位数分数提高三倍表明该模型通过操作序列不断取得进展,而不是在几次试验中依靠运气取得成功。
为什么空间推理突然变得重要
结果暗示了阿斯特拉是如何训练的。 Artzi 怀疑 OpenAI 在大量 3D 数据(例如 Blender 场景)上训练了模型,这与模型在 3D 任务上的特殊优势相一致。如果这种解读是正确的,那就表明合成 3D 环境(比现实世界的数据收集更便宜、更安全)正在成为实现物理世界能力的可行途径,而物理世界能力是机器人技术中长期存在的瓶颈之一。
该基准测试的设计还说明了机器人评估的发展方向。 StationeryBench 的任务故意显得平凡——打开记号笔、倒出回形针、交出一把尺子——因为日常操作,而不是电影般的壮举,才是实验室演示与实用机器的区别。在相同的双臂 YAM 硬件上通过 200 次试验对两个模型进行评分,并发布每个视频,对于涉及前沿实验室旗舰产品的能力声明来说,这是一种异常透明的设置。
MolmoAct2 是艾伦人工智能研究所 (Ai2) 的比较模型,完成任何任务都不是它自己的一种数据:它表明通用前沿模型和专用机器人模型之间的差距不再只是缩小,而是逆转,至少在推理繁重的操作上是如此。
这也符合 OpenAI 所宣称的雄心:根据 The Decoder 引用的报道,该公司有打造自己的消费机器人的长期计划。能够推理物体、手和轨迹的前沿语言模型是软件的一半。硬件的一半仍未解决,但像 StationeryBench 这样的基准测试是衡量这个故事的方式。
背景:一周复杂的模型
结果让 OpenAI 陷入了一个奇怪的新闻周期。该基准测试中心的同一个模型在一周的时间里都面临着用户的抱怨,称它自发布以来变得越来越愚蠢——在重置 Codex 使用限制之前,OpenAI 追踪到了三个指定的缺陷,从失火的技能到行为不当的上下文实验。一个模型在生产过程中遇到了麻烦,同时在实验室中发布了逐步变化的结果,这是当前人工智能行业的一个缩影:能力和可靠性在不同的时钟上不断进步。
它还引发了一场安全争论,OpenAI 自己的领导层也加入了这场争论。该公司的首席科学家警告说,没有实验室能够解决日益自主的系统的控制问题,Anthropic 的首席执行官呼吁该行业完全放慢前沿发展。显示操纵物理世界的模型的基准——即使世界只是一张铺满文具的桌子——正是两位高管在争论进展速度超出监督时所引用的结果。
底线
100 项任务中的 7 项完全完成不会让机器人明天出现在你的办公桌上。但从竞争对手的零分到七分,中位进步分数高出三倍,这是两年前重新绘制语言理解能力图表的一种不连续性。悬而未决的问题是,同一模型是否能够在基准之外以开发商愿意支付的价格可靠地提供这种能力。
保持人工智能领先地位
基准、突破以及对能发挥作用的机器的竞赛每天都在发生。
阅读更多人工智能新闻 →