来自 Meta、牛津大学和伦敦大学学院 FAIR 的一个研究团队推出了人工智能研究偏好模型 (RPM),这是一种用于决定自主研究代理应该实际运行哪些机器学习实验的方法。根据 MarkTechPost 的工作报告,RPM 不是预测实验的得分,而是对未执行的候选者进行排名,并选择最有希望的一个,该团队表示,这一转变解决了人工智能驱动研究的真正瓶颈:验证计算。

这个想法是在研究人员已经可以提出、实施并评分自己的实验的时候提出的。创意的产生成本低廉;执行则不然。训练单个候选者可能会消耗数小时到数天的 GPU 时间,因此代理不可避免地会提出远远超出其运行能力的实验。正如团队所设想的那样,哪些候选人被执行才是研究进展的真正杠杆。对于那些看着计算费用不断攀升的实验室来说,这种框架正是这项工作引起研究自动化领域最新人工智能发展关注的原因。

为什么实验选择是瓶颈

该团队发现语言模型在预测绝对指标或执行结果方面并不可靠。模型无法查看候选实验并准确预测它将达到的分数。研究人员发现,它能做的是判断两个候选者中哪一个是更好的选择——相对比较而不是绝对预测。 RPM 完全是围绕这一区别构建的:它们从不预测分数,只进行排名。

该系统在 AIRA-dojo 内运行,这是一个开源进化树搜索支架,通过贪婪的父级选择以及草稿、改进和调试运算符生成机器学习实验,最后返回最高验证分数的节点。基准测试 AIRS-Bench 也是开源的。脚手架和偏好模型都使用 Qwen3.6-27B 作为主干,团队指出这是开放权重。

淘汰赛如何进行

该代理不是生成一个子实验并执行它,而是并行应用一个运算符 15 次以生成 15 个未执行的候选实验。然后,RPM 在淘汰赛中对它们进行两两比较,只有获胜者才会被执行。每次比较都基于通过探索树的广度优先遍历收集的上下文节点,每个候选者与其祖先的验证分数一起显示,因此法官根据代理的实际搜索历史而不是在真空中进行推理。

该论文描述了具有不同计算预算的两种变体:

  • 仅推理 RPM — 法学硕士作为法官,一次性比较候选人计划、代码和搜索历史记录。它的提示使用 DSPy 框架中的 MIPROv2 进行了优化,并集中在团队所谓的首席研究员的标题上:它容忍可修复的错误,奖励可扩展性并惩罚冗余的研究方向。离线比较准确度为 57.7% 至 59.0%。
  • 代理 RPM — 相同的判断加上一个克隆代理环境的沙箱,包括单个 H200 GPU,工具仅限于 Python、Bash 和提交解决方案操作。它运行小规模的试点实验,然后反馈模型要么提出信息最丰富的下一个实验,要么结束循环。飞行员的上限为 30 次,阈值为 60 秒,并且剩余时间预算被故意夸大 - 报告为 2,700 秒,而实际为 300 秒 - 因此代理不会提前停止优化。

法官像首席调查员一样调整

首席研究员的框架是安静有趣的部分。优化后的标题并没有奖励看起来最令人印象深刻的候选人,而是反映了经验丰富的研究人员如何对想法进行分类:可以修复的错误代码胜过追求死胡同的精美代码,而重复现有树的方向比新颖的方向更有价值。该团队的消融表明,通过及时优化而不是手动调整来学习的标题才是带来改进的原因。

AIRS-Bench 上的基准测试结果

评估涵盖 20 个公共文本和表格任务,每个任务在单个 H200 和 10 个随机种子上进行 24 小时。至关重要的是,相同的 Qwen3.6-27B 主干网为实验操作员和偏好模型提供动力,因此收益来自选择层而不是更强的判断模型。平均归一化分数:

  • 无转速(随机选择):0.684
  • 仅推理 RPM:0.711
代理转速:0.729
  • 验证预言机(上限):0.748
  • 测试预言机(上限):0.759

对于仅推理变体,相对于随机选择的改进概率为 0.5923,对于代理变体,改进概率为 0.5913,95% 置信区间下限分别为 0.5066 和 0.5018,高于统计显着性的 0.5 阈值,尽管该团队坦言,这些差距是适度的,而不是变革性的。

效率才是更实际的结果。仅推理 RPM 在 14.88 小时内达到随机基线的最终分数 0.684,加速了 1.61 倍,而代理变体需要 15.50 小时,加速了 1.55 倍。即使考虑到自托管法官推理的开销,调整后的数字仍然有利。

开放权重和诚实的警告

该团队坦言 RPM 目前只能部分部署。这些组件是开放的——无需微调的冻结预训练主干、开源脚手架和基准测试以及开放权重主干模型——但代理变体的沙箱要求及其试点实验开销意味着大多数实验室将从纯推理版本开始。研究人员还指出,在代理变体中,调试步骤会恢复为随机选择,因为试点时间与代理自己的时钟竞争。

更大的意义可能是方向性的。随着自主研究代理从演示转向工业实验室的日常使用,稀缺资源不再是想法,而是 GPU 时间,以及随着时间的推移从固定计算预算复合中挤出更多进展的方法。跑步前排名是一个简单的想法,AIRS-Bench 的数据表明,这是一个非常有效的想法,非常重要。

保持人工智能领先地位

AI Buzz Wire 上了解塑造未来模型的研究。

阅读更多人工智能新闻 →