OpenAI 联合创始人、现任 Thinking Machines 首席科学家约翰·舒尔曼 (John Schulman) 表示,他预计人工智能系统将在大约三到四年内实现递归自我改进,即加速自身发展,这一时间表使他跻身该领域最积极的预测者之列。舒尔曼在周五发布的 Dwarkesh 播客的圆桌会议上给出了这一估计,其中三名前沿实验室研究人员公开讨论了该行业实际上距离天花板有多近。

这次对话罕见地不加警惕地展示了接近前沿的研究人员如何思考进展,在喧闹的一周中,Nvidia 首席执行官黄仁勋宣布“AGI 已经到来”,由 25 名菲尔兹奖得主组成的团体警告说,人工智能基准追逐正在损害数学。对于追踪最新人工智能发展的读者来说,这一集是一个有用的平衡:这些人是构建系统的人,他们彼此之间存在严重分歧。

谁在桌旁

主持人德瓦克什·帕特尔 (Dwarkesh Patel) 表示,他之所以召集这个小组,是因为嘉宾们在他所说的“有点开放的实验室和公司”工作,这意味着他们可以公开发言。加入 Schulman 的还有开发开源模型的初创公司 Zyphra 的首席技术官 Beren Millidge 和 Baseten 模型培训主管 Charlie O'Neill。

舒尔曼的资历使他的时间表谈话特别重要。他是 OpenAI 的联合创始人,并领导了基于人类反馈研究的强化学习,该研究产生了 ChatGPT 背后的技术,之后他前往 Thinking Machines,目前担任该公司的首席科学家。

反对奇点的案例,steelmanned

帕特尔首先提出了一个尖锐的问题:如果 2036 年到来时没有数十亿个超级智能系统改变世界,那么技术原因是什么?米利奇提供了最有力的怀疑论理由,描述了他所说的一种近乎莫拉维克悖论式的模式,在这种模式中,模型能够满足研究人员摆在他们面前的任何基准,但现实世界的影响却令人失望。

米尔奇说:“仍然存在一些持续存在的模拟与真实差距,这在某种程度上阻碍了一切。”他描述了一个人工智能变得“非常擅长人们放入基准的所有事情”的世界,而没有进一步概括。他补充说,他认为这种结果不太可能出现,并指出强化学习已经在实践中推广的证据。

舒尔曼基本上同意进步不是自动的。他说,人类相对于当今的模型拥有真正的优势,每个新模型的发布都在某些领域迎头赶上,但在其他领域仍然遇到瓶颈——这种模式定义了过去几个产品周期。

快速时间表:两年、三到四年、五到十年

当帕特尔要求提供数字时,小组分裂了。当被问及人工智能何时可以为有能力的白领员工带来十倍的生产力提升时,舒尔曼首先拒绝给出一个数字,然后说“我会说两年”。 Millidge 表示,他“实际上可以看到这一点”,并认为某些类别的工作收益已经超过 10 倍。奥尼尔最为保守,回答“5到10”年。

帕特尔随后进一步推进,将这种情况描述为“基本上只是 ASI”。舒尔曼的回应是:“我想说 3-4 年”,并补充说,自动化人工智能研究本身“并不是人工智能最困难的事情之一,因为它涉及很多”当前技术已经可以完成的工作。这次交流值得注意的是,这一估计几乎没有受到其他研究人员的反对。

自动化研究人员实际上如何接受培训

这一集的很大一部分涉及舒尔曼正在定价的场景的机制。当被问及如何训练能够自动化人工智能研究的人工智能系统时,舒尔曼描述了“从人类反馈中学习以吸收研究人员的品味的某种组合,以及创建大量涉及进行多步骤研究的实践环境。”

这个答案与行业资金的去向有关。谷歌最近完成了与 Mechanize 的交易,Mechanize 是一家为训练代理构建模拟工作环境的初创公司,这恰恰反映了这样的赌注:更好的训练场(而不仅仅是更大的模型)将推动下一轮能力提升。舒尔曼还指出了一个核心困难:基于自然数据构建的奖励函数很难指定,而诸如用户是否接受代码编辑之类的表面信号可能会误导训练。

蒸馏与集中

舒尔曼最具体的预测之一涉及产业结构。他说:“我认为蒸馏是对抗集中力量的主要因素。”他认为,通过强化学习学到的能力可以相对容易地转移到较小的模型中,从而将前沿能力扩展到少数有能力承担前沿培训运行的公司之外。

对于人类还剩下什么的问题,舒尔曼斩钉截铁。 “我想说,人类的最后一项工作,或者说人类持续时间最长的角色,就是定义目标并决定我们真正想要什么,”他说。当帕特尔总结“协调是最终的工作”时,舒尔曼表示同意:“协调是某种答案”,同时指出它分解为找出正确的目标,然后实际实现它。

这一集在时间线争论中的位置

这一集的副标题——“我们距离天花板还很远”——抓住了它的整体主旨:研究人员看到前方有广阔的跑道,尽管他们对这条路有多么崎岖存在争议。讨论范围包括推动中国实验室进步的因素、长期强化学习是否能够引发通用智能,以及为什么强化学习已经开始发挥作用。

本月,各方关于时间表的公开辩论都加剧了。据彭博社报道,黄仁勋的“AGI 已经到来”的声明引起了分析师的怀疑,他们将其视为商业案例而不是科学主张,而 OpenAI 首席执行官萨姆·奥尔特曼 (Sam Altman) 告诉员工,随着安全担忧的加剧,公司愿意放慢尖端技术的开发。舒尔曼的递归自我改进的三到四年窗口介于营销和暂停之间——这是一个拥有构建目前推动该领域技术的记录的人的工作估计。

他的观点是否正确将取决于小组仅讨论的问题:强化学习是否不断泛化其训练环境,以及基准性能与实际经济价值之间的差距是否继续缩小。

保持人工智能领先地位

前沿研究人员正在公开讨论人工智能的局限性——关注故事的发展。

在 AI Buzz Wire 上阅读更多人工智能新闻