当大型语言模型从未见过五年级以上的材料时会发生什么?由七名研究人员组成的团队从字面上回答了这个问题:他们建立了 LittleLearner,这是一个拥有 50 亿参数的法学硕士,在根据美国小学课程筛选的语料库上从头开始训练,然后测试是否有任何东西(更多的参数、更多的训练后、更聪明的提示)可以推动模型超越其预训练数据所教导的内容。他们报告说,答案是否定的。
论文《LittleLearner:教学控制知识暴露下的语言模型》由 Fanfei Li、Jana Zeller、Manuel Prada-Corral、Thaddäus Wiedemer、Prasanna Mayilvahanan、Ryan Cotterell 和 Wieland Brendel 于 8 月 13 日提交给 arXiv。到 8 月 16 日,它已成为 Hacker News 讨论的热门话题,获得了 200 多个点赞,研究人员和从业者们争论了这对于业界最喜欢的假设(即培训后可以凭空变出能力)意味着什么。这正是我们在人工智能研究报道 中关注的那种谨慎的逆向实验。
一个有知识边界的沙箱
现代法学硕士几乎接受了所有方面的培训,这使得几乎不可能判断所展示的技能是在培训期间真正学到的还是仅仅通过正确的提示而获得的。该团队的解决方案是限制训练分布本身。从 FineWeb-Edu 开始,他们通过符合幼儿园到 5 年级通用核心标准的五级过滤管道,提炼了一个包含 880 亿代币的语料库(称为 LittleCurriculum)。明确排除了 5 年级以上教授的概念、事实和词汇。
在这个语料库上,他们从头开始训练了三个尺度(0.6B、1.3B 和 5B 参数)的模型,每个模型都附带了一个匹配的控制模型,该模型是在具有相同架构和代币预算的未过滤数据上进行训练的。结果是一个足够流畅的模型,可以进行开放式评估——你可以在浏览器中与托管的 5B 版本聊天——但又具有清晰的、可解释的知识边界:如果它不在基础课程中,模型就永远不会看到它。
诱导,而非获取
核心发现很直白:让模型变得更智能的标准工具包放大了 LittleLearner 已经知道的知识,但没有一个能够有意义地改善超出范围的性能。
缩放提高了模型受控知识的准确性,并沿着相同的学习轨迹适度扩展,但对于需要 5 级以上材料能力的问题几乎没有作用。 使用 GRPO(推理模型热潮背后的强化学习方法)进行的后训练显着提高了范围内的 K-5 能力,但即使使用范围外的数据进行训练,也无法恢复超出 K-5 的能力。 上下文学习**,将知识填充到提示中的日常魔法,帮助模型使用它所拥有的知识,但没有解锁超出边界的新推理。简而言之,预训练过滤器设置了有效的能力上限。作者将这一结果作为该领域不断模糊的区别的证据:训练后和提示引发;预训练获得。
干净的控制、公共检查站
方法论赋予了这些主张以力量。因为每个 LittleLearner 模型都附带匹配的未过滤控制(相同的架构、相同的令牌计数、相同的训练配方),所以团队可以将任何行为差异单独归因于课程过滤器。经过 MathCAMPS 基准培训的数学专家让研究人员根据学校成绩对表现进行评分,准确追踪范围内能力的终点。与大多数前沿论文不同的是,一切都是公开的:语料库、HuggingFace 上所有三个尺度的基础和训练后检查点,以及托管的聊天演示,因此独立团队可以自己探索边界。
这种开放性正在加剧黑客新闻的争论。评论者一直在测试托管模型在其知识边缘的行为(无论是在超过 5 年级时放弃、猜测还是产生幻觉),并对其影响进行了争论:一些人将结果视为推理模型炒作的坏消息,另一些人指出网络规模的预训练数据包含的内容远远超出了小学概念,因此前沿模型的上限相应更高。该论文的作者本人在这一点上很谨慎:他们的主张是标准干预措施对于已知的受控教育模型无法做什么,而不是对前沿实验室的直接预测。
为什么它在课堂之外很重要
该实验直接反映了人工智能领域的实时辩论。人工智能实验室在训练后方案上花费了数十亿美元,其前提是强化学习可以使基础模型远远超出其原始能力。 LittleLearner 认为,这些收益可能很大程度上存在于预训练数据支持的范围内,并受其限制。这是一个需要更多地关注数据管理以及对“新兴”训练后能力的说法持怀疑态度的论点。
该版本也是一个真正的研究工具,而不仅仅是一篇论文。该团队公开发布了 LittleCurriculum 和所有模型检查点,项目页面概述了沙盒能够进行的实验:强化学习是否能够真正创造能力而不是奖励能力,模型如何有效地学习真正的新概念,例如引入负数时,以及机器和孩子在学习分数时是否需要类似的接触或犯类似的错误。
对于一个很少得到干净控制的领域来说,具有明确指定教育的模型是一份难得的礼物。对于其他人来说,这是一个值得放在桌子上的提醒:没有任何模特或个人能够从他们从未被教导过的东西中推理出来。
保持人工智能领先地位
每日发布重塑人工智能研究的同行评审级报道。为我们的中心添加书签,了解最新的人工智能发展。
阅读更多人工智能新闻 →