去中心化人工智能实验室 Prime Intellect 发布了一项大规模实验的结果,测试了当今前沿人工智能模型执行自主机器学习研究的能力,其中最好的模型在著名的社区基准上非常接近人类世界纪录。
该项目名为 NanoGPT Speedrun Frontier,于 8 月 22 日发布,由 18 个前沿模型的 153 次自主运行组成,尝试进行 nanoGPT 优化器 speedrun——研究人员在这场竞赛中寻找最有效的方法来训练小型语言模型以达到固定的质量目标。这个故事很快登上了《黑客新闻》的头版,吸引了数十条评论,讨论研究结果如何说明人工智能真正的科学发现能力。 更多相关背景,请参阅我们的AI行业报道。
NanoGPT Speedrun 到底是什么
该基准来自 Keller Jordan 和一长串社区贡献者维护的 modded-nanogpt 存储库。这一挑战说起来看似简单:使用 8 个 NVIDIA H100 GPU,尽可能快地训练一个语言模型,使其在 FineWeb 验证集上达到 3.28 交叉熵损失(Andrej Karpathy 的原始 GPT-2 复制在 45 分钟后达到的性能水平)。
通过过去两年中数百个社区的贡献,人类记录已被缩短至 75 秒以下和 4 亿个训练代币以下,比原始方案提高了 30 倍以上。获奖解决方案读起来就像现代机器学习工程的目录:Muon 优化器、QK-Norm 的旋转嵌入、ReLU 平方激活、注意力的 FP8 量化和 MLP 传递、具有滑动窗口模式的 Flash Attention 3 以及数十种相互堆叠的其他技术。
Prime Intellect 的测试使用了基准测试的优化器轨道,根据存储库的文档,它最大限度地减少了达到目标损失所需的训练步骤数,并受到固定架构、数据集和批量大小的影响,并且具有有效无限的挂钟预算。这使得它成为纯粹的算法发现测试,而不是原始硬件速度。
实验如何进行
18 个模型中的每一个都自动完成任务:提出对训练方案的更改、运行实验、检查结果和迭代——使用固定的验证脚本和固定的随机种子,确保所声称的改进是真实的,而不是幸运的运行。正如一位《黑客新闻》评论员所总结的那样,模型被要求研究如何改进小模型的训练,反复尝试更改、测试它们,并使用结果来决定下一步要尝试什么。
这些模型通过各种代理工具运行 - 包括 claude-code、OpenAI 的 codex、kimi-code、grok-cli、qwen-code 和 Prime Intellect 自己的 prime-agent - 并且团队跟踪每次运行的令牌消耗、实验计数、工具调用和代理时间。总的来说,该实验每个顶级模型消耗了数亿个代币,整个网格消耗了数十亿个代币。
排行榜:《神鬼寓言 5》领先
主要结果是:名为《神鬼寓言 5》的模型通过克劳德代码工具运行,缩小了基线配方与人类记录之间 81.7% 的差距,在排行榜指标上的最佳验证结果为 2,726。达到这一目标需要累计代理时间 8.7 天、大约 8 亿个代币、811 次实验和大约 3,000 次工具调用。
紧随其后的是 Opus 5,它缩小了 53.6% 的差距,紧随其后的是 Kimi K3,在 Prime Intellect 的主要代理工具驱动下为 52.2%(通过 kimi 代码为 45.8%)。 Opus 4.8 的占比为 39.4%,几个 GPT-5.6 变体的占比约为 11% 至 36%,Sonnet 5 的占比为 26.8%,Grok 4.5 和 Qwen3.8 Max 均达到约 24.6%。
再往下看,DeepSeek V4 Pro 缩小了 12.3% 的差距,GPT-5.5 达到 8.1%,而较旧的 Kimi K2.7 则达到 7.2%。值得注意的是,最近发布的一个模型——GLM 5.3——在发布时仍在运行,尚未经过验证的记录,这提醒人们,基准测试会惩罚那些无法可靠地验证其自身改进的模型。
为什么它很重要
像这样的基准很重要,因为它们衡量了编码排行榜无法衡量的东西:在几天而不是几分钟内运行真正的研究循环(假设、实验、分析、修订)的能力。这种能力是新兴的自主人工智能研究领域的基础,其中代理的任务不是按照规范编写代码,而是发现没人向他们展示过的东西。
结果的分布本身就具有丰富的信息。根据该项目的文章,实验中几乎每个模型都发现了相同的核心获胜想法——区分最佳运行的是实验留下的东西:更强的代理在噪声结果中保留微弱信号足够长的时间来验证它们,并更好地理解自己的实验数据。
社区的警告
《黑客新闻》评论者提出了公平的方法论观点。不同模型的努力设置和利用情况各不相同——Fable 5 在高推理设置上运行,而 Opus 5 在最大推理设置上运行——18 个模型运行 153 次的算术意味着某些模型比其他模型获得了更多的尝试。模型的排名是否反映了其原始研究能力或其利用的质量仍然是一个悬而未决的问题。
尽管如此,前进的方向还是明确的。当最快的人类双手需要多年的集体努力才能达到当前记录时,最好的自主代理现在可以在一周多一点的计算时间内缩小大部分差距。下一个问题——是否有任何模型可以关闭剩下的 18.3%——可能会比预期更快得到答案。
有关塑造人工智能前沿的基准和研究的更多信息,请关注 AI Buzz Wire 的持续报道。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →