OpenAI 写道,Astra 帮助解决的问题“至少十年来,在大多数情况下,更长时间没有在其核心结果上取得任何进展”。研究结果涵盖高维几何、编码理论、算术电路复杂性、群论、量子复杂性、晶格密码学和极值组合学等领域——这些领域的进展通常以年为单位来衡量,而不是单项研究的运行。
经过验证的证据,而不仅仅是答案
Astra 的输出与聊天机器人猜测数学的不同之处在于验证。 OpenAI 表示,人类研究人员使用相同的模型来准备论证作为手稿,然后 Astra 将每个论证形式化为精益证书。 Lean 是一款开源证明助手,可以通过机器检查数学论证,这意味着其他数学家不必相信结果——它们可以在几秒钟内通过软件独立验证。
这种区别很重要。语言模型可以产生看似合理的证明,但其中包含微妙的致命错误。通过将每个论点转化为精益,OpenAI 将营销主张转化为可检查的工件。据报道细节的 BleepingComputer 称,具体进展包括证明了非实体群的存在,解决了群论中的一个重大悬而未决的问题;反驳康尼斯的刚性猜想;高维球体堆积的新界限;其结果解决了最初由多产数学家 Paul Erdős 提出的几个问题。
OpenAI 指出,以目前的 API 费率计算,找到这些解决方案所需的代币总数约为 2,000 美元——这是关于现代数学发现的计算足迹的一个引人注目的数据点,也是一个让资金充足的学术团队(而不仅仅是实验室本身)能够进行前沿水平研究的数据点。
数学家的反应
据 The Decoder 报道,曼彻斯特大学数学家托马斯·布鲁姆 (Thomas Bloom) 运营着 Erdős 问题参考网站 erdosproblems.com,他将这一结果称为 X 上的“大新闻”。他认为它们比 5 月份发表的单位距离猜想的反例更重要。 “也许不会比单位距离的证明大,但就结构而言,这很大,”布鲁姆写道。
布鲁姆还反驳了人工智能正在取代数学家的说法,他认为,当该系统借鉴了一个多世纪的理论、由数学家构建并接受了数学家所写的所有内容的训练时,这种说法毫无意义。
Astra 所依赖的测试时推理技术背后的研究人员诺姆·布朗 (Noam Brown) 则更加慎重。他在 X 上发帖称,“遗憾的是,还没有千禧年奖问题”,指的是克莱数学研究所为每个问题提供 100 万美元奖金的七个著名问题——自 2000 年宣布奖项以来,只有一个被解决。
并不是每个人都印象深刻。人工智能评论家加里·马库斯 (Gary Marcus) 在 Substack 的一篇文章中称该模型“令人惊叹,但被严重夸大了”,每当前沿实验室声称取得了里程碑式的成果时,这都是常见的怀疑论调。真正的技术成就和宣传框架之间的紧张关系可能决定了 Astra 的受欢迎程度。
适合长时间任务的新模型系列
The Information 独立证实,Astra 是专为长时间运行的工作负载而构建的新型号系列。 OpenAI 将其描述为一个系统,可以让多个人工智能代理在更大问题的不同部分进行协作——这种设计专门针对需要数小时或数天而不是几秒钟的任务,例如证明定理或重构大型代码库。
BleepingComputer 报道称,OpenAI 尚未决定该模型是否将以 GPT-5.7、GPT-6 或其他名称 的形式发布。据 The Decoder 报道,首席执行官 Sam Altman 已经在华盛顿特区展示了 Astra,这表明该公司认为该系统已经足够成熟,可以提交给政策制定者。
政府审查障碍
也许最重要的细节是监管。据 The Decoder 报道,Astra 将成为首批通过美国政府计划审查程序的车型之一,该程序在公开发布之前需要获得官方批准。这给发布时间表增加了一层政治不确定性,而这是早期旗舰机型从未遇到过的,并提高了 OpenAI 如何描述 Astra 功能的风险。
首次亮相也是在激烈的公开重量级比赛中进行的。几天前,Thinking Machines Lab 发布了 Inkling-Small 开放权重模型,中国实验室继续推动开放权重前沿系统。 Astra 标志着 OpenAI 的赌注,即通过 Lean 等工具验证的专有大规模推理仍然是实现最大突破的途径。
目前,《Astra》尚未发布。但它在数学上的首次亮相已经重新构建了关于前沿人工智能系统可以为纯科学做出哪些贡献,以及公众应该如何仔细审查伴随它们的主张的讨论。
保持人工智能领先地位
想要跟上 Astra 等发展以及更广泛的前沿模型竞赛吗?为我们的最新人工智能发展中心添加书签。
阅读更多人工智能新闻 →