OpenAI 发布了由未发布的内部前沿模型生成的 722 篇数学手稿,并在 Apache-2.0 许可下将完整集合放置在公共 GitHub 存储库中。该发布是在 2026 年 10 月 6 日题为“分享人工智能数学进展”的研究文章中宣布的,是迄今为止人工智能生成的数学结果的最大单一转储之一,它附带了正式的精益证明检查、删节的推理摘要以及关于每个结果消耗多少计算量的不同寻常的细节。

这一举动落在了一个已经处于边缘的领域。 《纽约时报》报道称,这一发布进一步扰乱了数学界,他们花了数月时间努力研究人工智能系统,产生了严肃的研究成果,而《科学美国人》则将 OpenAI 描述为“在一个已经处于震惊状态的领域释放了数百个数学成果”。对于跟踪最新人工智能研究进展的读者来说,该版本是前沿实验室如何在不引发信用纠纷的情况下共享机器生成的科学的测试案例。

存储库内有什么

该集合位于 GitHub 上的 openai/math 存储库中。根据其自述文件,内容是由内部 OpenAI 模型生成的数学手稿和支持证明工件,作为开放研究问题模型开发评估的一部分进行组装。当前目录包含 722 份手稿,分为 372 个系列,每个系列将相关论文分组,其中可能包括主要结果、伴随论证、后果或替代证明,每个论文均按数学学科分类。

预印本目录包含 PDF、源文件以及每个手稿的引用和构建说明。精益图书馆将正式证明及其相关论文和验证配置进行编目。并非每份手稿都已形式化:许多结果都附带了精益形式化,精益是一种用于让计算机逐行检查校样的编程语言,但自述文件警告说,一些非形式化的结果可能包含问题。 OpenAI 表示将迅速解决此类问题,并致力于保留该集合的公开发布历史记录,将更正和修订记录为新版本,同时保持早期版本可访问。每个手稿目录还带有一个 BibTeX 块以供引用。

结果是如何产生的

绝大多数结果来自使用未发布的内部 OpenAI 模型的单一固定程序。在评估过程中,该模型提出了大约 4,000 个问题。 OpenAI 报告称,发布的结果平均消耗了大约三个小时的 ChatGPT Pro 思维计算,这种透明度在业内仍然很少见。该公司表示,在其现有数学基准的性能饱和后,它扩大了这些评估,并且一些输出建立在其自己的模型产生的早期结果的基础上。要求适当的重要性水平并将原始输出汇总到系列和手稿中,从而产生了出版的目录。

两个指定的例外偏离了该程序:为黎曼 zeta 函数建立零自由区域的工作,并为可读性而人工编辑了覆盖 Re(s) > 11/12 区域的文章,以及 CM 阿贝尔簇的霍奇猜想的证明。两者都是严肃的主流数学,现在都将面临社区审查。

还发布了该模型推理的十个删节摘要。它们涵盖的结果包括 pi 的无理指数、对称和一般马勒猜想、自由群因子的同构、算术级数的拟多项式界、特征二中卡普兰斯基的直接有限猜想、稀释自旋玻璃的 Mezard-Parisi 公式、量子海森堡铁磁体中的自发磁化以及三维相对论 Vlasov-Maxwell 系统。

咨询小组帮助制定了发布版本

OpenAI 表示,它在制定共享结果的最佳实践时咨询了高等研究院数学和人工智能独立咨询小组。在收到数学界的 600 多条回复后,该小组于 2026 年 9 月 29 日发布了负责任的发布建议。这些建议很直白:“我们不认可这种做法,我们要求他们停止在专有模型上测试高级数学问题。”该组织敦促实验室将结果存放在人工智能实验室无法控制的学术存储库中,分配持久的可引用标识符,披露模型名称、使用的提示和总结的推理链,并避免将结果发布视为营销工具。

OpenAI 的发布显然是为了遵守该框架而不是违背它。社会是否接受是另一个问题。该咨询小组的调查特别询问了一种情况,在这种情况下,实验室宣布了许多结果的存在,但没有提供细节,而出现的建议反映了对公布速度超过验证速度的深切担忧。

验证负担转移到数学家身上

现在,实际的挑战属于在职数学家。可以机械地检查正式的精益证明,它们的存在大大降低了错误的风险。但是,自述文件本身将其标记为潜在缺陷的未经形式化的手稿需要传统的同行评审,而 722 份手稿远远超出了社区能够快速吸收的范围。还有优先级和信用的问题:花了数年时间研究这些问题的数学家会想确切地知道模型被问到了什么,给出了什么,以及是否包含了任何人类结果。 OpenAI 发布的提示摘要和计算统计数据旨在提前回答其中一些问题。

该版本还设定了竞争对手可能被迫遵循的模板。 Anthropic、Google DeepMind 和其他拥有能够进行研究级数学的前沿模型的实验室现在面临着咨询小组阐明的事实上的规范,即隐藏在专有模型上的结果要么应该发布完整的出处,要么根本不被嘲笑。

目前,存储库已上线,形式化工作正在进行中,并且正在公开发布更正版本。这是否会成为人工智能生成数学的标准剧本,还是实验室和他们所利用的研究社区之间不断扩大的冲突的另一个爆发点,将取决于接下来几周的审查进展情况。

保持人工智能曲线的领先地位

人工智能生成的科学正在从新闻稿转向同行评审。 关注 aibuzzwire.news 上的人工智能突发新闻,了解每项重大研究发布、模型发布和政策转变的报道。

阅读更多人工智能新闻 →