就在 OpenAI 推出其最强大的模型一天后,该公司表示,该系统已经生成了循环双盖猜想的完整证明——这是图论中著名的开放问题,大约半个世纪以来一直困扰着数学家。
OpenAI 研究员 Ethan Knight 于 2026 年 7 月 10 日宣布了结果,并发布 GPT-5.6 Sol Ultra“在不到一小时的时间内使用 64 个子代理生成了 50 年前的循环双盖猜想的证明”。这一说法很快登上了黑客新闻的榜首,吸引了数学家和工程师的数百条评论,争论该证明是否成立。
对于任何追踪最新人工智能发展的人来说,结果是前沿模型的发展方向的惊人展示,并提醒他们,他们的数学主张仍然需要用老式的方式进行检查。
什么是循环双覆盖猜想?
这个猜想属于数学的一个分支,称为图论。简单来说,它提出了一个看似简单的问题:任何“无桥”图的边(没有边,删除它会将其分开)是否总是被一组循环覆盖,以便每个边都恰好出现两次?
多年来,该问题由几位数学家独立提出,包括 1979 年的 Paul Seymour 和 1973 年的 George Szekeres,其早期根源于 W. T. Tutte、Alon Itai 和 Michael Rodeh 的工作。尽管它的陈述很简单,但它成为该领域最著名的未解决问题之一,并且只有特殊类别的图才知道部分结果。
根据 OpenAI 发布的证明说明,该论证将问题简化为无环三次图,然后依赖于经典结果 - F32 群上的无处零流定理(相当于 Tutte 的 8 流定理) - 以及将边标记转换为循环双覆盖所需的结构的关键线性代数步骤。这篇文章只有几页长,而且值得注意的是,正如一位《黑客新闻》评论员所说,“没有使用过去 30 年内发展起来的数学”。
GPT-5.6 Sol Ultra 如何实现这一目标
这个结果与普通聊天机器人答案的不同之处在于模型的部署方式。 GPT-5.6 Sol Ultra 在 OpenAI 的“多代理 v2”模式下运行,启动了一个由多达 64 个合作子代理组成的系统,并行探索不同的证明策略。 OpenAI 发布了完整的提示和证明,罕见地展示了系统的指令。
该提示指示模型“积极、动态地使用多智能体 v2”,以维持“多样化的方法组合”,并部署对抗性智能体来审核任何候选证据是否存在常见陷阱,例如伪装成循环的封闭路径或意外的循环推理。它甚至告诉系统“在考虑返回或放弃之前至少花 8 个小时”,尽管据报道最终运行不到一个小时就完成了。
在证明说明的“AI 使用声明”部分中,OpenAI 明确表示:“本说明中的证明完全归功于 GPT 5.6 Sol Ultra 和 Codex 的撰写(使用 GPT 5.6 Sol)。”
并不是每个人都相信
数学界的反应既兴奋又谨慎——这种怀疑是有道理的。截至发布时,该证明尚未在 Lean 等证明助手中得到正式验证,也未通过传统的同行评审。
在《黑客新闻》上,一些评论者指出,著名猜想的简短、优雅的证明值得特别仔细的审查。一位用户写道:“这是一个非常简短的证明,没有使用过去 30 年来开发的数学知识。” “这并不一定是错误的,但在缺乏精益机械化或适当同行评审的情况下,我认为现在发布这个还为时过早。”
其他人指出,图论领先的形式证明库还不够成熟,无法检查此类研究级别的结果,这意味着验证可能需要来自人类专家逐行阅读论证。 OpenAI 本身将这一公告视为更广泛模式的一部分:“更多的测试时间计算会带来更大的智能,”该公司表示,这表明多代理方法(而不是单一结果)才是它想要讲述的真实故事。
为什么它很重要
即使循环双重覆盖证明最终需要修正,这一事件也标志着大型语言模型在纯数学中的作用发生了有意义的转变。前沿人工智能系统此前已经在专门领域产生了新颖的研究成果——包括最近声称已解决几何和组合学问题的其他研究成果——但用一群协调一致的推理代理来攻击一个已命名的、已有数十年历史的猜想,大大提高了门槛。
对于研究人员来说,收获是双重的。首先,多智能体配方——许多独立的尝试、思想的交叉传播和对抗性审计——似乎是解决难题的真正有用的模板。其次,验证瓶颈现在完全落在人类身上:模型生成候选证明的速度比社区检查它们的速度快。
这种张力很可能定义人工智能辅助数学的下一阶段。正如一位评论者所说,如果这个证据成立,“有人将列出”其他长期存在的问题清单,以扔给下一代模型。
目前,数学家将用手中的铅笔仔细阅读这份三页纸的笔记,而人工智能行业的其他人则关注 GPT-5.6 长达一小时的努力是否会成为永久数学记录的一部分。
保持人工智能领先地位
有关前沿模型突破和 AI 研究报道的更多信息,请访问 AI Buzz Wire 主页。
阅读更多人工智能新闻→



