OpenAI 的 GPT-5.6 Sol Ultra 解决了困扰人类 50 年的数学猜想
据报道,OpenAI 最新的推理模型 GPT-5.6 Sol Ultra 在图论领域取得了突破,解决了一个自 20 世纪 70 年代以来一直悬而未决的数学猜想。通过利用极强的计算持久性和多智能体架构,该模型在不到一小时的时间内就给出了完整的证明。
破解图论之谜
该猜想涉及图论中的一个基本问题:在任何由顶点和边组成的网络中,是否可以找到一组回路,使得每条边都被恰好遍历两次。尽管在过去的五十年里,数学家们已经为特定情况找到了部分解决方案,但通用的证明一直难以实现。
曼彻斯特大学的数学家 Thomas Bloom 将该证明描述为“简短、基础,本可以在 20 世纪 80 年代就被发现”。有趣的是,该解决方案并不需要发明全新的数学理论;相反,它巧妙地综合了现有的工具和已知的数学框架。
机器持久性的力量
一个关键问题随之而来:如果数学原理是“基础”的,为什么人类在 50 年里都没能解决它?Bloom 指出,该解决方案需要一种微小且违反直觉的推理转折。人类数学家通常遵循逻辑路径,一旦这些路径失败,就会得出问题无法解决的结论。
相比之下,GPT-5.6 Sol Ultra 展示了一种“机器持久性”。它不会产生挫败感这种认知偏差。相反,该模型会不断探索逻辑和标记的细微变化,直到找到成功的路径。这种无需“认输”便能对逻辑排列进行穷举的能力,使 AI 能够绕过阻碍人类研究人员的思维障碍。
高级提示工程与多智能体架构
Sol Ultra 的成功不仅仅是原始智能的结果,还得益于高度复杂的提示工程。为了确保模型不会默认回答“我不知道”,研究人员使用了一系列严格的指令:
- 强制假设: 提示词迫使模型假设完整的证明确实存在,从而防止其声称该猜想尚未解决。
- 信息隔离: 禁止模型通过搜索互联网来验证该问题是否已被解决。
- 多智能体对抗测试: 使用了一个由 64 个智能体组成的系统。其中许多智能体对哪种逻辑方法有效并不知情,以确保独立的推理;而对抗性智能体则负责仔细检查候选证明是否存在特定错误,例如错误识别的闭合路径。
关于 AI 创造力与引用的争论
这一突破重新引发了关于大语言模型(LLM)究竟是真正的“具有创造力”,还是仅仅是现有知识的高级重组者的争论。Bloom 指出,该证明的核心思想可以追溯到 Bermond、Jackson 和 Jaeger 在 1983 年发表的一篇论文。他批评 OpenAI 未能引用这项前人工作,并指出 AI 生成的论文经常在没有适当归属的情况下使用现有策略。
虽然科学界仍在等待完整的数学验证,但这一事件标志着 AI 格局的转变。大规模 AI 模型正越来越多地被部署用于攻克开放性的科学问题,有可能揭示那些一直就在人类触及范围内的解决方案。
核心要点
- 持久性胜过复杂性: AI 解决这一长期存在的问题并非通过发明新的数学,而是通过以人类所缺乏的、不知疲倦的逻辑变体来应用现有理论。
- 严格约束驱动结果: 使用“对抗性”提示并禁止互联网搜索,迫使模型去寻找解决方案,而不是提供标准的“未解决”回答。
- 归属挑战: 该事件凸显了 AI 研究中日益增长的一个担忧,即当模型重组现有科学文献时,缺乏适当的引用。
