AI 数学突破周:OpenAI 一夜 722 篇,Claude 证出概率论圣杯
10 月 6 日 21 点 47 分(UTC),OpenAI 在 GitHub 上创建了一个名为 math 的仓库。半天之内,六千多个账号给它点了星。
仓库里躺着 722 篇数学手稿,附源码、推理摘要和部分 Lean 形式化证明,覆盖数论、代数几何、理论计算机、统计力学等十几个方向,全部出自同一个尚未发布的内部模型。按 OpenAI 自己的统计,这批手稿对应约 377 个公开问题的解答(也有媒体整理为 372 组结果),而模型尝试过的问题约有 4000 个,绝大多数以失败告终。
八月底,一位 Anthropic 工程师把一份由 Claude 生成、经 Lean 验证的证明悄悄放上 GitHub,对象是概率论里悬置近 70 年的渗流猜想。没有官方公告,没有博客文章,到截稿时 Anthropic 仍未发过一个字的正式说明,证明就摆在那里,自己走进了世界。
下文盘点这 722 篇手稿的成色与成本,拆解那份渗流证明的来龙去脉,然后回到数学界这两个月的集体反应,最后说清这波突破对"AI 加速"争论意味着什么。
一夜七百篇
- 准黎曼猜想:模型给出 ζ 函数与所有狄利克雷 L 函数在实部大于 7/8 区域内无零点的证明,零点可能出现的范围被向中间推了一大截;同组另一份独立证明把边界收到 11/12,并一并排除了困扰数论界近百年的西格尔零点。此前数学家连"实部大于 0.99 的竖带内无零点"都证不出来,而离黎曼猜想要求的那条 1/2 直线,则仍有距离。
- 希尔伯特第十问题(有理数版本):不存在判定整系数多项式有无有理数解的通用算法。整数版本 1970 年已有答案,有理数版本悬置了五十多年。
- BSD 猜想(特例):对满足特定条件(Selmer 余秩为零或一)的椭圆曲线给出完整公式,结合仓库里另一组结果,按密度计可覆盖绝大多数二次扭曲。千禧难题的特例推进,离全解尚远。
- 霍奇猜想(特例):处理带复乘结构的阿贝尔簇(覆盖全部维度与余维)和 K3 曲面的乘积,同样是特例而非全解。
- 两个常数问题:一篇手稿声称 π 的无理性指数恰为 2,此前最好的结果只压到 7.1 附近,2 是理论最优值;另一篇声称证明了卡塔兰常数的无理性,这个问题此前没有公认答案。
- 唯一游戏猜想:2002 年提出,牵动一大批组合优化问题的近似难度,2018 年数学界只拿下弱化版本,这次手稿声称给出了完整证明。
按 OpenAI 的说法,约一半结果已经通过 Lean 形式化验证。Lean 是一种把证明写成计算机可检查代码的语言,编译通过即意味着推理链条在公理体系内无懈可击,而且任何人都可以重跑检查。OpenAI 称已完成的验证里没有发现模型的错误,个别形式化过程反而找出了既有数学文献里的问题。这个说法目前是厂商自报,尚未见独立复核,但好在验证本身可重跑,属于可以兑现的承诺。722 篇里唯一经过人工编辑的一篇,恰好是 ζ 函数无零点区域那篇,看起来 OpenAI 也清楚,最敏感的结论需要人手把关。

从百万美元到三小时
9 月初,OpenAI 宣布模型给出纳维-斯托克斯方程的相关证明。据 Quanta 报道,那次计算动用了数百万美元的算力,由一万个智能体组成的蜂群并行作业。一个多月后,同一个公司的同类发布,平均每个结果消耗的算力约为"ChatGPT Pro 思考三小时"。OpenAI 在新闻稿里说,这批新结果与纳维-斯托克斯那套流程"精神上完全不同"。
三小时说的是平均数。两处例外没有走标准流水线,ζ 函数无零点区域和复乘阿贝尔簇上的霍奇猜想消耗的算力远高于平均,具体数字 OpenAI 没有给出。
约 4000 个尝试的问题,产出约 377 组结果,绝大多数尝试失败。这套系统的做法是大规模试错,再把成功案例打包发布。模型本身何时公开,OpenAI 的说法是等到认为安全的时候。
从百万美元级的蜂群作业到三小时的高阶订阅,单问题算力成本塌掉的幅度,比任何基准测试的分数都更能说明"AI 做研究"这件事的斜率。
概率论的圣杯
时间回到 8 月 28 日。Anthropic 员工 Justin Leder 在公司名下的 formal-math 仓库提交了一个目录,里面是一份 Lean 证明和一份由 Claude 写的摘要,主题是渗流理论中的 θ(p_c)=0 猜想。他没有渗流方向的发表记录。九月初消息在社交平台扩散,10 月 1 日 Quanta 系统报道,10 月 7 日中文圈深度稿落地。
渗流问题 1957 年被提出,原型是液体如何穿过多孔介质。想象一张巨大的网格,每条边以概率 p 连通。p 很小时间片孤立,p 很大时出现贯穿整张网的无限连通簇,临界概率 p_c 就是两者之间的分界,好比水在零度结冰的相变。数学要问的是,恰好在临界点上,无限连通簇出现的概率是多少。若为零,相变连续;若为正,系统在临界点瞬间长出贯通网络。二维情形 1980 年解决,十维以上也早有答案,唯独 3 到 10 维悬置至今。三维是我们生活的空间,四维是相对论的时空,这些最要紧的维度恰恰是几十年来啃不动的部分。
转机在 2024 年出现。两位数学家证明,只要证出某个形式相对简洁的不等式,3 到 10 维的结论自动成立,整道题被压缩成一块跳板。此后两年,这个不等式卡住了所有人。这次的证明没有另起炉灶,Claude 在 Lean 的约束下调用人类已有的分析工具,用数千行形式化代码把这个不等式压死。接受 Quanta 采访的一位数学家评价它聪明且技术上精湛,但不含实质性的新思想,真正的突破是 2024 年那篇压缩论文。同一位数学家自己借大模型之力,一天之内把证明推广到了另一类渗流模型,他苦做八年没有进展的项目,如今在 AI 协助下接近解决。
跳出跳板的那两位原作者态度谨慎得多。其中一位表示对这一宣称暂不置评,还在等 Anthropic 拿出"人类能读得懂的版本",并说明证明是如何做出的。Anthropic 没有回应媒体的置评请求。
8 月 30 日,2022 年菲尔兹奖得主、渗流领域的旗帜性人物 Duminil-Copin 恰好发文讨论 AI 对数学的冲击,举的例子正是这个猜想。他写道,自己多年攻坚全部失败,但失败的草稿孕育了几十个想法,被他用到其他领域,成就了他后来获奖的那些工作。这篇博文的主题与两天前悄悄上库的证明互为注脚,人类在这个猜想上收获的全部价值,恰恰不在那份证明里。

数学界的两个月
- 6-02:Leiden 宣言发布,措辞克制、追求共识,三个多月只积累了有限的签名。
- 8 月:据 WIRED 报道(中文媒体转述),OpenAI 召集约 40 名数学家讨论成果该怎么发布;部分与会者的记忆是"不会一次全放",OpenAI 发言人则表示不清楚有过这样的承诺。
- 9-08:纳维-斯托克斯证明公布,随即与另一组数学家爆发归属争议,双方几乎同时拿出相近的结果;一位菲尔兹奖得主用"数学界有史以来未见过的浩劫"形容自己的感受(中文媒体转述口径)。
- 9-11:25 位菲尔兹奖得主联名发文,措辞不再克制:AI 公司把解题当作能力标杆来推进,对数学科学与数学共同体有害,双方目标严重错位。数日内联署研究者超过 7400 人,多于此前磨了三个多月的宣言。
- 9 月中:陶哲轩在两份宣言上全部签名。他是过去几年最著名的"AI 用于数学"布道者,组织过 OpenAI 资助的研讨会,如今写道"情况已显著恶化";他在社交平台的说法更直接,开放问题的解正在被大规模收割,这种收获方式不可持续,整片数学领域会因此变得贫瘠。
- 9-29:普林斯顿高等研究院的独立顾问组发布"负责任发布"通用准则,基于六百多份问卷。这个顾问组的成立方式本身就是信号,OpenAI 最初找几位数学家想设外部顾问委员会,数学家们反手建了个独立组织,不收酬劳,声明愿意服务任何 AI 公司。
- 10-06:顾问组就 OpenAI 的发布表态,咨询角色不构成对结果或过程的认可,发布是"人类理解过程的开始而非完成",数学家必须能提出自己的问题,算力与工具的公平获取是这种自由的前提。
- 10-06:Hexagon 上线,一个不依赖任何 AI 公司的数学与理论计算机科研平台。

加速与治理
Hinton 联合 22 位作者在 10 月初发表了首篇系统性研究"AI 自主改进研发"的论文(中文圈 10 月 5 日报道),给出的研发回报率中心估计在 1.2 到 1.9 之间;按论文的外推,若研发完全自动化且回报率维持,一年半内 AI 的进步速度可提升十倍,一年的进步压缩进五周。论文转引的实验室内部数字(如获批代码中 AI 生成占比超过八成)均为实验室自报,回报率本身是外推,论文的基调也明确说了证据不足以证明智能爆炸已经发生。这周数学领域发生的事,给这条外推补上了微观注脚,同一个公司,解一道题的算力成本从百万美元级降到三小时级,证明的产量从一个月一篇变成一夜 722 篇。数学恰好是验证基础设施最完备的学科,于是也最先被成规模地收割。
数学界两个月里搭出了完整的链条,独立顾问组、发布准则、联署宣言、替代平台,再加一条技术防线,形式化验证。任何一环单拎出来都不新鲜,难在全部真实运转了起来,这在目前所有关于"AI 失控"的讨论里还没有第二个样本。多数行业对 AI 失控的应对还停留在事后处置,高监管领域的治理框架大多停在纸面。数学界的做法提供了一个可拆解的模板。
不指望公司自律,发布冲动由独立建制接住。
证明成立与否,交给机器可检验、任何人可重跑的形式化验证守住。
社区的议价权,由替代平台来保。
OpenAI 称将出资组织研讨会,帮助数学界消化这批手稿。顾问组的回应已经很清楚,材料公开只是开始,判断要由数学共同体自己做出。六千人给仓库点了星,而按数学家自己的说法,9 月那篇流体力学证明,专家们研究到现在还没读完。这场消化的时间单位,大概率不会是周。
参考
- OpenAI:Sharing AI Progress in Mathematics(2026-10-06)
- Quanta Magazine:Deluge of 377 OpenAI Proofs Bewilders the Math World(2026-10-06)
- Quanta Magazine:Major Lattice Proof Percolates Through Math(2026-10-01)
- AGMAI:On OpenAI’s Release of Mathematical Results(2026-10-06)
- 量子位:OpenAI 一夜甩出 722 篇数学论文(2026-10-07)








