AI 快讯OpenAI组建数学顾问组
模型上新

OpenAI组建数学顾问组

2026-09-22T00:07:53.841Z
OpenAI组建数学顾问组

OpenAI近日成立“数学与人工智能顾问组”,此前其内部模型已解决或实质推进超过100个开放数学问题,并在单位距离问题、理论计算机科学等方向连续取得突破。

OpenAI组建数学与人工智能顾问组,AI已解决逾百个开放数学问题

OpenAI 正在把“AI 做数学”从一次次模型演示,推进成一项需要长期治理、同行审查和研究协作的基础设施工程。 9 月 21 日,OpenAI 宣布成立“数学与人工智能顾问组”(Advisory Group on Mathematics and Artificial Intelligence)。几乎同一时间,公司披露,内部 AI 系统已经解决或在超过 100 个开放数学问题上取得实质进展。

这件事的重点不只是“AI 又做出了一批证明”,而是 OpenAI 开始为数学研究建立一套外部顾问和评议机制。顾问组将帮助公司评估 AI 生成数学成果的可靠性、意义和潜在影响,但不会获得放缓、暂停或改变 OpenAI 当前数学研究方向的权限。

换句话说,这不是一个拥有“刹车权”的伦理委员会,而更像一个高水平的外部评议层:它可以指出证明哪里有漏洞、哪些结果真正重要、哪些只是形式上的技术推进,但 OpenAI 仍将继续按照自己的路线推进模型与数学研究。

OpenAI数学推理模型、数学家顾问组与形式化验证系统之间的协作流程示意图

顾问组成立,核心矛盾不是“AI会不会证明”

数学与人工智能顾问组是一个由数学家和 AI 研究人员组成的外部咨询机制,用于评估 AI 生成数学成果的正确性、原创性和长期影响。 OpenAI 没有把它描述成传统意义上的研究管理委员会,也没有承诺顾问组可以决定哪些方向必须停止。

这项安排反映出一个现实:AI 已经能够在不少数学问题上提出人类研究者没有预期到的构造、反例和证明路径,但“生成答案”与“确认答案”之间,仍然隔着一整套复杂工作。

一个数学证明是否成立,至少要回答四个问题:

  1. 逻辑上是否没有漏洞。 模型是否偷换了概念、遗漏了边界条件,或者把“看起来合理”当成了已经证明。
  2. 技术上是否真的解决了原问题。 有些结果只解决了特殊情形,却被包装成一般结论;有些结果改善了常数,但没有改变问题的本质难度。
  3. 数学上是否具有原创性。 模型可能重新组合已有定理,也可能确实发现了此前没人注意到的结构。
  4. 学术上是否值得关注。 一个形式上正确的证明,不一定会改变一个领域;真正重要的结果通常会打开新的研究路线。

过去一年,OpenAI 的数学项目已经从“让模型解竞赛题”进入“让模型处理研究级开放问题”的阶段。此时,最需要外部专家的地方,并不是告诉模型下一道题是什么,而是判断模型给出的结果究竟属于突破、改进,还是一个还没有完成的草稿。

从单位距离问题开始,AI连续碰撞数学难题

单位距离问题是平面上给定数量的点,最多能有多少对点之间的距离恰好等于 1 的组合几何问题。 这个问题由数学家保罗·埃尔德什于 1946 年提出,表述简单,却在近 80 年里持续吸引组合几何领域的研究者。

今年 5 月,OpenAI 宣布,其一个尚未公开发布的通用推理模型推翻了长期流行的结构猜想。数学界此前普遍认为,正方形网格在最大化单位距离点对数量方面已经接近最优;OpenAI 模型则给出了一类无限构造,证明可以在此基础上实现多项式级改进。

这项结果的特别之处在于,它并不是一个专门针对单位距离问题训练的系统,也不是把有限搜索空间全部枚举一遍的暴力程序。按照 OpenAI 的说法,该模型在评估埃尔德什问题时,自主提出了引入代数数论工具的证明路线,随后由外部数学家团队审阅并撰写配套论文。

这也是 AI 数学研究最值得关注的变化:模型不再只是把已知方法执行得更快,而是开始把一个领域中的工具搬到另一个领域。单位距离问题本身看起来是初等几何问题,但最终证明却借用了代数数论的思想。对数学家来说,这类跨领域连接往往比单纯得到一个更强的不等式更有价值。

8月公开十项成果:覆盖数学与理论计算机科学

AI 数学研究的“开放问题”通常指尚未被完整解决、但已有明确研究定义和可验证目标的数学问题。 8 月 1 日,OpenAI 又公布了十项数学与理论计算机科学成果,涉及高维几何、编码理论、群论、算子代数、量子复杂性、格密码学和极值组合学等方向。

这些成果并非全部意味着“一个领域被彻底解决”。更准确的说法是:其中一些问题被解决,一些问题获得了长期缺失的关键进展,还有一些结果改善了已知界限或排除了长期存在的猜想。

OpenAI披露的代表性结果包括:

  • 高维球体堆积: 给出新的密度上界,逼近 Cohn–Elkies 阈值。
  • 二元码与球面码: 针对给定最小距离,改进二元码最大规模的界,并在高维球面码中获得类似结果。
  • 非 sofic 群: 构造出非 sofic 群,推进群论中的核心开放问题。
  • Connes 刚性猜想: 反驳关于某些群能否由其冯·诺依曼代数唯一确定的长期猜想。
  • 算术电路复杂性: 给出新的复杂性下界,其中包括阶为 n^4/log n 的算术公式下界。
  • 量子并行重复: 为一般双人量子博弈证明带有指数衰减界的并行重复定理。
  • 最近向量问题: 证明该问题具有多项式因子近似困难性,与后量子密码学存在直接关联。
  • Ehrhart 体积猜想: 研究质心是唯一内部格点的凸体在各维度中的最大体积。
  • 多色 Ramsey 数: 给出多色三角形 Ramsey 数的超指数下界,解决 Erdős 第 183 号问题。
  • 极值数猜想: 推进极值图论中的紧致性猜想与退化性猜想,解决 Erdős 第 146 号和第 180 号问题。

OpenAI 还表示,这批结果由代号为 Astra 的下一代重要模型内部版本取得,随后由同一模型整理成论文草稿,并尝试转化为可以由 Lean 验证的形式化证明。按照公司披露的 Sol API 费率,模型寻找这些问题解法消耗的 Token 总成本约为 2000 美元。

这个成本数字很容易被误读。2000 美元不是“解决十个数学问题的全部成本”,它更接近模型推理阶段的直接计算费用,不包括研究人员筛选问题、核查证明、补全文稿、形式化验证、同行评审以及后续修改的时间成本。真正的研究成本,仍然明显高于模型账单。

“88小时解出千禧年难题”仍需要谨慎看待

千禧年大奖难题是克雷数学研究所于 2000 年公布的七个重大数学问题,每个问题的首个正确解答奖金为 100 万美元。 9 月中旬,OpenAI 对外宣布,其尚未公开的最新模型在 88 小时内解决了纳维–斯托克斯存在性与光滑性问题。

纳维–斯托克斯问题研究描述流体运动的偏微分方程,核心问题是:在三维情况下,方程的光滑初始条件是否始终会产生光滑、存在的解,还是可能在有限时间内形成奇异性。

按照 OpenAI 的说法,模型给出了一个声称能够构造奇异行为的证明。这一消息如果最终被数学界确认,将是 AI 参与基础数学研究以来最具象征意义的事件之一,因为它触及七个千禧年大奖难题中仍未解决的核心问题。

但这里必须区分三个层次:

  1. 模型生成了一个候选证明。 这说明模型具备处理长链条数学推理的能力。
  2. 研究团队完成了证明整理。 这说明人类研究者能够将模型输出变成可读、可审查的论文。
  3. 数学界确认其满足问题原始定义。 这才意味着该千禧年大奖难题真正被解决。

对数学而言,第三步最关键。证明不以发布会上的演示结果为终点,也不以模型声称“我已经证明”为终点。它需要经过专家阅读、反复质询、补充细节,必要时还要形式化到 Lean、Isabelle 等证明助手中。尤其是偏微分方程和流体力学问题,很多关键步骤涉及函数空间、正则性条件和极限交换,任何一处隐含假设都可能改变结论。

因此,OpenAI 这次声明的新闻价值很高,但学术结论仍应以完整证明公开、同行复核完成以及相关数学机构最终确认作为判断标准。顾问组的成立,正是为了处理这种“模型已经给出答案,但人类还需要确认答案意味着什么”的局面。

AI与数学家的关系,正在从助手变成合作者

AI 数学系统是能够生成、搜索、解释或形式化数学证明的人工智能系统,区别于只回答常规题目的聊天机器人。 这类系统的能力边界,已经从计算和知识检索扩展到猜想生成、反例搜索、证明策略发现和形式化验证。

过去,AI 更像数学家的计算器:它能快速验证大量特例,帮助寻找模式,或者把论文中的公式整理得更规整。现在的先进模型更像一个速度极快、但需要严格监督的研究助理。它可能在几小时内提出几十条路线,其中大多数是错的,少数路线可能包含一个人类研究者值得继续追踪的关键想法。

这也解释了为什么 OpenAI 没有把数学研究完全交给模型。数学研究不是单纯追求“答案正确”,还要判断问题的重要性、证明的简洁性、方法的可迁移性,以及它是否揭示了新的概念结构。一个模型可以找到反例,却未必理解这个反例为什么重要;它可以拼接出完整证明,却未必知道这套方法能否推广到其他问题。

陶哲轩等数学家此前提出过一个尖锐担忧:如果 AI 几乎不需要人类参与就能解决最难的问题,人类数学家可能失去通过解决问题来建立直觉和理解的过程。这个比喻很直接——机器替你完成了举重,但你本人并没有因此获得力量。

OpenAI 的顾问组因此面临一个比“检查证明”更大的问题:如何让 AI 提升数学研究效率,同时避免把数学研究变成一场只追求结果的自动化竞赛。

与传统数学软件相比,OpenAI的优势在哪里

| 方向 | 传统计算机代数系统 | 证明助手 | AI 数学推理模型 | |---|---|---|---| | 典型能力 | 符号计算、数值计算、公式化简 | 检查严格形式化证明 | 生成猜想、寻找证明路线、整理论证 | | 优势 | 结果稳定、计算效率高 | 逻辑可靠、可机器核验 | 能处理开放问题和跨领域线索 | | 局限 | 缺乏研究直觉 | 使用门槛高、形式化成本大 | 可能产生幻觉和隐含漏洞 | | 最佳角色 | 计算工具 | 最终验证层 | 研究探索与证明草稿生成器 |

从产品角度看,AI 数学模型最有价值的地方不是取代 Mathematica、SageMath 或 Lean,而是把这些工具串起来。模型负责提出假设、寻找结构和解释结果;计算系统负责验证大规模实例;证明助手负责检查逻辑闭环;人类数学家负责判断问题价值并修正研究方向。

这是一条比“一个模型单独解决所有数学问题”更现实的路线。OpenAI 目前公布的工作,也基本符合这种分工:模型负责发现,人类负责审阅,形式化系统负责验证,外部专家负责评价影响。

OpenAI现在最需要证明的,不是速度而是可靠性

AI 数学模型的核心竞争力,正在从“能否做出答案”转向“能否稳定地产出可验证、可复用、可解释的研究成果”。 OpenAI 已经展示了模型在开放问题上的速度和跨度,但接下来还要回答三个更难的问题。

第一,模型能否持续复现结果。一次成功可能来自偶然的搜索路径,也可能依赖某个尚未公开的内部技巧。只有在不同问题、不同模型版本和不同研究团队中稳定重现,才能证明这是一种能力,而不是一次性的研究事故。

第二,模型能否降低形式化成本。如果 AI 生成的证明仍需要数学家花数周逐行修补,那么它的效率优势会被部分抵消。真正成熟的系统,应当能够从自然语言证明逐步生成 Lean 可验证代码,并在出现错误时定位到具体命题和假设。

第三,模型能否解释自己的关键洞见。数学家不只需要知道证明成立,还需要知道为什么成立。一个无法提炼核心结构的黑箱证明,可能在短期内解决问题,却很难推动整个领域继续发展。

目前看,OpenAI 的十项成果和“逾百个开放问题”更像是一个研究规模的信号:AI 已经可以大规模进入数学前沿,但还没有让“数学研究”变成一个完全自动化流程。

OpenAI成立顾问组,意味着模型上新进入“科研治理”阶段

这次事件虽然被归入“模型上新”,但它的意义已经超出单个模型发布。OpenAI 没有公布一个面向公众的新模型名称,也没有推出一套普通用户可以直接体验的数学产品;公司真正发布的是一套围绕前沿推理能力建立的研究机制。

过去,模型升级通常通过上下文长度、基准分数、价格和速度来衡量。现在,在数学、代码、科学发现等领域,评价标准正在变复杂:模型是否提出了新想法,证明能否被独立验证,结果能否进入正式论文,是否能被其他研究者复用,这些指标比一次性跑分更重要。

OpenAI 数学与人工智能顾问组的成立,说明公司已经意识到:当 AI 开始参与高水平基础研究,产品评测、科学审查和社会影响评估不能再完全由内部团队完成。但顾问组没有权力减速或改道,也说明 OpenAI 仍将把数学推理视为模型能力竞赛的核心战场。

对开发者和深度用户而言,值得关注的不是“AI 是否已经取代数学家”,而是未来模型是否会成为一种新的科研基础设施。最理想的结果不是人类把所有问题交给模型,而是模型把搜索空间从几百条路线扩展到几百万条路线,再由人类挑选真正有意义的那一条。

截至 2026 年 9 月 22 日,OpenAI 已经把 AI 数学研究推到了一个新的阶段:从解决单个难题,转向系统性评估数百个开放问题;从内部模型演示,转向外部数学家参与审查;从自然语言答案,转向 Lean 等系统可验证的形式化证明。 这条路是否会带来下一代数学方法,还要看这些成果能否经受住公开论文、同行评议和时间的检验。但可以确定的是,AI 已经不再只是数学家的计算工具,而开始成为数学研究流程中的主动参与者。

参考来源

以下为便于国内读者检索的公开讨论与技术资料入口;OpenAI 官方公告、陶哲轩相关评论及 TechCrunch 报道为本文事实依据,原始页面可能存在地区访问限制。

  1. 知乎:OpenAI 数学与人工智能顾问组相关讨论——用于检索中文社区对顾问组成立及 AI 数学研究的讨论。
  2. GitHub:Lean 与 AI 数学证明相关项目——用于了解形式化证明、证明助手和 AI 数学研究的技术背景。
  3. 知乎:OpenAI 单位距离问题与数学模型相关讨论——用于检索相关中文解读和学界反应。
  4. GitHub:数学形式化与证明助手项目检索——用于补充了解 Lean 形式化数学生态。

相关推荐

查看全部