OpenAI一次公开722篇数学预印本

OpenAI于10月7日公开722份数学手稿,覆盖372个结果家族,称一款尚未发布的前沿模型已解决数百个长期开放问题。成果规模令人震动,但其数学有效性、署名与发布方式仍待学界审查。
OpenAI一次公开722篇数学预印本
OpenAI今天公开了一批由尚未发布的前沿模型生成或推进的数学研究成果:722份手稿,覆盖372个结果家族,涉及数百个长期未解决问题。 这批材料已经发布在 OpenAI 的 GitHub 数学仓库中,包含部分推理过程摘要、算力消耗估算,以及模型尝试过的问题数量统计。
这不是一次普通的模型能力演示。它更像是 OpenAI 把过去数周持续释放的数学进展,第一次以接近研究资料库的形式整体摊开:让数学家看到问题列表、预印本、证明草稿和部分过程记录,也把一个更棘手的问题交给整个学界——当模型可以批量产出数学结论时,什么才算真正的数学成果?

722份手稿,372个结果家族意味着什么
“结果家族”是将围绕同一猜想、同一技术路线或同一类问题的相关证明与反例归为一组的统计口径。 因此,372个结果家族并不等于372个完全独立的重大定理,也不等于722份手稿都对应全新的数学发现。
OpenAI此次公开的核心数字如下:
| 项目 | OpenAI此次披露的信息 | |---|---:| | 公开手稿数量 | 722份 | | 结果家族数量 | 372个 | | 成果覆盖范围 | 数百个开放数学问题 | | 模型状态 | 尚未向公众发布的前沿模型 | | 单项普通成果算力 | 约相当于 ChatGPT Pro 连续思考3小时 | | 发布载体 | GitHub 预印本仓库 | | 配套机构 | 数学与人工智能咨询小组 AGMAI |
这个规模首先改变了问题的性质。此前外界讨论的是某个模型是否解出一道重要难题,现在需要面对的是一批研究材料能否被逐篇验证、复现、修改和吸收。对数学界来说,验证一条证明通常比生成一个看起来合理的答案慢得多;对 AI 公司来说,批量生成结论已经不再是唯一瓶颈,如何让这些结论进入可审计的学术流程,才是下一阶段的竞争点。
OpenAI在9月曾表示,其模型已经解决一百余个长期悬而未决的公开难题,覆盖数学的绝大多数分支领域。10月7日的这次发布,则把此前偏宣传式的数字进一步落到了文稿、问题清单和推理记录上。不过,材料被公开并不意味着结论已经被数学界接受,预印本更不等同于经过同行评审的正式论文。
从单点突破转向批量数学研究
AI数学研究是利用大模型、搜索算法、代码执行环境和形式化验证工具协同探索数学问题的研究范式。 它与传统聊天机器人回答数学题不同:系统需要提出猜想、寻找中间引理、编写或运行程序、筛选失败路线,并把最终论证整理成其他研究者能够检查的形式。
此前披露的纳维–斯托克斯存在性与光滑性问题,是这轮竞争的分水岭。OpenAI曾称,尚未公开的模型利用大规模并行智能体,在约88小时内得到相关解法,后续又花费约17小时进行 Lean 形式化与验证。按照公开报道,系统最多使用了约1万个协同工作的 AI 智能体。
这里需要明确区分两个层面:Lean形式化证明是将数学论证翻译为可由定理证明器检查的形式系统,而不是模型说“我证明了”之后由软件自动认可。 如果关键定义、前提条件或形式化过程本身存在遗漏,Lean 也只能验证被输入的那套形式化陈述,不能替研究者判断问题是否被正确理解。
这也是为什么“AI攻克数学难题”不能简单等同于“模型给出一个答案”。模型可以快速探索海量路径,甚至找到人类研究者没有优先考虑的构造;但研究者仍然需要确认它是否解决了原始问题、是否偷偷改变了假设、是否把已有结果换了一种表述,以及论证是否具有可推广的新思想。
OpenAI此次公开资料中包含部分模型推理过程摘要和算力开销估算,这对外部审查有帮助,但还不够构成完整复现条件。尤其是模型版本、系统提示、搜索策略、工具环境、采样次数、失败样本和筛选规则,都会影响研究结果。只公布成功案例,外界很难判断模型到底是在高效发现数学结构,还是在极大规模的试错中偶然撞到可用路线。
成果价值不在“数量最多”,而在能否被数学家接管
数学成果的价值主要取决于证明是否正确、方法是否可理解、结论是否能被后续研究使用,而不取决于模型一次生成了多少份手稿。 722份文稿真正有价值的部分,可能不是其中最适合做新闻标题的那几项,而是能否提供新的引理、反例、构造方法或证明工具。
这种价值可以分成三层:
- 正确性层。 证明是否完整,是否覆盖原命题的全部条件,是否存在隐藏的循环论证或边界遗漏。
- 可理解性层。 人类数学家能否从模型生成的步骤中提炼出清晰概念,而不是只能依赖机器逐行检查。
- 可迁移性层。 方法能否用于其他问题,是否能形成新的技术路线,而不是只对单个问题有效。
OpenAI此前披露的研究方向横跨高维几何、编码理论、量子复杂度、格密码学、极值图论、拉姆齐理论和群论等领域。这样的覆盖范围很能说明大模型系统的广度,却不能自动说明每个领域都出现了同等深度的突破。数学不同分支的证明标准、已有文献密度和形式化程度差异很大,统一用“解决”描述容易掩盖结果层级的差别。
例如,一个结果可能是完整解决开放猜想,也可能是给出更强的下界、构造一个反例、证明特殊情形,或把一个问题转化为更容易处理的等价命题。对开发者和研究者而言,最应该关注的不是新闻稿中的“攻克”二字,而是每份手稿对原问题究竟推进了哪一步。
AGMAI试图补上发布规则这一课
AGMAI,即数学与人工智能咨询小组,是OpenAI在2026年9月下旬推动成立的独立数学咨询机制,目标是帮助评估和传播 AI 生成的数学成果。 该小组由数学家组成,强调应通过成熟学术渠道及时发布成果,并披露模型名称、提示词、算力开销等关键信息。
AGMAI提出的建议,实际上击中了这轮 AI 数学竞赛最敏感的几个问题:
- 不要把数学成果当成模型营销素材;
- 尽可能披露使用的模型、提示词和计算资源;
- 让外部数学家拥有足够时间检查证明;
- 说明人类研究者与模型分别承担了哪些工作;
- 通过学术社群托管的平台发布,而不是只依赖企业宣传渠道。
OpenAI这次选择 GitHub 作为主要发布载体,并制定了文稿修订和引用规范,说明公司至少意识到单纯发布一篇博客已经不够。GitHub 的优势是版本记录、问题追踪和协作修改都比较直接,研究者可以对具体文稿提出意见,也能观察后续修订。
但 GitHub 仍然不是同行评审系统。它解决的是材料可访问和版本可追踪问题,不能替代期刊、预印本平台、专题研讨会以及领域专家的独立检查。OpenAI表示,后续会继续完善文稿质量、引用情况、数学内容阐述和成果展示形式,这也意味着本次公开版本很可能仍是一个中间状态。
最大争议:谁发现了,谁应该署名
AI数学研究中的署名争议,本质上是发现、验证、组织和表达四种劳动如何分配的问题。 模型可以生成关键论证,人类可以选择问题、设计搜索流程、提供工具、筛选结果并完成形式化;如果只把最终文字整理者列为作者,可能低估模型在论证中的作用;但如果把模型当作普通作者,又无法承担学术责任和回答质疑。
今年以来,OpenAI、Anthropic等实验室接连发布数学成果,部分外部研究者也围绕同一批公开难题推进研究。相关事件已经引发关于研究草稿是否被模型接触、研究优先权如何确认、企业是否利用外部研究路线,以及人类作者与机构之间权责边界的讨论。
这类争议并不只是学术圈内部的署名纠纷。一个企业如果先让模型大规模扫描公开问题、内部草稿和网络缓存,再以模型生成的方式快速发布结果,可能会把传统学术界用于确认优先权和贡献归属的时间压缩到几天甚至几小时。对于没有同等算力和发布能力的独立研究者来说,这会直接改变研究工作的风险收益结构。
OpenAI表示,数学论证本身由 AI 系统生成,将其简单标注为人类作者既不准确,也不尊重真正的智力劳动。这个判断在技术层面有道理,但它还没有完全回答责任问题:如果证明后来被发现有错误,谁负责回应?如果模型组合了他人的未署名思想,谁负责说明来源?如果模型只是从人类提供的路线中完成了最后几步,贡献又该如何界定?
未来更可行的做法,可能不是把模型硬塞进传统作者名单,而是建立详细的贡献记录:列出模型版本、运行时间、搜索预算、提示词、人工干预点、引用来源、形式化验证状态和每次重大修改。对 AI 生成的数学研究来说,这种可审计的研究日志可能比一个简单的作者列表更重要。
对开发者而言,真正的机会在哪里
这批成果对开发者最大的启示,不是“普通人也能让模型解决千禧年难题”,而是数学研究正在变成一个由模型、工具和人共同组成的工程系统。 模型本身只是其中一环,问题分解、并行搜索、代码执行、文献检索和形式化验证同样关键。
从工程视角看,这套系统至少包含四个组件:
- 问题路由器。 根据问题类型,把任务分配给代数、几何、组合、数论或计算机科学方向的不同智能体。
- 证明搜索器。 生成猜想、引理和候选证明,并通过多轮采样探索不同路径。
- 外部工具链。 调用计算机代数系统、数值实验环境、代码执行器和 Lean 等形式化证明工具。
- 人类审查层。 负责确认问题定义、排除已有结果、判断证明质量并把结论写成可交流的数学文本。
这种架构与单次问答完全不同。它更像一个研究团队,只是团队成员大部分是速度极快、记忆广泛但可能自信犯错的程序。系统设计者需要重点解决任务拆分、状态同步、失败路线去重、上下文压缩和证据保存等问题。一个模型在单轮对话中很聪明,并不意味着它能在数万条并行路线之间稳定管理研究状态。
成本也不能被忽略。OpenAI称,一项普通成果的算力消耗大致相当于 ChatGPT Pro 连续思考3小时;而此前纳维–斯托克斯相关任务涉及约1万个并发智能体,整体成本显然不是普通开发者可以随意复制的规模。随着芯片和推理效率提升,单位结果成本可能下降,但复杂数学研究的总预算仍会受到并发规模、验证时间和人工审查成本的约束。
因此,开发者更现实的切入点是做“小而可靠”的研究代理:让模型辅助阅读论文、寻找反例、检查边界条件、生成 Lean 草稿、比较多个证明路线,而不是直接追求一次性解决顶级开放问题。对多数团队而言,能把一个证明检查流程的人工时间从数天缩短到数小时,已经是非常有价值的生产力提升。
这次发布应该如何看待
OpenAI公开722份预印本是 AI 数学研究进入批量生产阶段的明确信号,但不是数学问题已经被模型普遍解决的证明。 它展示了前沿模型在跨领域搜索、长链条推理和形式化辅助方面的潜力,也把发布规范、优先权、署名和责任等问题提前推到了台前。
对数学家来说,接下来最重要的工作是逐项验证,而不是立即接受或否定全部成果。对 AI 公司来说,真正的信誉将取决于它们是否愿意公布失败样本、修订历史和完整实验条件,而不只是挑选最震撼的结果。对开发者来说,应该把这批材料当作研究自动化系统的案例库,观察模型如何提出中间命题、如何调用形式化工具,以及它在哪些边界条件下会失效。
短期内,这批预印本更可能带来一轮集中审查,而不是立刻改写数学教材。 数学家需要时间判断哪些结果是新发现,哪些是已有结论的重新组织,哪些证明可以转化为人类可理解的方法。只有当外部研究者能够复核、引用、推广并在此基础上继续工作,OpenAI今天公布的“数百个问题”才会从公司叙事变成数学共同体真正拥有的知识。
截至2026年10月7日,最值得关注的不是 OpenAI 是否已经用 AI 取代数学家,而是数学研究的生产链条正在被重构:模型负责更广泛地搜索,人类负责提出更好的问题、判断什么值得相信,并把机器找到的路径变成可以传承的理解。这个过程才刚刚开始,且远未到可以下结论的时候。
参考来源
- OpenAI 数学预印本 GitHub 仓库 —— 本次公开的722份手稿及相关预印本目录。
- IT之家:OpenAI 发布又一批 AI 数学研究成果 —— 关于722份手稿、372个结果家族、AGMAI建议及算力披露的报道。
- OpenAI 数学进展分享页面 —— OpenAI 对数学研究成果发布机制和咨询小组的官方说明。



