AI 快讯陶哲轩押注开放数学模型
行业快讯

陶哲轩押注开放数学模型

2026-09-19T17:06:02.456Z
陶哲轩押注开放数学模型

陶哲轩代表 SAIR Foundation 启动开放数学模型计划,目标是让开放模型与可负担算力成为数学研究的共享基础设施。真正的考验不只是模型跑分,而是能否形成可验证、可复现、可持续迭代的开放生态。

陶哲轩押注开放数学模型

**数学家陶哲轩于 2026 年 9 月 19 日代表 SAIR Foundation 宣布启动“开放数学模型计划”,目标是为数学研究建设开放、可负担且能够持续迭代的模型与算力底座。**这项计划没有把重点放在推出一个新的聊天机器人,而是试图解决一个更基础的问题:当 AI 开始进入猜想生成、证明搜索、形式化验证和文献梳理环节时,数学研究者能否拥有不受单一商业平台控制的公共基础设施。

**开放数学模型计划是一个面向数学研究的开放 AI 基础设施项目。**按照目前披露的信息,其核心方向包括开放模型、可负担算力和面向研究社区的共享能力,但 SAIR Foundation 尚未完整公开模型架构、参数规模、训练数据构成、许可证、算力预算、发布时间表及首批合作机构。因此,现阶段更准确的理解是:这是一项已经正式启动的长期计划,而不是一款已经完成交付、可以立刻下载部署的成熟产品。

陶哲轩与开放数学模型计划主题视觉,背景由数学公式、定理证明树、GPU 集群和开放模型节点构成

这不是再做一个“会解题的聊天机器人”

**数学模型是专门面向数学推理、计算、证明和形式化任务优化的人工智能模型。**它与普通大语言模型的差别,不是词汇表里多了多少公式,而是能否在长推理链中维持逻辑一致性,能否调用计算工具,并把自然语言论证转换成 Lean 等证明助手可以检查的形式化证明。

**当前数学 AI 的核心矛盾已经从“能不能答题”转向“答案能不能被验证”。**普通模型可以写出一段看似流畅的证明,但只要其中一个量词范围、边界条件或引理引用出错,整段结论就可能失效。数学研究容错率极低:自然语言中的一句“显然”,在形式化系统里往往需要补上数十行依赖关系、类型约束与中间引理。

**形式化证明是由计算机证明助手逐步检查、能够机械验证正确性的数学证明。**Lean、Coq 和 Isabelle 等系统不会因为文字写得像论文就接受结论;只有每一步都满足形式规则,证明才能通过编译。这使数学 AI 获得了其他生成式 AI 场景少有的优势:模型输出存在一个相对明确、可以自动执行的正确性判定器。

**陶哲轩参与推动这一计划的意义,在于把数学家的真实工作流带进模型设计。**竞赛题跑分可以衡量模型在有限题型中的能力,却无法完整覆盖研究数学中的开放问题、跨论文检索、定义设计、反例搜索、证明修补和多人协作。一位顶尖数学家能帮助项目判断哪些能力真正节省研究时间,哪些只是演示效果。

“开放”至少要拆成四层来看

**开放模型并不天然等于开放源代码,更不等于任何人都能低成本复现训练。**一个项目可能只开放在线试用,也可能开放权重但不公开数据;即便代码、权重和数据全部公开,数百万美元级别的训练与推理成本仍可能把多数大学研究组挡在门外。因此,SAIR Foundation 所说的“开放模型与可负担算力”,需要通过具体交付物来验证。

| 开放层级 | 应当公开的内容 | 对数学研究的实际价值 | 目前状态 | |---|---|---|---| | 使用开放 | 在线界面、批量任务能力、清晰的使用限制 | 让研究者低门槛测试模型 | 尚待公布 | | 权重开放 | 可下载模型权重、推理配置、量化版本 | 支持本地部署、微调和离线研究 | 尚待公布 | | 训练开放 | 训练代码、数据配方、评测流程、实验记录 | 允许社区复现结果并定位能力来源 | 尚待公布 | | 治理开放 | 许可证、贡献机制、版本路线和决策流程 | 避免项目由单一机构长期封闭控制 | 尚待公布 |

**真正有研究价值的开放,应允许第三方检查模型为何成功、为何失败。**如果项目最终只提供一个免费网页入口,它可以降低使用门槛,却仍然无法支持数据溯源、模型可解释性、定向微调和可复现实验。对于需要发表论文的研究者来说,“能访问”与“能研究”是两件事。

**许可证将直接决定这项计划能否成为公共底座。**数学模型通常同时涉及模型权重、训练代码、合成数据、论文语料和形式化证明库,这些资产可能分别采用不同许可证。项目不仅需要说明能否用于学术研究,还要回答能否商用、能否再训练、衍生模型是否必须开放,以及训练数据中受版权保护内容如何处理。

可负担算力比开放权重更难

**可负担算力是指个人研究者和普通高校实验室能够以可预期成本训练、微调或运行模型,而不必依赖超大规模 GPU 集群。**这一定义不能停留在“比闭源模型便宜”,而应落到具体指标:完成一万道形式化证明搜索需要多少 GPU 小时,单个证明任务平均消耗多少显存,模型是否能在 8 张、4 张甚至 1 张加速卡上运行。

**数学推理的算力瓶颈往往出现在推理阶段,而不只在预训练阶段。**复杂证明通常需要模型生成多条候选路径,再由证明器逐条检查并回传错误,随后继续搜索。若每一步有多个可能策略,搜索树会迅速膨胀;模型即使不大,也可能因为长上下文和高并发候选消耗大量计算资源。

**可负担的关键不是单纯压低每百万 Token 的价格,而是提高每单位计算得到正确证明的概率。**一个便宜但需要尝试 1,000 次才能成功的模型,实际成本可能高于尝试 20 次即可完成任务的高性能模型。数学 AI 更合理的经济指标应包括“每个通过验证的证明成本”“单位 GPU 小时解决的问题数”和“给定预算下的成功率”。

**SAIR Foundation 若要兑现算力普惠,至少需要同时推进模型小型化、推理优化和共享计算。**可行路径包括知识蒸馏、低比特量化、稀疏专家结构、证明状态缓存、候选路径去重,以及针对 Lean 等验证器设计更高效的搜索策略。相比简单发放算力额度,这些工程优化更可能形成长期可复制的成本下降。

数学 AI 已经有一批开源先行者

**开放数学模型计划进入的并不是一片空白市场。**过去几年,DeepSeek-Prover、Qwen2.5-Math、NuminaMath、miniF2F、Lean 和 mathlib 已经分别覆盖数学推理模型、开放训练数据、形式化评测与证明库,证明了开源社区可以在数学 AI 上形成完整工具链。

| 项目 | 主要定位 | 开放资产 | 更适合的任务 | 主要局限 | |---|---|---|---|---| | SAIR 开放数学模型计划 | 数学研究基础设施 | 尚待公布 | 研究级推理、证明与社区协作 | 具体模型和许可尚未公开 | | DeepSeek-Prover | Lean 形式化定理证明 | 模型权重及相关研究资源 | 自动生成与补全 Lean 证明 | 重点集中在形式化证明任务 | | Qwen2.5-Math | 通用数学推理模型 | 多种规模模型权重 | 解题、计算和自然语言推理 | 正确答案不等于形式化可验证证明 | | NuminaMath | 数学数据与模型训练 | 开放数据集及模型资源 | 数学推理训练、指令微调 | 数据质量与污染控制要求高 | | Lean 4 + mathlib | 证明助手与数学库 | 源代码、定理库和社区工具 | 机器可验证的数学证明 | 形式化成本高,学习曲线较陡 |

**SAIR 计划的潜在差异不应只是再训练一个参数更多的模型。**如果它只在现有竞赛数学数据上追加训练,价值很容易被已有开源模型覆盖;如果它能连接自然语言数学、形式化证明库、验证器、计算工具和研究者反馈,则有机会成为一套研究操作系统。

**基础设施路线比单模型路线更符合数学研究的长期需求。**模型能力会快速更新,但高质量形式化数据、稳定评测集、证明器接口、实验记录和研究者协作机制可以跨越多个模型周期。对于 SAIR Foundation 来说,最值得建设的未必是某个短期排名第一的模型,而是一套其他团队可以持续接入和改进的公共协议。

最大难点不是参数规模,而是数据

**数学数据的质量问题比数量问题更棘手。**互联网上存在海量公式、习题与论文,但其中相当一部分缺少完整推导,答案可能错误,符号约定彼此冲突,扫描文档还可能存在 OCR 误差。模型在低质量数据上训练得越久,越可能学会模仿证明语气,而不是掌握可靠推理。

**形式化数据能够提供高置信度监督,但生成成本明显高于普通文本。**mathlib 等证明库包含经过机器检查的定义、定理和证明,是数学模型训练的重要资产;然而,把一篇自然语言论文转换为完整形式化版本,仍需大量专家劳动。自动形式化工具可以加快流程,却又需要可靠模型支持,形成典型的“数据依赖模型、模型依赖数据”循环。

**合成数据是扩大数学训练集的现实路径,但必须经过验证器过滤。**模型可以生成新题、改写条件、提出辅助引理并尝试证明,只保留能够被 Lean 等系统通过的样本。这种做法可以把证明器变成数据工厂的质量闸门,不过验证通过只代表形式正确,不代表题目有研究价值,也不能排除大量近似重复样本。

**数据污染会直接削弱数学模型跑分的可信度。**如果测试题、标准证明或高度相似的变体出现在训练集中,模型可能依靠记忆得到高分。未来的开放数学模型需要公开去重方法、数据时间边界和污染检测结果,并增加动态生成、专家盲测及真实研究任务等更难被提前记忆的评估方式。

衡量项目成败,不能只看竞赛分数

**一个面向数学研究的模型,至少需要同时接受答案正确性、证明可验证性、计算成本和新颖性评估。**只公布 AIME、MATH 等数据集准确率,最多说明模型擅长标准化题目,并不能证明它能帮助数学家处理尚无标准答案的问题。

未来值得关注的指标包括:

  • 形式化证明通过率: 模型生成的 Lean 证明中,有多少能够被编译器完整接受。
  • 固定预算成功率: 在相同 GPU 时间或相同推理次数下,模型解决问题的比例。
  • 人类时间节省: 数学家完成文献梳理、证明补全或形式化转换所需时间下降多少。
  • 跨领域泛化能力: 模型能否从代数、数论扩展到分析、概率、拓扑等不同方向。
  • 错误可诊断性: 模型能否指出失败发生在哪一步,而不是只返回一段无法检查的长文本。
  • 复现成本: 第三方团队需要多少硬件和时间才能重复官方结果。

**研究级数学 AI 的最佳形态更像副驾驶,而不是自动论文生成器。**它可以检索相似定理、提出辅助引理、尝试构造反例、把草稿转为形式化语言,并在证明器报错后修正局部步骤;最终的命题选择、价值判断和理论解释,仍需要数学家负责。

陶哲轩为什么适合推动这件事

**陶哲轩长期处在纯数学研究与机器辅助数学的交界处。**他的价值不只是公众影响力,更在于理解真实数学研究如何发生:很多突破不是一次生成完整证明,而是不断尝试局部估计、修正定义、查找文献、构造中间命题,并与合作者反复讨论。

**数学家主导项目可以降低“为跑分造产品”的风险。**AI 团队容易优化可量化指标,研究者则更关心系统是否能处理定义不完整、符号不统一和目标不断变化的开放任务。两类视角结合,才可能把模型从解题工具推向研究工具。

**名人背书不能替代工程交付。**SAIR Foundation 接下来仍需回答一系列硬问题:首个模型何时发布,权重是否可下载,最低部署硬件是什么,训练数据是否公开,Lean 与其他证明器如何接入,研究者如何申请算力,以及项目采用何种长期资金模式。

这项计划真正挑战的是闭源研究基础设施

**开放数学模型计划的行业意义,在于把 AI 能力的所有权问题提前摆到桌面上。**如果数学研究越来越依赖少数闭源模型,模型更新、价格变化、服务中断和使用政策都可能影响研究连续性;未发表论文、私有猜想和合作记录上传到第三方平台,也会带来保密与知识产权风险。

**可本地部署的开放模型能够给高校和研究机构更强的数据控制权。**研究团队可以在内部环境处理未公开手稿,保留完整实验记录,并固定模型版本以满足论文复现需求。对于数学研究而言,几年后还能否运行同一模型,可能比模型今天多解出几道题更重要。

**开放生态也更容易覆盖商业回报有限的小众数学方向。**闭源产品通常优先优化用户规模更大的写作、编程和办公任务,而专业数学领域数据少、评估难、短期付费需求有限。由基金会和研究社区维护的公共项目,理论上更有动力投入这些长尾任务。

接下来要看三份“成绩单”

**第一份成绩单是开放程度。**项目需要明确权重、代码、数据、许可证和治理结构,而不是只使用“开放”作为品牌标签。

**第二份成绩单是可负担程度。**官方应公布最低硬件配置、推理吞吐量、单项任务成本和量化模型表现,让中小研究团队能够算清使用账。

**第三份成绩单是研究价值。**项目必须证明自己不仅能解决已有答案的题目,还能在形式化、反例搜索、文献连接和新命题探索中节省数学家的真实时间。

**目前最合理的判断是,陶哲轩和 SAIR Foundation 选对了问题,但尚未交出产品答案。**数学 AI 下一阶段的竞争,不会只是谁的模型在竞赛题上多拿几分,而是谁能把模型、证明器、开放数据和算力组织成一套可信的研究基础设施。

**开放数学模型计划若能兑现承诺,其价值可能不在于诞生一个“数学版 ChatGPT”,而在于建立一个任何研究者都能检查、扩展和负担得起的数学智能公共层。**这比发布一张漂亮的榜单更困难,也更值得做。

参考来源

相关推荐

查看全部