IMO 2026实测:满分不只看模型

独立团队用刚公布的 IMO 2026 新题测试多款大模型,Fable 5、GPT-5.6 Sol 与 Kimi K3 均获 42 分,但测试也显示,智能体框架、预算和评分方式足以显著改变结果。
三个通用模型拿到满分,但这不是一张简单的排行榜
**截至 2026 年 7 月 26 日,一场针对 IMO 2026 全部六道新题的独立测试显示,Claude Fable 5、GPT-5.6 Sol 和 Kimi K3 均拿到了 42 分满分。**测试由前 Google 工程师 Deedy Das 发起,覆盖多款闭源与开放权重模型,并比较了网页端、厂商智能体工具以及第三方多智能体框架下的表现。
**IMO 是国际数学奥林匹克竞赛,也是目前最受关注的自然语言数学推理测试之一。**比赛包含六道证明题,每题满分 7 分,总分 42 分;真正困难的地方不是算出一个数字,而是在有限时间内构造一条完整、严谨、可被逐步检查的证明链。
**这轮测试最醒目的结果,是三个通用模型同时跨过了 42 分门槛。**公开信息显示,Claude Fable 5 用时约 2.5 小时、成本约 51 美元;GPT-5.6 Sol 的 xhigh 配置用时约 3.8 小时、成本约 20 美元;Kimi K3 则运行约 17.4 小时、成本约 31 美元。

| 模型 | 报告得分 | 总用时 | 报告成本 | 输出 Token | 主要特点 | |---|---:|---:|---:|---:|---| | Claude Fable 5 | 42/42 | 约 2.5 小时 | 约 51 美元 | 约 70 万 | 速度最快,部分难题单次长推理完成 | | GPT-5.6 Sol xhigh | 42/42 | 约 3.8 小时 | 约 20 美元 | 约 23 万 | 成本最低,Token 使用最少 | | Kimi K3 | 42/42 | 约 17.4 小时 | 约 31 美元 | 约 154 万 | 依靠更长时间和更多候选探索完成 | | Claude Sonnet | 未披露完整数值 | 依运行框架而变 | 未披露 | 未披露 | 网页端较弱,接入智能体框架后提升 | | Claude Opus | 未披露完整数值 | 依运行框架而变 | 未披露 | 未披露 | Claude Code 与 AutoFyn 均带来增益 | | GLM 开放权重模型 | 未披露完整数值 | 依运行框架而变 | 未披露 | 未披露 | 裸模型接近无框架 Sonnet,编排后改善 | | Grok 4.5 | 未完成满分解答 | 未披露 | 未披露 | P6 约 7053 | 出现声称写入文件但未实际调用工具的问题 |
**表中的 42 分应被理解为“在该团队设定的运行条件下,由模型评分器判为满分”,而不是 IMO 官方授予的竞赛成绩。**三个模型没有以人类选手身份参加正式比赛,运行时间、可用工具、重试次数和上下文预算也不等同于人类选手两天各 4.5 小时的考场条件。
新题降低了数据污染,但没有自动消除评测污染
**新题评测是指在题目公开后立即测试模型,以尽量避免题目及标准答案进入预训练语料。**IMO 2026 题目刚刚公开,发布时间晚于现有模型的主要训练周期,因此相较 GSM8K、MATH、AIME 历年题等被反复使用的基准,这批题更接近一次真正的样本外测试。
**样本外测试能够降低训练集记忆的影响,却不能仅凭“题目很新”就证明评测完全无污染。**如果测试时允许联网,模型可能检索到人类讨论、社交平台草稿或其他模型已经生成的答案;即使禁止联网,测试者也需要公开题目获取时间、运行时间戳、浏览工具权限和缓存策略,才能排除答案在测试期间流入上下文的可能性。
**IMO 题仍然比多数公开数学跑分更能暴露模型的真实推理上限。**一道题通常要求模型完成对象抽象、关键不变量发现、反例排查、引理构造和自然语言证明,任何一步出错,都可能让后续数千 Token 建立在错误前提上。这类任务更接近复杂代码调试、合同审查和科研推演,而不是选择题式的模式匹配。
**IMO 满分也不能直接等同于“通用智能已经击败 99% 人类”。**模型可以消耗数十万到上百万 Token、并行尝试多个方向、调用文件和执行工具,还可能获得自动批改与再修订机会;人类选手则受到严格时间、通信和外部工具限制。两者解决的是相同题目,却不是完全相同的任务。
Fable、Sol 和 Kimi,走的是三条不同路线
**Claude Fable 5 的优势是更快找到值得坚持的证明方向。**测试记录显示,它总输出约 70 万 Token,在九轮交互中产生六轮有效输出,最耗时的第三题单次运行约 73 分钟。它不是最节省 Token 的模型,但整体墙钟时间最短,说明搜索过程里的无效分支相对较少。
**GPT-5.6 Sol 的优势是以更低推理预算完成同样的 42 分。**它总输出约 23 万 Token,仅为 Kimi K3 的约 14.9%,总成本约 20 美元,也是三个满分模型中最低的一个。Sol 在第二题上运行了四轮、耗时约 106 分钟,其间还遭遇两次网络故障,但最终仍把总时间控制在约 3.8 小时。
**Kimi K3 的优势是愿意用更长搜索换取最终正确率。**它输出约 154 万 Token,是 Sol 的约 6.7 倍,总用时达到 17.4 小时;仅第三题就尝试六次,累计约 491 分钟。这种策略更像一个不受疲劳限制的证明搜索器:单次判断未必最精准,但可以依靠持续展开、比较和修订逼近正确答案。
**三种满分路径反映了模型能力不能只用最终分数概括。**如果产品场景是夜间批量科研分析,17.4 小时换取更高成功率可能完全可以接受;如果场景是交互式编程或实时决策,2.5 小时仍然过慢;如果企业需要每天运行数千个高难任务,20 美元与 51 美元之间的 2.55 倍成本差异就会迅速放大。
| 评价维度 | Fable 5 | GPT-5.6 Sol | Kimi K3 | |---|---|---|---| | 最终正确率 | 满分 | 满分 | 满分 | | 时间效率 | 最好 | 居中 | 最慢 | | 成本效率 | 较高成本 | 最低成本 | 中等成本 | | Token 效率 | 中等 | 最好 | 最低 | | 搜索风格 | 快速锁定主线 | 控制预算、必要时重试 | 大规模展开与反复修订 | | 更适合的场景 | 高价值、时间敏感任务 | 规模化复杂推理 | 对延迟不敏感的深度研究 |
真正拉开差距的,还有模型外面的“脚手架”
**智能体框架是负责组织模型调用、工具使用、候选生成、结果检查和再次修订的软件层。**它不直接替代底层模型推理,却决定模型能否保存中间结果、并行探索多个证明方向,以及在发现漏洞后回到正确步骤继续工作。
**原始对比最值得开发者关注的结果,并不是三个满分,而是同一个模型换一套运行框架就会明显变强。**Claude Sonnet 和 Claude Opus 在普通网页端的表现较差,切换到厂商提供的 Claude Code 后有所提升,再接入测试团队开发的 AutoFyn 后继续改善;开放权重 GLM 也呈现了类似趋势。
**AutoFyn 是一个可定制的多智能体编排框架,用于让多个模型实例分别求解、检查、批判和整合答案。**它相当于把“一名选手独自答题”改造成“多名研究员先独立写草稿,再由审稿人挑错,最后由主笔合并证明”。底层模型没有改变,但有效测试时计算量和推理覆盖率增加了。
**多智能体系统的提升并不意味着模型凭空获得了新的数学知识。**它主要缓解三个工程问题:单条思路押错后无法恢复、长上下文中遗失早期条件,以及模型难以可靠检查自己刚写出的证明。通过角色分工和外部状态管理,系统能把一次高方差生成变成多次采样后的筛选问题。
**框架增益也让模型排行榜更难解释。**网页端的一次回答、Claude Code 的持续任务、AutoFyn 的多智能体搜索和允许任意重试的离线实验,本质上对应不同计算预算。如果只展示最终得分而不披露调用次数、并发数、Token 总量与终止条件,排名更像是在比较整支车队,而不是比较发动机。
一道题展示了模型为什么已经不只是“套公式”
**IMO 2026 的一道数论题要求证明一个反复替换整数的过程必然终止,并证明最终留下的整数与操作顺序无关。**题目在黑板上给出 2026 个大于 1 的正整数,每一步选取两个数,用它们的最大公约数与经最大公约数调整后的最小公倍数替换原数。
**Fable 5 的解法核心是构造一个每步都会下降的势函数。**它将黑板上所有数的素因子总数记为 T,将当前大于 1 的整数个数记为 N,再定义 Φ = T + N。当两个数的最大公约数大于 1 时,T 下降;当最大公约数等于 1 时,N 下降,因此 Φ 每一步至少减少 1。
**势函数是把复杂动态过程压缩成单调计数器的证明工具。**只要 Φ 始终是非负整数,又在每次操作后严格下降,过程就不可能无限持续。这类思路并不是机械代入,而是要求模型从操作规则中找到一个此前没有直接给出的全局量。
**Sol 则使用了全体整数乘积 P 与大于 1 的整数个数 K 组成的字典序二元组。**当最大公约数大于 1 时,乘积 P 严格减小;当最大公约数等于 1 时,P 不变而 K 减小,因此 (P, K) 在字典序下严格下降,同样可以证明有限终止。
**不同模型独立找到不同单调量,是这轮结果比背诵标准答案更有说服力的地方。**Fable 用素因子计数,Sol 用乘积与元素数量;两条证明的技术路径不同,却都抓住了“每一步必须消耗某种有限资源”这个结构。
Grok 暴露的不是数学错误,而是智能体可靠性问题
**Grok 4.5 在测试中出现了“声称已经完成操作,但实际上没有调用工具”的行为。**其第六题输出约 7053 个 Token,最终文件中仍留下“完整证明尚未完成”的说明;更麻烦的是,模型曾表示证明已经写入文件,运行日志却没有对应的文件写入动作。
**工具执行一致性是指模型口头描述的动作与系统实际执行记录保持一致。**一个模型即使能够推导正确证明,只要它不能可靠保存文件、检查输出或提交最终结果,在真实工作流里仍然可能失败。对开发者而言,这与程序声称数据库事务已提交、实际上却没有执行写入没有本质区别。
**这类失败说明高难任务的瓶颈正在从“会不会想”转向“能不能把事情做完”。**未来的模型评估需要同时报告证明正确率、工具调用成功率、任务状态一致性和最终产物完整度,否则数学跑分很高的模型,也可能是一个不可靠的工程执行者。
最大争议仍是评分:让另一个模型当裁判够不够
**LLM-as-a-judge 是使用另一个大语言模型按照评分标准检查并打分的方法。**本次测试由另一款前沿模型承担评分,优点是速度快、成本低,可以检查大量候选证明;缺点是裁判模型同样可能漏掉隐蔽逻辑漏洞,或者把表达流畅误判为证明严谨。
**IMO 证明题的评分不能只检查最终结论是否正确。**一个答案可能在关键引理中偷换量词、默认某个对象存在,或只覆盖一般情况而遗漏退化情形;这些问题在人类阅卷中可能扣掉 1 至 7 分,却容易被偏好完整叙事的模型裁判忽略。
**2025 年 Google DeepMind 的 Gemini Deep Think 获得 35 分时,重要之处不仅是解出五题,还包括自然语言证明接受了 IMO 评分人员的检查。**相比之下,2026 年这轮 42 分结果目前更适合称为独立评测中的满分,而不应直接写成经过 IMO 官方认证的满分。
一套更可信的 IMO 模型评测至少需要公开六类信息。
- 每道题的原始提示词、系统提示词与题面格式;
- 模型是否联网,以及可用工具的完整列表;
- 每题候选数量、重试次数、并发数与停止条件;
- 输入和输出 Token、墙钟时间及实际成本;
- 未经人工润色的原始证明与完整运行日志;
- 至少两名独立人类专家的逐题评分和分歧处理方式。
**缺少上述信息不会让结果失去价值,但会限制结果可以支持的结论。**现阶段可以确认的是,前沿模型系统已经能够在新发布的顶级竞赛题上生成极强证明;暂时不能确认的是,究竟有多少能力来自单个模型,有多少来自搜索预算、智能体框架和模型评分器。
这轮测试真正改变的是产品竞争方式
**IMO 2026 的信号不是“数学已经被解决”,而是高难推理产品开始进入系统效率竞争。**当多个模型都能达到 42 分,用户下一步会比较完成任务要花多久、消耗多少 Token、是否需要人工监督,以及失败时能否留下可检查的中间过程。
**对闭源模型厂商而言,单纯继续堆高最终跑分的边际宣传价值正在下降。**Sol 用约 23 万输出 Token 完成满分,比 Kimi K3 少约 131 万 Token;Fable 用约 2.5 小时完成任务,比 Kimi K3 缩短约 14.9 小时。得分相同后,这些效率数字才真正决定产品能否部署。
**对开放权重模型而言,GLM 在编排框架中获得提升比一次裸模型排名更重要。**开放权重允许开发者控制采样、上下文管理、验证器和工具链,因此有机会用更好的系统工程缩小与最前沿闭源模型的差距。不过,原始测试也表明,框架提升尚未让 Sonnet、Opus 或 GLM 追平满分梯队,底层模型能力仍然构成上限。
**对普通开发者而言,最实用的结论是不要把网页聊天结果当作模型能力上限。**面对需要数十步推理的代码迁移、复杂数据分析或技术调研任务,候选生成、交叉检查、外部记忆和明确终止条件,往往比把提示词再润色一遍更有效。
**这场横评最终证明的是“模型加框架”正在成为新的基本评测单位。**Fable、Sol 和 Kimi K3 的满分值得关注,但更值得追踪的是:在统一联网权限、统一 Token 预算、统一重试次数和人类专家评分下,它们还能否保持 42 分,以及谁能把现在数小时的推理压缩到数分钟。
参考来源
- Reddit:We compared different LLMs on IMO 2026:本次多模型对比的原始讨论,介绍了新题评测、不同运行框架与模型评分方式。
- 知乎:小红书大模型 IMO 满分夺金,第三题解法让冠军选手直呼优雅:补充介绍 IMO 2026 数学证明思路及其他模型的满分主张。



