小红书大模型IMO满分夺金

dots-note-3.0在IMO 2026六道题中取得42分满分,成为首个获IMO官方金牌水平评定的中国大模型。更值得关注的是,它全程使用自然语言完成证明。
小红书第一次参加IMO,就拿了满分
小红书大模型 dots-note-3.0 在 IMO 2026 的六道题中全部答对,以 42 分满分获得金牌水平评定。
截至 2026 年 7 月 22 日,这是中国大模型首次获得 IMO 官方金牌水平认证,也是全球第二个达到 IMO 金牌水平的模型。与此前答对 5 道题、取得 35 分的 Google Gemini 相比,dots-note-3.0 又向前走了一步:它拿到了全部 6 道题的分数。
这里需要先说清楚,所谓“IMO 金牌”是指模型提交的解答经过 IMO 官方评定后达到当届人类选手的金牌分数线,并不意味着模型以正式选手身份领取了一块实体奖牌。模型可以被官方评审,但 IMO 的正式参赛主体仍然是各国家和地区选拔出的中学生代表。
不过,42 分不需要借助任何分数线解释。IMO 每道题满分 7 分,六道题总计 42 分,dots-note-3.0 的结果就是一张没有失分的答卷。

42分的价值,在于证明而不是答案
IMO 是国际数学奥林匹克竞赛,也是面向中学生、强调原创证明能力的顶级数学赛事。比赛分两天进行,每天 4.5 小时完成 3 道题,六道题通常覆盖代数、组合、几何和数论,每题 7 分。
IMO 与普通数学跑分的核心区别是,猜中最终结论几乎没有意义。参赛者必须给出逻辑完整的证明,评审会逐步检查定义是否准确、推导是否成立、边界情况是否遗漏,以及关键引理有没有被偷换。
这恰好击中了大语言模型的薄弱环节。模型可以生成看上去很像数学证明的文字,却经常在中间省掉一个无法成立的条件,或者引用一个名称正确、实际并不适用的定理。对选择题来说,这类错误可能被最终答案掩盖;对 IMO 来说,错误会直接暴露在证明链条中。
因此,dots-note-3.0 的 42 分不是“六次押中答案”,而是六份证明都通过了逐步审查。它展示的是长链条推理、问题建模、路线选择、局部验证和自然语言表达的组合能力。
dots-note-3.0最关键的进步,是全程自然语言
自然语言数学推理是指模型直接阅读人类书写的题目,并以普通数学语言完成分析和证明,而不依赖 Lean 等形式化证明语言作为中间层。
根据目前披露的信息,dots-note-3.0 从读题、解析到最终证明均使用自然语言完成。这一点比单纯的满分更值得开发者关注,因为它决定了模型能力能否从竞赛场景迁移到真实产品。
形式化证明系统的优势是规则极严,任何一步不合法都会被检查器拒绝;它的代价则是需要把自然语言问题转换成机器可验证的定义、引理和证明目标。早期数学 AI 常常需要先做这层翻译,再让搜索系统在巨大的证明空间里寻找路径,最后还要把形式化结果翻译回人类能读懂的答案。
自然语言端到端推理更接近用户实际使用模型的方式。研究人员、工程师和学生不会先把每个问题编码成形式化语言,他们更希望模型直接理解题面、识别隐藏结构,并给出可以讨论和修改的推理过程。
这并不意味着自然语言证明比形式化证明更可靠。恰恰相反,自然语言容许省略和歧义,因此更难自动验证;dots-note-3.0 的意义在于,它提交的自然语言证明经受住了高水平人工评审,而不是只通过模型自己的自检。
和Google相比,这次跨过的是最后一道题
Google 是此前唯一获得 IMO 官方金牌水平评定的 AI 团队。其 2024 年系统取得 28 分、达到银牌水平,当时仍较多依赖 AlphaProof、AlphaGeometry 等专用系统以及形式化表达;随后 Gemini 在自然语言条件下答对 5 道题,取得 35 分并达到金牌水平。
小红书这次把成绩从 5/6 推到了 6/6。表面上看只是多答对一道题,但 IMO 的题目并非等难度排列,后三题通常承担拉开顶尖选手差距的作用,特别是每天的最后一题往往只有少数金牌选手能够完整解决。
| 模型或系统 | 对应赛事 | 得分 | 解出题数 | 评定水平 | 主要解题方式 | |---|---:|---:|---:|---|---| | Google AlphaProof、AlphaGeometry 2 组合系统 | IMO 2024 | 28/42 | 4/6 | 银牌水平 | 形式化推理与专用几何系统 | | Google Gemini 系统 | 后续 IMO 官方评定 | 35/42 | 5/6 | 金牌水平 | 自然语言推理 | | 小红书 dots-note-3.0 | IMO 2026 | 42/42 | 6/6 | 金牌水平 | 自然语言端到端证明 |
这张表最值得看的不是品牌排序,而是技术路线的变化。数学 AI 正从“为特定题型搭建专用求解器”,转向“由通用模型直接理解题目并写出人类可读证明”。
不过,不同年份的 IMO 题目难度并不相同,28 分、35 分和 42 分不能被简单处理成线性性能曲线。更严谨的结论是:dots-note-3.0 在 IMO 2026 这一套全新题目上完成了满分证明,并在结果上超过了此前公开的模型纪录。
第三题让竞赛选手注意到“数学审美”
真正让 dots-note-3.0 区别于暴力搜索系统的,是它在部分题目上给出了非常规且简洁的证明路径。
公开评价尤其提到了 IMO 2026 第三题。双 CMO 金牌得主刘涵祚认为,模型给出了一条“正确且漂亮”的证明思路,其结构紧凑、逻辑自然,即使放进 IMO 标准解答中,也属于较为简洁优雅的一类。
CMO 金牌得主汪千桐的判断更直接:常规解法已经很巧妙,但 dots-note-3.0 直接处理了题目最难、也最本质的部分。它的切入角度并不容易被人类选手首先想到,读完之后却会让人觉得每一步顺理成章。
数学审美不是一个标准化跑分指标,但它能区分“搜到一条可行路径”和“识别出问题结构”。一份冗长证明可能通过大量分类讨论覆盖所有情况,一份漂亮证明则往往先找到不变量、对称性或等价转换,再用很少的步骤消掉复杂度。
这类能力对 AI 产品很重要。用户真正需要的通常不是几十页搜索轨迹,而是模型从大量可能性中挑出最有解释力、最容易验证的一条路线。换到编程场景,它类似于模型没有继续堆补丁,而是先识别出错误的数据结构;换到科研场景,它类似于模型没有枚举所有实验,而是先指出决定结果的关键变量。
IMO满分很硬,但还不能直接等于通用智能
IMO 是衡量数学推理能力的高质量测试,但它不是通用智能的完整代理指标。
第一,竞赛数学拥有清晰题面、封闭条件和可判定目标。真实科研问题往往连“应该证明什么”都不明确,输入中还可能混有错误数据、缺失变量和互相冲突的假设。
第二,六道题的样本量仍然很小。42 分证明模型成功解决了六个极难问题,却不足以单独回答稳定性问题,例如同一题换一种叙述后能否保持正确、对证明提出质疑后能否修正,以及面对数百个连续任务时错误率会不会累积。
第三,官方评分确认的是提交答案的质量,而不是完整产品指标。模型调用了多少测试时算力、是否并行生成多个候选解、是否使用外部检索、有没有人工筛选、单题生成多少次,目前公开信息仍不足以支持完整复现。
第四,竞赛成绩无法代替幻觉率、工具使用、指令遵循和成本测试。一个能做 IMO 的模型,仍可能在事实问答中捏造文献,也可能在工程任务里遗漏版本约束;推理上限和日常可靠性不是同一项指标。
因此,最准确的判断不是“小红书已经解决了数学”,而是 dots-note-3.0 把中国大模型在可审查自然语言证明上的公开上限推到了 42 分。这个结果很硬,但外界还需要更多评测来确认它的能力宽度和部署价值。
小红书还欠开发者一张完整的模型卡
目前最需要补充的信息不是庆祝海报,而是可复现的技术披露。
一份对开发者有价值的模型卡,至少应该回答以下问题:
- dots-note-3.0 是通用模型、推理模型,还是面向研究任务强化的专用版本;
- 模型参数规模、上下文窗口和训练语料截止日期分别是多少;
- IMO 测试是否严格限制在两天各 4.5 小时的竞赛时间内;
- 每道题生成了多少条候选证明,最终答案如何选择;
- 推理期间是否启用了代码执行、搜索、形式化验证器或其他工具;
- 官方评审看到的是原始输出,还是经过排版与人工整理的版本;
- 单题推理时长、计算成本、并行规模和完整失败样本是多少;
- 模型是否会公开体验、技术报告、权重或研究接口。
这些问题不会削弱 42 分的含金量,反而决定了成绩能否被研究社区正确理解。对模型公司来说,公布成功案例只能证明上限;公布约束、失败案例和评测流程,才能证明方法。
截至发稿,小红书尚未在公开信息中完整披露 dots-note-3.0 的参数量、训练方法、推理预算、产品开放计划和价格。现阶段把它与其他商业模型比较调用成本、速度或上下文能力,都缺少可靠依据。
这次成绩对小红书意味着什么
dots-note-3.0 的满分让小红书第一次以基础模型研发者的身份进入全球顶级推理模型讨论。
小红书过去在外界眼中的技术标签更多是推荐系统、社区搜索、多模态内容理解和广告算法,而不是前沿数学推理。IMO 42 分改变不了公司的主营业务,却能迅速改变人才市场和研究社区对其模型团队的认知。
这项能力也与小红书的产品场景存在潜在连接。社区里有大量留学、教育、科研、编程和专业知识内容,一个更擅长长链条推理的模型可以用于复杂搜索、内容核验、知识问答和创作者辅助,而不只是生成更像真人的文案。
真正的考验仍然是产品化。竞赛模型可以不计成本地思考一道题,在线产品却要同时面对延迟、吞吐量、价格和稳定性;用户也不会只问定义严密的奥数题,而会给出截图、口语化描述和互相矛盾的上下文。
结论:这是一张满分答卷,不是一张免检证书
小红书 dots-note-3.0 在 IMO 2026 获得 42 分,标志着中国大模型首次通过 IMO 官方评定达到金牌水平,而且一步做到满分。
这次结果的技术含量主要来自三个部分:六道新题全部解出、证明接受逐步审查、全程使用自然语言表达。第三题受到竞赛金牌选手肯定,则进一步说明模型并非只会用冗长搜索堆出结论,而可能已经具备发现简洁结构的能力。
但满分不应成为跳过技术细节的理由。dots-note-3.0 接下来最需要的不是更多形容词,而是技术报告、完整原始输出、推理预算、时间约束与跨基准测试。
在这些信息补齐之前,可以确定的是:小红书交出了一张足够进入全球第一梯队讨论的数学推理答卷;暂时不能确定的是,这张答卷能否转化为低成本、可稳定调用、对真实任务同样有效的模型产品。
参考来源
- IT之家:小红书大模型 IMO 满分夺金,第三题解法让冠军选手直呼优雅——报道 dots-note-3.0 的 IMO 2026 官方评定结果、自然语言解题方式及 CMO 金牌选手评价。



