小艺物理奥赛理论卷拿下28.6分
华为小艺在IPhO 2026理论考试中取得28.6分,达到满分的95.3%。成绩展示了AI处理复杂物理推导的能力,但测试规则、工具权限和评分细节仍待披露。
华为小艺在物理奥赛理论卷上拿到28.6分
华为在7月30日宣布,小艺完成第56届国际物理奥林匹克竞赛(IPhO 2026)理论考试,并取得28.6分、满分30分的成绩,超过本届理论考试金牌线。
28.6分意味着小艺拿到了理论卷总分的95.3%,距离满分只差1.4分。对一套包含流体力学、相对论、几何光学、热力学和电磁学的综合试卷来说,这不是依靠记忆公式就能获得的分数,而是一次对问题建模、长链推导和结果验证能力的集中测试。

国际物理奥林匹克竞赛理论考试是一项面向中学生的高难度物理测试,要求参赛者从陌生情境中建立模型,并用数学推导得到可以评分的结论。与常规考试相比,IPhO题目通常不会直接告诉考生应该使用哪条定律,也很少能通过套用一道相似例题解决。
华为此次公布的成绩足够亮眼,但现阶段更准确的说法是:小艺在一套封闭、可评分的高难度物理题上展示了接近满分的求解能力。它证明AI科学推理已经明显越过简单知识问答阶段,却还不能直接等同于AI能够独立开展物理研究。
三道题为什么难
本届IPhO理论考试的难点不只是计算量大,而是每道题都要求系统在多个物理分支之间切换,并维持较长推导链条的一致性。
根据华为公布、IT之家转述的信息,本届理论卷的三道大题分别覆盖以下内容:
- 第一题要求处理流体静力学中的力矩平衡,并进一步进入相对论散射问题。
- 第二题围绕光学多次反射展开,需要推导渐晕线包络线,并使用泰勒展开处理近似关系。
- 第三题涉及磁制冷循环,需要证明麦克斯韦关系,并完成降温时间的积分计算。
物理建模是把自然语言描述的真实或理想化情境,转换成变量、约束条件、守恒关系和可求解方程的过程。模型一旦建立错误,后续计算即便完全正确,也只是在精确地回答另一个问题。
长程推理是模型在多步推导中持续维护前提、中间变量和逻辑关系的能力。IPhO题目经常需要连续完成十几步甚至更多步骤,早期漏掉一个负号、边界条件或近似适用范围,错误就会一直传递到最终答案。
科学推理能力是系统基于明确假设建立模型、推导结果并检查结论是否符合物理约束的能力。它与普通问答最大的区别在于,正确答案不只取决于模型记住了多少知识,还取决于模型能否把知识组织成一条自洽、可检查的证明链。
这三类题目放在一起,实际考查了AI的三种薄弱环节:能否读懂复杂条件,能否在长推导中保持状态,以及能否发现自己的中间结果已经违反量纲、极限情况或守恒定律。
28.6分的含金量在哪里
小艺此次成绩的真正价值,在于物理题比纯数学题多了一层现实建模的不确定性。数学奥赛通常会给出定义清晰的对象和严格约束,而物理奥赛需要先判断哪些因素可以忽略、哪些近似成立,以及题目描述对应什么物理过程。
| 测试对象 | 年份与考试 | 理论得分 | 得分率 | 可说明的问题 | 主要限制 | |---|---:|---:|---:|---|---| | 华为小艺 | IPhO 2026理论卷 | 28.6/30 | 95.3% | 复杂物理建模、长程推导与综合计算能力 | 华为尚未完整公开逐题答案、评分细则与运行配置 | | Physics Supernova | IPhO 2025理论卷 | 23.5/30 | 78.3% | 专用物理智能体能够完成高难度奥赛理论题 | 与2026年试卷难度不同,不能直接横向排名 | | 华为小艺 | IMO 2026数学竞赛题 | 42/42 | 100% | 代数、几何、数论和组合数学推理能力 | 数学题与物理题的建模要求并不相同 |
小艺的28.6分比Physics Supernova在2025年测试中取得的23.5分高5.1分,对应得分率高17个百分点。这个数字可以作为AI物理推理进展的参考,但不能被解释为小艺一定强21.7%,因为两套试卷的题目、难度和评分环境并不相同。
Physics Supernova是一个面向物理奥赛解题设计的AI智能体,公开报道显示其在IPhO 2025三道理论题上获得23.5分。相关项目介绍可见知乎整理的技术文章,但该成绩同样不等于正式学生参赛成绩。
奥赛分数是当前评估科学推理模型较有效的指标之一,因为它比选择题更难被猜中,也比开放式科研任务更容易客观评分。每一步公式、结论和数值都可以检查,系统是否真正完成推导,通常会在答卷中留下明确证据。
奥赛分数又不是完整的科学能力指标,因为试题仍然具有清晰目标、有限信息和标准答案。真实科研往往没有现成问题陈述,研究者需要先判断什么问题值得研究,再设计实验、处理噪声,并接受假设可能从根本上错误。
关键不只是底层模型,而是Agentic系统
Agentic系统是能够围绕目标自主规划步骤、调用工具、检查结果并根据反馈修正方案的AI系统。华为将此次成绩归因于小艺的Agentic系统,这意味着完成试卷的可能不是一次性生成答案的单一模型,而是一套包含规划、推理、计算和验证环节的工作流。
多智能体协同是把复杂任务拆分给不同角色模型处理,再由调度模块整合结果的方法。此前小艺参加AI竞赛时披露过Planner、Thinker和Coder等模块:Planner负责制定解题路径,Thinker负责探索思路,Coder负责生成和执行计算方案。
迭代验证是这类系统拉开分差的关键,因为高难度物理题最常见的失败并不是完全不会做,而是在一条基本正确的推导中混入局部错误。一个负责求解的模型可能忽略符号或边界条件,另一个验证模块则可以通过量纲分析、极限情况和数值代入发现问题,再触发重新推导。
多模态复杂任务是同时包含自然语言、公式、图形、表格或界面操作的任务。IPhO试卷经常使用示意图定义几何关系,因此模型不仅要识别文字和公式,还要理解图中方向、距离、角度与物理量之间的对应关系。
这也是华为强调多模态Agent潜力的原因:真实世界的科学问题很少以一段干净文本出现,更多时候散落在论文图表、实验记录、仿真软件和仪器界面中。能够完成书面试卷只是第一步,下一步是让系统在这些异构信息之间稳定地传递状态。
仍有三个问题需要华为回答
测试透明度决定了28.6分究竟是一项可复现的技术结果,还是一场表现出色但信息有限的产品演示。目前公开信息给出了总成绩和题目范围,却没有完整披露逐题得分、标准答案、原始输出、人工干预规则与评卷过程。
工具权限会显著影响AI在物理考试中的表现。如果系统可以自由调用符号计算、数值积分、搜索或多轮自我验证工具,其测试目标就是整套Agent工程能力;如果只允许模型在固定时间内独立生成答案,测试目标才更接近底层模型本身。
计算预算也会影响成绩的可比性。一个系统可以为每道题生成数十条候选推导,再由验证器筛选最佳答案,而人类考生必须在有限考试时间内完成作答;两者都可以解决同一道题,但成本、速度和方法完全不同。
独立评分是建立行业可信度的最后一环。华为目前使用的是超过金牌线这一表述,但AI并非以普通学生身份进入IPhO正式奖牌排名,因此更严谨的说法应当是:其理论卷得分按公开竞赛标准达到了金牌区间,而不是小艺正式获得了IPhO金牌。
华为如果进一步公布答卷、评分rubric、每题耗时、总推理Token、使用模型版本、外部工具列表和失败重试次数,这项结果的研究价值会明显提高。对开发者而言,完整失败轨迹甚至比最终28.6分更重要,因为它能解释系统究竟是在建模、计算还是验证环节取得了突破。
从IMO满分到IPhO 28.6分
小艺在一周内连续公布数学与物理奥赛成绩,显示华为正在把竞赛Agent作为验证复杂推理能力的重要窗口。此前披露的信息显示,小艺在IMO 2026题目测试中取得42分满分,而此次IPhO理论卷得分率为95.3%。
数学奥赛满分与物理奥赛高分共同说明,当前高端AI推理系统正在从单次语言生成转向复杂问题建模、长程推理、工具协同和严格验证。底层大模型提供知识与推理候选,Agent框架则负责控制过程、分配计算资源并压低错误率。
物理成绩比数学成绩更能暴露系统是否具备跨领域迁移能力,因为同一道题可能同时涉及几何关系、微积分、近似展开和物理直觉。模型需要在符号系统与现实含义之间来回切换,而不能只把问题当成形式化字符串操作。
小艺是华为自主研发的AI智慧助手,目前覆盖网页、手机、平板、手表、智慧屏、车机、家庭中控、PC、耳机和音箱等设备。它提供知识问答、写作、文档阅读、编码和鸿蒙代码生成等功能,奥赛Agent则代表了这套助手在复杂推理方向上的能力上限。
今年6月,小艺Claw接入开源盘古openPangu 2.0 Pro模型,重点增强鸿蒙系统级任务执行能力。华为给出的数据是,该模型针对昇腾算力进行优化,单卡吞吐率可达到其他业界主流开源模型的2倍,不过这一性能数字仍需要在统一硬件、精度和输入长度条件下比较。
对开发者和用户意味着什么
这项成绩短期内不会让手机助手直接变成物理学家,但会提升复杂任务代理进入实际产品的可信度。一个能够拆解奥赛题、维护中间变量并自我检查的系统,也更有机会处理长文档分析、代码调试、工程计算和跨应用任务。
教育场景可能最早受益,因为奥赛解题系统可以展示多个思路、定位错误步骤,并根据学生的推导提供针对性反馈。真正有用的产品不应该只报出答案,而应该明确区分已知条件、假设、推导和结论,让用户能够检查每一步。
工程场景对可靠性的要求会比奥赛更高,因为一个看似合理的错误公式可能带来真实损失。AI在芯片验证、材料模拟或控制系统中的输出,必须附带可追踪的计算过程,并经过传统求解器、仿真工具或人类专家复核。
华为全场景设备生态是小艺相较纯网页模型的重要优势,因为Agent可以直接接触日程、文档、设备状态和系统能力。它的挑战也同样明显:系统权限越高,错误操作的代价越大,权限隔离、确认机制和执行审计必须跟推理能力同步升级。
一次高质量实测,但还不是科学智能的终点
小艺的28.6分是一个值得重视的信号:AI已经能够在高难度物理题中完成跨章节建模和长链推导,而不再只是检索定义或复述例题。95.3%的得分率也说明,专用Agent与验证机制可以把底层模型的能力进一步放大。
这项成绩目前仍更接近受控环境中的能力上限,而不是开放世界中的可靠性证明。没有完整答卷、工具权限、计算预算和独立评测信息,外界还无法判断28.6分中有多少来自底层模型、多少来自搜索与计算工具,又有多少来自多轮候选筛选。
真正的下一道题不是再刷一张更难的试卷,而是把这种推理能力带进没有标准答案的现实任务。AI需要学会发现问题、提出可证伪假设、设计验证方案,并在证据不支持结论时主动承认失败;做到这些之后,科学推理才会从竞赛高分变成真正的科研生产力。
参考来源
- IT之家:华为官宣小艺高分超出第56届国际物理奥林匹克竞赛理论金牌线——提供小艺28.6分成绩、IPhO 2026题目范围及华为官方表述。
- 知乎:Physics Supernova智能体挑战2025年国际物理奥赛——介绍Physics Supernova在IPhO 2025理论题测试中的成绩与方法背景。


