世界模型训练完就退场,机器人反而更强

光象科技联合清华大学李升波教授课题组发布 Phi-WM 1.0 ActEffect:世界模型只在训练阶段评估动作后果,部署时退出执行链路。该方法在 LIBERO 上达到 98.8% 平均成功率,并降低了机器人在线推理的算力与时延负担。
世界模型训练完就“退场”,机器人反而更能干了
2026 年 9 月 5 日,光象科技联合清华大学李升波教授课题组公布了第一代物理原生世界模型 Phi-WM 1.0 ActEffect。它最值得关注的地方,不是让世界模型在机器人执行任务时想得更多,而是让它训练结束后直接退出部署链路。
这和过去几年具身智能领域的主流叙事不太一样。
传统世界模型通常被设想为机器人的“脑内沙盘”:机器人看到当前画面后,先在模型中预测不同动作可能带来的未来,再从候选动作里挑一个执行。理论上,预测得越准确、搜索得越充分,机器人就越不容易犯错。但代价也很直接——更长的推理链路、更高的显存与算力消耗,以及更难控制的在线延迟。
ActEffect 采取了另一条路线:**受控世界模型是用于训练策略的后果评估器,而不是部署时持续运行的控制器。**它在训练阶段检查机器人提出的动作会导致什么结果,并将这个结果转化为策略优化信号;训练完成后,机器人只保留已经被优化过的策略,执行任务时不再依赖世界模型展开未来搜索。
从目前公布的结果看,这种“训练时重、执行时轻”的设计并非概念演示:在 LIBERO 基准上,ActEffect 达到 98.8% 平均成功率;在包含七类分布偏移的 LIBERO-PLUS 上达到 80.3%;在动作空间达到 29 维的 RoboCasa-GR1 测试中,平均成功率为 67.5%。

它解决的不是“看不懂”,而是“动作像不像不等于结果对不对”
**模仿学习是让机器人从示范数据中复制动作分布的方法,但动作与示范相似,并不保证动作造成的结果正确。**这正是 ActEffect 试图补上的一环。
目前不少通用机器人策略建立在视觉-语言-动作模型,也就是 VLA 之上。摄像头提供视觉状态,语言指令描述任务目标,模型根据人类或专家演示生成机械臂轨迹。训练时,模型输出越接近示范动作,通常越容易获得更高的训练分数。
问题在于,物理世界并不按照“动作数值距离”给结果打分。
夹爪提前几十毫秒闭合,可能就没有抓稳物体;机械臂末端姿态只偏转几度,插接动作可能从顺利完成变成卡死;推动杯子时,速度和接触点略有变化,杯子可能移动到完全不同的位置。对模型而言,这些动作在向量空间中或许相距不远,对真实机器人而言,却可能对应成功和失败两个结果。
这可以类比自动驾驶中的车道决策:两条轨迹在屏幕上看起来都接近人类驾驶数据,但其中一条可能会在几秒后压线。只看当前动作像不像,无法判断它是否会把系统带向正确的未来。
ActEffect 的判断是,与其让机器人在部署阶段实时思考更多,不如在训练期间把“动作会造成什么”这件事提前教给策略。
先让策略给出三份完整答案
ActEffect 的核心训练机制,是让策略针对同一个当前状态生成三份完整动作提案,再由世界模型比较这些提案的后果。
这三份提案分别来自不同的策略分支:
- 前馈分支输出的动作:可以理解为策略面对当前场景时的“第一反应”。
- MIP 动作头生成的粗提案:先给出一个相对粗粒度、可执行的动作方案。
- 基于粗提案进一步精修的最终动作:这是更接近实际执行结果的候选方案。
这里的关键不是候选数量,而是每份候选都必须是完整动作。扩散策略、流匹配策略在生成过程中往往会经过多个带噪中间状态,这些中间状态并不一定具有物理可执行性。如果把每一步中间结果都送进世界模型评估,模型看到的可能只是“半成品动作”,难以对应真实的物理后果。
ActEffect 因此选择在同一个起点上比较三份完整提案。它不只是问“哪个动作更接近示范”,而是进一步问“哪个动作执行后能让场景更接近任务要求”。
世界模型只看物理状态,不读取语言指令
ActEffect 中的受控世界模型负责预测视觉状态在动作作用下如何变化,而不是负责理解任务意图。
这一区分非常重要。
语言指令继续留在 VLA 策略侧,负责回答“机器人要做什么”;受控世界模型只处理“这个动作会造成什么物理变化”。例如,机器人对桌上的杯子施加一次推动动作,杯子最终移动多少、朝哪个方向移动,主要取决于杯子的当前位置、桌面摩擦、周围障碍物以及机械臂的接触方式,而不会因为指令从“把杯子挪开”换成“整理桌面”就改变物理结果。
因此,世界模型不读取语言,并不意味着它缺少任务信息,而是避免把目标语义和底层动力学混在一起。任务意图由策略负责,物理后果由世界模型负责,二者通过训练反馈连接起来。
从系统设计上看,这是一种相对克制的模块化:VLA 负责感知、语言对齐和动作生成;世界模型负责判断动作对环境的影响;优化器则利用这种判断更新策略参数。到了部署阶段,世界模型被移除,保留的是已经吸收了物理反馈的动作策略。
“退场”为什么可能带来更高的部署价值
世界模型在部署阶段退出,最大的收益不是让机器人更聪明,而是减少每个控制周期都进行未来预测的必要。
对工业机器人或服务机器人来说,在线推理的代价比论文里的平均成功率更容易决定产品能否落地。每一次动作决策都涉及视觉编码、状态预测、动作生成和控制下发。如果再叠加多步世界模型 rollout,系统就需要反复计算多个候选未来。
这会带来三类成本:
- 时延成本:机器人需要等待更多预测结果,快速抓取、避障和接触操作更容易受到影响。
- 算力成本:世界模型和策略模型同时在线运行,往往需要更强 GPU 或边缘计算设备。
- 系统复杂度:在线搜索涉及候选动作数量、预测步数和停止条件,参数越多,工程调试越困难。
ActEffect 把大部分计算转移到了训练阶段。训练当然可能更慢、更贵,但训练成本通常是一次性的;部署阶段则需要重复执行数百万次甚至更多控制循环。对工厂流水线而言,减少每个周期的计算,比单纯增加一次训练时的 GPU 消耗更有现实意义。
这也是它与“让世界模型成为机器人在线大脑”的路线差异所在。后者追求更强的即时规划能力,ActEffect 则更接近一种“把规划经验蒸馏进策略”的思路:世界模型在训练时充当教练,真正上场的只有学会了规则的运动员。
与传统模仿学习、在线世界模型的差异
| 方法 | 世界模型是否参与部署 | 训练时主要反馈 | 在线推理负担 | 典型优势 | 主要限制 | |---|---|---|---|---|---| | 传统行为克隆 | 否 | 动作与示范的相似度 | 较低 | 简单、速度快 | 容易出现动作像但结果错 | | 在线世界模型规划 | 是 | 预测未来状态与任务奖励 | 较高 | 能进行动态规划和候选搜索 | 时延、算力与系统复杂度较高 | | ActEffect | 否 | 候选动作造成的物理后果 | 较低 | 训练时利用物理反馈,部署轻量 | 依赖世界模型的预测质量与覆盖范围 |
ActEffect 的真正定位不是替代所有在线规划,而是在不增加部署链路负担的前提下,让模仿学习获得结果层面的监督。
如果任务环境高度结构化、动作节奏稳定、实时性要求高,那么这种方案有明显吸引力。比如零件抓取、物体推移、插接、桌面整理等任务,动作后果与局部视觉状态之间通常存在较强关联,训练好的策略可以直接输出动作。
但如果环境变化极大,或者任务需要长时间、多步骤的临时规划,世界模型完全退出也可能成为限制。机器人在训练数据覆盖之外遇到新障碍时,缺少在线预测和搜索能力,可能无法像具备规划模块的系统那样临场修正。
三组成绩说明了什么
**LIBERO 上 98.8% 的平均成功率,说明 ActEffect 在相对标准化的操作任务中已经具备很强的策略优化效果。**LIBERO 通常用于测试机器人在语言指令、视觉状态和操作动作之间的泛化能力,任务包括抓取、放置、开关和物体交互等。
**LIBERO-PLUS 上 80.3% 的成功率,更能体现它对分布偏移的适应能力。**这里加入了七类分布变化,可能涉及物体外观、位置、光照、任务组合或场景条件的变化。与标准 LIBERO 接近满分相比,PLUS 环境中的成绩明显下降,说明机器人仍然会受到训练分布与真实变化之间差距的影响,但 80.3% 也表明后果反馈并非只对固定模板有效。
**RoboCasa-GR1 上 67.5% 的平均成功率,则把问题推向了更复杂的动作空间。**29 维动作空间意味着策略需要同时处理更多自由度,候选动作之间的差异也更难通过简单的距离度量判断。在这样的环境中,ActEffect 仍能达到 67.5%,显示出方法对复杂控制任务具有一定迁移能力,但距离可直接用于高风险工业场景,还有明显工程距离。
需要注意的是,这些数字不能直接等同于真实机器人部署成功率。仿真基准能够控制环境变量,却无法完全复现真实世界里的摩擦变化、传感器噪声、执行器误差、线缆干涉和安全约束。尤其是世界模型本身如果主要在仿真或有限数据上训练,预测出的“正确后果”仍可能与现实存在偏差。
这不是世界模型退潮,而是角色重新分工
ActEffect 的信号并不是世界模型没有用,而是世界模型未必需要一直在线才能创造价值。
过去的讨论经常把世界模型和机器人策略绑定在一起:模型预测未来,策略根据预测选择动作。但从工程角度看,世界模型至少有三种不同角色:
- 仿真器:为策略提供大量训练环境和合成数据。
- 评估器:判断候选动作可能导致的状态变化和任务结果。
- 在线规划器:部署时实时预测未来并搜索动作。
ActEffect 主要使用了第二种角色,同时放弃第三种角色。这样做可以绕开在线规划的成本,但也把系统成败更多地压在训练质量上:如果世界模型在训练时错误地判断某个动作会成功,策略就可能把这种错误反馈学进去。
因此,未来更可能出现的不是“所有机器人都不用世界模型”,而是不同任务采用不同组合。高速、重复、低延迟任务可以采用 ActEffect 这类训练后退场的方案;开放环境、长时序任务和高不确定性任务,仍然可能需要在线世界模型、价值函数或局部搜索模块。两者甚至可以组合:默认由轻量策略直接执行,只有检测到异常或置信度不足时,才临时唤起世界模型进行规划。
对具身智能开发者的启发
对开发者而言,ActEffect 最值得借鉴的不是一个具体模块,而是“把结果监督前移”的系统思路。
第一,评估动作时不要只计算动作空间距离。对于接触丰富的机器人任务,最终状态、物体位姿变化和任务完成度往往比轨迹是否逐点贴近示范更重要。
第二,候选动作必须具备明确的物理语义。扩散过程中的中间噪声状态不适合作为真实动作评估对象,完整、可执行的动作提案更适合交给后果模型比较。
第三,要将语言目标与物理预测解耦。语言告诉策略任务是什么,物理模型判断动作会发生什么,二者职责清晰后,系统更容易复用和调试。
第四,评测不能只看单一基准。LIBERO 的 98.8% 很亮眼,但 LIBERO-PLUS 的 80.3% 和 RoboCasa-GR1 的 67.5% 同样重要,因为它们暴露了模型面对分布偏移和高维控制时的真实边界。
判断:这是更务实的世界模型路线
ActEffect 的价值,在于它没有把世界模型神化成一个必须在线思考的“机器人通用大脑”,而是把它降格为训练阶段的物理老师。
这条路线不一定在所有任务上都优于在线规划,但它更符合当前机器人产业的一个现实:很多系统首先需要的是稳定、低延迟、可控成本地把事情做完,而不是每一步都生成一段复杂的未来推演。
如果后续实验能够在真实机器人、长时序任务和更复杂的跨场景泛化中复现当前结果,ActEffect 可能会推动具身智能从“世界模型越大越好”转向更细致的系统设计:哪些知识应该留在世界模型里,哪些知识应该被训练进策略,哪些能力只在异常情况下被调用。
世界模型训练完就退场,听起来像是主动放弃能力;但在机器人领域,少一个在线模块,有时反而意味着更短的控制链路、更低的部署成本,以及更容易真正进入生产现场的系统。至少从 ActEffect 目前公布的结果看,世界模型不必一直站在台前,才能发挥作用。
参考来源
- 知乎:用于补充具身智能、世界模型与机器人策略学习的公开讨论背景。
- Hugging Face:用于了解开源机器人模型、具身智能数据集与评测生态的公开信息。
- GitHub:用于追踪机器人学习、世界模型和 LIBERO 等相关开源项目的公开资料。
注:本文根据 2026 年 9 月 5 日公开报道整理。Phi-WM 1.0 ActEffect 的完整论文、代码、训练细节及真实机器人测试范围,应以研究团队后续发布的正式材料为准。



