清华VPP2登顶具身智能榜

星动纪元发布世界动作模型VPP2,在RoboDojo评测中以32.26%的综合成功率和39.26分综合得分登顶,超过GPT-6-Astra、π0.5和GR00T-N1.7。其关键路线不是把视频和动作混在一起训练,而是先学会预测物理变化,再分阶段学习机器人动作。
清华VPP2登顶具身智能榜:视频预测和动作学习,终于不再“一锅炖”
星动纪元的世界动作模型 VPP2,近日在具身智能仿真评测基准 RoboDojo 中拿下全球第一。根据公开评测结果,VPP2 的综合平均成功率为 32.26%,综合平均得分为 39.26 分,超过 OpenAI 的 GPT-6-Astra、Physical Intelligence 的 π0.5,以及英伟达 GR00T-N1.7。
这次结果最值得关注的,不只是清华系团队赢过了几家全球头部公司,而是它给出了一个相当明确的技术判断:视频预测和动作学习不一定要同时优化,先让模型学会“世界会怎么变化”,再让它学习“机器人该怎么做”,可能更适合具身智能。

VPP2到底赢在哪里
RoboDojo是一个用于测试机器人在非结构化环境中泛化能力的具身智能仿真评测平台。 据公开资料,该平台由香港大学MMLab牵头,并联合近20所学术机构建设,包含42项双臂操作任务,覆盖泛化、精细操作、长程任务、记忆和开放词汇指令理解五个维度。
这类评测和传统机器人数据集不太一样。传统数据集更像是“考试题库”:训练数据里见过的物体、动作和场景,机器人往往能够按照模板完成。RoboDojo更接近“换题考试”,会改变物体位置、环境布局、指令表达和任务组合,测试模型是否真正理解了动作背后的物理规律。
从结果看,VPP2并不是只在单一指标上取胜,而是在综合成功率和综合得分上同时领先:
| 模型 | 综合平均成功率 | 综合平均得分 | 与VPP2差距 | |---|---:|---:|---:| | VPP2 | 32.26% | 39.26分 | — | | GPT-6-Astra | 22.48% | 28.97分 | 成功率低9.78个百分点,得分低10.29分 | | 其他对比模型 | 公开资料未完整披露 | 公开资料未完整披露 | — |
VPP2相较GPT-6-Astra的综合成功率提高了9.78个百分点,综合得分提高了10.29分。 如果只看绝对数字,32.26%的成功率仍然谈不上“机器人已经会干活”;但在包含未见场景、精细操作和长程任务的综合测试里,这个差距已经足以说明模型路线存在结构性差异。
公开结果还显示,VPP2在泛化能力、精细操作和记忆能力三个关键维度上均排名第一。也就是说,它的优势不是只会把物体抓起来,而是更擅长处理“没见过的摆放方式”、对动作力度和轨迹要求更高的任务,以及需要记住前序状态的连续操作。
真机成绩比榜单更重要
零样本真机迁移是指模型不经过针对目标机器人或具体任务的额外微调,直接部署到真实机器人上执行。 在真实ALOHA双臂机器人测试中,VPP2覆盖抓取、放置、堆叠等10类任务,平均成功率达到 58.5%,对比模型π0.5的平均成功率为 40%。
按照公开材料,VPP2在10类任务中有9类取得最佳成绩。这个结果的意义在于,仿真榜单上的领先并没有完全停留在“虚拟世界里”。机器人最终要面对的是摄像头噪声、机械臂误差、物体摩擦变化和光照差异,仿真中一条看似完美的轨迹,到了真实环境可能就会变成抓空、碰撞或物体滑落。
不过,58.5%的平均成功率也应当被正确解读。它说明VPP2已经具备一定的跨场景迁移能力,但距离仓储、家庭和工业现场要求的稳定性仍有距离。对于一个需要连续执行数十个步骤的任务,单步成功率哪怕达到95%,整体成功率也可能因为误差累积而明显下降。具身模型真正的商业门槛,不是一次演示成功,而是长时间运行下的可靠性、可恢复性和安全性。
核心变化:把“看未来”和“做动作”拆开
世界动作模型是能够同时建模环境变化与机器人动作的模型,目标是预测某个动作会让现实世界发生什么变化。 传统做法往往试图让模型一边预测未来视频,一边直接输出机器人动作,类似于让一个人同时担任物理模拟器、导航规划器和机械臂控制器。
这种端到端路线的优点很明显:系统链路短,理论上可以从视觉输入直接得到动作输出。但问题也很明显。视频生成追求的是“未来画面看起来合理”,动作控制追求的却是“机械臂每一帧都不能偏”。一个模型可能能够预测杯子会被拿起,却无法准确判断夹爪应该提前多少毫秒闭合;也可能生成一段视觉上连贯的视频,却输出无法被真实机械臂执行的轨迹。
VPP2的关键选择,是将视频预测与动作学习进行解耦,并重新安排训练顺序。简单说,它不是把所有目标都放进同一个损失函数里反复拉扯,而是先建立对物理变化的预测能力,再把这部分能力转化为动作决策。
据公开资料,VPP2采用了分阶段训练思路,主要包括以下环节:
- 事件级视频继续预训练。 模型首先利用多源视频、任务描述和事件级预测,学习“物体发生了什么变化”。这里的重点不是逐帧复述画面,而是理解诸如“手臂靠近物体—夹爪闭合—物体被抬起—位置发生改变”这样的事件链。
- 保留和强化物理预测能力。 通过事件级目标,模型需要关注接触、位移、遮挡、状态转换等与动作结果相关的因素,而不是只学习视频表面的纹理连续性。
- 蒸馏与分阶段动作学习。 在具备世界状态预测能力后,模型再学习如何把预测结果映射为机器人动作,并通过蒸馏等方式降低推理成本,同时减少动作训练对原有泛化能力的破坏。
这里的“解耦”不是简单地把一个模型拆成两个完全互不相干的模型,而是将不同学习目标按阶段排序。视频模型负责回答“如果继续这样运动,世界可能变成什么样”;动作策略负责回答“为了达到目标,我现在应该采取什么动作”。
为什么“视频、动作一锅炖”容易失效
具身模型中的目标冲突,是指视频预测要求画面合理,而动作学习要求控制结果可执行,二者优化方向并不总是一致。 视频预测可以容忍小幅度的位置误差,只要整体画面和事件逻辑看起来合理;机器人控制则不能接受这种误差,因为几毫米的偏差就可能导致夹爪错过物体。
举个例子:模型预测“把红色积木放到蓝色积木上方”。对视频生成来说,只要最终画面里红色积木大致出现在蓝色积木上方,预测就可能被视为成功。但对机器人来说,放置过程至少还包含夹爪姿态、接近速度、接触点、释放高度和碰撞风险等约束。最终画面正确,并不代表动作轨迹正确。
反过来,如果一开始就把大量动作监督加入视频预训练,也可能让模型过早适应有限的机器人数据。机器人动作数据的规模通常远小于互联网视频,且设备、视角和任务类型高度集中。模型可能因此变得“会做训练集里的动作”,却失去对新物体、新空间和新指令的泛化能力。
VPP2的方案本质上是在做能力分工:先用更广泛的视频和事件信息学习世界的变化规律,再用机器人数据学习如何将规律落地。它不一定是所有具身任务的最终答案,但至少绕开了一个长期存在的工程矛盾——既要保持视频模型的知识和泛化,又要让动作输出足够精确。
“不靠外挂和额外数据”意味着什么
所谓不使用额外数据,是指VPP2在该次对比中主要依赖标准数据集和预训练基座能力,没有通过额外采集数据或特定增强手段获得评测优势。 公开资料还称,VPP2没有使用Agent RSI等额外增强方式。
这个信息对于评测公平性很重要。具身智能模型的成绩很容易受到数据规模、机器人型号、任务筛选和测试时增强策略影响。如果一个模型在测试阶段拥有额外轨迹、在线搜索或针对评测集的强化流程,那么榜单成绩就很难直接反映模型本身的泛化能力。
VPP2的结果更接近一次“标准条件下的模型能力对比”:在相同或相近的基础条件下,通过训练目标和模型组织方式的改变获得提升。当然,这并不意味着模型完全不需要机器人数据,也不意味着它已经解决了数据瓶颈。具身智能仍然需要高质量的动作轨迹、真实世界反馈和跨机器人适配数据,只是VPP2说明,如何使用这些数据,可能比盲目增加数据量更关键。
与GPT-6-Astra、π0.5和GR00T-N1.7相比,VPP2处在什么位置
具身模型的竞争已经从单纯的视觉理解,转向世界建模、动作规划和真实机器人执行的联合能力。 GPT-6-Astra代表通用大模型向物理世界扩展的路线,π0.5代表专注机器人操作和策略学习的路线,GR00T-N1.7则体现了英伟达围绕机器人基础模型和硬件生态构建平台的思路。
| 模型 | 代表性路线 | 公开评测中的特点 | 需要关注的问题 | |---|---|---|---| | VPP2 | 视频预测与动作学习分阶段解耦 | RoboDojo综合成功率32.26%,综合得分39.26分;真实ALOHA零样本成功率58.5% | 真实场景规模化部署、长程任务稳定性仍需验证 | | GPT-6-Astra | 通用大模型向具身任务扩展 | RoboDojo综合成功率22.48%,综合得分28.97分 | 通用能力如何转化为低延迟、高精度控制 | | π0.5 | 面向机器人操作的策略模型 | ALOHA对比测试平均成功率40% | 跨平台泛化和复杂环境下的持续执行 | | GR00T-N1.7 | 机器人基础模型与硬件生态结合 | 具备平台化和工程落地优势 | 不同机器人本体之间的迁移效率 |
这张表不能简单得出“VPP2全面碾压所有竞品”的结论。RoboDojo和ALOHA测试分别衡量不同能力,模型版本、推理设置和训练条件也会影响结果。但可以确定的是,在题述公开评测口径下,VPP2已经证明了自己的路线有效,而且是真正意义上的第一名,而不是仅在某个边缘指标上领先。
这对具身智能行业意味着什么
VPP2最重要的行业信号,是具身智能模型开始从“端到端更简单”转向“模块化但能力相互传递”。 过去几年,端到端模型因为链路短、训练目标统一而受到追捧;但机器人系统最终仍然需要感知、预测、规划和控制之间存在不同时间尺度。视频预测关注未来几秒甚至更长时间的状态变化,底层动作控制却可能需要在几十毫秒级别做出反应。
把二者完全合并,理论上可以得到一个统一模型,但工程上常常要在泛化、实时性和稳定性之间做取舍。VPP2的解耦路线则更像“高层规划加底层执行”:高层模型负责理解事件和预测结果,低层策略负责把目标变成可执行的动作。
这种方法可能带来三个直接影响:
- 训练效率更容易优化。 视频数据和机器人动作数据可以分阶段使用,不必强行把所有数据组织成完全一致的训练格式。
- 能力迁移更清晰。 预训练阶段获得的物理常识和状态预测能力,可以通过蒸馏或策略学习传给动作模块。
- 系统调试更可控。 当机器人抓取失败时,工程师可以区分是状态预测错了,还是动作执行偏了,而不是面对一个难以解释的黑盒输出。
但解耦也有成本。模块之间需要传递足够准确的状态表示,视频预测如果只停留在“看起来合理”,仍然可能误导动作规划;分阶段训练还可能造成目标不一致和误差累积。因此,真正决定这条路线能否落地的,不只是榜单成绩,还包括模型在低延迟推理、传感器变化、机械臂更换和异常恢复方面的表现。
结论:榜单第一不是终点,但路线已经变了
VPP2登顶RoboDojo,说明具身智能的关键突破未必来自更大的模型或更多的数据,也可能来自训练目标和能力顺序的重新设计。 它选择先让模型学习“世界如何变化”,再学习“机器人如何行动”,在公开结果中同时改善了仿真泛化和真实ALOHA零样本操作表现。
对于开发者而言,VPP2值得关注的不是“清华模型击败了哪些名字”,而是它提出了一个可复用的工程问题:在具身任务中,视频生成、世界建模和动作控制,是否真的应该用同一种方式、在同一阶段、由同一个目标共同优化?
目前来看,答案可能是否定的。具身智能正在从“让一个大模型直接控制机器人”,转向“让模型先理解物理变化,再把理解转化为动作”。VPP2是否能在更多机器人平台和真实工业场景中保持优势,还有待后续开源代码、完整实验设置和更多第三方复现验证。但至少在2026年10月这次评测中,解耦视频预测与动作学习,已经从一种训练策略,变成了具身模型竞争中的新变量。
参考来源
- GitHub:用于查找星动纪元VPP2及相关开源代码,具体仓库以项目方最新发布为准。
- 知乎相关讨论搜索:汇总VPP2、RoboDojo及视频预测与动作学习解耦路线的公开讨论。
- Hugging Face:可用于关注具身模型、机器人策略模型及相关评测模型的公开信息。
注:本文根据2026年10月9日前后公开资料整理。RoboDojo的完整评测配置、模型权重和第三方复现结果,仍应以项目方后续发布的官方材料为准。



