Zeva:冻结参数也能自进化

清华 AIR 联合域变换提出具身世界动作模型 Zeva,以 In-Context Causal Learning 从交互历史中即时适应环境。冻结权重后,其多项具身任务累计成功率仍从 26% 提升至 73%。
冻结权重,机器人却在多次尝试中越做越好
**清华大学智能产业研究院(AIR)与域变换近日提出具身世界动作模型 Zeva,试图让机器人在不更新模型参数的情况下,从刚刚发生的交互经验中持续改进动作。**截至 2026 年 9 月 1 日披露的信息,Zeva 在多个典型具身基准任务中,将冻结模型的累计成功率从 26% 提升至 73%;在真实化学实验室场景里,机械臂也表现出“多试几次后越来越稳”的适应现象。
**Zeva 是首个实现具身 In-Context Causal Learning(ICCL)的世界动作模型。**ICCL 即“上下文因果学习”,是指模型把近期交互中的动作、环境变化与任务结果放进上下文,通过识别“哪个动作导致了什么结果”来修正下一步决策,而不是依赖反向传播修改神经网络权重。
这项工作的关键不是又做了一个更大的机器人基础模型,而是改变了机器人“学习发生在哪里”。传统训练把经验写入参数,Zeva 则试图把短期经验写入上下文:模型本身保持冻结,但每一轮交互都会为下一轮推理增加新的证据。
这听上去像文字模型根据对话内容临时掌握用户偏好,但具身任务要难得多。聊天模型回答错一句话,通常只损失一次交互;机械臂把烧杯碰倒、夹爪打滑或动作轨迹偏离,错误会立刻改变物理环境,甚至让后续任务无法继续。

26% 到 73%,提升来自推理阶段而非再训练
**Zeva 最值得关注的数据,是冻结模型的累计成功率由 26% 上升至 73%。**这一变化相当于提高 47 个百分点,最终成绩约为初始成绩的 2.81 倍,按相对增幅计算约为 180.8%。
| 指标 | 初始冻结模型 | 使用 ICCL 后 | 变化 | |---|---:|---:|---:| | 多项具身任务累计成功率 | 26% | 73% | +47 个百分点 | | 相对提升 | 1 倍 | 约 2.81 倍 | 约 +180.8% | | 推理期间是否更新权重 | 否 | 否 | 不变 | | 适应信息来源 | 预训练知识 | 预训练知识 + 当前交互历史 | 增加在线经验 |
**这组结果的含金量在于,性能增长并不依赖现场微调。**机器人部署后收集数据、清洗轨迹、计算梯度、更新权重,再重新验证和上线,是一条成本很高的闭环;如果模型能够直接利用交互上下文改善后续决策,适应过程就可能从“小时或天级训练任务”缩短为“一次推理会话内的即时调整”。
累计成功率也不能被简单理解为单次任务成功率从 26% 跳到 73%。“累计”意味着模型可能在多轮尝试中获得新信息,并把之前的失败转化为后续成功;最终数字会受到尝试次数、任务划分、是否重置环境、上下文长度和成功判定方式影响。后续判断 Zeva 的泛化能力,仍要看完整论文中的评测协议、基线设置、置信区间与逐任务结果。
换句话说,73% 是一个相当醒目的信号,但还不是“机器人已经会自主学习一切”的证据。它首先证明的是:冻结参数不等于冻结行为,推理上下文本身也可以成为一条有效的适应通道。
ICCL 不只是“记住失败”,而是追问失败为什么发生
**普通的 In-Context Learning(ICL)是模型根据上下文示例完成新任务的能力。**在语言模型中,用户给出几组问答格式,模型不经过训练便能模仿格式继续作答,这就是最常见的上下文学习。
**In-Context Causal Learning(ICCL)进一步要求模型从交互轨迹中判断因果关系,而不是只复现表面相关性。**对于机械臂而言,看到“夹取失败”并不够,它还需要区分失败究竟来自夹爪闭合过早、接触位置偏移、物体材质打滑,还是上一步动作改变了物体姿态。
一个直观例子是夹取透明实验器皿。第一次失败后,如果模型只是记住“这条轨迹不好”,下一次可能会随机换一条路径;如果模型能够推断“夹爪接触点偏高导致器皿倾斜”,它就可以在下一次尝试中主动降低接触位置。前者是经验相关性,后者才接近因果归因。
**具身因果学习的价值在于,同一种表面失败可能对应完全不同的物理原因。**机器人看到的图像、语言指令和动作序列只是观测,真正决定任务结果的还包括摩擦力、物体质量、关节误差、夹爪状态以及环境中没有被传感器完整捕捉的变量。ICCL 要做的,是在有限上下文里找出最可能影响结果的因素,并据此选择下一次行动。
这种设计也解释了为什么 Zeva 被称为“自进化 WAM”。这里的“自进化”不是模型自行改写代码或永久改变参数,而是行为能力随着上下文中的经验增加而提高;一旦清空上下文,相关的短期适应是否仍能保留,需要取决于系统有没有额外的外部记忆机制。
WAM 把“预测世界”和“选择动作”放进同一条链路
**世界动作模型(World Action Model,WAM)是同时利用环境状态、动作与未来结果进行预测和决策的具身模型。**它不仅要理解摄像头里有什么,还要估计“如果现在执行这个动作,接下来会发生什么”,再从候选行为中选择更可能完成任务的一种。
传统视觉模型更像观察员,负责识别物体和空间关系;动作模型更像执行员,根据输入生成控制序列;世界模型则像沙盘,负责预演不同动作可能造成的后果。WAM 的目标,是把观察、预演与执行连接起来,使模型能够围绕物理结果作出决策。
**Zeva 的变化是把近期真实交互也纳入这条预测链路。**模型面对的输入不再只是当前画面和任务指令,还包括“刚才做过什么、环境怎样变化、最终是否成功”等历史信息。新的动作因此不只是基于预训练时学到的一般规律,也会参考当前机器、当前物体和当前环境的即时反馈。
这对真实部署尤其重要。即使两台机械臂型号相同,它们的关节零点、夹爪磨损和相机标定也可能存在细微差异;同一种容器装入不同剂量液体后,质量和重心也会改变。每个变化都重新收集数据并微调模型并不现实,而上下文适应可以让模型在任务过程中逐步校正。
它和在线学习、强化学习不是一回事
**Zeva 的 ICCL 与在线微调、强化学习和常规上下文学习解决的是相近问题,但更新对象不同。**最核心的分界线,是系统是否在部署现场修改模型参数。
| 方法 | 部署时更新权重 | 经验如何进入系统 | 适应速度 | 主要风险 | |---|---|---|---|---| | 在线微调 | 是 | 通过梯度写入参数 | 通常需要多轮训练 | 灾难性遗忘、训练不稳定、算力开销 | | 在线强化学习 | 通常是 | 奖励信号驱动策略更新 | 依赖探索次数 | 真实环境探索成本高、安全风险大 | | 模仿学习 | 训练阶段通常是 | 学习人类示范轨迹 | 取决于示范规模 | 容易复制示范偏差,分布外状态脆弱 | | 普通 ICL | 否 | 示例进入上下文 | 推理时即时生效 | 可能停留在模式匹配 | | Zeva 的 ICCL | 否 | 交互轨迹及结果进入上下文 | 多次尝试内生效 | 上下文容量、因果误判与错误累积 |
**ICCL 的优势是把适应成本从训练阶段挪到了推理阶段。**它不需要现场计算梯度,也不必为了每一个新物体重新生成训练版本,因此更适合实验室自动化、柔性制造和家庭机器人这类环境持续变化、任务批量又不够大的场景。
**ICCL 的代价是上下文会越来越长,推理成本和信息筛选难度也会随之上升。**如果系统把几十次无关失败全部塞入上下文,真正有用的因果线索反而可能被噪声淹没。工程上需要解决哪些轨迹值得保留、怎样压缩长期经验、何时清空错误记忆,以及如何避免一次异常反馈污染后续决策。
参数冻结也不等于系统绝对安全。一个错误的因果判断虽然不会永久写入权重,却可能在当前任务的后续步骤中连续放大;在化学实验、工业装配和医疗辅助等场景中,短期错误一样可能造成不可逆后果。
一次人类演示的意义,不在“少一条数据”
**公开报道显示,Zeva 还能利用一次人类演示快速调整后续行为。**单次演示并不是传统意义上的大规模模仿学习数据集,而更像放在上下文中的一条高质量因果线索:人类展示动作顺序、接触位置和操作节奏,模型再结合自己的执行反馈作出修正。
**单次演示真正降低的是任务配置成本。**在实验室里,如果研究人员能够先做一次移液、抓取或容器摆放,机器人随后通过自身试验稳定下来,就不必为每个实验流程采集数百条专家轨迹。这种能力比单纯追求更大的参数量更贴近机器人落地中的成本结构。
但“一次演示”并不等于所有任务都只需要一个样本。任务复杂度、模型预训练覆盖范围、演示质量与环境差异都会决定最终效果;对于训练分布之外的新工具、新材料或长时序任务,一条示范是否足够仍需要更细的消融实验支持。
化学实验室是一个比桌面抓取更有说服力的场景
**真实化学实验室验证提高了 Zeva 结果的应用价值。**实验室操作通常包含透明或反光器皿、狭小工作空间、精细接触、多步骤依赖和严格安全约束,这些因素都比标准桌面抓取更容易放大感知与控制误差。
公开信息显示,机械臂在多次尝试中呈现“越用越稳”的趋势。这种稳定性如果来自模型对自身动作结果的即时归因,而不是人工重新标定设备,就意味着 ICCL 有机会处理现实部署中最常见的“最后一公里”偏差。
**化学实验同时也会暴露 ICCL 的安全边界。**一个系统不能为了学习倾倒动作而无限试错,更不能把危险试剂当成普通积木探索。真正进入生产环境前,Zeva 一类模型仍需要动作约束、碰撞检测、风险分级、人工接管和可回滚状态等外部安全层。
因此,Zeva 更合理的早期落地方式不是完全自主接管实验室,而是在低风险材料、数字孪生或受约束动作空间中积累经验,再逐步扩大自主操作范围。
“参数冻结、能力暴涨”并不违反机器学习常识
**冻结的是神经网络权重,不是模型在当前上下文中计算出的内部状态。**Transformer 类模型会根据输入序列动态计算注意力和隐状态,因此即便参数完全不变,不同的交互历史也能产生完全不同的决策。
语言模型已经展示过类似现象:同一个模型在没有示例时可能答错,加入几条高质量示例后便能显著提高正确率。Zeva 把这一机制搬到物理交互中,只是上下文不再是纯文本,而是状态、动作、反馈与结果构成的多模态轨迹。
**真正困难的部分不是让模型读取历史,而是让历史形成可执行的因果修正。**机器人必须把“观察到什么”“采取了什么动作”“环境发生了什么变化”和“任务是否完成”对齐起来;只要其中一个环节存在时间错位或感知误差,模型就可能把成功归因给无关动作。
这也是 Zeva 后续最值得检查的技术细节:因果变量如何表示,交互轨迹怎样组织,上下文长度是多少,模型如何区分自身动作与环境扰动,以及面对相互冲突的经验时采用什么选择机制。当前公开结果说明方向有效,但完整技术路线仍应以正式论文、项目页面和可复现实验为准。
Zeva 的价值,是为机器人增加“工作记忆”
**Zeva 更像给机器人增加了一块能做因果推理的工作记忆,而不是让模型一夜之间获得永久学习能力。**它解决的是部署现场的快速适应:今天这只夹爪有轻微偏移、这只杯子更滑、当前工作台光线不同,模型能否从刚发生的失败中马上调整。
这条路线与扩大具身模型规模并不冲突。更大的预训练模型提供更广泛的物体、动作和物理先验,ICCL 则负责把这些先验快速校准到当前环境;前者决定模型“原本知道多少”,后者决定它“能否从眼前几次尝试中学会”。
**从产业角度看,推理时适应可能比单纯扩大参数更直接地降低部署成本。**机器人客户真正关心的往往不是模型榜单高了几个点,而是换一批零件、移动一次相机或更换夹爪后,是否还要工程师重新采集数据和训练模型。若 26% 到 73% 的累计成功率提升能在更多真实设备上复现,这会显著缩短具身系统的调试周期。
现在还不能把它等同于持续学习
**Zeva 展示的是上下文内适应,而完整的持续学习通常还要求经验跨任务、跨会话长期保留。**如果系统关闭后清空上下文,第二天仍需从头试错,那么它更接近高效的短期学习,而不是具备长期记忆的自主智能体。
未来系统可能把 ICCL 与外部记忆、经验检索和周期性离线训练结合起来:短期经验先在上下文中即时生效,经过验证的轨迹再进入长期记忆,最后由离线训练固化为模型能力。这样可以在速度、稳定性与知识保留之间取得平衡。
Zeva 目前最重要的贡献,是证明机器人不必每次都靠改参数才能进步。“参数冻结、能力暴涨”并不是魔法,而是把交互经验从训练数据变成推理条件,把一次次失败从需要回炉处理的数据,变成下一次动作可以立即利用的证据。
这比“又一个更大的具身模型”更值得关注。模型规模决定能力上限,而能否在真实世界里边做边学,决定机器人离开演示视频后究竟能走多远。
参考来源
- GitHub:检索 Zeva 与 In-Context Causal Learning 相关公开项目:用于跟踪项目代码、实验配置及后续公开仓库;是否为官方实现应以仓库认证信息为准。
- Hugging Face:检索 Zeva 相关模型与资料:用于关注模型权重、演示页面或社区复现;截至发稿应以项目团队正式发布信息为准。



