AI 快讯HOST开源:机器人看一遍就会
模型上新

HOST开源:机器人看一遍就会

2026-08-03T05:05:06.638Z
HOST开源:机器人看一遍就会

自变量机器人开源HOST框架,机器人只需观察一段平均29秒的人类视频,即可在不微调模型的情况下学习新任务,成功率达到62%。

自变量机器人在今天(2026年8月3日)发布并开源了 HOST 框架,让机器人只看一段数十秒的人类操作视频,就能尝试执行此前没有训练过的新任务。按照官方披露的数据,HOST 从一段平均29秒的人类视频中获取新技能,任务成功率达到62%;对比零样本基线的45%,提高了17个百分点。

HOST 最值得关注的地方不是“机器人会看视频”,而是它把学习新技能从训练阶段挪到了推理阶段。机器人不需要为每项新任务重新采集数十条示范、更新模型参数,再等待一轮微调,而是在执行任务时直接把人类视频当成目标参照。

这更接近人类的观察学习,也可能是通用机器人走出实验室的一条现实路径。

HOST框架让机器人观察人类视频并学习新技能的流程示意图,左侧为人类演示,中间为视觉预测与任务进度对齐,右侧为机器人执行

一段29秒视频,成功率做到62%

HOST 是 Human-to-robot One-Shot Skill AcquisiTion 的缩写,即“人类到机器人单样本技能获取”框架。这里的单样本不是只给机器人看一张图片,而是只提供一段完整的人类任务演示视频,让机器人从中提取任务目标、步骤和预期结果。

官方披露的核心数据可以概括如下:

| 指标 | HOST | 对照方案 | 差异 | |---|---:|---:|---:| | 人类演示数量 | 1段视频 | 通常需要多条示范或额外训练数据 | 单样本获取 | | 演示视频平均时长 | 29秒 | 未披露统一口径 | 数十秒级输入 | | 新任务成功率 | 62% | 零样本基线45% | 提高17个百分点,相对提升约37.8% | | 相对 π0.5(Pi-0.5)微调方案的数据量 | 1/50 | 50倍 | 数据量减少50倍 | | 技能获取速度 | 约500倍 | π0.5 + 微调 | 跳过任务级微调循环 | | 任务进度对齐误差 | 降低一个数量级 | 常规时间对齐 | 约为10倍量级的改善 | | 是否更新模型参数 | 不需要任务级微调 | 需要微调 | 在推理时获取技能 |

62%的成功率还谈不上解决机器人学习,但对单条、平均29秒的人类视频来说,这个数字已经有实际意义。机器人领域最昂贵的环节之一不是模型训练本身,而是由真人遥操作机器人、反复执行任务并清洗轨迹数据;如果一项技能只需要拍摄一段普通人类视频,数据生产成本会出现结构性变化。

45%的零样本基线也说明基础策略并非完全不会这些任务。HOST 提升的核心,是让机器人在已有视觉、动作与物理先验之上,理解“这一次具体要把环境变成什么样”,而不是从头学会抓取、移动和放置。

需要注意的是,官方目前给出的62%属于特定实验设置下的结果。任务集合大小、物体分布、场景变化范围、硬件平台和成功判定标准,都会直接影响机器人跑分;在这些信息完整公开并得到独立复现之前,62%不能简单外推为家庭或工厂里的通用成功率。

HOST不模仿手,而是预测结果

HOST 的核心思路是先预测任务结果,再反推动作。它不要求机器人逐帧复制人类的手部轨迹,而是先判断人类动作会让场景发生什么变化,再调用机器人自己的动作能力实现这种变化。

这一差别看似只是建模方式不同,实际上绕开了机器人模仿学习中最难处理的问题之一:人和机器人的身体根本不一样。

人类有手指、腕关节和柔顺的肌肉控制,机器人可能只有两指夹爪、不同长度的机械臂以及完全不同的关节自由度。即便把视频中的人手轨迹恢复为精确的三维坐标,机器人也未必能够照着走;强行映射动作,不仅容易出现不可达姿态,还可能把“完成任务”错误地等同于“复刻动作”。

结果导向的表示把重点从“手怎么动”改成了“环境应该变成什么样”。例如,人类把桌上的杯子放进托盘时,机器人不需要复制手指如何包住杯壁,只需要理解杯子从桌面移动到托盘、最终保持稳定这一状态变化,然后使用自己已经掌握的抓取和放置动作完成任务。

这种设计借鉴了认知科学中的观察学习。观察学习是指学习者通过观察他人的行为及其结果,在不进行大量亲身试错的情况下形成新行为;HOST 将这一过程实现为视觉结果预测、进度定位和机器人动作生成,而不是为每个新任务重新训练一套策略。

从工程角度看,HOST 更像给机器人的基础策略增加了一层“现场任务说明”。基础模型负责提供抓取、移动、放置等通用能力,人类视频负责告诉它这些能力此次应当如何组合,以及任务完成后的世界应该是什么样。

按进度对齐,而不是按秒对齐

HOST 解决的第二个关键问题是人类演示和机器人执行速度不一致。人类可能用3秒拿起物体,机器人需要8秒;如果系统机械地把视频第5秒与机器人执行第5秒对应,机器人看到的参考画面可能已经进入下一步骤。

这种错位在长序列任务中会不断累积。假设人类在10秒内完成切菜并开始翻炒,而机器人在第10秒仍处于切菜阶段,按时间戳对齐会让策略误以为自己应当立刻操作炒锅,最终跳过尚未完成的步骤。

HOST 使用动态时间规整来进行任务进度对齐。动态时间规整(Dynamic Time Warping,DTW)是一种将两条速度不同的序列按内容相似度进行匹配的算法,它允许一方的若干帧对应另一方的一步或多步,因此不要求两条序列以相同速度推进。

具体来说,HOST 会把人类视频的每一帧和机器人执行过程的每一步编码到同一个向量空间。系统比较的不是“现在都是第几秒”,而是“当前场景在任务流程中处于哪一个阶段”,随后为机器人找到人类视频中进度最接近的参考帧。

任务进度对齐让人类视频变成了一条可以伸缩的视觉时间轴。机器人动作慢时,系统可以在同一阶段停留更久;机器人完成某一步后,参考进度再向后推进,类似播放器根据实际执行情况动态调整播放位置,而不是强制按照原视频速度播放。

官方称,这种方法将进度对齐的时间误差降低了一个数量级。“一个数量级”通常意味着约10倍量级的改善,不过目前公开材料没有给出误差从多少秒降至多少秒,也没有披露不同任务长度下的完整分布,因此这个结果仍需要结合论文和开源评测细节判断。

两个“专家”分工:一个想画面,一个管动作

HOST 的策略核心是带视觉预测能力的级联模型。级联策略模型是指前一个模块先产生中间预测,后一个模块再基于预测输出控制动作;在HOST中,这个中间结果就是机器人继续执行后,环境可能出现的未来画面。

该框架采用双专家 MoT 架构,把视觉理解和动作控制交给两个分工不同的专家:

  • 视频专家负责理解演示。 它处理人类视频,判断当前任务进度,并预测接下来应该出现的视觉状态。
  • 动作专家负责控制机器人。 它把预测的未来状态转换为机器人能够执行的动作序列,再控制机械臂完成操作。

双专家设计避免让同一个网络同时承担跨物种视频理解和高频动作控制。前者关注物体关系、任务阶段和未来结果,后者关注机器人本体状态、关节约束和动作可执行性,两者所需的信息粒度并不相同。

“先想象、后行动”也是 HOST 与常规行为克隆的主要区别。行为克隆是直接学习从当前观测到专家动作的映射,但人类视频通常没有机器人的关节角、夹爪状态和控制指令,无法直接提供机器人动作标签;HOST 先预测视觉结果,相当于建立一座与具体身体形态关系较弱的桥梁。

这种拆分并不意味着动作问题已经消失。视觉专家可以预测“抽屉应该打开”,但动作专家仍需解决抓住把手、施加合适方向的力、避免碰撞等问题,因此 HOST 的上限依赖基础动作策略原本掌握了多少可复用能力。

从训练时微调,变成推理时获取

HOST 把训练分成“同体预训练”和“人机视频训练”两个阶段。同体预训练是指机器人先从自身执行任务的视频和动作中学习视觉结果与控制动作之间的关系,从而建立“做这个动作,环境会怎样变化”的内部模型。

人机视频训练负责缩小人类演示与机器人观测之间的表示差异。人类和机器人虽然动作形态不同,但操作的物体、任务目标和环境状态可以共享;模型需要把两类视频映射到可比较的任务进度与结果空间中。

训练完成后,新任务不再触发一次新的参数微调。机器人接收一段人类视频,通过视频专家理解目标和进度,再由动作专家使用既有能力执行,这就是官方所说的“推理时技能获取”。

这一机制也解释了 HOST 为什么能够保留旧技能。任务级微调可能覆盖模型原有参数,造成灾难性遗忘;灾难性遗忘是神经网络学习新任务后,旧任务性能显著下降的现象。HOST 不为单个新任务修改核心模型参数,理论上更不容易因学习一次新操作而破坏此前能力。

但“推理时获取”不应被直接理解为机器人已经永久学会。公开信息尚未说明人类视频是否会被压缩为可长期复用的技能记忆,也没有说明机器人重启或更换场景后能否脱离原视频稳定复现;就现阶段信息看,更准确的说法是“机器人能以视频为上下文执行新任务”。

比微调快500倍,真正省下的是数据闭环

HOST 相对 π0.5 + 微调方案减少50倍数据、提升约500倍技能获取速度,优势主要来自取消任务级数据采集和训练。传统流程通常要先遥操作机器人完成多次示范,再整理观测—动作轨迹、启动微调、验证结果,并在失败后补采数据。

一段普通人类视频则容易获得得多。开发者可以让熟悉任务的人直接演示,而不必要求演示者掌握遥操作设备;对于整理桌面、收纳物品或装配新零件这类频繁变化的任务,这会明显缩短部署周期。

| 方案 | 新任务输入 | 是否任务级微调 | 跨本体难点 | 主要优势 | 主要限制 | |---|---|---|---|---|---| | 零样本基础策略 | 文字、图像或当前观测 | 否 | 较低,但缺少具体示范 | 部署最快 | 复杂新任务成功率有限 | | 行为克隆 | 多条机器人动作轨迹 | 是 | 人类视频无法直接提供动作标签 | 动作监督直接 | 数据采集成本高,分布外易失败 | | π0.5 + 微调 | 任务数据与机器人轨迹 | 是 | 需要适配机器人本体 | 可针对任务优化 | 数据和训练耗时较高 | | HOST | 一段人类演示视频 | 否 | 通过结果预测和进度对齐处理 | 数据少、获取快、较少遗忘 | 依赖基础动作能力,当前成功率62% |

500倍是一个很亮眼的数字,但它不能被等同为执行动作快500倍。这里比较的是新技能获取或适配流程的速度,而不是机械臂移动速度;机器人真正执行任务时,仍受电机、控制频率、安全限制和场景复杂度约束。

50倍的数据优势也需要统一统计口径。单条人类视频与机器人遥操作轨迹在采集难度、传感器信息和标注成本上并不等价,后续更值得观察的是:同等成功率下需要多少人类演示、多少机器人预训练数据,以及失败后是否仍需补采机器人轨迹。

HOST的价值,是让“教机器人”更像教人

HOST 对具身智能最现实的意义是降低长尾任务的部署成本。工业流水线里的固定任务可以用大量数据反复训练,但家庭、门店、仓库和实验室存在大量低频且不断变化的任务,为每一种情况单独制作机器人数据集并不经济。

人类视频天然覆盖了丰富的长尾技能。互联网上有海量烹饪、维修、装配和整理视频,如果跨本体学习能够继续提升,机器人训练数据就不再局限于昂贵的遥操作轨迹,而可以部分利用已有的人类行为视频。

不过,HOST 目前还不能证明机器人可以直接观看任意网络视频并稳定工作。公开视频存在镜头切换、遮挡、加速剪辑、第三人称视角、缺少深度信息等问题,而实验演示通常场景更干净、视角更稳定,两者之间仍有明显距离。

62%的成功率同样意味着约38%的尝试没有成功。对于桌面整理,失败可能只是物体没放准;对于刀具、热源、玻璃器皿或人机协作场景,38%的失败率无法直接用于生产,因此安全约束、失败检测和在线纠错仍然不可缺少。

开源之后,开发者应重点看四件事

HOST 能否成为可复用框架,最终取决于开源内容是否足以复现实验。发布消息确认了框架开源,但现有参考材料没有完整列出仓库地址、许可证、模型权重、训练数据和硬件配置,开发者不应只根据演示视频判断成熟度。

后续最值得核对的是以下四项:

  1. 开源范围是否完整。 代码、预训练权重、推理脚本、评测任务和训练配置是否全部提供,决定了“开源”是可复现研究还是仅开放部分组件。
  2. 62%的评测边界是什么。 需要查看任务数量、每项任务试验次数、是否更换物体和背景,以及失败是否允许重试。
  3. 跨本体能力能走多远。 同一种机械臂上的新任务,与更换夹爪、机械臂乃至移动底盘后的迁移,难度不在同一层级。
  4. 推理成本是否适合实时控制。 视频预测模型通常计算量不低,视觉规划频率、动作延迟和所需GPU规格,会决定它能否部署到真实机器人上。

独立复现将比单次跑分更能说明 HOST 的价值。如果不同团队能在不同机械臂、不同相机视角和未见过的物体上接近62%的结果,HOST 才真正证明“单视频学习”不是针对特定环境调出的演示效果。

判断:方向比当前跑分更重要

HOST 现阶段更像一套有前景的技能适配方法,而不是已经成熟的通用机器人学习系统。62%的成功率说明它仍有明显失败空间,开源细节和完整实验口径也需要进一步核验。

但 HOST 选择的问题非常关键:机器人不能永远依赖昂贵的本体数据学习每一项新技能。把人类视频转化为任务结果和进度参照,再复用机器人的既有动作能力,比强行复制人手轨迹更符合跨本体学习的实际条件。

如果这条路线能够扩展到更复杂的长序列任务,未来给机器人增加技能的过程可能不再是“采集数据—重新训练—部署验证”,而是让人演示一次,机器人现场理解并执行。HOST 还没有把这个目标完全实现,但它至少把学习周期从微调循环压缩到了一段29秒的视频。

参考来源

相关推荐

查看全部