50万小时视频,世界模型摸到触觉

Generalist AI 的 GEN-1 从50万小时真实世界视频中学习接触规律,不依赖显式触觉标签。它还不等于拥有皮肤,却把世界模型从“看懂运动”推进到“理解受力后果”。
世界模型第一次试着“摸”东西
截至 2026 年 7 月 28 日,Generalist AI 最新披露的 GEN-1 正在给机器人世界模型补上一种关键能力:不依赖大规模力传感器和触觉阵列标注,仅从约 50 万小时真实世界视频与操作轨迹中,学习物体接触、形变、滑动和受力后的状态变化。
**GEN-1 是一种面向机器人操作的世界动作模型,即根据当前观测与候选动作,预测物理世界接下来会怎样变化。**它最受关注的地方不是单纯扩大视频训练规模,而是引入了官方所称的“隐式触觉”:模型虽然没有真正的皮肤,却试图从视觉变化和动作结果中建立接触动力学表征。
50 万小时相当于连续观看约 57 年视频,也是目前公开披露的机器人视频学习数据规模中最激进的一档。与近期同类项目相比,GEN-1 的训练规模约为 Being-H0.7 所披露 20 万小时的 2.5 倍,是 DreamDojo 44,711 小时的约 11.2 倍,也是 EgoScale 2 万小时的 25 倍。

这项工作的价值很明确:**机器人不再必须先装满昂贵的触觉传感器,才能学习“碰到东西之后会发生什么”。**不过,把它称为真正意义上的触觉仍然偏早。GEN-1 学到的是触觉相关的潜在物理规律,而不是直接测得的压力、剪切力、温度或材料纹理。
“隐式触觉”到底是什么
**隐式触觉是模型从视觉运动、物体形变和动作后果中推断接触状态,而非直接读取触觉传感器数值的能力。**例如,一只手捏住纸杯时,杯壁凹陷幅度能够暗示施力大小;抹布在桌面上突然减速,能够反映摩擦变化;玻璃杯在夹爪里发生微小旋转,则可能意味着夹持力不足或正在滑落。
视觉视频本身并不包含“当前压力为 4.2 牛”“摩擦系数为 0.6”这样的标签,但其中保留了力作用后的结果。模型可以把动作、接触点和后续画面联系起来,在潜在空间中学习一套未被显式命名的物理变量。
这种学习方式类似于人隔着玻璃观察别人揉面团。观察者没有亲手接触面团,却仍能从手指陷入深度、面团回弹速度和拉伸形态,大致判断它是柔软、黏稠还是富有弹性。GEN-1 做的事情更系统:把海量视频里的这些变化压缩成可用于预测和控制的内部表征。
**隐式触觉并不等同于触觉传感。**真正的触觉传感器可以直接测量法向力、切向力、振动、温度和局部接触分布,尤其擅长发现相机难以捕获的微小滑移;隐式触觉则胜在数据来源广、训练规模大,而且可以从普通视频中获得监督信号。
两者更可能是互补关系,而不是替代关系。视觉预训练负责建立广泛的物理常识,机器人本体上的力矩、触觉和关节传感器则负责校准现实中的精细反馈,这比要求模型只依赖某一种模态更符合实际部署需求。
GEN-1 与普通视频模型差在哪里
**普通视频生成模型关心“下一帧长什么样”,世界动作模型关心“执行这个动作后,世界会变成什么样”。**前者可以生成看起来合理的运动,后者还必须建立动作与结果之间的可控关系,否则无法服务机器人规划。
假设桌上放着一只装水的纸杯,机器人准备从侧面抓取。普通视频模型可能预测杯子被拿起后的连续画面;世界动作模型则需要比较不同夹爪位置、闭合幅度与移动速度造成的后果,例如杯壁是否被压瘪、杯子是否滑落、水是否溢出。
动作条件是这类模型从“视频生成”走向“机器人控制”的关键。模型必须知道状态变化究竟源于机械臂向左移动、夹爪加力,还是物体自身惯性,而不能只学习画面中的相关性。
**潜在动作是从没有机器人控制标签的视频中提取可操作信息的一种方法。**大量人类视频只记录了手与物体的运动,并没有关节角度、末端执行器位姿或夹爪开合量,因此模型需要先在潜在空间中识别“拿起”“推动”“旋转”“释放”等动作变化,再把这些变化映射到具体机器人本体。
这也是 50 万小时数据真正有用的前提。单纯把更多视频塞进模型,并不会自动产生机器人能力;模型还需要解决动作识别、时序因果、视角变化以及不同身体结构之间的对齐问题。
50万小时数据意味着什么
**50 万小时最大的意义是覆盖更多接触方式,而不只是提高画面多样性。**机器人操作的长尾并不只来自物体类别,还来自材质、重量、重心、摩擦、遮挡和动作速度的组合。
一只机械臂即使会抓 100 种杯子,也可能在杯壁有水、桌面倾斜或杯中液体晃动时失败。接触任务中的变量是连续的,很难像图像分类那样依靠有限类别覆盖,因此视频规模对于建立物理先验尤为重要。
| 模型或数据项目 | 公开训练视频规模 | 主要路线 | 是否强调动作条件 | 是否强调触觉相关表征 | |---|---:|---|---|---| | GEN-1 | 约500,000小时 | 真实世界视频世界动作模型 | 是 | 是,隐式触觉 | | Being-H0.7 | 约200,000小时 | 人类视频与隐式推理世界模型 | 是 | 非主要公开卖点 | | DreamDojo | 44,711小时 | 第一人称视频、潜在动作、实时世界模型 | 是 | 非主要公开卖点 | | EgoScale | 约20,000小时 | 第一人称视频与视频—动作预训练 | 是 | 未作为核心能力强调 | | 传统机器人模仿学习 | 通常远低于上述规模 | 机器人示范与行为克隆 | 是,动作标签明确 | 取决于硬件采集 |
这张表不能被理解为直接跑分排名。各项目对“小时”的统计口径、数据质量、视频视角和动作密度并不一致,50 万小时公开视频也不必然比 5 万小时高质量机器人轨迹更有效。
**数据质量仍然可能是 GEN-1 的最大不确定性。**大量互联网或自然视频缺少精确动作标签,镜头会切换,接触区域会被手掌遮挡,同一个视觉结果也可能对应完全不同的受力过程。
因此,真正决定上限的不是总时长,而是模型能从其中提取多少有效的“状态—动作—结果”三元组。若 50 万小时里只有少部分包含清晰操作和连续接触,其有效训练密度就会明显低于同规模的机器人遥操作数据。
它为什么比传统 VLA 更像一个世界模型
**视觉—语言—动作模型(VLA)是把视觉观测、语言指令和机器人动作放进统一模型的具身智能架构。**VLA 擅长回答“用户要我做什么”以及“下一步应该输出什么动作”,但纯粹依赖行为克隆的 VLA 往往缺少对动作后果的显式预测。
以“把熟透的番茄放进篮子”为例,VLA 可以根据示范学会靠近、抓取和移动;世界动作模型还需要提前判断抓取力度过大是否会挤破番茄,力度过小是否会导致滑落。前者更像直接模仿老司机打方向盘,后者则试着理解车辆为何会转弯、打滑或失控。
| 技术路线 | 核心学习目标 | 主要优势 | 主要短板 | |---|---|---|---| | 行为克隆 | 从观测直接预测专家动作 | 训练简单、执行链路短 | 容易复制错误,分布外状态恢复能力弱 | | VLA | 根据视觉和语言生成动作 | 指令理解强,任务迁移方便 | 可能知道该做什么,却不清楚动作后果 | | 视频世界模型 | 预测未来视觉状态 | 能学习环境动态,可用于仿真 | 画面合理不代表物理正确 | | 世界动作模型 | 预测候选动作导致的未来状态 | 可以比较动作后果并辅助规划 | 训练和实时推理成本更高 | | 显式触觉策略 | 使用压力、力矩等传感数据控制 | 接触反馈精确、响应直接 | 硬件成本高,跨设备数据难统一 | | GEN-1式隐式触觉 | 从视频动作后果学习接触规律 | 数据可扩展,能建立广泛物理先验 | 无法替代高精度实时触觉测量 |
GEN-1 的路线更接近“先在脑中试一遍”。当机器人面对多个候选动作时,模型可以预测每个动作可能产生的后续状态,再选择风险更低的方案,而不是只生成一个看似最像训练数据的动作。
这种能力对分布外恢复尤其重要。行为克隆一旦进入示范中没有出现过的状态,错误就可能连续累积;世界模型至少提供了一种重新评估后果的机制,让策略有机会停下来、调整夹爪或换一个接触点。
真正的难点是因果,不是画面
**机器人世界模型最难解决的问题是因果混淆。**模型看到夹爪闭合后物体上升,并不意味着它真正理解“夹持产生摩擦力,摩擦力克服重力”这一过程,它也可能只是记住了两段视觉模式经常连续出现。
因果理解不足会在陌生物体上暴露。例如训练视频中常见的纸盒重量较轻,模型可能把“夹住盒子即可抬起”当作稳定规律;换成外观相似但内部装满金属零件的纸盒后,同样动作就可能失败。
**视觉歧义是隐式触觉无法绕开的物理限制。**物体被遮挡时,相机看不到接触面;两个外观相同的材料可能具有完全不同的摩擦系数;透明、反光和柔性物体也会让视觉运动估计变得不稳定。
这意味着 GEN-1 更适合作为触觉先验,而不是触觉替代品。它可以帮助机器人在第一次接触前形成合理预期,但在精密装配、插拔连接器、抓取易碎物和处理布料时,实时力控依然不可缺少。
现在还不能只看“首个”与“最大”
GEN-1 的技术方向值得重视,但目前公开信息还不足以证明它已经解决通用机器人操作。“首个隐式触觉世界动作模型”属于项目方的定位,行业尚缺少统一的隐式触觉定义和标准化评测。
一套有说服力的评测至少应回答四个问题:
- **接触预测是否准确:**能否预测滑移、碰撞、形变和抓取失败,而不只是生成视觉上连贯的视频;
- **闭环控制是否有效:**模型加入真实机器人后,任务成功率相较普通 VLA 或行为克隆提升多少;
- **跨本体迁移是否成立:**从人类视频学到的动作知识,能否迁移到双指夹爪、多指灵巧手和不同机械臂;
- **实时性是否可接受:**世界模型能否在控制周期内完成预测,而不是离线生成几秒钟的视频。
目前最该警惕的是用生成视频质量代替物理能力。机器人并不需要一段看起来漂亮的未来,而需要在毫秒到秒级控制周期内得到可靠、可验证的动作后果预测。
**没有统一成功率、预测误差和推理延迟数据,就无法仅凭 50 万小时判断 GEN-1 是否领先。**训练规模证明了团队在数据和计算上的投入,但模型最终仍需在真实机器人闭环、陌生材质和失败恢复任务中接受检验。
世界模型正在从“看见”走向“干预”
**GEN-1 真正推动的是世界模型训练目标的变化。**过去的视频模型主要学习“世界如何自行演化”,现在的世界动作模型开始学习“当智能体介入后,世界如何改变”。
这一变化对于具身智能比生成更清晰的视频重要得多。机器人不是坐在电影院里的观众,而是会碰倒杯子、拉断电线、捏碎水果的参与者;一个不理解接触后果的世界模型,很难成为可靠的行动底座。
GEN-1 还没有让机器人获得人类意义上的触觉,但它证明了一条更容易扩展的路线:先用 50 万小时视频建立粗粒度的物理直觉,再通过少量高质量机器人轨迹和真实传感器反馈完成对齐。
**我们的判断是,隐式触觉不会取代机器人皮肤,却可能成为未来 VLA 和世界模型的标准预训练能力。**视觉数据负责把物理常识做到足够宽,触觉与力控数据负责把真实执行做到足够准,这种“海量视频预训练+本体传感校准”的组合,比单纯堆机器人示范更有机会继续扩展。
世界模型所谓的“触觉”,眼下更像是在看到物体变形后猜出它有多软,而不是亲手感觉到柔软。但对于长期困在数据稀缺和本体差异中的机器人行业来说,能通过普通视频学会这种猜测,已经是一次值得关注的范式推进。
参考来源
- 视频世界模型的两条脉络:梳理 DreamDojo、潜在动作空间及视频世界模型的主要技术路线。
- OpenVLA 官方 GitHub 仓库:用于了解开源视觉—语言—动作模型的架构、训练方式与机器人部署基础。
- Physical World Models 资料汇总:汇总物理世界建模、视频预测和具身世界模型相关研究。



