AI 快讯DYNA-2:机器人开始向人类视频要数据
模型上新

DYNA-2:机器人开始向人类视频要数据

2026-08-13T08:05:02.135Z
DYNA-2:机器人开始向人类视频要数据

Dyna Robotics 发布世界动作模型 DYNA-2,用超 100 万小时第一人称人类视频预训练,制造任务成功率最高达到 90%。它真正值得关注的不是单项成绩,而是人类视频能否成为机器人规模化训练的数据底座。

DYNA-2:机器人开始向人类视频要数据

Dyna Robotics 本周发布了机器人基础模型 DYNA-2,并把机器人训练的数据来源从昂贵的真机遥操作,扩展到了超过 100 万小时的第一人称人类视频。按照公司披露的数据,随着预训练视频规模增加,DYNA-2 在制造任务上的成功率由约 20% 提升至 80%—90%,一次客户现场部署的质量通过率也从上一代 DYNA-1 的 46% 提升至 87%。

DYNA-2 是一种世界动作模型(World-Action Model,WAM),即同时学习“物理世界接下来会怎样变化”以及“机器人应该采取什么动作”的生成式模型。它不只是识别画面里有一个瓶盖、一把刀或一根芹菜,而是要理解手指接触瓶盖后应该沿哪个方向施力、刀刃落下后食材如何位移,以及动作受干扰时怎样继续完成任务。

这次发布最值得关注的不是“最高 90%”这个单独数字,而是 Dyna Robotics 声称观察到了从人类经验迁移到机器人控制的缩放规律。机器人行业过去缺数据,现在第一次出现了一条类似大语言模型的路径:先从海量、便宜的人类视频中学习物理常识,再用少量机器人数据完成动作对齐。

DYNA-2通过观察第一人称人类视频学习切菜、拧瓶盖和精密制造动作的示意图

100 万小时视频,试图绕开机器人最贵的数据环节

机器人数据长期比互联网文本昂贵几个数量级。语言模型可以直接读取网页、书籍和代码仓库,机器人却通常需要真人拿着控制器或穿戴采集设备,让实体机械臂逐次完成抓取、折叠、装配和切割,再同步记录相机画面、关节位置、末端轨迹与夹爪状态。

真机遥操作数据是由人类直接控制机器人,并同步保存机器人观测与动作的数据。它的优点是动作标签与机器人本体严格对应,缺点是采集速度受设备数量、操作人员和物理执行时间限制;一次失败还可能打坏工件、机械臂或周边设备。

DYNA-2 的预训练则完全依赖人类视频数据。Dyna Robotics 披露的数据集超过 100 万小时,包含约 4380 万段视频片段、97160 条任务指令和 9917 类物体;若按人每天清醒 16 小时计算,这相当于约 171 年连续经验。

百万小时的意义在于把机器人预训练从“必须让机器人亲自做”改成“先看人类怎么做”。互联网上已经存在大量烹饪、维修、手工、装配和日常操作视频,只要模型能够从中抽取稳定的空间关系与物体交互规律,机器人数据就可能从预训练主粮变成后训练阶段的校准数据。

这种路线并不意味着机器人可以完全不接触真机数据。人手的自由度、触觉反馈和运动范围与机械臂不同,第一人称视频也没有直接提供关节角、扭矩和夹爪开合量,因此 DYNA-2 仍需要少量机器人专用数据,把“人类如何完成任务”映射到具体本体能够执行的动作空间。

它与 VLA 的差别,是先想世界怎么动

视觉—语言—动作模型(Vision-Language-Action,VLA)是把图像、文字指令和机器人动作放进统一模型,并直接预测下一步控制指令的架构。典型 VLA 更像一位看图下命令的驾驶员:输入当前画面和任务要求,输出机械臂下一段轨迹或离散动作。

世界动作模型则把未来画面也纳入预测目标。DYNA-2 被描述为一个基于视频生成的原生 WAM,可以对未来视频与动作同时或分别进行去噪;通俗地说,它在伸手前不只决定“手往右移动”,还会预测“手碰到瓶盖后,瓶子是否会滑动、瓶盖是否会旋转以及下一帧应该出现什么变化”。

这种联合预测有机会补上普通视觉语言模型对接触物理理解不足的问题。文字和静态图片能告诉模型杯子在桌面上,却很难完整表达杯子被侧推后会不会翻倒;连续视频天然包含速度、遮挡、形变、碰撞和物体状态变化,对学习操作任务更有价值。

DYNA-2 与上一代 DYNA-1 的路线差异也比较明确。公开信息显示,DYNA-1 采用 VLA 架构,并以 Qwen3-VL-3B 的参数进行初始化;DYNA-2 则转向以视频生成为中心的世界动作模型,不再把未来世界状态只当作动作预测的隐含副产品。

| 对比项 | DYNA-1 | DYNA-2 | |---|---|---| | 模型路线 | 视觉—语言—动作模型(VLA) | 世界动作模型(WAM) | | 核心预测对象 | 以机器人动作为主 | 未来视频与机器人动作 | | 预训练重点 | 视觉语言表征向动作控制适配 | 从人类视频学习物理变化与交互规律 | | 对照测试成功率 | 基准值 | 为 DYNA-1 的 1.55 倍 | | 对照测试综合评分 | 基准值 | 为 DYNA-1 的 1.12 倍 | | 客户现场质量通过率 | 46% | 87% | | 极端干扰表现 | 小规模后训练下较易失效 | 官方称无需人工干预即可持续运行 |

这张表不能简单理解为 WAM 已经全面取代 VLA。两代模型的架构、预训练来源和训练阶段共同发生变化,而 Dyna Robotics 尚未公开足够完整的消融实验,外界还无法准确拆分收益究竟来自更多视频、更合适的生成目标,还是后训练流程的变化。

13 分钟真机数据,展示的是预训练价值

DYNA-2 最有冲击力的实验,是仅使用约 13 分钟机器人专用数据,让两只五指灵巧手学会拧开瓶盖。五指灵巧手需要协调多根手指的位置、接触顺序和旋转力度,动作空间远比普通二指夹爪复杂,因此少量样本适配具有较高难度。

这项实验真正要证明的是预训练模型已经掌握部分可迁移的动作先验。模型如果从零开始学习,13 分钟示范通常不足以覆盖瓶子位置、手指接触点、瓶盖松紧度和操作误差;如果它已经从人类视频中理解“固定瓶身、捏住瓶盖、持续旋转”这一因果链,真机数据只需要教会它如何用特定机器人的关节复现该过程。

Dyna Robotics 还在 15 项基准任务上增加了人类视频预训练规模。公司称,在后训练数据集保持不变时,制造任务成功率从约 20% 上升到 80%—90%,说明收益并不是简单增加机器人示范带来的。

| 测试或部署场景 | DYNA-2 公布结果 | 结果应如何理解 | |---|---:|---| | 预训练数据规模 | 超 100 万小时 | 全部为第一人称人类视频预训练数据 | | 数据集片段数量 | 约 4380 万段 | 覆盖约 97160 条指令、9917 类物体 | | 制造任务成功率 | 约 20% → 80%—90% | 后训练数据不变,扩大人类视频预训练规模 | | 双五指手拧瓶盖 | 约 13 分钟真机数据 | 展示少样本本体适配能力,不代表所有任务均可复现 | | 客户现场质量通过率 | 87% | DYNA-1 为 46%,提高 41 个百分点 | | 指令条件任务得分 | 提升 133% | 来自加入视频协同训练后的官方对照结果 | | 同条件模型对决 | 65% 胜、29% 负、6% 平 | DYNA-2 对 DYNA-1 的检查点与后训练结果比较 |

客户现场的 87% 通过率比实验室里的 90% 更值得看。公司披露,两代模型在内部条件下都曾达到 100% 成功率,但进入真实环境后,DYNA-1 的质量通过率降至 46%,DYNA-2 仍有 87%;这说明世界模型的价值可能不在标准动作上多拿几分,而在光线变化、遮挡、工件偏移和人员干扰出现时少崩溃几次。

官方展示的切菜案例进一步强调了抗干扰能力。DYNA-2 被放在闪烁灯光、摄像头短时受遮挡和人为扰动条件下执行任务,并且切出的芹菜成品质量优于使用相同后训练数据配置的 DYNA-1。

“人到机器人 Scaling Law”是最大卖点,也是最大待验证项

缩放规律(Scaling Law)是指模型性能随训练数据、参数量或计算量增加而呈现相对可预测变化的经验关系。大语言模型产业正是依靠这种规律,把“扩大训练规模可能有效”变成一条可以提前规划算力与投入的工程路线。

Dyna Robotics 将本次结果称为“人到机器人缩放规律”。公司的核心观察是,加入更多第一人称人类视频后,机器人在未见数据和下游操作任务上的预测与执行表现持续改善,而且这种提升跨越了不同机器人本体。

如果这条规律得到独立验证,机器人公司的竞争重心会明显变化。过去企业需要比拼遥操作团队规模和真机数量,未来则可能更像训练视频模型:谁拥有更大、更干净、动作覆盖更广的视频数据集,谁就能训练出更强的通用物理先验,再通过少量本体数据部署到机械臂、灵巧手或移动操作平台。

但目前把它称为机器人领域的“第一条真正 Scaling Law”仍然偏激进。公开结果主要由 Dyna Robotics 自行报告,外界尚未看到完整模型权重、参数规模、训练算力、数据清洗细节、逐任务原始成绩和第三方复现实验;15 项任务与一次客户部署,也不足以覆盖柔性物体、透明物体、精细插拔、动态抓取和长流程装配等机器人难题。

跨本体扩展同样需要更多证据。双五指灵巧手的 13 分钟适配非常亮眼,但不同机器人之间不仅关节数量不同,摄像头位置、控制频率、末端执行器、负载和安全约束也完全不同;从一种机械臂迁移到另一种机械臂,远比给同一语言模型换一套提示词复杂。

人类视频很多,但并不等于物理信息完整

人类视频缺少机器人控制最关键的一部分隐变量。单目第一人称画面通常看不到手指施加了多大力,也无法直接知道物体重量、摩擦系数和关节阻力;当手掌遮住接触区域时,模型只能通过接触前后的状态变化反推中间发生了什么。

触觉缺失可能成为 WAM 路线下一阶段的瓶颈。拧瓶盖、插接头、整理柔性线缆和抓取易碎品都依赖微小的力反馈,视频能够教会模型动作的大致结构,却未必能告诉它“现在应该停止加力”;真正可靠的系统仍需要视觉、触觉、力矩和本体感知共同闭环。

数据版权与隐私也不能因为是机器人训练而被忽略。100 万小时第一人称视频来自哪里、是否获得训练授权、如何去除面部和敏感环境信息、不同国家与人群的动作习惯是否均衡,都会影响模型能否商业部署,而 Dyna Robotics 目前没有公开足够详细的数据卡。

安全问题则比生成一段错误文字更直接。世界模型即使能预测大多数情况下的下一帧,也可能在罕见物体、镜面反射或外力干扰下产生错误预期;当输出连接到刀具、机械臂和生产设备时,尾部风险不能只用平均成功率描述,还需要碰撞率、人工接管率、失败恢复率和最坏情况评估。

DYNA-2 的价值,不是让机器人看视频就能毕业

DYNA-2 的现实价值是把人类视频确立为机器人预训练的一等数据源。它没有证明机器人已经拥有通用智能,也没有消除真机采集,但它展示了一种更经济的数据配方:用百万小时人类视频学习广泛的物理变化,再用分钟级或小时级机器人数据完成本体对齐。

这条路线比单纯堆遥操作数据更有扩展性。真机数据始终受物理时间限制,一台机械臂运行一小时最多产生一小时经验,而视频预训练可以同时吸收数百万人的历史操作记录;只要模型架构能把视觉中的动作因果关系转成控制先验,机器人训练就第一次拥有接近互联网规模的数据入口。

DYNA-2 目前更像一个方向性拐点,而不是已经定型的平台产品。Dyna Robotics 尚未公布面向开发者的模型权重、完整技术报告、参数量、授权方式和标准化接入方案,因此开发者现阶段无法像下载开源视觉模型那样自行复现或测试。

接下来最值得关注的是三个数字:更多任务上的独立成功率、跨机器人本体所需的真机数据分钟数,以及客户连续运行数百小时后的人工接管率。只有这三项继续成立,“百万小时人类经验”才会从一个漂亮的发布标题,变成机器人基础模型真正可复制的规模化方法。

参考来源

相关推荐

查看全部