AI 快讯1200亿Token喂出机器人底座
模型上新

1200亿Token喂出机器人底座

2026-09-23T09:06:02.700Z
1200亿Token喂出机器人底座

最新研究把人类动作预训练扩展至1200亿Token,并观察到误差随数据规模按幂律下降。第一视角视频展现出比纯机器人轨迹更持久的扩展潜力,但仍无法替代具身对齐与真实世界验证。

机器人开始押注互联网里的人类经验

截至2026年9月23日,一项最新具身智能研究把人类动作预训练规模从37.5亿Token扩展到1200亿Token,数据量增长32倍,并在扩大训练规模后观察到可预测的幂律下降趋势。

**人类动作预训练是指让模型先从人类执行任务的视频中学习动作规律、物体交互和任务流程,再把这些知识迁移到机器人控制上的训练方式。**它试图回答一个直接决定机器人行业成本结构的问题:机器人是否也能像大语言模型读取互联网文本一样,通过观看海量人类视频获得通用技能?

这项工作的真正价值不在于又做出了一个更大的机器人模型,而在于它给出了一个更接近大模型发展路径的信号——至少在当前实验区间内,机器人能力并没有因为数据从几十亿Token增加到千亿Token而提前撞墙。

更关键的是,第一视角人类视频在未见任务上的扩展曲线,比真实机器人轨迹更稳定。相关公开结果显示,机器人数据在训练分布内仍然有效,但面对未见任务时更早出现收益饱和;第一视角人类数据则随着Token继续增加,保持了更清晰的Scaling趋势。

人类动作预训练规模从37.5亿Token增长到1200亿Token的曲线图,横轴为训练Token数量,纵轴为预测误差,分别展示第一视角人类视频与机器人轨迹在已见任务、未见任务上的变化

1200亿Token到底装了什么

**具身Token是将视频帧、视觉特征、语言指令和动作序列离散或分块后得到的训练单位,并不等同于大语言模型中的文本Token。**因此,1200亿视频与动作Token不能直接换算成1200亿个汉字或单词,但它仍然是衡量训练计算量和数据覆盖范围的重要尺度。

公开材料给出的整体训练数据超过3.5万小时,其中约1.4万小时来自机器人轨迹、1.6万小时来自人类视频,另有约5000小时通用多模态数据,最终形成约1200亿个训练Token。

| 数据类别 | 数据时长 | 主要作用 | 核心限制 | |---|---:|---|---| | 机器人轨迹 | 约1.4万小时 | 学习机器人可执行动作、关节控制和具身约束 | 采集昂贵,硬件与场景覆盖有限 | | 人类动作视频 | 约1.6万小时 | 学习任务流程、物体交互和动作先验 | 人与机器人形态不一致,缺少关节控制标签 | | 通用多模态数据 | 约5000小时 | 补充语义、视觉识别和语言理解能力 | 不能直接提供低层控制信号 | | 合计 | 超过3.5万小时 | 构建视觉、语言、动作统一预训练底座 | 仍需真实机器人完成具身对齐 |

**第一视角视频是由佩戴式或头戴式摄像设备记录、接近操作者视线的视频数据。**它比普通第三视角短视频更适合机器人预训练,因为画面通常能同时覆盖手部、被操作物体、目标位置和动作结果。

比如人在整理餐桌时,第一视角视频会连续记录手伸向杯子、抓取杯壁、避开盘子、移动到托盘并松手的全过程。第三视角视频也能说明“这个人收走了杯子”,但第一视角数据更容易让模型学习抓取发生在哪里、遮挡如何变化,以及动作会造成什么视觉后果。

这也解释了为什么研究团队特别强调第一视角数据,而不是笼统地声称“所有互联网视频都能训练机器人”。公开视频中大量存在剪辑、镜头切换、画外操作和不可见手部,真正能提供连续动作监督的数据只是其中一部分。

幂律下降意味着机器人有了自己的Scaling Law

**Scaling Law是模型误差、数据量、参数量和计算量之间呈稳定幂律关系的经验规律。**它最重要的意义不是证明模型已经足够聪明,而是帮助研究团队判断继续扩大训练是否仍然值得。

这类关系通常可以写成:误差E(N)=A×N^-α+B,其中N是训练Token数量,α代表扩展效率,B则是当前架构和数据条件下难以消除的误差下限。

本次公开结果没有给出足以支持跨模型横向比较的统一幂律指数,因此不能简单宣称机器人已经复制了语言模型的Scaling Law。不过,从37.5亿Token扩展到1200亿Token后,误差仍然沿着拟合曲线下降,至少说明当前模型尚未明显耗尽人类动作数据带来的收益。

**未见任务上的曲线比训练任务上的跑分更重要。**机器人在见过的桌面、杯子和抓取流程上取得高成功率,可能只是记住了数据分布;如果面对不同房间、不同物体摆放和不同任务组合仍然能受益于更多预训练数据,才说明模型正在形成可迁移的动作先验。

目前最值得关注的观察是:真实机器人轨迹对已见任务非常直接,但在未见任务上更早进入平台期;第一视角人类视频虽然没有精确的机器人关节标签,却表现出了更长的扩展曲线。

这个结果并不反常。单一型号机器人通常在固定相机、固定机械结构和有限场景内重复采集动作,数据精确但分布狭窄;人类视频的动作标签不够“干净”,却覆盖了不同家庭、工具、物体、视角和任务策略。前者像高质量专项题库,后者更像规模庞杂的通识教材。

人类视频为什么可能比机器人数据更能扩展

**机器人数据的核心瓶颈不是存储空间,而是每一秒数据都需要真实硬件参与。**机械臂或人形机器人要完成采集,往往涉及遥操作人员、设备折旧、故障恢复、场地维护、数据清洗和安全检查,增加数据量的边际成本很难像抓取网页文本那样快速下降。

人类视频则已经广泛存在于互联网、可穿戴设备和企业操作记录中。厨房备餐、仓库分拣、家庭清洁、设备维修与手工制作等场景,本身就包含大量“观察—操作—结果”链条,许多内容不需要为了训练机器人重新拍摄。

| 数据路线 | 扩展成本 | 动作精度 | 场景多样性 | 对未见任务的潜力 | |---|---|---|---|---| | 纯机器人遥操作 | 高 | 高,可获得关节与末端执行器信号 | 中低 | 容易受机器人型号和采集场地限制 | | 第一视角人类视频 | 中低 | 中,需要解决人机形态差异 | 高 | 当前实验显示扩展趋势更清晰 | | 普通第三视角视频 | 低 | 低,遮挡和镜头变化较多 | 很高 | 适合学习语义与任务流程 | | 合成视频或视频生成数据 | 边际成本低 | 取决于生成模型与物理一致性 | 可控 | 适合补长尾,但存在模型偏差 |

**第一视角视频的优势不是比机器人轨迹更精确,而是更容易覆盖技能的长尾。**机器人数据可以告诉模型Unitree G1或某款机械臂应该如何移动,但大量人类视频能够告诉模型,人们在现实世界中究竟会完成哪些任务、遇到哪些异常,以及同一目标有哪些不同解法。

这正是“押注互联网里的人类经验”的含义。大语言模型利用网页文本学习世界知识,具身模型则希望从视频中提取动作知识;两者的共同点都是先通过大规模弱监督数据形成通用底座,再使用少量高质量数据完成对齐。

视频不能直接变成机器人的肌肉记忆

**人机具身差距是指人类身体结构、动作范围和感知视角与机器人硬件之间的系统性差异。**一个人可以用五根手指捏住杯把,双指夹爪却只能从杯壁两侧施力;人可以通过肩、肘、腕连续补偿姿态,人形机器人的关节范围和控制频率则完全不同。

因此,“刷视频就能学会干活”仍然是一种过度简化的说法。视频预训练更像是在教机器人理解任务和预测后果,而不是直接给出可执行的电机指令。

一个可部署的系统至少还要解决四层问题:

  1. 语义层:理解用户究竟要求完成什么任务。
  2. 世界模型层:预测物体在抓取、推动或碰撞后会发生什么。
  3. 动作映射层:把人类动作意图转换为特定机器人的关节或末端轨迹。
  4. 安全控制层:在摩擦、延迟、遮挡和外力变化下及时停止或修正动作。

1200亿Token主要推动了前两层,并为第三层提供更好的初始化。最后一厘米的抓取精度、接触力控制和故障恢复,仍然离不开机器人本体数据与真实环境测试。

WAM-TTT和BridgeV2W提供了两条旁证

**WAM-TTT是一种在部署阶段用快速权重记忆吸收人类演示、同时冻结世界动作模型主体参数的方法。**这项同期研究与1200亿Token预训练并非同一套模型,但它证明了人类视频不只能用于离线预训练,也可以成为机器人现场学习新任务的输入。

WAM-TTT的实验显示,当训练数据由100条机器人轨迹和100条人类视频组成时,任务平均成功率达到74.1%,已经接近全部使用机器人轨迹的方案。加入人体姿态估计和动作重定向后,四项任务平均完成度反而只有28.9%,比原始方案低43.4个百分点。

| 适应方法 | 公开实验结果 | 说明 | |---|---:|---| | 100条机器人轨迹+100条人类视频 | 平均成功率74.1% | 人类视频在特定条件下可替代部分机器人轨迹 | | 姿态估计与动作重定向管线 | 平均完成度28.9% | 显式还原人体骨架可能引入额外误差 | | WAM-COTRAIN | 成功率29.8% | 直接把人类视频混入联合训练并不一定有效 | | WAM-LoRA | Table Bussing为30%,Swap Place为0% | 通用参数微调未能稳定适应任务 | | WAM-TTT | Table Bussing为100%,Swap Place为88.9% | 快速权重记忆更适合部署阶段适应 |

**BridgeV2W是一种利用具身掩码,把视频生成模型连接到机器人世界模型的训练框架。**它的思路不是直接从视频回归机器人动作,而是先让模型预测机器人采取某个动作后,未来画面可能如何变化,再在想象空间中评估策略。

BridgeV2W在训练时可以用分割模型提取人手或机器人本体的掩码,因此不要求每段人类视频都具备URDF模型和相机标定;部署时再使用机器人的几何信息生成更精确的具身掩码。这个设计降低了大规模无标注视频的使用门槛,也说明“视频预训练+少量具身对齐”正在成为一条独立技术路线。

这些结果共同指出一个容易被忽视的问题:人类视频并不是简单加入训练集就一定有效。WAM-COTRAIN只有29.8%的成功率,说明如果模型没有专门处理人类与机器人之间的视角、动作空间和身体结构差异,更多视频甚至可能成为噪声。

这会改变机器人公司的数据账本

**1200亿Token实验最可能改变的是具身智能的数据配比,而不是立刻替代现有机器人控制栈。**过去不少团队把数据护城河等同于机器人运行小时数,未来更合理的指标可能是:人类视频负责覆盖任务和环境,机器人轨迹负责提供精确动作,人类反馈与失败数据负责完成安全对齐。

如果第一视角视频的Scaling趋势在更大模型和更多硬件平台上继续成立,机器人公司的训练流程可能逐渐接近下面的三阶段结构:

  • 大规模视频预训练:从互联网和授权数据中学习物体交互、任务流程与动作后果。
  • 跨具身对齐:用相对少量的机器人数据建立视频动作与真实关节控制之间的映射。
  • 在线适应与安全验证:通过快速记忆、强化学习或世界模型规划适应新环境,同时保持底层安全约束。

这套结构会让高价值从“谁拥有最多遥操作工位”转向“谁能把异构视频稳定转化为可执行技能”。数据清洗、动作表示、跨具身迁移和部署阶段适应的重要性,可能超过单纯堆积机器人小时数。

结论:视频会成为底座,但不是全部底座

**人类视频正在成为机器人通用技能预训练最有希望的数据底座之一。**从37.5亿扩展到1200亿Token后仍出现可预测的误差下降,说明这条路线至少尚未触及明显上限;第一视角数据在未见任务上的表现,也证明多样性可能比动作标签的绝对精度更有长期价值。

但1200亿Token还不能证明机器人已经迎来自己的GPT时刻。语言模型输出错误文字的成本通常有限,机器人输出错误动作却可能摔坏物体、撞击人员或损坏本体;视频里的视觉相关性,也不自动等于真实世界中的因果关系和接触动力学。

我的判断是,人类视频不会取代机器人数据,而会把机器人数据从“主要知识来源”改造成“具身对齐与安全校准数据”。如果未来实验能在更多机器人平台、更长任务链和开放家庭环境中复现同样的幂律趋势,那么这次1200亿Token扩展的意义,才会从一次漂亮的Scaling实验,升级为机器人基础模型的数据范式转折点。

参考来源

相关推荐

查看全部