AI 快讯机器人看3秒就会新动作
模型上新

机器人看3秒就会新动作

2026-08-21T11:04:22.109Z
机器人看3秒就会新动作

Generalist AI 发布 GEN-1.5,把一次性上下文学习带进物理世界:机器人观看3至12秒演示即可执行新任务,10项任务平均成功率为59%。

机器人开始用“动作”当提示词

Generalist AI 近日发布机器人基础模型 GEN-1.5,机器人只需观看一次持续 3 至 12 秒的动作演示,就能在不微调、不更新参数的情况下尝试执行新任务。在官方公布的 10 项任务中,GEN-1.5 的一次演示平均成功率达到 59%;加入约 5 分钟数据、50 次演示和 10 个梯度更新步骤后,平均成功率提高到 83%。

GEN-1.5 是一个面向通用物理操作的机器人基础模型,其核心卖点不是把某项动作练得更熟,而是让机器人在推理阶段临时理解此前没有专门训练过的任务。这个差别很重要:传统机器人部署一个新技能,往往要重新采集数据、训练策略、验证稳定性;GEN-1.5 则试图把新任务变成一段可以直接塞进上下文的“动作提示词”。

这也是 GEN-1.5 被称为机器人“GPT-3 时刻”的原因。GPT-3 当年的关键变化不只是参数变多,而是模型表现出了 one-shot 和 few-shot in-context learning,也就是只看一个或少量示例,便能在不更新权重的情况下理解任务格式并继续完成任务。GEN-1.5 现在把同一套交互范式从文字世界搬到了机械臂面前。

GEN-1.5观看人类或夹爪完成3至12秒动作演示,随后在新物体位置复现任务的流程示意图

“Physical Prompting”究竟是什么

Physical Prompting 是用传感器观测与动作轨迹向机器人描述任务的物理提示方式。给语言模型的提示词是一串 token,给 GEN-1.5 的提示则是一段视觉、机器人状态和动作随时间变化的轨迹;模型读取这段轨迹后,再结合当前环境生成下一步控制动作。

这套方法把机器人教学从“先做数据集,再训练模型”压缩成了“当面示范一次”。例如,操作者可以用一对简易夹爪演示如何拉开铅笔袋拉链,机器人看完后便在物体位置和初始状态发生变化的情况下尝试复现;操作者也可以演示如何从袋子里取出物品,让模型临时获得另一个技能。

GEN-1.5 的上下文记忆长度约为 30 秒,因此它接收的不是一张静态结果图,而是一段包含动作先后关系的短时物理过程。3 至 12 秒的演示已经足以覆盖抓取、移动、接触、拉动和放置等常见操作,同时还给模型留出了容纳多个演示的空间。

更值得关注的是,GEN-1.5 可以把两段独立演示组合成一项连续任务。把“拉开拉链”和“从袋中取物”分别放入上下文后,模型不只是机械回放两条轨迹,还要自己处理两段动作之间没有被明确示范的环节,包括重新抓取、调整手腕姿态、改变接触点,以及在动作偏离时恢复。

这种组合能力比单纯模仿更接近语言模型的上下文推理。机械臂的初始位置、物体朝向和摩擦状态不可能与演示完全一致,因此模型无法只记住坐标序列;它必须从轨迹中提取“打开容器”和“取出目标物”这类相对抽象的意图,再把意图映射到当前场景。

59%的成功率,既惊艳也不够用

GEN-1.5 在 10 项不同任务上的 one-shot 平均成功率为 59%,这是目前最需要被正确解读的数字。它意味着单次演示已经能够让模型在多数测试中产生有效行为,但也意味着平均每 10 次执行仍有约 4 次失败,距离无人值守的仓储、制造或家庭服务还有明显差距。

| 学习方式 | 数据与训练成本 | 参数是否更新 | 公布的平均成功率 | 更适合的场景 | |---|---:|---:|---:|---| | 一次物理演示 | 3至12秒、1次演示 | 否 | 59%(10项任务平均) | 快速试错、临时任务、交互式教学 | | 少量快速适配 | 约1分钟数据、1个梯度步骤 | 是 | 66.5%(单个留出任务) | 对单项新技能做低成本适配 | | 小样本训练 | 约5分钟数据、约50次演示、10个梯度步骤 | 是 | 83%(10项任务平均) | 需要更高稳定性的重复任务 |

83%的结果反而揭示了 GEN-1.5 更现实的产品路径:先用一次演示验证模型是否理解任务,再用几分钟数据把成功率推到可测试、可部署的区间。相比为每个动作采集数小时乃至数天数据,这种“先上下文学习、后轻量适配”的流程可能显著缩短机器人技能上线周期。

66.5%的数字不能和另外两组平均值直接画等号。官方披露的“1分钟数据加1个梯度步骤”结果来自一个 held-out task,也就是训练流程中留出的任务,而 59%和83%是10项任务的平均成绩;任务集合与统计口径不同,不能据此简单计算提升幅度。

目前公开信息也不足以证明 GEN-1.5 已经解决了通用机器人学习。10项任务仍是较小的评估范围,官方演示通常会选择光照、相机位置、机械臂状态相对可控的环境,而且平均成功率无法反映最差任务、长尾失败和连续运行稳定性。真正决定工业价值的,往往不是平均分,而是第99百分位故障率以及失败后是否会伤人、损坏物品或让生产线停摆。

从模拟器到现实,关键不是“照抄轨迹”

GEN-1.5 展示了用模拟器轨迹直接提示现实机器人的 sim-to-real 能力。Sim-to-real 是把模拟环境中的经验迁移到现实硬件上的技术路线,而 GEN-1.5 的特别之处在于,其预训练数据据称没有包含模拟数据,却仍能把模拟器中的动作演示当作上下文提示,并在现实场景中执行对应任务。

这项能力如果能在更大规模测试中成立,价值可能高于“看人演示一次”。现实机器人数据昂贵、缓慢且伴随硬件磨损,模拟器却可以快速生成多种物体位置、碰撞状态和失败分支;如果模拟轨迹可以直接充当 Physical Prompt,开发者就能先在虚拟环境中设计任务,再把轨迹交给现实机器人理解。

GEN-1.5 也能从人类直接演示中提取任务意图。操作者不一定需要遥控与机器人完全同构的机械臂,而可以直接在摄像头前用手展示动作,再由模型使用自己的夹爪完成任务。这种跨形态模仿要求模型处理“人手有五指、夹爪只有两个接触面”的结构差异,因此它学习的不能只是关节角度,而应当包含更高层的物体关系和动作目标。

不过,人类演示、模拟器演示和同构机械臂演示的难度并不相同。同构轨迹能够直接提供机器人动作空间中的控制信息,人类视频则缺少精确力反馈、关节状态和可执行动作标签;把三者都称作“一次演示”容易掩盖技术差异,后续仍需更完整的分项成功率和失败案例。

香蕉当刷子,说明模型开始理解“用途”

GEN-1.5 最吸睛的演示是工具替换:训练示例让机器人使用刷子把积木扫入碗中,测试时换成香蕉,模型仍把香蕉当作长条工具完成清扫;换成簸箕后,它又改变策略,将积木铲起并倒入碗中。

这段演示体现的是工具可供性理解,而不是香蕉识别能力。Affordance 是物体在当前环境中能够支持的动作可能性,例如香蕉虽然通常用于食用,但它的长度、硬度和可抓取形状也允许其临时充当推扫工具;簸箕的形状则更适合承载和倾倒。

工具替换能力说明 GEN-1.5 没有把“完成任务”等同于“必须使用训练中的刷子”。当指定工具缺失时,模型仍围绕“让积木进入碗中”这个目标寻找替代策略,这比按固定物体类别调用固定技能更灵活,也更接近人类处理开放环境的方式。

单个精彩案例仍不能证明模型具有稳定的因果推理能力。香蕉的外形与刷子柄存在明显相似性,簸箕也天然暗示铲取动作;更严格的测试应该包含易碎、柔软、过短、过重或具有危险性的候选工具,观察模型能否识别“不能用”,而不是无条件尝试。

它和传统模仿学习有什么不同

GEN-1.5 与传统 imitation learning 的核心差异在于任务信息进入模型的时间。模仿学习通常先把示范轨迹放进训练集,通过优化参数得到策略;GEN-1.5 的 one-shot 模式则在推理阶段读取示范,把轨迹当作当前任务的上下文,模型权重保持不变。

| 路线 | 新任务如何加入 | 是否重新训练 | 优势 | 主要问题 | |---|---|---:|---|---| | 传统任务专用策略 | 重新采集并训练 | 通常需要 | 单项任务可做到较高稳定性 | 数据和部署成本高,迁移能力弱 | | 行为克隆 | 从多次专家演示学习动作映射 | 需要 | 实现直接、训练目标清晰 | 容易累积误差,依赖演示覆盖范围 | | 视觉—语言—动作模型 | 用图像、语言和动作共同预训练 | 视方案而定 | 能用自然语言指定任务 | 语言难以描述精细接触过程 | | GEN-1.5 Physical Prompting | 推理时输入传感器与动作轨迹 | 一次演示时不需要 | 任务表达具体,适合快速教学 | 上下文较短,成功率和安全性仍有限 |

Physical Prompting 也不是简单的视频条件生成。机器人必须在闭环中反复观察环境、输出动作并承受动作造成的状态变化,一次抓偏就可能让后续画面完全偏离演示;语言模型答错一个词还能继续生成,机械臂抓空则可能需要重新定位、规划和恢复。

官方表示,团队没有为 one-shot learning 专门加入元学习机制,也没有设置针对该能力的特殊训练目标。如果这一说法在技术报告中得到充分验证,意味着一次性物理学习可能是大规模、多样化机器人预训练自然涌现出的能力,类似大语言模型在规模增长后出现的上下文学习现象。

为什么说它像GPT-3,但还不是机器人GPT-3

“GPT-3 时刻”更准确地描述了交互范式变化,而不是能力水平对等。GEN-1.5 让开发者第一次清晰看到:未来教机器人做事,可能不必先编写动作流程或组织训练项目,只要当场做一遍,机器人就能把演示作为上下文理解。

这个比喻的局限同样明显。GPT-3 可以在统一的文本接口中处理大量任务,而现实机器人受制于机械结构、相机视角、控制频率、负载、摩擦和安全边界;一个模型在某款机械臂上学会拉拉链,并不意味着它可以无缝迁移到不同自由度、不同夹爪和不同控制系统的硬件。

GEN-1.5 当前最大的意义不是59%已经足够高,而是机器人技能的边际教学成本开始接近“演示一次”。当新任务的输入单位从几百条训练轨迹变成几秒上下文,机器人的产品迭代方式就可能从季度级模型训练,转向现场人员随用随教。

GEN-1.5 当前最大的风险也来自同一个特性。允许用户用动作即时改变机器人行为,会让提示注入、误示范、上下文污染和危险动作复制从软件安全问题变成物理安全问题;机器人需要在理解提示之前先判断动作是否越过速度、力度、区域和工具使用限制。

OpenAI Hub判断:真正的拐点是“训练”变成“提示”

GEN-1.5 是近年机器人基础模型中少数把上下文学习做成直观产品交互的案例。它不要求普通操作者理解损失函数、数据标注或策略优化,只要求操作者完成一次正确示范,这比用语言描述“夹住拉链头后沿袋口方向匀速移动”更具体,也比为每个任务重新训练更快。

59%的平均成功率决定了它暂时更像研发工具,而不是可直接接管生产线的通用工人。对于实验室、机器人开发团队和允许人工监督的低风险场景,这个水平已经足以快速验证任务;对于医疗、重型制造和无人值守家庭环境,83%的轻量适配结果也远未达到可接受的可靠性。

真正值得持续追踪的指标将不只是单任务成功率。下一阶段需要观察模型能否把30秒上下文扩展到数分钟,能否跨不同机械臂复用同一段演示,能否在遮挡、物体滑落和人类干预后恢复,以及能否明确拒绝危险或物理上不可行的示范。

机器人行业过去几年一直在寻找自己的大模型统一接口,而 GEN-1.5 给出的答案是“动作本身就是提示词”。这未必已经是机器人的GPT-3时刻,但它至少让那个时刻第一次有了一个可操作、可量化的形状:看3至12秒,零参数更新,10项任务平均成功率59%;再用5分钟数据适配,平均成功率提高到83%。

参考来源

相关推荐

查看全部