AI 快讯ER 2发布:机器人看视频协作
模型上新

ER 2发布:机器人看视频协作

2026-07-30T17:05:59.808Z

Google DeepMind 发布 Gemini Robotics ER 2,以视频理解、任务编排和多机器人协作为核心,让机器人从执行单步指令走向协同完成复杂现实任务。

Google 把机器人的“眼睛”和“调度员”合到了一起

Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics ER 2,重点升级视频理解、任务编排和多机器人协作能力。与上一代主要围绕单台机器人理解场景、拆解指令不同,ER 2 开始把连续视频、外部工具和多台机器人纳入同一套任务闭环,让机器人不只知道“眼前有什么”,还要理解“刚才发生了什么、下一步该由谁做”。

Gemini Robotics ER 2 是面向机器人场景的具身推理模型,负责理解物理环境、规划任务、调用工具并协调执行。这里的“ER”指 Embodied Reasoning,也就是具身推理:模型不仅处理文本和图像,还要理解物体的位置、状态变化、可操作方式以及动作可能带来的后果。

这次升级最值得关注的地方并不是模型又能识别多少种物体,而是 Google 正在尝试解决机器人落地中更棘手的问题:怎样让一个任务在较长时间内持续推进,并在环境变化、步骤失败或多台机器人并行工作时及时调整计划。

Google DeepMind 在官方发布文章中将 ER 2 描述为机器人视频理解、工具编排和多机器人协作的一次“step change”。不过,截至发稿,官方没有同步披露标准化基准成绩、任务成功率提升幅度、推理延迟、上下文长度或价格,因此现阶段更适合把 ER 2 看作机器人系统能力边界的升级,而不是已经得到完整量化验证的性能飞跃。

Gemini Robotics ER 2通过视频理解环境,并将复杂任务分配给多台机器人协同执行的示意图

视频第一次成为机器人的“工作记忆”

视频理解是模型对连续画面中的物体、动作、时序关系和状态变化进行联合推理的能力。单张图片告诉机器人“桌上有一个杯子”,视频则可以告诉它“杯子刚被移动过”“有人正在向杯中倒水”以及“机械臂伸过去时可能与人发生冲突”。

ER 2 的关键变化是把时间维度正式放进机器人决策过程。传统视觉系统往往以当前帧为中心,通过目标检测、深度估计和姿态识别生成环境状态;这种方案适合抓取位置固定的零件,却很难判断一个动态过程是否已经完成,更难理解动作之间的因果关系。

连续视频为机器人提供了接近“短期工作记忆”的信息来源。机器人可以通过前后画面对比判断抽屉是否已经打开、液体是否仍在流动、另一台机器人是否拿走了目标物体,以及人类是否临时改变了工作区域。对现实世界而言,这些状态变化往往比物体类别本身更重要。

ER 2 的视频能力也不能简单等同于给机器人接入一颗摄像头。真正的难点在于,模型需要从大量视觉变化中筛选与任务有关的信息,并把识别结果转换成可执行的下一步计划;否则,更长的视频只会增加计算量和误判机会,不会自动带来更高的任务成功率。

一个典型场景是整理工作台。只看当前画面,机器人可能知道桌面上有杯子、工具和包装盒;结合视频后,它还可以判断哪个工具刚被人使用、哪个包装盒已经装入物品,以及另一台机器人正在清理哪一侧区域。模型据此可以避免重复劳动,也能减少两台机械臂争抢同一物体的情况。

ER 2更像机器人的“总调度”,而不是电机控制器

任务编排是把一个高层目标拆成多个有依赖关系的子任务,并为每一步选择机器人能力、软件工具和执行顺序的过程。用户说“收拾桌面并准备午餐”时,任务编排层需要决定先识别食物和容器,再清理空间、检查物品、完成装盒,最后确认桌面是否达到预期状态。

Gemini Robotics ER 系列本质上更接近机器人的认知与规划层,而不是直接控制关节的底层控制器。它可以理解视觉和语言输入、输出物体坐标或边界框、规划抓取与轨迹,并通过函数调用连接已有的机器人技能,但最终的运动控制仍需交给视觉—语言—动作模型、运动规划器或厂商自己的控制系统。

视觉语言模型(VLM)是同时处理视觉信息与自然语言的模型,适合回答“场景里有什么、物体在哪里、下一步应该做什么”。视觉—语言—动作模型(VLA)则进一步把视觉和语言理解转换成机器人动作,更接近实际操纵机械臂、夹爪和移动底盘的执行层。

这种分层设计比让一个大模型包办所有动作更现实。ER 2 可以像项目经理一样拆解任务、检查进度和重新分工,底层控制器则像熟练工人一样完成抓取、移动、旋转或避障;前者负责“做什么和为什么”,后者负责“具体怎么动”。

工具调用进一步扩大了 ER 2 能处理的任务范围。机器人遇到模拟仪表、电路板编号或陌生物体时,可以调用图像裁剪、文字识别、搜索、代码执行或专用检测工具,再根据返回结果继续推理,而不是要求一个模型仅凭参数记忆解决所有问题。

这套架构的价值在于复用现有机器人资产。工厂和仓库通常已经部署运动控制、碰撞检测、路径规划和安全停机模块,企业不可能为了接入一个新模型全部推倒重来;ER 2 如果能稳定调用这些既有能力,实际部署成本会低于从头训练端到端机器人策略。

多机器人协作不再只是“把任务分成两份”

多机器人协作是多台机器人共享任务目标、环境状态和执行进度,并根据能力差异动态分配工作的机制。真正有效的协作不仅要求两台机器人同时行动,还要求它们知道彼此正在做什么、何时需要等待,以及发生冲突后怎样重新规划。

ER 2 试图把单机器人任务规划提升为多执行体任务编排。假设一台移动机器人擅长运输,另一台机械臂擅长抓取,模型可以先让移动机器人把周转箱送到工作台,再让机械臂装入物品;如果箱子没有按时到达,机械臂不应继续执行预定动作,而应等待、切换到其他子任务或触发重新规划。

多机器人系统最难解决的是共享状态而非动作生成。只要预先写好程序,两台机械臂早已可以按固定节拍协同装配;但当物体位置、任务数量和人类指令持续变化时,固定流程会迅速失效。ER 2 的意义在于让协作计划根据视频中的真实进度更新,而不是只依赖预设时间表。

ER 2 也不意味着机器人已经能像人类团队一样自主沟通。官方目前没有公布多机器人任务的规模上限、通信机制、冲突解决成功率和长时间运行数据,因此尚不能判断它能否从两三台实验机器人扩展到数十台仓储机器人或整条生产线。

更谨慎的判断是,ER 2 提供了一个通用认知协调层,但工业级调度仍需要确定性规则兜底。涉及高速机械臂、重载设备和人机混行区域时,模型生成的计划不能绕过安全控制器、权限系统和紧急停机机制。

从“看图规划”到“看视频带队”

Gemini Robotics ER 2 延续了 Google 自 2025 年以来的双层机器人路线:ER 模型负责理解与规划,Gemini Robotics VLA 模型或其他控制系统负责执行。其演进方向并非单纯追求更灵巧的抓取,而是逐步增加长期任务、自主工具调用和跨机器人协调能力。

| 模型 | 发布时间 | 模型定位 | 主要输入 | 任务编排 | 多机器人协作 | 已公开价格 | |---|---:|---|---|---|---|---| | Gemini Robotics-ER | 2025 年 3 月 | 初代具身推理模型 | 图像、文本 | 基础规划与空间推理 | 未作为核心能力公布 | 未披露 | | Gemini Robotics-ER 1.5 | 2025 年 9 月 | 面向物理世界的智能体式 VLM | 图像、视频、文本 | 支持多步骤计划与工具调用 | 重点仍是单任务执行 | 未披露 | | Gemini Robotics-ER 1.6 | 2026 年 | 强化空间、时间推理与长期任务编排 | 图像、视频、音频、文本 | 支持子任务排序、函数调用和代码执行 | 官方文档未将其列为主要卖点 | 未披露 | | Gemini Robotics ER 2 | 2026 年 7 月 30 日 | 新一代机器人具身推理与协调模型 | 以视频和自然语言为核心 | 强调复杂任务与工具编排 | 首次成为官方核心能力之一 | 截至发稿未披露 |

这张对比表反映出的路线很清楚:Google 正在把机器人模型从空间识别工具升级成物理世界的智能体系统。第一阶段解决“物体在哪里”,第二阶段解决“任务怎样拆”,ER 2 则开始处理“多个执行者如何基于连续环境变化共同完成任务”。

ER 2 与传统仓库调度系统的差别也很明显。传统系统依赖结构化订单、地图和固定设备状态,优点是稳定、可审计;ER 2 可以直接理解视频和自然语言,应对未被完整编码的开放环境,但输出的不确定性也更高。短期内,两者更可能组合使用,而不是互相替代。

暂时没有跑分,能力展示比数字更抢先

Google 此次没有提供足以横向比较的量化指标。官方发布内容强调视频理解、任务编排和多机器人协作,但没有公布相对 ER 1.6 的任务成功率增幅,也没有给出视频推理延迟、并发机器人数量、单次任务持续时间和失败恢复率。

缺少数字会限制外界对 ER 2 实际价值的判断。机器人演示通常经过场景选择和流程设计,一次成功的视频不能代表系统能够连续运行 8 小时,更不能证明它在光照变化、摄像头遮挡、网络波动或机械误差下仍然可靠。

机器人模型真正有意义的指标至少应包括四类:首次执行成功率、失败后恢复率、完成任务所需时间,以及需要人类介入的次数。对于多机器人协作,还应增加冲突次数、空闲等待时间和通信中断后的降级能力。

价格和部署方式同样尚不明确。截至 2026 年 7 月 30 日,参考资料没有给出 ER 2 的正式模型端点、输入输出计价、区域可用性或企业部署条款,因此不能把此前 gemini-robotics-er-1.6-preview 的名称、价格或限制直接套用到 ER 2 上。

本文不提供调用示例,因为官方尚未在现有资料中确认 ER 2 的公开接口名称与参数。对开发者而言,等待正式模型卡和开发文档比根据产品博客猜测端点更可靠,也能避免把演示能力误当成已经开放的产品能力。

机器人进入“Agent 化”,但离通用劳动力仍远

ER 2 展示的是机器人 Agent 化的下一步:模型不再只生成一次动作,而是持续观察、规划、调用工具、检查结果并重新安排任务。这个循环与软件世界中的 AI Agent 相似,只是机器人每一次错误都可能碰倒物体、损坏设备,甚至对人造成伤害。

视频理解让机器人拥有更完整的上下文,多机器人协作则让模型能够调度更多物理执行能力。两者结合后,机器人系统理论上可以覆盖实验室整理、仓库分拣、零售补货、设备巡检和家庭收纳等更长链条的任务,而不必为每一种流程编写完全固定的脚本。

ER 2 的短期价值更可能出现在半结构化环境。完全标准化的汽车产线已经有速度快、确定性高的自动化方案,未必需要大模型介入;完全开放的家庭环境又存在物体繁杂、安全要求高和成本敏感等难题。介于两者之间的实验室、柔性制造和小批量仓储,反而更适合验证 ER 2。

Google 的优势在于其多模态模型、搜索与工具生态,以及从高层规划到 VLA 执行模型的完整布局。相比只提供机械本体或单一控制模型的厂商,Google 更有机会成为机器人认知层的平台提供者;但它仍需证明模型能稳定适配不同摄像头、机械臂、夹爪和移动底盘,而不是只在少数演示硬件上表现良好。

ER 2 目前更像一次方向明确但数据不完整的升级。它抓住了机器人从单机智能走向系统智能的关键矛盾:复杂任务不是靠一只更灵巧的手完成,而是靠持续理解环境、调用合适工具,并让多个执行者保持一致。

真正决定 ER 2 能否进入生产环境的,将不是演示视频有多流畅,而是正式开放后能否给出可复现的成功率、延迟、价格和安全边界。在这些数字出现之前,可以确认机器人正在学会“看视频带队”,但还不能断言它们已经成为可靠的自主工作团队。

参考来源

本文关于 ER 2 发布与核心能力的事实,以 Google DeepMind 于 2026 年 7 月 30 日发布的官方文章《Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration》为主要依据;按照来源域名限制,文末未附该站外链。

相关推荐

查看全部