AI 快讯高德ABot五模型补齐具身全栈
模型上新

高德ABot五模型补齐具身全栈

2026-07-22T11:05:16.571Z
高德ABot五模型补齐具身全栈

高德一次发布ABot-N1、M0.5、ER、AgentOS与C0,覆盖导航、操作、决策、执行和记忆,并宣称在17项基准取得SOTA。真正值得关注的不是模型数量,而是其闭环自进化架构。

高德把具身智能从单模型竞争推向系统竞争

高德近日宣布完成 ABot 具身技术体系的全栈升级,一次发布 ABot-N1、ABot-M0.5、ABot-ER、ABot-AgentOS 和 ABot-C0 五款模型,覆盖感知、决策、执行与记忆等关键环节。高德称,这套新体系在 17 项权威基准测试中取得 SOTA,并将机器人的导航、操作、任务规划和经验回流接入同一个闭环。

**ABot 是高德面向通用机器人构建的全栈具身技术体系。**它不是把五个彼此独立的模型打包发布,而是尝试将世界模型、导航与操作基座模型、具身 Agent 以及机器人本体连接成一个持续收集数据、修正策略和积累记忆的系统。

**具身智能是让 AI 通过机器人等物理载体感知环境、理解任务并执行动作的技术路线。**相比只需要输出文字或图像的生成式模型,具身模型必须处理传感器噪声、动作延迟、本体差异以及不可逆的物理错误;聊天模型答错一句可以重新生成,机器人端错一杯水却可能直接终止任务。

截至 2026 年 7 月 22 日,这次发布仍以高德披露的技术结果为主,17 项 SOTA 尚不能简单理解为机器人通用能力已经被解决。SOTA 是 State of the Art 的缩写,指模型在特定测试设置下取得当前公开最佳成绩;它能证明模型在对应基准上领先,却不等于模型在所有真实环境中都优于竞品。

高德ABot五款模型与感知、导航、操作、决策、记忆闭环关系示意图

五款模型分别解决什么问题

**五款新模型的核心分工,是把机器人从「会看、会想」推进到「能走、能做、能复盘」。**其中 ABot-N1 和 ABot-M0.5 分别对应导航与操作,ABot-ER 负责具身推理,ABot-AgentOS 负责跨本体调度与执行,ABot-C0 则被纳入整个体系的感知和自进化链路。

| 模型 | 主要定位 | 对应机器人能力 | 本次披露的关键特性 | 已公布结果 | |---|---|---|---|---| | ABot-N1 | 通用导航基座模型 | 「双脚」与空间直觉 | 快慢双系统、像素级思维链、视觉纠偏 | 室外导航成功率 92.9%,覆盖五类导航任务 | | ABot-M0.5 | 通用操作基座模型 | 「双手」与物体操作 | 含噪画面训练、数据回流、长程误差修复 | RoboCasa-365 复杂任务领先前代 SOTA 20.4%,基础任务领先 10.6% | | ABot-ER | 具身推理模型 | 「大脑」 | 联合理解物体、空间和任务关系 | 取得 3 项 SOTA,并登顶 Embodied Arena 2D-EQA | | ABot-AgentOS | 具身 Agent 执行中枢 | 「中枢神经」 | 规划、调用、执行、验证解耦,支持插件式 Skill | 支持人形、四足、轮式等异构机器人接入 | | ABot-C0 | 全栈体系中的基础能力模型 | 感知与自进化链路 | 与世界模型、数据闭环协同 | 完整任务边界和单项成绩仍待技术报告进一步披露 |

**ABot-C0 是目前公开资料中技术细节最少的一环。**高德把它列入本轮五模型升级,但现有信息尚不足以确认其完整架构、参数规模、训练数据构成和独立基准成绩,因此不宜把体系级的 17 项 SOTA 全部归因于某一款模型。

ABot-N1要解决的不是寻路,而是开放世界导航

**ABot-N1 是面向真实开放环境的通用导航基座模型。**传统导航系统更像一套确定性很强的地图与控制流水线:先定位,再规划路线,最后由控制器跟踪轨迹;一旦地图不精确、路面被临时占用或机器人偏离路径,各模块之间很容易出现信息断层。

**高德为 ABot-N1 设计了快慢双系统架构。**慢系统负责理解长程指令、拆分任务和进行空间推理,快系统负责低延迟的局部动作控制;当地图路线与摄像头看到的真实道路发生冲突时,系统可以把部分导航权限回退给视觉判断,而不是继续机械地沿着规划路径前进。

这个设计可以类比自动驾驶中的「导航规划加局部避障」,但机器人面对的空间更碎片化。机动车通常沿结构化道路移动,服务机器人却要处理台阶、门槛、行人、狭窄通道和临时障碍,同时还要理解「跟着穿蓝衣服的人」「去便利店门口」「到指定坐标」等不同形式的目标。

**像素级思维链是 ABot-N1 用于连接视觉证据与动作决策的方法。**它把推理依据落到图像中的具体区域,使系统能够展示机器人为什么选择转弯、停下或重新规划;这比只输出一段自然语言解释更接近可执行的视觉定位,也为失败轨迹的回放和再训练提供了更细粒度的数据。

**ABot-N1 公布的室外导航成功率为 92.9%。**高德称,该模型在点位导航、目标导航、指令跟随、兴趣点导航和人物跟随五类任务上均领先同类方案,并且只依靠导航地图也能执行城市级自主导航。

92.9% 是一个值得关注但仍需拆解的数字。真实部署最关键的问题包括测试路线长度、城市数量、天气条件、定位信号质量、动态障碍密度和失败判定标准;如果这些变量没有完整公开,不同团队之间的成功率就很难直接横向比较。

ABot-M0.5开始正面处理误差累积

**ABot-M0.5 是高德面向跨场景机器人操作推出的通用操作基座模型。**操作模型接收图像、语言指令和机器人状态,再输出机械臂或其他执行器动作,目标是让同一套模型完成抓取、开门、整理物品和多步骤家务等任务。

**长程误差累积是机器人操作从演示走向实用的主要障碍。**机械臂第一次抓取偏差 2 厘米,可能导致物体放置位置继续偏移;后续关门、收纳和清理动作再叠加误差,最终会让十步任务在第八步彻底失败。模型在短视频里完成一次抓取,并不意味着它能稳定执行半小时工作流。

**ABot-M0.5 的「梦境自愈」训练是本次升级最有辨识度的技术点。**模型会基于自身预测出的含噪视觉画面继续生成动作,相当于在训练阶段主动制造轻微偏差,再要求自己从偏差状态中恢复;这种方法不只学习标准演示轨迹,也学习「杯子没有抓正之后怎么办」。

这个思路与自动驾驶训练中的扰动注入类似。只用完美轨迹训练出来的机器人,往往只会在理想状态下继续行动;加入视觉噪声、位置偏移和动作延迟后,模型才能见到真实部署中更常见的非标准状态。

**ABot-M0.5 在 RoboCasa-365 复杂任务上比前代 SOTA 高 20.4%,在基础任务上高 10.6%。**高德还称其在 LIBERO、Robo-Twin 等四项操作基准上取得 SOTA,但当前披露没有统一说明上述提升是相对增幅还是成功率百分点差,因此这些数字更适合用于观察趋势,而不是直接换算为商业部署成功率。

| 操作模型代际 | 重点能力 | 已公开代表结果 | 主要变化 | |---|---|---|---| | ABot-M0 | 跨本体动作统一、3D 空间感知 | LIBERO-Plus 成功率 80.5%,较当时的 π0 高近 30% | 解决不同机器人数据难以统一的问题 | | ABot-M0.5 | 长程任务纠错、含噪状态恢复 | RoboCasa-365 复杂任务领先前代 SOTA 20.4% | 从学习标准动作转向学习失败后的恢复 |

**M0.5 相比 M0 的关键进步不是单步动作更漂亮,而是更不容易因小错崩盘。**对于酒店整理、仓储分拣和家庭服务等任务,恢复能力通常比一次性最高精度更重要,因为真实环境不会持续提供干净背景和标准物体位置。

ER与AgentOS试图把大脑和身体解耦

**ABot-ER 是统一处理感知、空间关系和任务决策的具身推理模型。**它不只判断画面里有没有杯子,还要理解杯子位于桌面边缘、机械臂从当前角度难以安全抓取,以及任务要求先移动底盘再执行操作。

**ABot-ER 已被高德披露为取得 3 项 SOTA。**其中包括在 Embodied Arena 2D-EQA 上登顶;EQA 是 Embodied Question Answering 的缩写,要求智能体在环境中移动、观察并回答问题,测试重点不是静态看图,而是能否通过行动主动获得信息。

**ABot-AgentOS 是用于组织机器人规划、工具调用、执行和验证的具身 Agent 中枢。**它把高层任务流程从具体机器人本体中解耦,并通过插件式 Skill 接入移动、抓取、拍摄或开门等能力,使同一套上层系统可以适配人形机器人、四足机器人和轮式机器人。

AgentOS 的价值更接近机器人领域的运行时和任务编排层,而不是另一个单纯追求跑分的大模型。比如执行「去前台取一瓶水」时,它需要依次调用导航、目标识别、抓取和返回技能,并在每一步完成后验证结果;如果货架上没有水,系统还要决定重新搜索、询问人类还是终止任务。

**多模态终身记忆是 ABot-AgentOS 与普通工作流编排工具的关键差异。**终身记忆是智能体跨任务、跨时间保留环境信息、执行经验和失败轨迹的能力,它可以让机器人记住某扇门经常上锁、某条走廊在特定时段拥堵,或者某类透明物体需要更保守的抓取策略。

**高德强调这套记忆可在本地私有化保存。**这一设计对家庭、工厂和商业空间尤其重要,因为机器人的视频、音频和位置轨迹往往包含高敏感信息;如果所有记忆都必须上传到远端,数据合规和网络延迟都会成为部署阻力。

真正的升级是数据开始在系统内循环

**ABot 本轮升级最重要的变化,是将仿真训练、物理交互和记忆调度接入同一条数据回流链路。**过去的机器人系统通常由导航团队、机械臂团队和任务规划团队分别维护模型,一次失败可能被记录在日志里,却很难转化为其他模块可以利用的训练样本。

**闭环自进化是应用数据持续反哺模型训练和决策记忆的系统机制。**机器人在真实环境中执行任务,AgentOS 记录成功和失败轨迹,ER 提取可复用的判断依据,导航与操作模型再用这些数据训练,更新后的模型继续进入应用,形成「数据—模型—应用—新数据」循环。

这套体系对高德尤其合理。高德原有业务积累集中在地图、空间关系、路线规划和真实世界动态变化,这些能力与具身导航天然相邻;它未必能直接解决机械臂控制的全部难题,却能在城市级空间数据、兴趣点语义和长程导航上形成区别于纯机器人公司的基础设施优势。

**全栈体系也会带来更高的工程耦合风险。**导航模型、操作模型、推理模型和执行中枢如果采用不同频率更新,一次局部升级可能破坏原有接口;记忆中的历史策略也可能与新模型冲突,因此系统必须处理版本管理、权限边界、回滚和安全验证,而这些问题不会体现在单项 SOTA 中。

17项SOTA还不能回答三个商业化问题

**17 项 SOTA 证明了 ABot 的研发覆盖面,但尚未证明整套系统已经可以低成本复制。**机器人商业化不仅取决于任务成功率,还取决于硬件成本、推理延迟、功耗、人工接管频率和连续运行时间。

目前仍有三个关键问题需要高德用后续技术报告或真实部署数据回答:

  1. **基准设置是否可复现。**17 项测试分别使用什么数据划分、硬件平台和评测协议,是否开放模型权重或完整推理配置,将决定外部团队能否验证结果。
  2. **跨本体迁移成本有多高。**AgentOS 可以连接多种机器人,不代表同一套动作策略能够零成本迁移;不同自由度、传感器位置和控制频率仍可能需要重新采集数据或微调。
  3. **连续任务的可靠性有多高。**单项成功率 92.9% 如果被串联到十个相互依赖的步骤中,整体成功率可能显著下降,具身系统最终要看的是端到端任务完成率和人工接管次数。

**安全约束同样比榜单排名更重要。**机器人进入商场、园区和家庭后,需要明确处理碰撞风险、误识别人脸、错误抓取危险物品以及记忆泄露等问题;像素级思维链和本地记忆有助于追踪决策,但可解释并不自动等于安全。

高德正在争夺具身时代的系统入口

**高德这次五模型齐发,标志着国内具身竞争开始从单点模型跑分转向全栈系统能力。**ABot-N1 负责走到任务现场,ABot-M0.5 负责完成物理操作,ABot-ER 负责理解任务,ABot-AgentOS 负责组织执行和保存经验,C0 则被放进感知与自进化闭环;这套组合比单独发布一个导航模型或机械臂模型更接近真实产品。

**ABot 的优势在于空间数据和系统协同,而不是已经实现了通用机器人。**92.9% 的室外导航成功率、RoboCasa-365 上 20.4% 的复杂任务领先幅度以及 17 项 SOTA,都说明高德正在快速补齐技术栈;但 C0 技术细节、17 项评测的完整清单、真实部署成本和长期运行数据仍不充分。

**这次发布最值得行业关注的判断,是机器人能力的瓶颈可能不再只是模型大小。**当导航、操作、推理、执行和记忆能够共享失败数据,系统每完成一次真实任务,都可能为下一次任务增加经验;谁能以更低成本跑起这个闭环,谁才更有机会成为具身智能时代的基础平台。

参考来源

相关推荐

查看全部