AI 快讯AWE 3.5让机器人开始多任务实战
模型上新

AWE 3.5让机器人开始多任务实战

2026-07-23T05:04:10.738Z
AWE 3.5让机器人开始多任务实战

它石智航发布具身原生基座模型 AWE 3.5,打通预训练与后训练,并以百万小时级真人数据推动机器人从单任务演示走向连续、多任务作业。

一台机器人,开始连续处理不同任务

它石智航于 7 月 17 日在 WAIC 2026 主论坛发布具身原生基座模型 AWE 3.5(AI World Engine),并在大会现场展示同一台机器人连续完成多类工业任务。AWE 3.5 获得 WAIC 2026 SAIL 之星奖,据发布方披露,它也是本届获此奖项的唯一具身智能大模型项目。

AWE 3.5 是一个将视觉、空间、动作和触觉统一建模的机器人基础模型。它石智航将这一代升级概括为 Born as One:机器人不再依靠视觉模型、语言模型、轨迹规划器和控制器层层拼接,而是在同一个模型体系内学习看见什么、物体在哪里、应该如何接触,以及下一步动作会带来什么结果。

这次发布最值得关注的并不是机器人又学会了几个新动作,而是它石智航试图跑通具身智能版的“预训练+后训练”完整流程。大语言模型已经证明,统一预训练、规模扩展和后训练可以把大量零散能力压进一个模型;AWE 3.5 想做的,是把这套路线迁移到有摩擦、有碰撞、会失败的物理世界。

WAIC 2026现场,它石智航机器人搭载AWE 3.5执行多任务操作

AWE 3.5 的重点不是“会做”,而是“换任务还能做”

多任务实战是指同一套模型在较少任务专用开发的情况下,连续处理不同物体、操作目标和环境变化。传统工业机器人当然也能完成多道工序,但它们通常依赖固定工位、精确标定和逐任务编程;一旦物体位置、材质或摆放方式变化,系统就容易退出预设轨道。

AWE 3.5 瞄准的正是这段“非结构化差距”。在发布方展示的工业场景中,机器人需要面对随机摆放、遮挡、柔性物体、接触反馈和连续操作,而不是只在干净桌面上完成一次抓取。这里的难点不只是识别目标,还包括选择抓取位置、控制力度、处理滑动或碰撞,以及在上一步出现偏差后继续完成任务。

这种能力如果能够稳定复现,会比单项演示更接近真实采购需求。工厂通常不缺一台能在固定轨迹上重复运动十万次的机械臂,真正缺的是部署成本可控、换线速度足够快,并能覆盖长尾异常的自动化系统。

“原生”意味着不再把机器人拼成一套流水线

具身原生架构是从训练开始就联合表示感知、几何、动作和触觉信息的模型架构。与之相对的是“乐高式”系统:视觉模型负责识别,语言模型负责理解指令,运动规划器生成轨迹,控制器再把轨迹转换成电机动作。

模块化路线的优势是边界清楚、方便调试,但误差会沿流水线放大。视觉模块如果把杯把位置估错 2 厘米,后面的规划器即使计算完全正确,机械臂仍然可能抓空;触觉模块如果只在动作末端介入,也很难及时修正已经形成的错误轨迹。

AWE 3.5 的 Born as One 设计试图让这些信息在共享表征中相互约束。视觉看到物体发生位移,动作表示需要同步更新;触觉检测到接触,模型也能结合几何关系判断是抓稳、打滑还是发生碰撞。这种统一建模更像人拿杯子的过程:人不会先输出一份三维坐标文档,再交给另一套大脑模块计算手指轨迹。

统一架构并不等于系统从此没有模块。机器人仍需要相机、触觉传感器、底层控制器和安全策略,真正的变化在于高层能力是否由一个可规模训练的模型统一学习,以及不同信号能否在推理过程中形成闭环。

双先验让模型在接触机械臂前先理解动作和空间

隐空间动作先验是模型从视频等数据中学习潜在动作变化,而不要求每段数据都附带机器人关节指令。互联网上和生产现场存在海量人类操作视频,但这些视频通常没有机械臂关节角、末端位姿或夹爪力度标签;如果模型只能学习标准机器人示教数据,可用数据规模会受到明显限制。

几何先验是模型对物体形状、深度、遮挡、相对位置和空间变化规律的基础认知。机器人要把零件插入卡槽,仅知道“这是一个零件”没有用,它还需要理解插入方向、孔位尺度、接触边界以及运动过程中可能产生的干涉。

AWE 3.5 在预训练阶段同时引入隐空间动作与几何双先验。按照它石智航的说法,模型可以先从 human-centric 数据中学习人类如何操作物体以及物体如何在三维空间中变化,再把这些能力迁移到不同机器人本体,而不是为每一款机械臂从头采集同等规模的数据。

Human-centric 数据是以人类活动和真实操作为中心采集的多模态数据。它石智航披露,目前相关数据规模已经达到百万小时级,并计划在 2026 年底将用于预训练的真实世界数据提升至千万小时级。如果按 100 万小时计算,相当于连续观看约 114 年的视频;如果达到 1000 万小时,则对应约 1141 年。

数据规模本身并不能自动转化为机器人能力。视频视角、动作可见度、任务分布、传感器同步精度和失败样本比例,都会直接影响预训练效果;100 万小时低质量固定机位视频,未必比 10 万小时带空间、动作和接触信息的高质量数据更有价值。它石智航此次强调“精细建模与筛选”,恰好说明具身 Scaling 的瓶颈不只是收集,还包括数据如何被表示和利用。

世界引擎把后训练搬进隐空间

世界引擎是用于预测动作将如何改变环境状态的内部动力学模型。简单来说,普通策略模型更像直接回答“下一步怎么动”,世界引擎则会先估计“如果向左抓会发生什么、如果换一个角度又会发生什么”,再从多个可能未来中选择更合理的动作。

AWE 3.5 的后训练由世界引擎驱动,并支持在隐空间中推演未来状态。与完全依靠真机试错相比,这种方式不需要让机械臂把每一个错误动作都实际执行一遍;与纯仿真训练相比,它又试图从真实世界数据中学习接触、形变和不确定性,减少模拟环境与现实环境之间的差距。

隐空间推演的价值在长任务中更明显。一次抓取可能只持续数秒,但整理货架、装配零件或处理一套餐饮流程通常包含几十个连续动作,前一步的微小偏差会影响几分钟后的结果。它石智航称 AWE 3.5 已能进行数分钟的连续、交互式闭环推演,这比只预测下一帧或下一个动作更接近机器人真正需要的长程规划。

不过,“能推演数分钟”不等于“能稳定工作数小时”。长时任务的误差通常会累积,模型还需要处理视野外变化、工具磨损、人员介入和传感器漂移。发布方暂未公布推演时长对应的成功率、任务数量、失误恢复率及真机连续运行时间,因此这项能力目前更适合被视为技术方向已得到验证,而不是工业可靠性已经完成验证。

从 AWE 3.0 到 3.5,升级发生在整条训练链路

AWE 3.5 相比 AWE 3.0 的变化,是从强化若干感知与控制能力,进一步扩展到数据、预训练、后训练和跨任务迁移。AWE 3.0 已经提出 OSD、HTS 与 LAS 三条技术路线,3.5 则把它们纳入更完整的基础模型训练框架。

OSD 是它石智航提出的全视角通感决策能力,目标是让机器人从不同视角和感知信号中形成一致决策。HTS 是高密度触觉感知路线,用于捕捉接触位置、压力变化和滑动等信息。LAS 是隐空间动作路线,目标是让模型在潜在表示中学习连续动作规律,减少逐帧、逐关节控制带来的僵硬感。

以下对比依据发布方目前公开的信息整理,尚不能替代同一硬件、同一任务集下的第三方测试:

| 对比维度 | AWE 3.0 | AWE 3.5 | π0.5 对照基线 | |---|---|---|---| | 产品定位 | 具身通用模型 | 具身原生基座模型 | 通用机器人视觉—语言—动作模型 | | 核心训练路线 | 强化通感、触觉与隐空间动作 | 打通预训练与世界引擎后训练 | 通过多源数据提升跨环境泛化 | | 预训练先验 | 已包含相关能力路线 | 明确引入隐空间动作与几何双先验 | 采用异构机器人及开放世界数据 | | 长程推演 | 未披露同口径指标 | 发布方称支持数分钟闭环推演 | 本次未披露同条件结果 | | 数据规模 | human-centric 真实数据 | 当前百万小时级,年底目标千万小时级 | 数据口径不同,不能直接换算 | | 任务效率 | 作为上一代基线 | 发布方称相对 π0.5 任务执行效率达到约 2 倍 | 被用作对照,但完整测试条件未公开 | | 公开权重与接入方式 | 未见完整公开 | 截至 7 月 23 日未见完整公开 | 研究生态相对开放 | | 商业价格 | 未公布统一价格 | 未公布统一价格 | 不适合按统一商用价格比较 |

“AWE 3.5 效率达到 π0.5 的 2 倍”是此次发布中最醒目的数字,但也是最需要测试细节的数字。任务吞吐量可能按单位时间完成次数、成功任务数或有效动作数量计算,不同机器人本体、动作频率和成功率门槛都会改变结果;在任务集、硬件配置、推理延迟和失败重试规则公开前,这一结果不能简单理解为 AWE 3.5 在所有机器人任务上都快一倍。

具身 Scaling Law 开始从口号变成可验证命题

具身 Scaling Law 是指随着模型参数、训练数据和计算量增加,机器人模型的预测能力与任务成功率呈现可测量的规律性提升。语言模型可以用 token 数和困惑度建立相对清晰的扩展曲线,机器人却要同时面对视觉、动作频率、触觉、硬件差异和真实世界反馈,因此更难找到统一尺度。

AWE 3.5 的意义在于给出了一条相对完整的扩展链路:先收集大规模真人操作数据,再学习动作和几何先验,随后通过世界引擎进行后训练,最后让真机执行结果持续反哺数据系统。这比“为一个任务采一批示教、训练一个策略”的项目制路线更接近基础模型方法。

闭环是否成立仍然需要扩展曲线来证明。理想的公开结果应至少包含不同数据规模下的成功率、不同参数规模下的推演误差、跨本体迁移所需样本量,以及数分钟任务中的故障恢复率。它石智航目前披露了百万小时、千万小时目标、效率约 2 倍和数分钟推演等关键节点,但尚未公布完整的 Scaling 曲线与统一评测集。

这并不削弱 AWE 3.5 的工程价值,但会影响外界对领先幅度的判断。具身智能行业已经不缺视觉效果不错的演示,下一阶段真正稀缺的是可重复的测试方法:同一任务跑 100 次成功多少次,换一种材质下降多少,换一台机械臂需要多少新数据,连续工作 8 小时会出现几次人工接管。

工业“深水区”考验的不是动作漂亮,而是总成本

工业深水区是指传统自动化难以用固定程序经济覆盖的高变化、高接触和长尾任务。典型场景包括柔性分拣、线束处理、混料取放、非标装配、餐饮操作和仓储理货,它们往往同时包含视觉遮挡、物体形变与频繁换型。

AWE 3.5 对工业客户最现实的吸引力,是降低新任务的开发和数据成本。如果一套基座模型已经理解常见物体、空间关系和操作规律,部署团队只需要补充少量现场数据,而不必从零开始示教数万条轨迹,机器人的投资回收周期就可能明显缩短。

跨本体迁移则决定了这套能力能否成为平台。工厂里的机械臂负载、臂展、夹具、相机和控制频率各不相同,如果模型只能绑定某一种硬件,它仍然更像一套高成本定制方案;如果动作先验能在不同本体之间迁移,模型才有机会像机器人行业的“操作系统层”一样扩张。

安全性仍是从展台走向产线的最后一道门槛。世界引擎可以预测动作结果,却不能替代硬件限位、碰撞检测、急停系统和确定性安全控制;在人员共处环境中,生成式策略尤其需要明确的动作边界和可回退机制。

这次发布真正推进了什么

AWE 3.5 把具身智能的竞争从“单个任务成功率”推进到了“完整训练范式”。原生架构解决能力如何统一,双先验预训练解决大规模真人数据如何利用,世界引擎后训练解决真机试错成本,数据闭环则尝试让模型能够持续迭代。

AWE 3.5 目前最强的部分是路线完整,而不是公开指标已经无可争议。百万小时级数据、年底千万小时目标、相对 π0.5 约 2 倍的任务执行效率,以及数分钟交互式推演,构成了一个有进攻性的产品叙事;但模型参数、任务集、成功率、推理算力、部署成本和第三方复现结果仍然缺席。

具身智能正在进入“少看一次演示,多看一组连续数据”的阶段。它石智航已经证明,一台机器人可以在统一模型驱动下走向多任务实战;接下来真正决定 AWE 3.5 含金量的,是它能否在不同工厂、不同本体和数千小时运行中,仍然保持现场演示中的连贯、稳定与精确。

参考来源

相关推荐

查看全部