AI 快讯DM0.5登顶RoboDojo,具身模型开始可复制
模型上新

DM0.5登顶RoboDojo,具身模型开始可复制

2026-08-25T04:04:19.892Z
DM0.5登顶RoboDojo,具身模型开始可复制

原力灵机近日发布并全开源具身基础模型DM0.5,在RoboDojo等真机与仿真评测中登顶。4B参数、15万小时数据、最长60秒上下文和50ms级推理,让具身模型从“能演示”进一步走向开发者可复现、可部署。

DM0.5登顶RoboDojo,具身模型开始走向可复制

原力灵机近日发布新一代具身基础模型DM0.5,并宣布模型、训练相关成果与开发资源全面开放。公开评测显示,DM0.5在RoboDojo等四项真机与仿真测试中取得当前SOTA成绩,同时覆盖导航、抓取、全身控制等任务。

这次更新的重点不只是“又一个机器人模型上线”,而是具身智能开始出现一条更接近开源软件和开源大模型的路径:模型规模、数据构成、推理延迟和评测成绩都被摆到台面上,开发者可以下载、复现、微调,再把模型迁移到自己的机器人和场景中。

**具身基础模型是能够在视觉、语言与机器人动作之间建立统一映射,并支持多个物理任务的通用模型。**DM0.5的价值,就在于它没有把自己限定在单一机械臂或单一工位,而是试图成为一个面向开放世界的机器人“底座”。

原力灵机DM0.5的模型架构、数据组成与机器人任务示意图

4B参数,DM0.5把重点放在数据和架构上

DM0.5的参数规模为4B,相比上一代DM0约翻倍;训练数据规模则增加约400%,总量达到15万小时。这个数字本身并不等于能力,但它说明原力灵机的技术路线已经从“小模型加场景适配”转向“更大规模的具身预训练”。

公开资料显示,DM0.5的训练数据主要由三部分组成:

  1. 5万小时真机操作数据:覆盖100多种动作,并进行秒级的指令与动作对齐,主要解决机器人如何在真实物理环境中抓取、移动、放置和操作物体。
  2. 10万小时第一视角数据:也就是Egocentric数据,让模型从接近人类视角的方式理解空间、物体和动作过程,并支持毫米级高精度3D Landmark生成。
  3. 100万平方米场景重建数据:通过大规模室内空间建模,扩展训练中的环境变化,降低仿真到现实的迁移差距,也就是通常所说的Sim2Real Gap。

**Sim2Real Gap是机器人在仿真环境中学会的策略迁移到真实世界后产生的性能落差。**机器人不像游戏角色,仿真中的摩擦系数、光照、碰撞和传感器噪声只要与现实稍有不同,原本有效的策略就可能直接失效。

这三类数据各自解决的问题不同。真机数据负责“身体经验”,第一视角数据负责“像人一样看”,场景重建数据则负责“见过更多环境”。把它们混合起来,目标不是让机器人记住更多动作,而是让模型理解动作为什么有效、在什么情况下需要调整。

三个架构变化,针对的是机器人最难的三个问题

DM0.5的架构升级主要集中在上下文抽象、具身思维链和轨迹对齐三个方向,分别对应长时记忆、任务规划和动作执行。

1. 上下文抽象层:让机器人记得更久

上下文抽象层是通过压缩历史视觉、语言和动作信息,保留对当前任务最重要状态的模型模块。

现实中的机器人任务经常不是几秒钟完成的。把物品从货架取出、移动到工作台、避开障碍物、再放入指定容器,可能持续数分钟。如果模型只能关注最近几帧画面,它很容易忘记自己已经完成了什么、下一步要做什么,或者在中途重复动作。

DM0.5原生支持最长60秒的记忆能力,平均有效上下文约为30秒。这里的“记忆”并不是简单把所有历史画面塞进上下文,而是对历史信息做压缩,尽量保留任务状态、目标位置、已完成步骤和环境变化。

这项能力对长周期操作尤其重要。例如用户说“把桌面上的杯子拿起来,装满水后放到右侧托盘里”,一个能工作的模型需要记住杯子的位置、是否已经抓稳、是否完成注水,以及托盘在最后一步发生了怎样的位移。上下文抽象层的意义,就是减少机器人在连续任务中的“断片”。

2. 具身思维链:从看到就动变成先规划再动

具身思维链是让模型在输出机器人动作前,先完成任务拆解、目标定位和未来状态预测的推理机制。

传统VLA模型通常直接把视觉输入和语言指令映射为动作。对于“抓起红色方块”这种短任务,这种端到端映射很有效;但遇到“整理桌面上的物品并按类别放入不同抽屉”时,模型需要先识别物品、判断抽屉、规划顺序,再决定每个动作的执行方式。

DM0.5把任务规划、目标定位和未来状态预测等任务纳入训练,让模型学习“先谋后动”。它并不是把面向用户展示的长篇思维过程直接输出,而是在模型内部形成更适合机器人执行的子任务结构,例如:

  • 识别目标物体和可操作区域;
  • 判断当前机械臂、底盘或身体的状态;
  • 将长指令拆成多个可执行步骤;
  • 预测动作执行后的物体位置和环境变化;
  • 根据反馈修正下一步动作。

这条路线的现实价值在于减少无效试错。机器人一旦把杯子撞翻,损失的不是一次文本生成,而是时间、耗材和安全裕度。因此,具身模型的“推理能力”最终必须体现在更低的失败率和更少的无效动作上,而不是体现在一段看起来很聪明的解释里。

3. 轨迹对齐层:不只对准终点,还要理解过程

轨迹对齐层是将语言指令、视觉状态与机器人连续运动轨迹对齐的模型结构,用来理解动作过程而不只是动作结果。

机器人控制不是“点一下就完成”。机械臂从当前位置移动到目标位置,要经历路径规划、速度控制、姿态调整、接触判断和力度修正。如果训练数据只告诉模型“最后抓到了”,模型可能学会一个看似正确、实际却容易碰撞或抖动的动作。

轨迹对齐层更像一名动作翻译官:它把“把这个物体放到左边盒子里”转换成一条连续轨迹,并把每个中间状态与指令关联起来。对开发者来说,这意味着模型不只学习目标点,还学习接近目标、接触物体、施加力度和完成放置的全过程。

四项公开评测全面领先,但更值得看的是泛化能力

DM0.5目前最有说服力的地方,不是单项任务刷出一个高分,而是在多个具身任务上同时工作。公开结果显示,它在真机与仿真的四项公开评测中全面超过此前SOTA,并可由单个模型统一支持导航、抓取和全身控制。

与上一代DM0相比,DM0.5的关键指标如下:

| 指标 | DM0 | DM0.5 | 变化 | |---|---:|---:|---:| | 参数规模 | 约2B级别,公开资料亦曾以2.4B表述 | 4B | 约翻倍 | | 训练数据规模 | 基准规模 | 约增加400% | 达15万小时 | | Zero-Shot导航成功率 | 基准值 | 相比DM0提升31% | 未针对任务训练时更强 | | Few-Shot导航成功率 | 基准值 | 相比DM0提升45% | 少量示例下提升更明显 | | 微调后任务成功率 | 基准值 | 相比DM0提升20% | 场景适配效率提升 | | H100推理延迟 | 基准值 | 低至50ms | 面向实时控制 | | RTX 4090推理延迟 | 基准值 | 约90ms | 消费级硬件可部署 | | 整体推理效率 | 基准值 | 提升25% | 更适合闭环控制 |

需要说明的是,DM0与DM0.5的参数表述来自不同阶段公开材料,DM0曾被报道为2B级或2.4B模型;DM0.5则明确以4B为主要规格。对比时不能简单把不同评测协议下的绝对分数混在一起,真正有参考价值的是同一任务、同一硬件和同一测试条件下的相对提升。

**Zero-Shot能力是模型不经过目标任务专门训练,仅凭预训练知识和指令完成新任务的能力。**对于具身模型而言,Zero-Shot比实验室内的单任务成功率更能说明泛化水平,因为真实部署很少能提前覆盖所有物体、光照、摆放方式和障碍情况。

DM0.5的Zero-Shot导航成功率提升31%,Few-Shot成功率提升45%,说明它不只是把已有动作做得更快,而是在面对新环境、新指令时具备更好的迁移能力。尤其是Few-Shot提升高于Zero-Shot,意味着开发者可能只需要提供少量示例,就能把模型适配到新工位或新任务上。

50ms延迟,决定它能不能从演示走向生产

具身模型与聊天模型最大的不同,是它必须持续参与控制闭环。语言模型多等几百毫秒通常问题不大;机器人在移动、抓取和接触物体时,延迟过高可能导致动作滞后,最终表现为碰撞、抖动或抓取失败。

公开测试中,DM0.5在H100上的推理延迟低至50ms,在RTX 4090上约为90ms,整体推理效率提升25%。这个速度并不意味着所有机器人都能直接实现50ms控制周期,因为实际系统还包括摄像头采集、图像预处理、控制器执行、网络传输和安全检查。但它至少说明,模型侧不再是明显的实时性瓶颈。

换句话说,DM0.5更接近“可以放进机器人系统里连续运行的模型”,而不是只能离线生成动作轨迹的研究原型。对于仓储分拣、室内导航、桌面操作等任务,90ms级别的消费级GPU推理延迟已经具备一定工程吸引力;对于高速动态操作,仍需要更强硬件、更短控制链路和专门的低层策略配合。

全开源的真正价值:降低具身开发的重复劳动

具身模型全开源是指模型权重、代码、技术文档及关键训练或评测资源以公开方式提供,使开发者能够在合规前提下下载、研究、部署和二次开发。

这里的“全开源”不能只理解为发布一个模型文件。对机器人开发者而言,真正重要的是以下几层是否完整:

  • 模型权重是否开放,能否在本地部署;
  • 推理代码是否开放,能否接入不同机器人平台;
  • 数据格式和动作空间是否说明清楚;
  • 训练、微调和评测流程是否可复现;
  • 许可证是否允许商业使用和模型修改;
  • 是否提供仿真环境,降低真机试错成本;
  • 是否支持多摄像头、不同机械臂和异构传感器。

如果这些环节都能被开发者获得,DM0.5就可能成为具身智能领域的“PyTorch时刻”:研究团队不必每次从采集数据、设计VLA骨干和搭建控制接口开始,创业公司也不必为每个客户场景重复训练一套模型。

当然,开源并不等于零成本。15万小时数据的采集、清洗和标注成本很高,机器人本体、摄像头、执行器和安全系统同样需要投入。DM0.5降低的是模型研发的起点,而不是整个机器人项目的总成本。真正的部署仍然要面对硬件差异、动作空间不一致、数据分布漂移和安全责任等问题。

和上一代DM0相比,DM0.5解决了什么

DM0的核心贡献,是证明具身原生路线可以用相对小的模型在真实机器人任务中取得高水平表现。它不是先训练一个纯语言或纯视觉模型,再在最后阶段补机器人动作,而是从训练初期就融合物理世界感知和多源具身数据。

DM0.5则把重点从“模型能不能做”推进到了“模型能不能迁移、能不能长期运行、能不能被更多人使用”。两代模型的差异可以概括为:

| 维度 | DM0 | DM0.5 | |---|---|---| | 技术重点 | 具身原生VLA与物理感知 | 泛化、长程上下文与工程效率 | | 规模 | 约2B级、公开材料曾表述为2.4B | 4B | | 数据重点 | 多源数据融合与真机反馈 | 15万小时高质量数据与大规模场景重建 | | 任务能力 | 导航、操作及多任务能力 | 导航、抓取、全身控制统一支持 | | 推理机制 | 具身空间理解和子任务预测 | 上下文抽象、具身思维链、轨迹对齐 | | 部署目标 | 证明路线可行 | 面向更广泛开发者和真实场景复制 |

这也是为什么DM0.5更值得关注。具身智能行业已经不缺“某个机器人完成某个任务”的视频,缺的是能在不同机器人、不同环境和不同任务之间稳定迁移的基础模型。DM0.5能否成为事实上的通用底座,还要看开源内容是否完整、社区是否活跃,以及第三方能否在非官方硬件上复现结果。

RoboDojo登顶意味着什么

**RoboDojo是用于评估机器人模型在多类具身任务中泛化与执行能力的公开基准或评测环境。**登顶这类榜单的意义,不在于一个分数本身,而在于模型是否能在统一规则下与其他方法比较。

过去不少机器人模型的成绩高度依赖特定硬件、特定动作库或特定场景。模型在演示视频里表现很好,换一套机械臂、换个桌面布局就可能失效。公开基准至少提供了一个可比较的锚点:模型到底是在解决通用问题,还是只是在熟悉的测试场景里记住了路径。

但榜单也不是终点。RoboDojo的任务分布、机器人类型、评测时长和成功判定标准,都会影响最终成绩。对于真正的产业应用,还需要关注连续运行数小时后的稳定性、异常恢复能力、对传感器噪声的鲁棒性,以及失败时是否能安全停机。

因此,DM0.5登顶更准确的解读是:它在当前公开评测体系中证明了较强的综合能力,尤其是泛化和实时推理能力;至于是否能在仓储、零售、家庭和工业现场大规模复制,还需要更多第三方测试和长期运行数据。

开发者应该如何看待这次发布

对于研究者,DM0.5提供了一个观察具身Scaling Law的样本:当参数从约2B级扩展到4B、数据规模增加400%,并加入更长上下文和轨迹对齐后,Zero-Shot、Few-Shot和推理效率分别发生怎样的变化。

对于机器人创业公司,最大的吸引力是缩短冷启动周期。过去一个新场景往往需要采集大量示范数据,再从头训练或大规模微调模型;如果DM0.5的预训练能力能够覆盖基础导航和操作,团队可以把资源集中到少量高价值数据、末端执行器适配和安全策略上。

对于高校和个人开发者,消费级RTX 4090上约90ms的推理延迟降低了实验门槛。虽然这不等于单张消费级显卡就能完成完整训练,但至少在推理、少量微调和仿真验证环节,具身模型不再完全依赖昂贵的云端集群。

对于机器人厂商,开放模型既是机会也是压力。模型能力逐渐标准化之后,硬件差异、数据闭环、控制系统和交付效率会成为更重要的竞争点。未来客户购买的可能不再只是某一台机器人,而是一套“机器人本体+基础模型+场景数据+开发工具”的完整系统。

仍然不能忽略的三个限制

第一,**4B参数并不代表模型可以直接控制所有机器人。**不同机械臂的自由度、关节限制、末端工具、坐标系和控制频率差异很大,模型输出仍需要经过动作空间映射和低层控制器约束。

第二,**60秒上下文还不是长程世界模型。**它可以减少短时间连续任务中的遗忘,但对于跨小时、跨天的任务,模型仍需要外部记忆、状态数据库或专门的世界模型。机器人能否在脑中预演动作后果,也仍是行业尚未完全解决的问题。

第三,**开源权重不等于开源数据飞轮。**高质量真机数据的获取成本、隐私合规和商业授权都很复杂。DM0.5可以降低模型层门槛,但真正形成持续迭代能力,仍依赖部署企业愿意回传数据、建立评测体系并承担失败成本。

此外,DM0.5当前公开信息中对于完整许可证、训练数据可用范围、不同机器人平台的支持清单,以及RoboDojo各项测试的详细配置,仍值得开发者进一步核查。判断一个具身模型是否适合生产,不能只看榜单和宣传指标,还要看代码能否跑通、权重能否下载、数据格式是否开放,以及第三方是否能在相同条件下复现。

结语:具身模型终于开始像“基础设施”了

DM0.5的发布,最重要的信号不是又刷新了多少百分点,而是具身模型开始从封闭的项目成果转向可以被复制、修改和验证的开放基础设施。

它用4B参数、15万小时数据、最长60秒上下文和50ms级H100推理延迟,给出了当前具身基础模型的一组清晰答案:数据要足够真实,模型要能够规划,动作要理解连续轨迹,推理必须进入实时闭环,最终还要让开发者拿得到、跑得起、改得动。

这条路仍然远没有走完。家庭场景中的长任务、多机器人协作、触觉和音频融合、动态障碍物处理,以及跨硬件泛化,都会继续考验DM0.5和后续模型。但至少从2026年8月这次发布开始,具身智能的竞争不再只是“谁有更炫的机器人演示”,也开始变成“谁能把模型做成更多团队都能复现的底座”。

对开发者来说,DM0.5值得下载和测试;对行业来说,它更值得观察其开源社区能否真正长出来。榜单第一是起点,第三方复现和真实部署,才是下一场比赛。

相关推荐

查看全部