智象发布具身世界模型

智象未来今日发布原生全模态具身世界模型 HiDream-O1-Embodied,首次参评 RoboColiseum 即以 0.692 分拿下 Robustness 子榜第一,试图打通从感知、推演到机器人执行的完整链路。
智象把世界模型从屏幕推向机器人
智象未来(HiDream.ai)今天正式发布具身世界模型 HiDream-O1-Embodied。具身世界模型是能够理解物理环境、预测动作后果,并将模型输出转换为机器人执行策略的世界模型。与主要负责生成和推演数字场景的交互式世界模型不同,HiDream-O1-Embodied 的目标是让模型真正参与现实世界中的感知、决策与操作。
这次发布最值得关注的不是又多了一个机器人模型,而是智象试图把此前已经布局的图像、视频、3D 和交互式世界模型,继续向动作与物理执行侧延伸。按照智象的技术路线,模型不再是一个接收图像、再调用语言模型、最后连接动作模块的拼装系统,而是希望在统一的原生全模态架构中,同时表达视觉、空间、时间、动作和物理因果关系。

首次参评,Robustness 子榜拿到 0.692 分
HiDream-O1-Embodied 发布同期首次参加具身智能模型评测平台 RoboColiseum 的评测,并在核心的 Robustness(扰动适应)子榜单中以平均分 0.692 登顶榜首。
Robustness 是衡量具身模型能否应对现实环境变化的指标。机器人在实验室里按照固定路线完成任务并不难,难的是地面摩擦力变化、光照改变、物体位置偏移、遮挡出现、动作执行存在误差时,模型能否及时调整,而不是一旦环境与训练数据不一致就失效。
RoboColiseum 是面向具身模型的仿真评测平台,强调多维度、可复现和与真机表现的相关性。它通过仿真环境模拟现实中的扰动,让模型在统一条件下接受测试。智象此次拿到的 0.692 分,不能简单等同于机器人在现实工厂中有 69.2% 的任务成功率,但它至少说明:在该评测设置下,模型对环境变化的适应能力已经具备较强竞争力。
| 对比维度 | HiDream-O1-Embodied | 传统视觉语言动作模型 | 纯交互式世界模型 | |---|---|---|---| | 主要目标 | 理解环境并执行物理动作 | 将视觉和指令映射为动作 | 生成、理解和推演数字世界 | | 输入模态 | 图像、视频、文本、3D、动作等 | 以图像、文本为主 | 文本、图像、视频和交互指令 | | 输出结果 | 具身任务中的动作或策略 | 离散动作、轨迹或控制信号 | 场景、视频、环境状态变化 | | 核心能力 | 物理感知、动态预判、扰动适应 | 指令跟随和动作执行 | 时空一致性、物理一致性 | | 典型应用 | 机器人操作、仿真训练、具身 Agent | 机械臂控制、导航、抓取 | 交互式影游、数字孪生、训练环境 | | 已披露成绩 | RoboColiseum Robustness:0.692,子榜第一 | 需以具体模型和评测为准 | HiDream-O1-World 在 WBench Navi:80.9 |
需要注意的是,目前公开信息主要披露了榜单名次和 Robustness 子榜成绩,尚未完整公布模型参数量、训练算力、端到端延迟、支持的机器人本体、动作空间定义以及完整任务成功率。对于开发者来说,0.692 是一个有价值的信号,但还不是足以判断模型能否直接部署到真机的全部证据。
原生全模态,不只是把几个模型接在一起
原生全模态模型是从统一底层表征出发,同时处理多种模态信息的模型,而不是分别训练图像、文本、视频和动作模型后再通过接口拼接。智象将 HiDream-O1-Embodied 建立在自研 UiT(Unified Transformer) 架构之上,核心方向是把不同模态映射到共享的表示空间中。
传统机器人系统通常采用分层结构:视觉模型负责识别物体,语言模型负责理解指令,规划器负责拆解任务,控制器负责输出动作。这样的架构工程上清晰,也便于替换模块,但模块之间存在信息损失。视觉模块可能只告诉规划器有一个杯子,却没有完整保留杯子的材质、重量、摩擦力和当前受力状态;语言模型知道用户想要拿起杯子,却未必知道机械臂应该从哪个方向接近,或者杯子被遮挡后是否仍然可抓取。
HiDream-O1-Embodied 的路线,是让图像、视频、3D 几何、动作轨迹和文本指令在更早阶段完成统一建模。模型不仅要回答眼前有什么,还要进一步判断物体如何运动、下一步会发生什么,以及某个动作是否会造成碰撞、滑落或结构变化。
这种设计的价值可以用一个简单场景说明:机器人需要把桌上的瓶子放进箱子。普通视觉语言动作系统可能把任务拆成靠近瓶子、抓取瓶子、移动到箱子上方、释放瓶子;具身世界模型则需要额外预测瓶子在不同夹持力度下的姿态变化,判断箱体边缘是否会碰撞,并在瓶子被人移动、桌面出现障碍物时重新规划。这些差异,决定了系统究竟是在执行固定脚本,还是在理解一个动态环境。
从 HiDream-O1-World 到 HiDream-O1-Embodied
不到一个月前,智象发布了交互式世界模型 HiDream-O1-World。该模型主要解决数字环境中的理解与推演问题,支持第一人称和第三人称漫游,也支持通过文本等方式编辑场景、驱动角色动作和触发环境事件。
公开信息显示,HiDream-O1-World 在交互式视频世界模型评测基准 WBench 的 Navi 分榜中以平均分 80.9 登顶,其中 Physical 维度得分 73.3,Consistency 维度得分 88.0。这款模型强调的是长时程时空一致性和全局物理一致性:镜头移动时,物体不应凭空消失,场景结构不能持续漂移,碰撞、遮挡和重力响应也要符合因果逻辑。
HiDream-O1-Embodied 则把问题往前推进了一步。交互式世界模型负责构建一个可探索、可编辑、可持续推演的环境;具身世界模型需要在这个环境中判断动作后果,并把推演结果用于现实机器人的行动。前者更像一个能够持续运行的模拟器,后者则需要成为机器人在模拟器和现实之间的决策中枢。
| 模型 | 发布时间 | 主要定位 | 关键能力 | 已披露评测成绩 | |---|---|---|---|---| | HiDream-O1-Image | 此前发布 | 图像生成模型 | 文生图、图像理解与编辑 | 公开资料称 8B 开源版本在部分开源文生图榜单表现突出 | | HiDream-O1-World | 2026 年 8 月 | 交互式世界模型 | 漫游、编辑、环境事件触发、长时程推演 | WBench Navi 平均分 80.9;Physical 73.3;Consistency 88.0 | | HiDream-O1-Embodied | 2026 年 9 月 7 日 | 具身世界模型 | 物理感知、动态预判、动作执行、扰动适应 | RoboColiseum Robustness 平均分 0.692,子榜第一 |
从产品矩阵看,智象正在形成一条相对清晰的路线:先用图像和视频模型建立视觉生成能力,再用交互式世界模型构建可持续推演的数字环境,最后接入动作与机器人数据,形成面向物理世界的具身模型。它的核心叙事不是单点模型性能,而是用同一套原生全模态底座覆盖从内容生成到世界构建、再到机器人执行的不同阶段。
数据闭环是具身模型真正的门槛
具身模型最难的部分通常不是让机器人完成一次动作,而是获得足够多、足够真实且覆盖异常情况的数据。现实世界数据采集昂贵、速度慢,而且每次失败都可能损坏设备、物体甚至伤及人员;纯仿真数据成本低,却容易存在视觉和物理上的分布偏差。
智象披露的方案是利用原生全模态能力对真实动作数据进行精细化扩增。以与诺亦腾的合作为例,诺亦腾提供高精度真人动作捕捉数据,智象则在保持物理约束不变的前提下,对单段真实动作样本生成不同背景、光照、物体形态和环境条件下的视频变体,完成百倍级数据扩增。
这类扩增的关键不在于生成更多看起来不同的视频,而在于动作与环境变化之间的因果关系不能被破坏。一个人抬手的动作可以换到不同房间,但身体关节的运动范围、脚底与地面的接触关系、物体被推动后的位移仍应合理;机械臂抓取一个物体时,改变光照可以,改变物体的重心和摩擦力则需要同步改变动作策略。
因此,具身数据生成不是普通的视频增强,而是带有物理约束的条件生成。模型既是训练数据的使用者,也可以根据自身的短板主动生成样本。例如,当模型在低照度环境或部分遮挡场景下表现不稳定时,系统可以定向生成这些困难条件,并反复训练,形成数据与模型互相驱动的增长飞轮。
这套机制如果能在真机测试中成立,价值会高于一次榜单排名。因为机器人行业真正需要的不是某个固定 benchmark 上的高分,而是面对长尾情况时仍然不容易崩溃的系统。现实世界中的失败往往来自训练集之外:陌生材质、异常姿态、突然出现的障碍物,以及人类操作带来的不可预测变化。
对开发者意味着什么
对机器人开发者而言,HiDream-O1-Embodied 最直接的价值,是可能减少从视觉识别到动作控制之间的手工胶水代码。传统系统需要工程师为不同物体、不同场景编写大量规则,并针对每一种机器人本体重新标定;统一模型如果能够同时理解场景、动作和物理约束,就有机会把部分任务从规则编排转移到模型推理。
但这不意味着机器人应用可以直接从实验室模型切换到生产环境。开发者仍然需要重点确认以下问题:
- 动作接口是否开放。 模型输出的是高层动作意图、末端轨迹、关节控制量,还是完整的视觉语言动作策略,决定了接入成本。
- 是否支持主流机器人本体。 不同机械臂的自由度、负载、控制频率和坐标系并不相同,模型泛化能力不能只看视觉输入。
- 推理延迟是否足够低。 抓取、避障和人机协作通常要求毫秒级到数十毫秒级响应,离线仿真高分不代表实时控制稳定。
- 安全机制是否独立于模型。 即使模型具备物理推演能力,也不能替代碰撞检测、限位、急停和权限控制等硬安全层。
- 真机与仿真之间的差距。 仿真中的摩擦、软体形变、传感器噪声和执行器误差,仍可能与真实设备存在明显差异。
- 评测是否可复现。 需要公开任务配置、扰动类型、随机种子、传感器设置和失败判定标准,否则不同模型的分数很难横向比较。
对自动驾驶、无人机和工业自动化团队来说,这类模型同样值得关注。它们面对的共同问题是:系统不能只识别当前画面,还必须预测几秒后的环境变化,并在不确定条件下采取保守行动。具身世界模型可能成为感知、预测和规划之间的新接口,但它是否能替代现有模块,还要看推理成本、稳定性和责任边界。
这次发布的含金量,应该怎么看
HiDream-O1-Embodied 的发布有明确意义:它显示出国内模型公司正在把世界模型竞争从视频生成和数字场景,推进到机器人动作与现实交互。尤其是首次参评 RoboColiseum 就拿下 Robustness 子榜第一,说明智象至少在公开仿真测试中的扰动适应能力上交出了一份有分量的成绩单。
但现阶段更准确的判断是:这是一个值得关注的技术里程碑,还不是具身智能商业化已经解决的证明。原因很简单,具身系统的最终能力由模型、机器人本体、传感器、控制器、数据闭环和安全系统共同决定。单一模型在仿真榜单上的优势,不能直接转换为真实工厂中的产能提升或家庭机器人的可靠服务。
智象下一步最需要补齐的是工程化信息,包括可用模型规模、端到端延迟、支持的动作空间、真机任务成功率、仿真到现实迁移效果,以及模型是否向研究者和开发者开放。尤其对于希望实际使用的团队,榜单第一不如一套可复现的评测协议、清晰的部署条件和连续运行数百小时的故障数据。
从行业竞争看,Google、NVIDIA、Tesla 等公司已经分别从仿真训练平台、机器人基座模型和自动驾驶系统切入世界模型。智象选择以原生全模态 UiT 为核心,将图像、视频、3D、文本和动作统一到同一技术体系,优势在于路线完整,短板则是需要同时证明模型能力和生态落地能力。
无论最终谁能胜出,具身智能的竞争焦点都已经从让机器人看懂一张图片,转向让它在持续变化的真实环境中做出可解释、可执行、可恢复的动作。HiDream-O1-Embodied 的出现,至少说明这场竞争正在从单纯的内容生成,进入世界建模与物理执行的阶段。



