AI 快讯开悟3.0开源:昇腾世界模型登顶
模型上新

开悟3.0开源:昇腾世界模型登顶

2026-07-24T20:03:39.307Z
开悟3.0开源:昇腾世界模型登顶

国产世界模型开悟3.0近日开放代码与权重,并完成华为昇腾适配。它主打单图生成可交互动态世界,在李飞飞团队相关榜单中位列第一。

国产世界模型开悟3.0近日正式开源,代码、模型权重及华为昇腾适配方案一并开放,并在李飞飞创办的 World Labs 团队相关世界模型榜单中排名第一。

这次发布最值得关注的并不是「单图生成视频」,而是开悟3.0试图把一张静态图片扩展成一个能够改变视角、持续交互和预测物理结果的动态环境。按照团队公布的信息,模型支持生成 1080P 高清内容、长时交互、动态与静态场景编辑,还可以接收相机位姿乃至力学信息。

截至 2026 年 7 月 24 日,开悟3.0已经披露代码与权重开源信息,但完整参数规模、训练数据组成、昇腾与 GPU 的端到端性能对照,以及长时交互的具体时长仍未完全公开。因此,「登顶榜单」可以证明它在特定评测协议下进入第一梯队,却暂时不能直接等同于已经全面超过 World Labs 的 Marble,更不能说明它已经是一套可替代工业仿真器的物理引擎。

开悟3.0从单张图片生成可探索动态世界,并控制相机移动和物体交互的演示对比图

世界模型不是更长的视频生成器

**世界模型是能够表示环境状态,并预测动作将如何改变环境的生成式模型。**它不仅需要回答「下一帧长什么样」,还要理解观察者在哪里、场景里有哪些对象,以及推、拉、移动或碰撞之后会发生什么。

传统视频生成模型主要在像素空间预测后续画面。只要生成的视频足够短、镜头运动不复杂,模型即使没有稳定的三维空间表示,也可能得到视觉上合理的结果;但当用户绕到物体背后、重复进出同一房间,或者对场景中的物体施加动作时,问题就会迅速暴露:桌腿数量变化、门后空间重构、物体位置漂移,甚至上一秒被推倒的椅子下一秒重新站起来。

**开悟3.0的目标是把视觉生成、空间理解与状态预测放进同一套系统。**团队将其概括为「多模态理解—生成—预测」一体化架构:模型既要理解输入图像中的对象和空间关系,也要生成新视角,还要预测交互之后的场景状态。

这种路线与纯视频模型的区别,可以用驾驶来类比。视频模型更像坐在后排观看行车记录仪,它擅长猜测接下来会看到什么;世界模型则要坐到驾驶位,不仅要知道相机正在向左转,还要预测踩下刹车、碰到路沿或改变车道之后,车辆和周围环境会如何变化。

Puffin把相机位置变成模型能理解的语言

**Puffin 是开悟3.0体系中的相机感知技术,其核心是把相机内外参数编码为可理解和可生成的 Token。**相机内参描述焦距、视场角等成像条件,相机外参则描述相机在三维空间中的位置和朝向。

这一步解决的是生成模型长期存在的「视角失忆」问题。普通视频模型能看见一只杯子,却未必知道镜头是在桌面高度平视、从上方俯拍,还是正在绕杯子做圆周运动。由于缺少显式或稳定的相机状态,模型很容易把镜头移动误解成物体变形。

Puffin则试图让相机运动与画面内容共同进入模型的表示空间。根据团队披露的信息,它既可以从已有图像反推拍摄视角,也可以根据给定的相机轨迹生成对应画面。对机器人而言,这意味着系统可以在真正移动之前,先预测「向左走一步会看到什么」;对内容创作者而言,则意味着镜头推进、环绕和俯仰不再完全依赖文本提示碰运气。

**相机可控性是世界模型走向可交互应用的基础能力。**如果观察者的位置没有被稳定建模,模型生成的世界就只是围绕输入图像延展出来的视觉幻觉,而不是可以反复进入和探索的空间。

不过,相机轨迹准确并不等于几何结构准确。模型可能生成视觉上连续的新视角,却没有形成可导出的网格、深度场或碰撞体;它也可能在短距离移动时保持一致,但在长路径探索后出现闭环失败。判断 Puffin 的真正价值,还需要看相机轨迹误差、深度一致性、回到原点后的画面恢复程度,以及遮挡区域是否能维持稳定状态。

这次开源真正重要的是动态交互

**动态交互是指模型能够根据动作或外力,预测场景中对象随时间发生的状态变化。**开悟3.0不仅区分桌子、墙面等相对静态的背景与行人、车辆等动态对象,还尝试直接接收力学条件,让模型预测施力之后的结果。

这比生成一个可自由观看的三维场景更难。静态世界只需要在不同视角下维持外观一致,动态世界还必须回答一系列因果问题:椅子被推后向哪个方向倒、冰箱门打开后内部光照怎样变化、玻璃杯从桌面边缘掉落后是否破碎。

**力学条件输入让开悟3.0开始接近动作条件世界模型,而不是停留在镜头条件视频生成。**这类能力对具身智能尤其关键,因为机器人训练需要的不是一段预先生成的漂亮视频,而是大量「动作—结果」样本。机器人可以在模型构造的环境中先尝试抓取、避障和移动,再把筛选后的策略迁移到真实设备上。

但生成模型表现出符合常识的运动,并不代表它真正求解了刚体动力学。一个杯子被推倒的画面看起来合理,可能只是因为训练数据中有大量相似视频,而不是模型准确计算了质量、摩擦系数、重心和碰撞冲量。对于机器人训练,视觉合理性只是第一关,动作结果的可重复性和数值稳定性才是更难的门槛。

开悟3.0与 Marble 不是完全相同的产品

**Marble 是 World Labs 推出的可探索三维世界生成模型,能够根据文本、图像、视频或粗略布局生成空间场景。**它侧重高质量三维场景构建,并利用 3D Gaussian Splatting 等表示方式提高实时渲染效率,同时可以输出用于碰撞检测的简化几何结构。

开悟3.0与 Marble 的共同点是都不满足于生成平面视频,而是要让用户进入生成结果;两者的区别则在于能力重心。Marble目前更接近一套世界构建和空间呈现系统,开悟3.0强调动态对象、力学条件与交互预测,更直接地指向机器人预训练和具身智能。

| 对比项 | 开悟3.0 | World Labs Marble | 传统视频生成模型 | |---|---|---|---| | 产品定义 | 动态、可交互的世界模型 | 可探索的三维世界生成系统 | 按条件生成连续视频 | | 主要输入 | 图像、相机状态、交互或力学条件等 | 文本、图像、视频、粗略三维布局 | 文本、图片或参考视频 | | 主要输出 | 最高 1080P 的动态世界与状态预测 | 可探索三维场景、视觉表示及碰撞几何 | 固定时长二维视频 | | 相机控制 | 通过 Puffin 建模相机位姿 | 支持在生成场景中探索 | 通常依赖提示词或轨迹条件 | | 动态物体 | 强调静动态分离和交互结果预测 | 现阶段更侧重场景构建与空间呈现 | 能生成运动,但状态一致性有限 | | 物理交互 | 支持输入力学信息,具体精度仍待验证 | 通过碰撞网格支持后续模拟 | 通常没有明确物理接口 | | 开放程度 | 代码与权重开放 | 核心模型闭源,提供产品和开发接口 | 视具体模型而定 | | 国产算力 | 已披露华为昇腾适配 | 未披露昇腾支持 | 多数优先支持 NVIDIA GPU | | 参数量 | 截至发稿未完整披露 | 未公开 | 因模型而异 | | 价格 | 本地部署成本取决于硬件,托管价格未披露 | 商业服务价格以官方页面为准 | 免费开源或按生成量收费 |

**榜单第一与产品全面领先是两回事。**榜单通常只能覆盖视觉质量、空间一致性、相机可控性或提示遵循度中的一部分,而工业场景还关心交互延迟、世界状态能维持多久、同一动作能否复现相近结果,以及模型生成的状态能否被控制器直接读取。

因此,更准确的判断是:开悟3.0已经在公开评测中证明国产世界模型并非只能跟随,但它是否真正领先 Marble,取决于比较的是视觉生成、三维资产生产还是动态物理预测。两者目前更像是在同一个终点前选择了不同入口。

昇腾适配比「能启动」复杂得多

**昇腾适配是指模型能够在华为 Ascend AI 处理器及其软件栈上完成推理,理想情况下还包括训练和分布式扩展。**对开发者来说,这不只是把设备名称从 CUDA 改成 NPU,还涉及算子覆盖、混合精度、显存管理、图编译和集合通信。

世界模型比语言模型更考验算力适配。它通常同时包含视觉编码器、时空注意力、生成模块和多帧解码过程,视频分辨率、帧数和批量大小都会迅速放大显存占用。1080P只是输出分辨率,并不意味着模型始终以 1080P 原生时空特征完成全部计算;是否采用分块、潜空间压缩或多阶段超分,会直接影响速度和成本。

**开悟3.0提供昇腾版本的现实意义,是让世界模型不再绑定单一海外硬件生态。**如果代码中的关键模块已经完成稳定的 NPU 算子适配,国内机器人企业和研究机构就能在现有昇腾集群上开展微调、数据生成和场景评估,而不必重写整条推理链路。

不过,「适配昇腾」不能自动推导出「全程使用昇腾训练」。截至发稿,发布信息强调的是适配能力,尚不足以证明基础模型的全部预训练均在昇腾上完成。开发者在下载模型前,还应重点确认以下信息:

  • 是否同时支持训练、微调和推理,还是只开放推理路径;
  • 关键算子是否原生运行在 NPU,还是频繁回退至 CPU;
  • 支持哪些 CANN、PyTorch 和 torch_npu 版本;
  • 1080P生成所需的最低显存、卡数与实际耗时;
  • 多卡场景使用数据并行、张量并行还是序列并行;
  • GPU与昇腾版本在固定随机种子下是否存在明显质量差异。

没有这些端到端数据,昇腾适配仍然更接近生态可用性声明,而不是性能结论。

代码和权重都开放,才有机会建立世界模型生态

**完整开源是指开发者不仅能看到推理代码,还能获取模型权重并在许可范围内部署、微调和修改。**世界模型尤其需要这种开放,因为它目前没有像语言模型那样统一的输入输出范式,不同团队对相机轨迹、动作条件、深度信息和世界状态的编码方式差异很大。

如果开悟3.0的相机表示、动态对象建模和昇腾执行路径都能被社区复现,它带来的价值会超过一次榜单排名。机器人团队可以把自有动作数据接入模型,游戏开发者可以研究生成世界与现有引擎的结合,研究机构也能设计更严格的物理一致性评测。

**开源权重不代表没有使用门槛。**1080P长时世界生成对显存、存储带宽和推理时延的要求都远高于单图生成,开发者还需要核对许可证是否允许商业使用、训练数据是否披露、衍生模型如何分发,以及生成内容的版权和安全边界。

从行业竞争看,开悟3.0最有价值的地方不是复制一个中文版 Marble,而是把世界模型的竞争从「谁能生成更漂亮的场景」推进到「谁能提供可复现、可交互、可部署的环境预测」。这也是国产团队有机会建立差异化的位置:内容生成市场已经十分拥挤,但适配国产算力、服务机器人训练的开放世界模型仍然稀缺。

距离机器人的「物理直觉」还有三道关

**物理直觉是智能体在不进行完整数值计算的情况下,对物体属性和动作后果做出快速预测的能力。**机器人看到玻璃杯,应当预判它可能易碎;看到哑铃,应当估计其重量可能超过普通水杯,而不是每次都通过真实碰撞获得答案。

开悟3.0已经展示了通往这种能力的技术组合,但至少还有三道关需要验证。

第一道关是长期一致性。一个世界运行几十秒甚至数分钟后,物体数量、位置、材质和遮挡关系能否保持不变,比生成一段几秒钟的演示难得多。

第二道关是因果可控性。同一个初始状态施加不同大小、方向的力,结果是否连续变化;重复输入同一动作,结果是否保持在合理分布内,这决定了模型能不能用于强化学习。

第三道关是从模拟到现实的迁移。生成世界中的视觉和动力学偏差会被机器人策略放大,模型越逼真,越容易让人忽略这种偏差。最终仍需要真实机器人数据、在线校准和安全约束兜底。

**开悟3.0是一款值得开发者认真复现的开源世界模型,但现在还不是可以直接替代 MuJoCo、Isaac Sim 或游戏引擎的通用物理底座。**它证明了单图世界生成、相机控制、动态预测与国产算力可以被放进同一个开放体系;下一步真正决定含金量的,将是推理成本、长期一致性、物理评测和社区复现结果,而不是演示视频本身。

参考来源

相关推荐

查看全部