AI 快讯World Labs发布Atlas,世界模型进入下一站
模型上新

World Labs发布Atlas,世界模型进入下一站

2026-09-01T21:03:29.290Z
World Labs发布Atlas,世界模型进入下一站

World Labs近日发布面向空间智能的世界模型Atlas。相比只生成一段视频或一张图片,Atlas试图让AI建立可持续、可推理、可交互的三维世界表征,但它距离机器人和真实物理世界仍有明显距离。

World Labs发布Atlas:空间智能不再只生成“画面”

World Labs近日发布了面向空间智能的世界模型Atlas,这是继Marble之后,该公司在“让AI理解并生成三维世界”这条路线上的新进展。Atlas的重点不是把文本变成一段更逼真的视频,而是让模型具备一种更接近“世界内部模拟器”的能力:理解空间关系,维持物体与场景的一致性,并在环境发生变化时推演可能结果。

**空间智能是让AI理解物体在哪里、彼此如何关联以及世界如何变化的能力。**它区别于传统视觉模型的地方,不只是识别“桌子”“椅子”或“门”,而是进一步判断桌子与椅子的距离、门是否能够打开、物体被遮挡后是否仍然存在,以及一个动作会对场景造成什么影响。

这也是Atlas值得关注的原因。过去两年,生成式AI的竞争主要围绕语言、图像和视频展开;而World Labs试图把竞争带到另一个维度:AI能不能生成一个人或机器人可以进入、观察、移动和操作的世界。

World Labs Atlas世界模型生成的可探索三维场景示意图

Atlas究竟要解决什么问题

**世界模型是能够在内部构建、预测并更新环境表征的AI模型。**与只根据提示生成内容的模型不同,世界模型需要回答“如果我改变了某个条件,接下来会发生什么”。

例如,图像生成模型可以画出一间客厅,视频模型可以让镜头从客厅中央移动到窗边,但这并不意味着模型真正拥有了一间客厅的内部表示。镜头转向另一侧时,沙发可能改变形状;摄像机绕过桌子后,桌腿数量可能发生变化;被柜门遮住的物体,重新出现时也可能变成另一个东西。

这些问题在二维内容创作中有时只是瑕疵,在机器人、自动驾驶和空间设计中却是根本性缺陷。一个机器人不能因为物体暂时离开视野,就假设它已经消失;一辆自动驾驶汽车也不能只描述“前方有行人”,还需要预测行人的运动方向、与车辆的距离,以及道路环境对双方行动的约束。

Atlas所代表的路线,核心就是从“生成看起来合理的画面”,转向“维护一个可被持续访问的环境状态”。这个环境状态至少应包含三类信息:

  • 几何信息:物体的形状、尺寸、位置、朝向,以及不同物体之间的空间关系。
  • 语义信息:场景中有什么,物体是什么,哪些区域可以通行、抓取或操作。
  • 动态信息:物体如何移动,场景如何随时间变化,以及某个动作可能带来的后果。

这三者并不是简单叠加。模型只有把“这是什么”和“它在哪里”联系起来,才能进一步理解“它能做什么”。Atlas的价值,正是在于尝试把语言、视觉、三维几何与动态推理放进同一个系统中。

从Marble到Atlas,World Labs在升级什么

**Marble是World Labs此前推出的多模态三维世界生成产品,能够根据文本、图片、视频或360度全景等输入创建可漫游、可编辑的空间。**它把世界模型的能力包装成面向创作者的产品,让用户不必从零开始进行传统建模,就能快速生成一个具有空间连续性的虚拟环境。

Atlas则更像是基础模型层面的新一站。Marble解决的是“如何把输入转换为可探索的三维场景”,Atlas进一步指向“如何让模型理解场景并预测场景”。两者的关系,可以类比为:Marble更接近面向用户的三维创作工具,Atlas则试图成为支撑这些工具、模拟系统和具身智能应用的空间推理引擎。

| 对比维度 | 传统图像生成模型 | 视频生成模型 | Marble | Atlas代表的方向 | |---|---|---|---|---| | 主要输出 | 单张二维图像 | 连续视频片段 | 可漫游三维世界 | 可理解、预测和更新的空间世界 | | 空间一致性 | 通常较弱 | 随时间维持,长期一致性有限 | 强调空间连续性和持久性 | 进一步强调空间表征与推理 | | 物体恒常性 | 容易出现遮挡后变化 | 长时段仍可能漂移 | 试图保持物体和场景稳定 | 需要在状态更新中维持稳定 | | 交互能力 | 主要是重新生成 | 多为观看或镜头控制 | 支持编辑、漫游和组合 | 面向更复杂的环境交互和决策 | | 典型应用 | 海报、概念图、广告素材 | 短片、分镜、视觉特效 | 游戏原型、虚拟场景、空间设计 | 模拟、具身智能、空间推理基础设施 |

目前公开信息并没有给出Atlas完整的参数规模、训练数据规模、推理成本、标准化评测成绩或商业定价。因此,现阶段不适合把Atlas描述成已经成熟的通用物理模拟器,更不能简单等同于机器人“大脑”。更准确的说法是:World Labs正在把空间生成能力向空间理解和世界预测能力推进。

为什么这次发布的行业意义更大

Atlas的重要性不在于又发布了一个三维内容生成器,而在于它把生成式AI的基本输出单位从“内容”推向了“环境”。

过去的生成式AI产品通常围绕一张图、一段视频、一篇文章或一个音频文件组织工作流。世界模型的输出则可能是一套可持续存在的空间状态:用户可以改变视角,可以移动物体,可以重新布置场景,也可以让智能体在其中完成任务。

这种变化会影响模型的训练方式和产品形态。对于图像模型来说,生成结果是否美观往往是重要指标;对于世界模型来说,单帧画面好看只是起点,还需要考察以下问题:

  1. 摄像机移动较长距离后,场景是否仍保持一致?
  2. 物体被遮挡、拿起或放下后,是否仍然符合位置和形状约束?
  3. 模型能否区分墙、地面、门和可移动物体?
  4. 用户修改局部区域时,其他区域是否会被无关地破坏?
  5. 生成的环境是否能被游戏引擎、仿真系统或机器人控制模块使用?

这意味着世界模型的评估标准,不能只看一张截图或者几秒钟的视频。它更接近对一个“可运行环境”的测试:连续性、可控性、可编辑性、物理合理性和长时间稳定性,都需要同时考察。

Atlas距离“理解物理世界”还有多远

**空间一致性不等于物理真实性。**这是理解Atlas以及整个世界模型赛道时最需要保持的判断。

一个模型可以生成看起来连贯的房间,却未必知道一块木板能否承受重量;可以让球从桌面滚落,却未必能准确计算碰撞、摩擦和反弹;可以预测行人向前移动,却未必能在拥挤环境中可靠处理多主体之间的博弈关系。

真实世界的物理规律包含多个层次:刚体运动、流体、软体形变、光照变化、遮挡关系、材质属性,以及人类和动物的行为意图。只靠从视频中学习统计规律,模型可能在常见场景里表现不错,但遇到训练数据之外的组合,就容易出现“视觉上合理、物理上错误”的结果。

因此,Atlas如果要服务机器人和自动驾驶,至少还需要与仿真器、传感器数据、动作轨迹和真实世界反馈结合。单纯生成一个漂亮的三维空间,可以帮助创作者快速搭建原型,却不足以直接承担安全关键任务。

另一个现实问题是推理成本。三维世界比二维图像包含更多状态,模型不仅要生成当前画面,还要记住空间布局、对象身份和历史变化。如果场景可以长期漫游和编辑,系统就需要持续维护一个规模可控的世界状态。对于消费级设备和实时机器人而言,延迟、显存占用、带宽和能源消耗都会成为落地门槛。

对开发者和创作者意味着什么

Atlas首先会影响的是需要快速构建空间原型的人,而不是马上替代成熟的游戏引擎或机器人系统。

在游戏开发中,开发者可以用自然语言或多模态素材搭建关卡草图,再把生成的空间交给人工进行碰撞体、材质、灯光和交互逻辑的精修。它最有价值的环节不是替代全部制作流程,而是缩短“想法变成可走进去的场景”之间的距离。

在影视和广告制作中,导演或美术可以先生成多个空间方案,用于确定镜头调度、场景比例和视觉风格。相比单张概念图,可漫游场景更适合讨论“人物从哪里进场”“摄像机能否绕到背后”“这个布景是否支持连续镜头”等问题。

在建筑和室内设计中,模型可以帮助客户提前浏览空间方案,并快速比较不同布局。但涉及承重、消防、结构安全和施工可行性时,生成模型只能提供前期参考,不能替代专业设计软件和工程审查。

在机器人领域,世界模型的潜力更大,也更难兑现。机器人需要的不只是一个虚拟环境,而是能够把视觉观察映射为行动计划的系统。例如,看到桌面上的杯子后,模型要判断杯子的可抓取位置、机械臂的运动路径、碰撞风险,以及抓取失败后的恢复动作。Atlas可以成为其中的环境理解模块,但仍需结合控制策略、真实传感器和动作执行系统。

与Google Genie等路线相比,Atlas的差异

**世界模型不是单一技术路线,而是一个涵盖三维生成、视频预测、物理模拟和具身交互的研究方向。**Google等公司探索的Genie类模型更强调从视觉序列中学习环境变化,并生成可交互的动态内容;World Labs则从空间智能出发,长期聚焦三维结构、空间关系和可探索世界。

这两类路线并非完全竞争。视频世界模型擅长学习“接下来会发生什么”,三维世界模型更强调“世界由什么构成以及我身处何处”。前者像一个能够预测镜头的动态引擎,后者更接近一张可被查询、编辑和操作的空间地图。最终的通用系统很可能需要把二者结合起来:既理解稳定的三维结构,也能预测动态变化。

| 产品或路线 | 核心优势 | 当前更适合的场景 | 主要短板 | |---|---|---|---| | Marble | 多模态生成可漫游三维世界 | 创意生产、空间原型、场景搭建 | 精细物理和复杂交互仍需验证 | | Atlas | 面向空间智能的世界模型能力 | 空间理解、环境预测、未来智能体基础设施 | 公开参数、评测和生态信息仍有限 | | Genie类世界模型 | 从视觉序列学习动态环境 | 交互式视频、游戏环境、智能体训练研究 | 三维结构持久性和可编辑性需持续验证 | | 传统游戏引擎 | 物理、渲染和交互控制成熟 | 商业游戏、工业仿真、实时应用 | 内容制作成本高,自动生成能力有限 |

World Labs真正的竞争对手,未必只是另一家模型公司,也包括Unreal Engine、Unity、Omniverse以及各类数字孪生平台。模型公司提供的是生成和理解能力,传统引擎提供的是确定性、工具链和生产标准。谁能把两者接起来,谁才更可能成为空间计算时代的基础设施。

我们怎么看:Atlas是重要方向,但还不是“通用世界模拟器”

Atlas值得关注,但目前更适合被看作空间智能基础设施的早期组件,而不是已经完成的通用世界模型。

它的意义有三点。第一,World Labs继续坚持三维空间不是语言模型的附属能力,而是独立且重要的模型范式。第二,Marble面向创作者的产品化经验,为Atlas走向真实工作流提供了入口。第三,空间世界一旦具备可持续状态,就有机会连接游戏、仿真、机器人和数字孪生等多个市场。

但它的短板同样清楚:公开评测和技术细节仍不充分,真实物理规律的建模难度远高于视觉一致性,生成环境能否稳定接入现有工具链也有待观察。尤其对于机器人和自动驾驶,任何无法解释、无法验证的空间预测都不能直接用于高风险决策。

接下来判断Atlas是否真正有竞争力,可以重点看四个指标:

  • 长时段一致性:场景持续运行数分钟甚至更久后,物体和空间关系是否稳定。
  • 可控编辑能力:修改一个区域时,模型能否保持其他区域不被破坏。
  • 动态与物理推理:模型是否能预测遮挡、碰撞、移动和多主体互动,而非只生成视觉上合理的结果。
  • 生态接入能力:输出能否进入游戏引擎、仿真平台、机器人训练和数字孪生工作流。

如果Atlas能在这些指标上持续进步,World Labs就不只是做一个更方便的3D生成工具,而是在争夺下一代空间计算的模型入口。反过来,如果它只能生成短时稳定、不可验证的虚拟场景,那么它的商业价值仍将主要停留在创意生产,而不是更广泛的智能体和机器人系统。

从今天的节点看,Atlas最准确的定位是:它让“AI生成世界”开始向“AI理解并运行世界”靠近,但这条路才刚刚进入真正困难的阶段。

参考来源

相关推荐

查看全部