AI 快讯混元WorldClaw造开放世界
模型上新

混元WorldClaw造开放世界

2026-08-12T00:03:51.804Z
混元WorldClaw造开放世界

腾讯混元发布WorldClaw,用多智能体把文本拆成地形、区域和资产规划,再生成可自由探索、可编辑的3D开放世界。它解决的是世界级场景生产,而不只是单个3D物体生成。

腾讯混元把3D生成从“做模型”推进到“造世界”

腾讯混元近日发布 WorldClaw,试图用一套全智能体、由粗到细的生成框架,把开放文本描述直接变成大规模、可自由探索且能够继续编辑的3D开放世界。相关论文以《WorldClaw: Agentic 3D Open-World Generation at Scale》为题公开,论文编号为 arXiv:2608.05248,腾讯混元也同步展示了多个生成案例。

**WorldClaw 是一套面向大规模3D开放世界生成的智能体框架。**它不是一个只负责吐出单体网格的新3D基础模型,而是把语言理解、世界规划、地形搭建、区域生成、资产生产、材质配置和空间组装串成一条自动化流水线。

这一区别很重要:传统文生3D更像“根据描述做一把椅子”,WorldClaw想做的是“根据一句世界观设定,搭出包含道路、山地、建筑、植被和独立物件的整张地图”。前者关注单个资产的几何与纹理,后者还必须处理数百乃至更多对象之间的空间关系,以及远景和近景是否属于同一个世界。

WorldClaw从文本提示词出发,经由规划智能体、全局地形构建和局部资产细化,生成可自由探索3D世界的流程图

截至 2026年8月12日,WorldClaw公开的重点仍是论文、项目展示和方法验证,公开资料尚未给出面向普通开发者的完整产品入口,也没有披露统一硬件环境下的生成耗时、峰值显存、单次成本和世界面积上限。因此,“at scale”目前首先代表一种系统架构上的扩展能力,还不能直接等同于已经验证过的商业化吞吐量。

Agentic 3D,不是给模型换一个时髦名字

**Agentic 3D 是利用多个智能体进行规划、分工、调用生成模块并迭代修正的3D内容生产方式。**它与端到端一次生成的最大区别,是系统会先把模糊目标转换成结构化任务,再根据不同空间层级逐步执行。

WorldClaw采用三阶段、由粗到细的思路,可以按功能归纳为以下过程:

  1. **先规划世界,而不是立即生成画面。**规划智能体读取开放式提示词,将其拆成区域、地形、资产、材质和空间关系等结构化规格。例如,“一座建在火山峡谷中的废弃工业城市”不再只是一句视觉描述,而会被展开为火山地貌、峡谷走向、工业区分布、道路连接、建筑类型和局部装饰等约束。
  2. **再建立全局空间骨架。**系统先确定大尺度地形与区域组织,让山脉、河流、道路和聚落形成可解释的整体结构,避免局部场景各自好看、拼到一起却互相冲突。
  3. **最后生成并组装局部内容。**系统向区域内部补充建筑、植被、岩石、道路附属物和其他实例资产,同时处理纹理、材质、朝向、尺度与摆放关系,并对局部结果进行细化。

**由粗到细是WorldClaw最关键的设计选择。**如果系统一开始就逐个生成高精度对象,它很容易在局部细节上消耗大量算力,却没有能力保证整张地图的道路能连通、城镇不会压进山体、不同区域的密度与风格能够统一。

这套方法更像大型游戏项目中的制片流程:主策划先定义世界结构,关卡设计师划分区域,地形和环境团队建立骨架,资产团队再补充建筑与物件。WorldClaw的目标,是让智能体承担其中大量组织和调度工作,而不是把所有问题压给同一个生成模型。

真正有价值的是“显式、独立、可编辑”

**显式3D资产是可以直接访问几何、纹理和实例边界的数字对象。**与只能输出一段视频、全景图或隐式辐射场的方案相比,显式网格更容易被导入传统3D软件和实时引擎,也更适合替换、移动、删除、碰撞检测与后续优化。

WorldClaw生成的世界由带纹理的独立网格资产组成,并保留实例级别的组织方式。开发者面对的不是一整块难以拆分的“场景外壳”,而是可以继续操作的地形、建筑、岩石、树木和道具。

**实例级资产决定了WorldClaw是否真的能进入生产流程。**如果生成结果只有视觉上连续的表面,用户想把一栋房子向左移动5米,往往需要重新生成或进行复杂重建;如果房子本身就是独立实例,这类修改就接近传统关卡编辑操作。

显式表示也让WorldClaw与视频世界模型走上了不同路线。视频世界模型擅长生成随镜头变化的视觉反馈,但画面中的门、桌子和道路未必对应可访问的几何对象;WorldClaw优先解决的是“把世界交付为资产”,而不是只让世界在镜头中看起来存在。

WorldClaw和现有路线有什么不同

**WorldClaw瞄准的是开放文本到大尺度可编辑场景之间的缺口。**单物体文生3D、视频世界模型、程序化地图和WorldClaw都能产生某种形式的“3D内容”,但它们交付的结果并不相同。

| 路线 | 主要输入 | 主要输出 | 全局空间一致性 | 实例级编辑 | 更适合的场景 | |---|---|---|---|---|---| | WorldClaw | 开放式文本描述 | 大规模地形、区域与独立纹理网格 | 通过规划和粗到细生成重点保证 | 支持,资产按实例组织 | 游戏原型、虚拟世界、仿真场景预制 | | 单物体文生3D | 文本或参考图 | 单个网格、点云或高斯资产 | 通常不处理世界级布局 | 单体资产可编辑 | 道具、角色原型、商品模型 | | 图像/视频世界模型 | 文本、图片或交互轨迹 | 连续画面或隐式环境状态 | 强调视觉与时间连续性 | 通常较弱,不一定输出独立网格 | 交互模拟、具身训练、内容预览 | | 程序化地图生成 | 规则、种子与人工参数 | 结构化地图和预制资产组合 | 较强,但依赖人工规则 | 强 | 成熟游戏项目、大批量规则化地图 | | 传统人工制作 | 设计文档和美术资产 | 高质量可控场景 | 由团队负责 | 最强 | 正式发行内容、精细关卡制作 |

**WorldClaw的优势不是在所有维度上取代传统流程,而是把世界原型的起点提前。**过去团队拿到世界观文本后,需要先画概念图、做灰盒地图、划分区域,再逐步搭建资产;WorldClaw希望直接给出一个能走进去查看的第一版世界。

这会对游戏和虚拟内容团队产生实际价值。独立开发者可以用它快速验证地图尺度和视觉主题,影视团队可以用它搭建虚拟勘景空间,机器人与具身智能团队也可能用它批量构造训练环境。不过,后两类场景还要求碰撞、物理参数、语义标签和任务逻辑,单有视觉与几何并不够。

“规模化”最难的不是把地图做大

**开放世界3D生成是从文本自动构建大范围、可导航且内部关系一致的三维环境。**这里的“开放”不仅表示面积大,还意味着观察者可以自由改变位置和视角,系统不能依赖预设镜头掩盖背面缺失、几何穿插或场景断裂。

大尺度场景至少同时面对四组互相拉扯的目标:

  • **全局一致性:**河流要有合理流向,道路要连接关键区域,地形不能随意断裂。
  • **局部丰富度:**走近建筑和植被后,不能只剩重复贴图与低频几何。
  • **资产可编辑性:**对象必须保持实例边界,而不是粘成一块不可拆分的表面。
  • **计算可扩展性:**世界越大,对规划上下文、资产数量、纹理存储和渲染性能的压力越高。

**WorldClaw选择用分层规划化解全局与局部之间的冲突。**全局阶段只处理对整个世界有影响的低频结构,局部阶段再把计算资源投入单个区域和资产,这与图形学中的层级细节、分块加载和场景图管理有相似思路。

智能体架构还有一个容易被忽略的优势:它允许系统在不同步骤调用不同能力。地形模块不必擅长建筑细节,资产生成模块也不必理解整张地图的交通关系;智能体负责传递约束、检查结果和组织依赖,从而避免一个模型承担全部任务。

但智能体并不会自动消除误差。规划阶段如果把区域关系理解错了,错误会沿着地形、资产和材质链路向后传播;局部资产即使单独质量不错,也可能出现尺度不统一、风格漂移、碰撞穿插和重复使用过多的问题。WorldClaw真正的工程难点,因此不是“调用了几个Agent”,而是这些Agent能否围绕同一份世界状态稳定协作。

现在还不能把它当成自动版游戏引擎

**WorldClaw生成的是3D世界的几何与视觉内容,不等于生成了一款完整游戏。**开放世界产品还包含角色行为、物理规则、任务系统、导航网格、声音、昼夜循环、交互脚本、资源流式加载和性能预算,这些都不是一张可探索3D地图能够自动补齐的。

论文展示证明了智能体可以组织复杂的场景生产链,但距离成熟工具仍有几道门槛:

  • **可控性需要从文本提升到工程参数。**专业用户不仅会说“让城市更密集”,还会要求道路宽度、坡度上限、区域面积、建筑数量和性能预算满足明确约束。
  • **几何正确性需要独立验证。**视觉上合理不代表网格拓扑干净,也不代表资产具有封闭表面、正确碰撞体和可用UV。
  • **世界逻辑需要结构化交付。**一条道路看起来连通,与它能否生成可靠导航网格是两回事。
  • **大规模复用需要解决重复感。**批量调用资产生成器可能产生近似建筑和植被,世界面积扩大后,重复问题会比单张展示图更明显。
  • **生成成本目前缺少透明数据。**截至8月12日,公开材料未给出固定世界规模下的端到端耗时、GPU配置和成本,外界暂时无法比较它与人工搭建、程序化生成或其他3D生成系统的效率。

**缺少量化数据是WorldClaw现阶段最大的评估障碍。**论文和演示可以证明“能生成”,但生产团队更关心“生成多大、需要多久、失败率多少、修改一次要不要重跑、导入引擎后还能剩多少帧”。在这些数字公开之前,WorldClaw更适合被视为方向清晰的研究原型,而不是已经定型的生产工具。

腾讯混元押注的是3D内容的“管理层”

**WorldClaw的战略意义在于把模型能力上移到世界规划与生产调度。**过去3D生成竞赛主要围绕单个资产的几何质量、纹理清晰度和生成速度展开,而开放世界要求系统理解“什么应该出现在哪里,以及不同对象如何构成整体”。

这个方向可能比继续卷单体模型跑分更接近真实需求。游戏、数字孪生、虚拟拍摄和具身智能需要的从来不是一堆互不相关的精美模型,而是一套有空间关系、有层级结构、能够编辑和运行的环境。

WorldClaw也说明,大模型进入3D产业未必只靠一个端到端万能模型。更现实的路径可能是:语言模型负责规划和审查,专用生成模型负责地形、资产与材质,传统图形工具负责组装、优化和渲染,最后由场景图把所有内容连接起来。

**我们的判断是,WorldClaw比“一句话生成一个3D物体”前进了一层,但还没有跨过生产可用性的最后一公里。**它提出的分层规划、显式资产和实例级编辑都踩中了3D行业的真实痛点;与此同时,缺少生成成本、规模上限、几何合格率和引擎落地数据,也意味着目前最有说服力的仍是框架设计,而非量产能力。

如果腾讯混元接下来能够开放可复现实验、公布生成速度与硬件配置,并提供面向主流3D软件或游戏引擎的标准化导出流程,WorldClaw才有机会从研究演示进入开发者工具链。否则,它可能成为一个很好的论文样片,却难以改变内容团队每天处理拓扑、碰撞、LOD和性能预算的实际工作。

参考来源

相关推荐

查看全部