AI生成3D,开始从模型变软件

Nova3D 团队展示了一条不同于传统文生3D的路线:让大模型生成带层级、关节和运行逻辑的空间软件,而不只是一个好看的网格。
AI 生成的 3D,不再只是一个“壳”
**截至 2026 年 8 月 24 日,一项近期公开的研究正在把 AI 生成 3D 的目标从“做出形状”改成“写出一个能运行的空间对象”。**论文作者之一在 Reddit 的机器学习社区介绍称,团队尝试把大语言模型当作“空间软件生成器”,直接产出由逻辑部件、层级关系、关节约束和运行规则构成的 3D 对象;配套的 Nova3D 演示则展示了能够自然开合、旋转和重新配置的机械结构、家具及日常物件。
**可编程 3D 对象是以软件结构表达、能够被查询、修改和驱动的三维对象。**它和常见的 AI 文生 3D 最大区别,不在于最终截图是否逼真,而在于对象内部是否知道“自己由什么组成、哪些部分能动、应该怎样动”。一把剪刀不再只是剪刀形状的表面,而是左右刀片、转轴、握柄和开合约束的组合;一扇门也不只是嵌在墙上的网格,而是门板、门框、铰链、旋转轴和开合角度共同构成的程序。

**这项工作的价值不是让 AI 第一次“画出”3D,而是让生成结果从数字雕塑变成可继续开发的资产。**传统生成模型擅长迅速给出外观,尤其适合概念设计、商品预览和静态素材;但一旦进入动画、游戏、机器人仿真或数字孪生工作流,开发者仍要重新拆件、命名、绑定骨骼、设置碰撞体并补上交互逻辑。Nova3D 所代表的空间编程路线,试图在生成时就完成其中一部分工作。
什么是“空间软件生成”
**空间软件生成是让模型用程序、参数和结构关系描述三维世界,而不是直接预测一整块几何表面。**它可以被理解为把前端开发的组件化思路搬进 3D:按钮不是一张按钮图片,而是一个带状态和事件的组件;同样,抽屉也不只是一块长方体,而是一个属于柜体、沿指定轴移动、具有最大行程的子组件。
**单体网格是把物体外表编码为顶点、边和面的整体几何表示。**这类结果常被研究者形容为“mesh blob”,也就是一团看起来正确、内部语义却很弱的网格。它可以拥有很高的面数和不错的纹理,但模型未必知道轮子属于车身、杯盖可以旋转,或者机械臂的第二节只能绕某个轴转动。
**层级结构是父部件与子部件之间可继承变换和语义的组织关系。**例如,机器人手指属于手掌,手掌属于小臂,小臂又属于上臂;移动上臂时,后面的部件会跟随运动。缺少层级的模型更像一袋散装零件,开发者必须在 Blender、Maya 或游戏引擎中重新整理。
**关节表达是对两个部件之间运动方式和运动范围的明确约束。**铰链关节允许门板绕固定轴旋转,球窝关节允许多方向旋转,滑动关节则让抽屉沿轨道平移。传统 AI 3D 通常只生成“关节看起来在哪里”,空间软件则要进一步生成“关节实际上如何工作”。
**参数化表达是用少量可编辑变量控制对象尺寸、形态和行为的方式。**当桌子的长度、桌腿数量、板材厚度和支撑位置都由参数控制时,开发者不需要重新生成一张网格,只需修改参数,就能获得同一设计家族中的不同版本。
两条 AI 3D 路线,优化目标并不相同
**Nova3D 路线与扩散式文生3D并非简单的替代关系,而是在优化两种不同的结果。**前者优先保证结构、可编辑性和运行逻辑,后者通常优先追求几何细节、纹理质量和视觉相似度。把两者放在同一个“谁更逼真”的榜单里并不公平,但对真正要把资产送进生产流程的团队而言,结构质量往往比单张渲染图更重要。
| 对比维度 | 传统 AI 文生3D | 空间软件生成 | 对实际工作流的影响 | |---|---|---|---| | 核心输出 | 网格、点云、隐式场或纹理 | 程序、参数、部件层级与几何 | 后者更接近可继续维护的工程资产 | | 部件语义 | 通常较弱,可能只有整体外观 | 可显式标记门板、轮子、转轴等部件 | 更容易选择、替换和复用单个零件 | | 动画准备 | 常需重新拆件、绑定和设置骨骼 | 可在生成阶段写入关节与运动约束 | 适合机械动画和交互原型 | | 可编辑性 | 多依赖雕刻、重拓扑或局部重绘 | 可通过参数和代码修改 | 修改尺寸不必从头生成 | | 设备适配 | 常依赖后处理制作多档资产 | 可按运行环境切换复杂度 | 有机会降低移动端和网页端负担 | | 有机物体表现 | 更擅长人物、动物、布料和复杂曲面 | 当前更擅长规则、机械和组合式物体 | 两条路线短期内会长期共存 | | 物理与交互 | 通常由引擎侧另行添加 | 可随对象一起定义 | 减少从“模型”到“可玩内容”的距离 | | 公开价格 | 各产品差异较大 | 研究原型暂未公布统一价格 | 目前还不能做成本结论 | | 公开性能数据 | 部分系统提供几何或图像指标 | 作者帖未给出统一跑分与成功率 | 暂不能证明其在通用任务上领先 |
**空间软件最直接的优势是把“后期绑定”提前到了“生成时建模”。**以一辆玩具车为例,普通文生3D系统可能输出车身和四个轮子连成一体的网格;可编程对象则会把车身设为父节点,把四个轮子设为子节点,为轮子建立旋转轴,并允许开发者继续绑定转向、悬挂和碰撞规则。前者适合渲染一张图,后者才适合进入游戏或仿真。
**空间软件的第二个优势是同一个对象可以根据算力环境选择不同实现。**研究作者特别提到,对象从诞生起就可以包含设备适配逻辑:在手机或网页等弱算力环境中使用低复杂度几何,在桌面工作站或高端游戏引擎中启用更精细的模型、材质和物理效果。这不只是传统意义上的减面,而是对象主动根据运行条件决定“怎样呈现自己”。
**这种设备适配能力可以被视为 3D 领域的响应式设计。**网页会根据屏幕宽度改变布局,可编程 3D 对象也可以根据 GPU、内存、帧率目标和交互距离改变面数、阴影、碰撞精度甚至部件数量。对于 Web 3D、移动游戏和 AR 应用,这比无差别加载高精度资产更实用。
为什么大语言模型适合做这件事
大语言模型适合生成结构化 3D 的原因,是机械对象本身就可以被拆解成接近代码的问题。“创建一个带四条腿、两个抽屉和可开合柜门的桌子”同时包含对象列表、空间关系、尺寸约束、父子层级和动作规则,这些内容天然接近程序合成,而不只是图像生成。
**代码为 3D 生成提供了比像素更明确的因果关系。**当模型写出“门板通过铰链连接到柜体,并绕竖直轴旋转”时,旋转结果来自一条可以检查的规则;当扩散模型在图像或网格中画出一道门缝时,那道缝可能只是一种视觉纹理,并不保证门真的能打开。
**程序表达还让错误更容易定位和修复。**如果一个柜门旋转方向错误,开发者可以检查轴向、枢轴点或角度范围;如果一个单体网格内部黏连,问题往往需要重新分割、补面和重拓扑。前一种错误像软件 Bug,后一种错误更像雕塑损坏,修复工具和成本完全不同。
大模型的代码能力也让自然语言迭代更有可能落到具体参数上。“把桌面加宽 20%,保留桌腿粗细不变”“让左侧柜门最多打开 110 度”“移动端隐藏内部齿轮”等指令,都可以被转换为参数或条件逻辑。相比要求生成模型重新采样整个对象,这种修改更可控,也更容易保留未修改部分。
真正重要的是“生来可动”
**动画就绪是这项研究最接近生产价值的卖点。**一个视觉上完整、结构上混乱的 3D 模型,距离能用仍然很远;一个几何相对简单、但层级和关节正确的模型,却可以立刻进入交互测试。对于原型阶段,后者通常更有价值。
**“生来可动”意味着运动逻辑不是模型完成后的附加补丁。**例如折叠椅生成时就可以带有椅背、坐垫、支架和铰链关系,剪刀生成时就能围绕中心轴同步转动两片刀刃,台灯生成时则能限制每段支臂的旋转角度。开发者拿到的不是“像折叠椅的模型”,而是“具有折叠椅基本行为的对象”。
**这一路线对机器人训练和合成数据尤其有吸引力。**机器人需要知道抽屉的把手在哪里、抽屉能沿什么方向移动、最大行程是多少,以及碰撞后会发生什么;只有表面纹理的 3D 网格无法直接回答这些问题。带语义、关节和约束的对象,更接近仿真环境需要的资产形式。
**这一路线对游戏开发的意义则是压缩资产与玩法之间的手工链条。**今天的 AI 可以快速生成一辆叉车的外观,但让叉车真正拥有可转向车轮、升降货叉、碰撞体和驾驶逻辑,仍然需要技术美术和程序员协作。空间软件生成试图让模型同时承担一部分 3D 建模、绑定和玩法脚本工作。
它离成熟产品还有三道坎
**第一道坎是复杂有机形体仍然不适合纯程序化表达。**论文作者明确承认,这类方法在人物、动物、衣物、毛发和不规则自然物体上落后于传统 AI 3D 生成器。机械结构可以拆成圆柱、盒体、连接件和约束,但人的面部、肌肉和衣褶很难靠有限的参数组合得到同等自然度。
**第二道坎是结构正确不等于语义正确。**大模型可以生成一套看似合理的层级和铰链,但枢轴点偏移几厘米、部件发生穿插、运动范围违反现实机械限制,都会让对象在动画时露馅。代码能运行只是最低门槛,工程资产还需要几何有效性、物理合理性和任务可用性。
**第三道坎是当前公开信息缺少足以支撑横向结论的量化评测。**作者帖展示了可视化案例并解释了方法优势,但没有披露统一的生成成功率、平均生成时间、关节准确率、拓扑有效率、移动端帧率或与主流文生3D系统的盲测结果。公开价格也尚未给出,因此现在还不能判断它是否比成熟工具更快、更便宜或更稳定。
**缺少基准测试是这次发布最需要警惕的地方。**演示可以证明“这条路线能做出东西”,却不能证明“它能在开放提示词下稳定做对”。如果要进入生产环境,至少应评估四类数字:部件识别准确率、层级关系正确率、关节运动成功率,以及导入主流引擎后的可运行率。
**安全性和可维护性也会成为空间软件生成的新问题。**当 3D 对象本身包含代码、条件逻辑和运行时行为时,它就不再是被动资产。未来平台需要限制文件访问、网络访问、脚本执行和资源消耗,并建立类似软件依赖审计的检查机制;否则,一个“会运行的椅子”也可能携带不需要的行为。
更可能的终局是混合生成
**可编程 3D 最现实的方向不是完全取代扩散模型,而是与高质量几何生成合并。**大语言模型负责规划部件、层级、关节、参数和行为,几何模型负责生成复杂曲面、纹理和有机细节,物理引擎负责验证碰撞与运动,最后再由智能体根据验证结果反复修正。
**这套混合流程可以类比网页开发中的 HTML、CSS、JavaScript 和图片素材。**层级结构相当于 HTML,外观材质相当于 CSS,关节和交互逻辑相当于 JavaScript,而扩散模型生成的复杂几何与纹理则更像图片和视觉资产。只生成网格,相当于把整个网页截图保存下来;看起来可能一样,却无法点击、修改或响应设备变化。
**OpenUSD 一类场景描述标准可能成为这条路线的重要承载层。**开放场景描述的意义不只是交换一个模型文件,而是保留对象组合、引用、变体、层级和属性,让同一资产能够在数字孪生、动画、游戏引擎和机器人仿真之间复用。空间软件生成若要真正进入产业链,最终必须解决格式、语义和运行时兼容问题。
**未来 AI 生成 3D 的竞争指标也会从“像不像”扩展到“能不能用”。**几何质量仍然重要,但开发者还会关心对象是否能拆、能动、能改、能适配不同设备,以及是否能够被智能体可靠操作。对于生产团队而言,一个细节只有 80 分但结构正确的资产,往往比一张外观 95 分、内部完全不可编辑的网格更省时间。
OpenAI Hub 判断:这是表示方式的变化,不是一次普通模型上新
**Nova3D 展示的真正变化是 3D 生成结果的数据结构发生了改变。**过去的主流路线把 AI 当作自动雕塑家,目标是尽快输出一个可观看的表面;空间软件路线则把 AI 当作技术美术、程序员和机械设计助手,要求它同时处理形状、组成、运动与运行环境。
**这项研究目前更像方向验证,而不是可以直接替代现有 3D 生产管线的成熟产品。**它在规则物体、家具、工具、机械装置和低复杂度交互资产上已经表现出清晰价值,但在有机形体、视觉精度、稳定性和量化评测上仍有明显缺口。作者将其称为探索 LLM 空间编程属性的“奠基性工作”,这一说法目前主要来自团队自述,仍需后续论文、代码复现和第三方测试验证。
**AI 3D 的下一阶段很可能不是生成更多静态模型,而是生成越来越多能够被软件理解和操纵的对象。**当模型产出的门真的知道怎样打开、轮子真的知道绕哪根轴旋转、机器人真的能读取把手和关节信息时,AI 才算从“生成空间的外观”迈向“生成空间的规则”。
参考来源
- Reddit:Using AI as a spatial software generator to create 3D objects that are inherently programmable —— 论文作者之一对研究目标、Nova3D 演示、层级结构、关节表达、设备适配能力及现阶段局限的说明。



