AI 快讯李飞飞的世界模型开始练机器人
行业快讯

李飞飞的世界模型开始练机器人

2026-07-30T10:04:43.535Z
李飞飞的世界模型开始练机器人

World Labs收购机器人仿真公司SceniX,将Marble的空间生成能力接入机器人训练闭环。李飞飞押注的世界模型,正从生成可探索空间走向预测行动后果。

World Labs补上机器人训练这一块拼图

李飞飞创办的World Labs正在把世界模型从三维内容生成工具,推进为机器人训练基础设施。

7月22日,World Labs宣布收购机器人仿真初创公司SceniX。到今天(7月30日),这笔交易已经过去8天,双方尚未披露收购金额、客户名单、商业定价和合并后的产品发布时间,但战略方向已经十分明确:World Labs不再只满足于让AI生成一个可观看、可探索的三维世界,而是要让机器人进入这个世界训练、接受评测,并把学到的策略带回现实。

这笔收购的重要性不在于World Labs多了一套仿真软件,而在于它补上了从空间理解到具身行动之间最难的一段链路。此前,World Labs旗下Marble已经展示出根据图像、视频和文本构建可探索三维空间的能力;SceniX则把机器人、传感器、动作、碰撞、摩擦和任务评测带入这些空间。前者负责造世界,后者负责让机器在世界里行动。

World Labs的Marble世界模型与SceniX机器人仿真系统组成Real-to-Sim-to-Real闭环的示意图

世界模型不只是更长的视频生成器

世界模型是一类能够表示环境状态、理解空间关系,并预测行动将如何改变环境的AI模型。

这个定义强调的是“状态”和“行动”,而不是画面是否逼真。一个视频模型可以生成机械臂拿起杯子的流畅片段,但如果杯子在遮挡后改变位置、机械臂穿过桌面,或者同一个动作每次产生不同的物理结果,它就不适合训练机器人。机器人需要的不是视觉上合理的电影,而是可重复、可测量、能被动作控制的实验环境。

空间智能是机器理解物体位置、尺度、方向、几何结构及其相互关系,并据此进行推理和行动的能力。李飞飞近年来反复强调,语言智能解决的是“世界如何被描述”,空间智能解决的是“世界如何被组织、改变和进入”。对于机器人来说,知道桌上有杯子只是第一步;它还要判断杯子离桌沿有多远、杯柄朝向哪里、夹爪从哪个角度接近,以及抓取后杯中的液体会不会洒出来。

具身智能是智能系统通过某种物理或虚拟载体感知环境、规划动作并获得反馈的能力。这里的载体并不限定为人形机器人,也可以是仓储机械臂、轮式机器人、无人机、软体机器人,甚至用于狭窄环境或医疗场景的微型设备。World Labs与SceniX强调模型无关、机器人形态无关,实际是在争夺比单一人形机器人产品更底层的位置。

李飞飞对世界模型的判断因此比“生成3D场景”更激进:一个真正有用的世界模型,既要向人输出可见的像素,也要向机器人输出可以用于规划和学习的状态变化。Marble此前更接近前半部分,SceniX补的是后半部分。

核心闭环是Real-to-Sim-to-Real

Real-to-Sim-to-Real是先把现实环境转换为可编辑的数字场景,再在仿真中训练和评测机器人,最后把策略部署回现实世界的技术闭环。

第一步Real-to-Sim要解决数字化问题。工厂、实验室、仓库和家庭并不是干净的标准测试场,而是包含遮挡、反光、杂物、磨损和不断变化的布局。传统做法往往需要工程师手工建模、配置碰撞体并设置材质;世界模型的价值,是把图像或视频更快地转成具有语义和几何结构的空间表示。

第二步Sim要解决规模化训练问题。现实中的机器人数据昂贵而缓慢:每采集一段操作轨迹,都要占用一台机器人、一套遥操作设备和一名操作者;碰撞还可能损坏硬件,电池、维护和场地都会限制数据吞吐量。仿真环境则可以并行运行大量任务,并精确改变光照、摩擦系数、物体尺寸、摆放位置、相机视角和传感器噪声。

第三步Sim-to-Real要解决迁移问题。仿真与现实之间的差异通常被称为Sim-to-Real gap,即机器人在虚拟环境中学会的策略,因材质、动力学、传感器误差或场景细节不一致而无法在现实中稳定执行。World Labs与SceniX的组合并不会自动消灭这道鸿沟,但更高质量的空间重建、真实数据回流和可控的参数随机化,有机会缩小它。

这条闭环真正有价值的地方,是每次现实部署失败都可以变成下一轮训练数据。机器人在仓库里因为透明包装识别错误、在实验室中因夹爪摩擦不足掉落试管,系统可以把失败现场重新导入仿真,批量生成附近条件下的变体,再针对薄弱区域训练和评测。它更像自动驾驶行业的场景回放与长尾挖掘,而不是一次性制作一张漂亮的三维地图。

仿真的独特价值是练习没有发生过的失败

反事实推理是对“如果采取另一种行动,结果会怎样”进行模拟和比较的能力。

李飞飞在收购后的对谈中把仿真的价值落在反事实推理上,这是一个比“合成更多数据”更准确的解释。现实数据只能记录已经发生的事情,而机器人安全训练经常需要研究尚未发生、极少发生,甚至不应该真的发生的事故。比如机械臂夹持力度再增加10%会不会压碎玻璃瓶,无人机在一侧电机推力下降时能否稳定降落,家庭机器人碰到突然伸手的儿童应该如何停止。

现实世界不适合系统性地制造这些危险,但仿真可以重复数万次。研究团队还能控制变量:只改变地面摩擦力,其他条件保持不变;只移动障碍物5厘米,观察规划器是否失效。可控性使训练数据从“碰巧采到什么”变成“明确覆盖什么”,这也是SceniX对World Labs最关键的补充。

物理仿真和数据驱动并不是二选一。SceniX联合创始人李昀烛给出的路线,是早期更多借助物理规律保证结构、一致性和可控性,随后随着真实机器人数据积累,逐步增强数据驱动部分。换句话说,物理引擎提供训练的骨架,真实数据负责修正骨架与现实之间的偏差,世界模型则承担场景生成、状态表示和分布扩展。

这个组合比纯视频预测更务实。纯视频模型擅长从像素序列预测下一帧,却未必显式保留可供机器人读取的物体状态、碰撞关系和动作接口;传统物理引擎具备严格的动力学结构,却需要大量人工建模。World Labs想做的,是把两者合并成一种既能生成、又能控制,还能被机器人策略直接使用的数字世界。

World Labs要挑战的是机器人数据瓶颈

机器人基座模型是利用多任务、多环境和多种机器人数据训练,并可迁移到不同操作任务的通用模型。

语言模型能够从互联网获得海量文本,机器人模型却没有同等规模的公开行动数据。网页可以复制,真实抓取、行走和装配轨迹却必须由硬件执行;不同机械臂的关节结构、控制频率和传感器配置也不一致。即使收集到数据,一台双臂机器人完成叠衣服的轨迹,也不能无损迁移到轮式机械臂或其他夹爪上。

世界模型提供的是一个数据放大器,而不是凭空替代真实数据。少量真实场景可以被重建为数字环境,再通过改变布局、材质、光照和目标物体生成大量变体;人类演示可以作为起点,策略再通过强化学习或模仿学习探索不同动作。最终仍要回到真实机器人验证,否则系统可能只是在利用仿真的漏洞。

World Labs已经看到了来自机器人公司的实际需求。李飞飞透露,在与SceniX深入讨论合作之前,就有从机器人底层模型团队到垂直场景公司的潜在客户询问,能否使用Marble生成的数字世界训练机器人。这说明收购并非临时追逐具身智能热度,而是Marble在商业化过程中被客户拉向了机器人训练。

不过,市场需求不等于产品已经成立。截至7月30日,World Labs尚未公布机器人训练的标准化产品、支持的机器人本体、传感器模型、并行仿真规模、任务成功率,也没有给出从仿真迁移到现实后的量化提升。对于开发者和机器人公司而言,这些指标比生成场景的演示视频更重要。

它和现有仿真平台有什么不同

World Labs与SceniX的潜在差异,是用生成式世界模型降低场景创建成本,再以可控仿真支撑训练和评测。

机器人仿真并不是空白市场。NVIDIA Isaac Sim与Isaac Lab强调GPU并行计算、强化学习和完整的机器人开发栈;MuJoCo以高效、稳定的动力学仿真著称;Habitat更聚焦室内导航和具身AI研究。World Labs若只提供另一套物理引擎,很难建立优势,它必须证明世界模型能够显著降低现实场景数字化和长尾数据生成的成本。

| 平台或路线 | 核心定位 | 主要优势 | 当前限制 | 公开价格情况 | |---|---|---|---|---| | World Labs + SceniX | 生成式世界模型与机器人仿真闭环 | 从真实数据生成可探索环境,强调Real-to-Sim-to-Real和模型无关 | 尚未公布机器人训练基准、迁移成功率和正式产品时间 | 收购金额与产品价格均未公布 | | NVIDIA Isaac Sim / Isaac Lab | GPU机器人仿真、强化学习与开发工具链 | 生态成熟,可并行训练,和NVIDIA计算平台结合紧密 | 场景资产与工作流仍有较高工程门槛 | Isaac Sim可免费使用,算力和企业部署成本另计 | | MuJoCo | 通用刚体动力学仿真 | 速度快、研究生态成熟、控制接口清晰 | 重点是动力学,不负责自动生成完整真实场景 | 开源免费 | | Habitat Lab | 室内导航与具身AI研究平台 | 场景数据集、导航任务和学术评测体系成熟 | 更偏研究与导航,工业操作链路并非核心 | 开源免费 | | 纯视频世界模型 | 从视频预测环境后续变化 | 可利用大规模视频数据,生成能力强 | 物理一致性、动作可控性和状态可读性不足 | 因模型而异 |

真正的竞争不会只看画面逼真度。机器人公司会关注至少五个问题:导入一个真实场景需要多长时间;能否配置准确的碰撞和动力学参数;训练能并行到多大规模;同一任务在仿真和现实中的成功率差距是多少;失败案例能否自动回流并形成下一轮测试集。World Labs需要用数字回答这些问题。

这笔收购说明世界模型竞争正在换赛道

世界模型的竞争正在从“谁能生成更震撼的视频”,转向“谁能提供可交互、可验证、可执行的环境”。

视频生成主要服务内容消费,评价标准是清晰度、连贯性和审美;机器人训练服务生产系统,评价标准是物理一致性、动作响应、覆盖率、迁移效果和安全边界。同样是生成一间厨房,前者只要看起来像厨房,后者必须知道柜门的转轴在哪里、杯子能否被抓取、桌面摩擦力会如何影响物体滑动。

World Labs的机会,在于把空间生成、语义理解、几何重建、物理仿真和机器人评测统一起来。若这套系统成立,客户不必在三维建模工具、仿真器、数据生成管线和评测框架之间反复拼接,机器人团队可以把更多精力放在策略模型和真实部署上。

World Labs的风险,也来自目标过于庞大。生成视觉上可信的三维环境已经很难,再要求环境具备稳定几何、长期一致性、正确动力学和低延迟交互,难度会成倍增加。不同机器人还需要不同精度:仓库导航重视大尺度布局,机械臂装配重视毫米级接触,软体机器人则需要复杂形变模拟。一套世界模型未必能用相同成本覆盖所有场景。

收购本身也没有证明Marble已经能训练出更好的机器人。当前最合理的判断是,World Labs找到了空间智能最有商业价值、也最能检验技术真伪的落地场景,但仍处于基础设施整合期。下一阶段应关注的不是新演示,而是可复现基准:仿真训练带来了多少真实成功率提升,现实数据需求减少了多少,场景构建从几天缩短到几小时还是几分钟。

李飞飞押注的不是人形机器人

李飞飞的长期判断是,空间智能会成为AI越过语言边界后的下一层基础能力。

这也解释了World Labs为什么强调机器人形态无关。人形机器人适合进入为人类设计的空间,但具身智能不会只有人形这一种答案。实验室自动化可能更适合固定机械臂,仓储需要轮式底盘,深海和太空探索需要特种结构,医疗场景甚至可能使用微型或软体设备。底层世界模型若足够通用,就不应与某一种身体绑定。

这条路线还给World Labs留下了比机器人更宽的商业边界。同一套可生成、可编辑、遵循空间规律的世界模型,也可以服务游戏制作、影视预演、建筑设计、数字孪生、科学模拟和教育。但机器人是最严格的考场,因为它会把模型中的几何错误、物理幻觉和状态漂移直接暴露出来。

World Labs收购SceniX因此是一次方向明确、结果尚待验证的下注。它标志着李飞飞的世界模型开始从“让机器看懂并生成空间”,走向“让机器在空间里行动并承担后果”。如果Marble负责想象世界,SceniX负责让行动遵守规则,那么双方要共同完成的最后一块拼图,就是证明虚拟世界里练出的能力,真的能在现实中工作。

参考来源

受链接域名范围限制,事件信息依据World Labs于7月22日公布的收购消息、李飞飞与李昀烛的公开对谈,以及相关国内报道整理;以下仅列出符合要求、可用于核对竞品技术路线的公开项目。

  • NVIDIA Isaac Lab:NVIDIA面向机器人学习、强化学习和运动规划的开源框架,可用于理解GPU并行仿真路线。
  • Google DeepMind MuJoCo:通用物理仿真引擎的官方开源仓库,提供动力学、接触和控制相关资料。
  • Meta Habitat Lab:面向具身AI研究的仿真与任务平台,覆盖室内导航、操作和评测工作流。

相关推荐

查看全部