宇树开源UnifoLM-WLA-1.0

宇树发布并完全开源具身基座模型 UnifoLM-WLA-1.0,以单一模型统筹桌面操作和全身移动,真机覆盖64项任务。它的价值不只在榜单领先,更在于尝试打通人形机器人的手、脚与环境理解。
一套模型,同时管住机器人的手和脚
宇树科技在 9 月 10 日宣布完全开源新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,并称其刷新全球开源模型多项评测 SOTA。与只负责抓取、放置等桌面操作的传统机器人策略不同,这套模型试图用同一个“大脑”统筹精细操作、身体姿态和全身移动。
**UnifoLM-WLA-1.0 是一套面向通用人形机器人的具身基础模型。**它依托大规模通用多模态感知与理解数据,并融合以交互为中心的世界建模,让机器人在理解视觉场景和自然语言指令后,直接生成可以落到真实机体上的动作。
根据宇树披露的数据,UnifoLM-WLA-1.0 已在真机评测中以单模型覆盖 64 个任务,任务范围同时包含桌面操作与全身移动操作,并具备跨任务、跨末端执行器的泛化能力。IT之家报道称,该模型在多项具身推理评测中领先国内外开源模型,部分能力可与头部闭源模型相比。

**这次发布最值得关注的不是又多了一个机器人模型,而是宇树把过去分散的能力开始收进同一套策略。**机器人能够走到桌边,并不等于它能够稳定拿起杯子;能够在固定机位完成抓取,也不等于它能一边调整重心、一边伸手操作。UnifoLM-WLA-1.0 瞄准的正是这两类能力之间长期存在的断层。
“一模驱动”为什么比看起来更难
**桌面操作与全身移动是两类时间尺度、精度要求和风险边界截然不同的控制问题。**桌面抓取强调厘米甚至毫米级精度,容错空间很小;全身移动则要持续处理平衡、落脚点、碰撞和惯性,控制频率与安全约束更复杂。
**传统人形机器人系统通常通过多个模块接力完成任务。**上层规划器负责理解“去桌边拿起水杯”这样的目标,导航模块规划路径,步态控制器维持平衡,机械臂策略处理抓取,最后再由状态机决定模块切换。这个方案工程上可控,却很容易在模块交界处出问题:机器人走到了错误位置,手臂策略就可能失效;抓取时身体重心发生变化,原本稳定的步态控制也可能被打破。
**单模型统筹的核心价值是让机器人在决策时同时考虑全身状态。**它不再把“走过去”和“伸手拿”视为两个完全独立的问题,而是像人一样提前调整站位、朝向和躯干姿态,为后续操作留出空间。从系统角度看,这相当于把串联的多个局部优化器,换成一个能够观察整体任务的联合策略。
**单模型并不意味着底层所有控制器都被神经网络彻底取代。**真实机器人仍然需要关节伺服、安全限位、碰撞检测和紧急停止等确定性机制,而基座模型更适合承担感知、推理、技能选择及高层动作生成。宇树目前公开信息尚未完整说明 WLA-1.0 与底层运动控制栈之间的边界,因此不能简单把“一模驱动”理解为模型直接接管每个电机。
从 VLA、WMA 到 WLA,宇树在合并两条路线
**VLA 是把视觉、语言和动作映射到同一模型中的具身智能架构。**它通常接收摄像头画面、文字指令和机器人状态,再预测下一步动作或动作序列,优势是训练链路直接,适合模仿学习和端到端控制。
**WMA 是把世界模型与动作生成结合起来的具身智能架构。**世界模型不只学习“看到什么就做什么”,还要估计动作会如何改变环境,例如手臂向左移动后是否会碰到障碍物、物体被推动后会落在哪里。它更像机器人脑内的一套简化物理沙盘。
**UnifoLM-WLA-1.0 可以看作宇树对视觉语言动作与世界建模能力的一次收束。**在此之前,宇树已经开源 UnifoLM-VLA-0 和 UnifoLM-WMA-0,分别探索直接动作映射与世界模型驱动的技术路线;新模型则强调通用多模态理解、交互式世界建模和全身协同,不再只把能力限制在机械臂或固定工作台上。
| 模型 | 核心定位 | 已披露能力或成绩 | 主要局限与待确认项 | |---|---|---|---| | UnifoLM-VLA-0 | 视觉—语言—动作模型 | LIBERO 总分 98.7;Spatial 99.0、Object 100、Goal 99.4、Long 96.2 | 公开成绩主要来自仿真桌面操作,不能直接代表移动与真机表现 | | UnifoLM-WMA-0 | 世界模型—动作架构 | 强调通过世界建模预测交互结果 | 现有材料未给出可与 WLA-1.0 横向比较的统一数字 | | UnifoLM-WLA-1.0 | 通用人形机器人具身基础模型 | 单模型真机统筹 64 项任务;覆盖桌面操作和全身移动;支持跨任务、跨末端执行器泛化 | 具体基准分数、任务成功率、模型规模及训练数据细节仍待完整披露 |
**VLA-0 的 LIBERO 98.7 分不能直接用来证明 WLA-1.0 的真机能力更强。**LIBERO 是面向机器人终身学习和桌面操作的仿真基准,而真机全身任务还会受到相机噪声、关节误差、摩擦变化、遮挡和摔倒风险影响。两类成绩衡量的不是同一个问题,把它们简单排成高低榜容易造成误读。
跨末端执行器泛化,可能比64个任务更重要
**跨末端执行器泛化是模型在更换机械手、夹爪或其他执行机构后,仍能迁移已有技能的能力。**末端执行器决定机器人如何真正接触世界,两指夹爪、五指灵巧手和吸盘的动作空间不同,同一个“拿起瓶子”任务在控制层面可能完全是三套方案。
**具备跨执行器能力意味着数据资产有机会摆脱单一硬件绑定。**如果每换一只机械手都要重新采集完整数据、重做动作标注并从头训练,具身模型就很难形成规模效应;如果模型能把“抓住目标”抽象为通用意图,再根据不同执行器生成对应动作,已有数据的复用率会明显提高。
**宇树在硬件与模型两端同时布局,使这项能力具有现实意义。**相比只提供算法的研究团队,机器人厂商能够获得真实关节状态、视觉、触觉或力控反馈以及任务成败数据,也能快速调整机体设计验证模型。硬件、数据和模型形成闭环,才是具身智能公司相对于纯模型公司的真正壁垒。
**跨执行器泛化仍然需要更严格的公开测试来证明。**开发者需要知道测试覆盖了多少种机械手、是否改变自由度与控制接口、零样本成功率是多少,以及模型是否经过少量适配训练。目前公开材料确认了这一能力方向,但没有给出上述拆分数据,因此更合适的判断是“路线值得重视,泛化上限仍待验证”。
64个任务是起点,不是通用性的毕业证
**单模型完成64项真机任务是一个有分量的工程结果,但任务数量本身不能等同于通用智能。**如果64项任务共享相似场景、物体和动作模板,模型可能只是把有限技能组合得更顺;如果任务覆盖陌生环境、不同工具、长时序规划和故障恢复,其含金量则会高得多。
**判断具身模型是否真正可用,至少要看成功率、连续运行时间和异常恢复能力。**实验室演示可以挑选成功片段,生产环境却要求机器人在光照变化、物体偏移、人员干扰和网络抖动下持续工作。一次完成任务与连续完成100次任务,是两种完全不同的产品成熟度。
**评测 SOTA 也需要对应到明确榜单和统一设置才有可比性。**截至 9 月 10 日现有公开报道,宇树尚未在新闻材料中逐项列出 WLA-1.0 刷新的基准名称、完整分数、对照模型及评测协议。官方所称“比肩头部闭源模型”因此更接近阶段性结论,而不是已经能够独立复核的全量证据。
目前最值得进一步核对的指标包括:
- 64项真机任务各自的单次及多次平均成功率;
- 桌面操作和全身移动任务所占比例;
- 是否包含需要移动后再操作的长链条任务;
- 面对新物体、新背景和新语言表达时的零样本表现;
- 更换末端执行器后的适配数据量与训练成本;
- 推理所需 GPU、端到端控制延迟及机载部署条件;
- 失败后能否自主重试,而不是依赖人工复位。
“完全开源”最终要看放出了什么
**具身模型的完整开源不只是上传一份权重文件。**开发者真正需要的是模型权重、网络结构、推理代码、训练或微调工具、数据格式、机器人接口、评测脚本以及清晰的许可证;缺少其中任何一环,复现成本都会快速上升。
**机器人开源比语言模型开源更依赖硬件适配层。**语言模型下载后可以直接在通用 GPU 上测试,而具身模型必须处理摄像头标定、关节映射、动作归一化、控制频率和安全边界。即使权重能够运行,换一台机器人也未必能直接复现演示效果。
**宇树此次使用“完全开源”的表述,给社区设定了较高预期。**如果后续仓库能够提供可复现评测、模型权重和不同机体的适配说明,WLA-1.0 会比单纯发布视频更有价值;如果训练数据、关键控制模块或部署工具缺失,它更可能是一套开放权重的研究模型,而非拿来就能迁移的通用机器人底座。
**开源对宇树而言也是一种生态策略。**具身智能缺乏类似文本互联网那样统一而廉价的数据源,单家公司很难覆盖家庭、工厂、仓储和商业服务中的所有任务。把基座模型开放给高校、开发者和机器人团队,可以用更多机体与场景暴露模型缺陷,也可能推动数据格式和控制接口围绕宇树方案形成事实标准。
宇树这次真正推进了什么
**UnifoLM-WLA-1.0 推进的是“全身统一策略”,而不是单项动作跑分。**过去的人形机器人演示往往把走路、跳舞和抓取分别做得漂亮,但真正有用的机器人需要把这些技能串起来:绕开障碍走到货架前,蹲下取物,重新站稳,再把物品交给人。
**这套模型当前最明确的优势是软硬件结合与真机覆盖范围。**宇树有量产机器人平台,也积累了运动控制经验,因而比只在仿真环境训练的模型更容易接触真实数据;单模型覆盖64项任务,则说明它至少已经越过单技能策略的阶段,开始处理多任务和全身协同。
**这套模型当前最明显的短板是关键数字披露不足。**模型参数量、训练数据规模、推理延迟、64项任务的逐项成功率、SOTA 对应榜单以及跨执行器实验设置均未在现有报道中完整展开。对于开发者而言,这些数字比“全球领先”的概括更能决定模型是否值得部署。
**我们的判断是,UnifoLM-WLA-1.0 是宇树具身模型路线的一次重要整合,但还不是通用人形机器人的终局答案。**它把桌面操作和全身移动放进同一个模型,是比单独刷高 LIBERO 分数更接近真实应用的一步;它能否成为社区通用底座,则取决于开源资产是否完整、第三方能否复现,以及模型离开宇树自有硬件后还能保留多少能力。
参考来源
- IT之家:宇树科技开源全新一代通用人形机器人基座模型 UnifoLM-WLA-1.0——介绍模型定位、64项真机任务、跨任务与跨末端执行器泛化,以及宇树公布的评测结论。



