宇树 UnifoLM-X2 让人形机器人自主格斗

宇树科技今日宣布,UnifoLM-X2-1.0 首次让世界模型实时驱动全自主 humanoid 格斗。机器人不再依赖预设动作或人工遥控,而是基于对未来状态的预测,完成高动态决策与交互执行。
宇树 UnifoLM-X2 让人形机器人自主格斗
宇树科技今天宣布,UnifoLM-X2-1.0 已实现世界模型实时驱动的全自主 humanoid 格斗,并公开了相关实拍画面。按照官方说法,这是全球首次将世界-动作大模型用于人形机器人高动态、强交互的实时搏击场景。
这件事的价值不在于机器人“会打拳”本身,而在于控制方式发生了变化:过去的人形机器人格斗更像排练好的武术节目,动作顺序、脚步节奏和攻击轨迹大多提前规划;这一次,宇树试图让机器人先在模型内部预测“下一秒可能发生什么”,再根据对手和自身状态即时选择动作,并把决策直接转化为全身运动。
**世界模型是能够在内部预测环境未来状态,并据此规划动作的模型。**它不只是识别摄像头画面中的物体,也不只是把一句指令翻译成固定动作,而是要回答一个更难的问题:如果机器人现在抬腿、挥拳、后撤或改变重心,接下来身体、对手和周围环境会怎样变化?

从“动作表演”到“实时闭环控制”
**UnifoLM-X2-1.0 的核心变化,是把未来预测、动作规划和动态执行放进同一个实时闭环。**机器人观察当前场景后,不是一次性生成一段固定动作,而是持续执行“感知—预测—决策—行动—再感知”的循环。
可以把它类比成人类拳击手。拳击手不会在比赛开始前写好一份“先出左拳、再踢右腿、最后后撤”的脚本,而是根据对手的肩膀、重心和距离变化,持续判断对方下一步可能做什么,同时调整自己的站姿和攻击路线。对于机器人来说,这个过程还要额外处理关节极限、地面摩擦、身体惯性、碰撞风险和执行延迟。
宇树称,UnifoLM-X2-1.0 重点突破了三类问题:
- 瞬时规划:在极短时间内预测未来状态,并决定下一步行动,而不是依赖长时间离线计算。
- 动态决策:面对移动中的对手和不断变化的接触关系,实时选择攻击、防守、闪避或调整重心等动作。
- 交互执行:将高层决策转化为人形机器人的全身协调控制,让双腿、躯干、双臂和头部共同参与运动。
这三点缺一不可。只有预测,没有快速动作执行,机器人会“想得明白但来不及动”;只有动作生成,没有对未来的推演,机器人仍然只是把训练过的招式按顺序打出来;只有局部关节控制,没有全身协调,任何一次失衡都可能让动作链条中断。
与 2025 年擂台展示相比,差别到底在哪里
宇树的人形机器人并不是第一次公开“格斗”。2025 年 11 月 5 日,第八届中国国际进口博览会首日,两台宇树人形机器人曾在展台进行擂台格斗表演,引发现场关注。那次展示证明了机器人具备较强的动态运动能力,但公开信息并没有表明其已经摆脱预设动作编排或人工控制。
**预设动作表演的重点是把动作做出来,而世界模型闭环控制的重点是根据现场变化重新决定做什么。**两者在视频观感上可能相似,但技术难度完全不同。
| 对比维度 | 传统预设动作展示 | 人工遥操作 | UnifoLM-X2-1.0 全自主格斗 | |---|---|---|---| | 动作来源 | 提前编排的动作序列 | 人类操作者实时输入 | 模型根据现场状态自主生成 | | 对手变化 | 通常需要配合动作节奏 | 操作者负责判断 | 世界模型预测对手与自身未来状态 | | 控制方式 | 以脚本执行为主 | 人在回路中 | 感知、规划、行动持续闭环 | | 主要难点 | 稳定完成指定动作 | 降低操作延迟和负担 | 同时处理预测、决策与高动态执行 | | 泛化能力 | 受限于预设场景 | 依赖操作者经验 | 官方目标是适应更复杂交互场景 | | 目前公开信息 | 已有多次展示 | 行业常见方案 | 宇树于 2026 年 9 月 7 日宣布实机验证 |
需要强调的是,宇树此次公开的是“实现全自主格斗”的技术声明和实拍画面,目前尚未披露完整的模型参数规模、端到端控制频率、预测时域、推理硬件、对抗成功率、跌倒率,也没有公布标准化第三方测试结果。因此,现阶段更准确的判断是:它完成了一次具有代表性的工程验证,而不是已经证明世界模型在所有人形机器人任务上都具备成熟的通用能力。
世界模型为什么适合高动态动作
**高动态机器人控制的难点,是动作结果具有延迟、惯性和连锁反应。**机器人挥出一拳时,真正需要规划的不只是手的位置,还包括脚底是否稳定、躯干是否旋转过度、另一只手能否保护头部,以及下一次落脚时是否仍有足够的支撑面积。
传统控制器通常擅长处理边界清晰、结构稳定的任务。例如机械臂沿固定轨迹移动,或机器人在规则地面上按照预定步态行走。这类系统的优势是可解释、可验证、响应快,但面对未知对手、突然接触和连续失衡时,规则数量会迅速膨胀。
世界模型提供了另一种思路:不必为所有可能情况手写规则,而是让模型通过数据学习物理交互中的规律,在潜在空间中预测未来。这里的“预测”不一定意味着逐像素生成一段高清未来视频,更重要的是预测与控制有关的状态,例如身体姿态、接触关系、速度变化、重心移动和动作后果。
此前公开的 UnifoLM-WMA-0 已经展示了“世界模型 + 动作策略”的技术路线。相关解析称,该模型同时支持决策模式与仿真模式:在决策模式下,根据当前视觉观测预测未来交互信息并辅助生成动作;在仿真模式下,根据给定动作生成环境反馈,用于评估动作可能带来的结果。
**UnifoLM-X2-1.0 的新意,在于把这种“想象未来”的能力推进到了人形机器人对抗运动这一更难的场景。**抓取、搬运和整理任务往往允许机器人慢慢修正,而格斗中的有效反应窗口可能只有几十到几百毫秒;机器人既要及时避让,又要保持平衡,还要持续估计对手动作和自身动作的后果。
“闭环”比“能生成动作”更重要
在具身智能领域,动作模型常被误解为“输入一张图片,输出一个动作”。但真正可用的机器人系统必须解决闭环问题:机器人采取动作后,环境会改变,原来的判断可能立即失效,因此模型必须重新观察和规划。
**闭环控制是指机器人根据行动后的新观测持续修正下一步动作,而不是执行一次性生成的完整脚本。**对于格斗这样的动态任务,闭环能力至少包括四个层面:
- 视觉闭环:持续识别对手的姿态、距离和运动趋势,而不是只看开场画面。
- 本体状态闭环:实时读取关节角度、速度、加速度、足底接触和身体倾角,判断机器人是否正在失衡。
- 动作结果闭环:判断挥拳、格挡、侧移或踢腿是否达到预期,并根据结果调整后续动作。
- 安全约束闭环:在动作可能导致跌倒、关节过载或危险碰撞时,降低动作幅度、改变方向或主动停止。
如果 UnifoLM-X2-1.0 确实能够在上述层面持续工作,那么它的意义就超出了“机器人打得像不像”。它验证的是世界模型能否介入人形机器人的低延迟运动决策,并在真实硬件中处理连续的物理反馈。
这不是让大模型直接接管每个电机
需要区分“世界模型负责规划”和“世界模型直接控制电机”。后者在工程上通常并不现实,也不安全。人形机器人每个关节都需要高频、稳定、带约束的底层控制;语言或视觉模型更适合处理场景理解、动作选择和较长时间尺度的规划。
更合理的系统分层是:世界-动作模型负责判断下一段动作目标,例如向左闪避、改变支撑脚、抬臂格挡或向前压迫;运动控制器再把这些目标转换成关节轨迹、力矩和足端控制;传感器反馈则持续检查动作是否偏离预期。
**世界模型真正改变的不是电机控制器的存在,而是上层决策从“执行脚本”变成“预测后果再行动”。**这也解释了为什么高动态场景对模型和硬件提出了同时要求:模型必须足够快,机器人必须足够灵活,底层控制必须足够稳定,数据还必须覆盖大量真实接触和失衡情况。
宇树的技术路线正在形成连续链条
从公开资料看,宇树此前已经围绕 UnifoLM 建立了从世界模型、视觉语言动作模型到真机数据的连续技术路线。
- UnifoLM-WMA-0:强调世界模型与动作策略结合,支持未来状态预测和动作决策,并可用于机器人交互仿真。
- UnifoLM-VLA-0:基于视觉语言模型能力,让机器人理解自然语言指令并完成多类操作任务。
- UnifoLM-WBT 数据集:公开 G1 人形机器人全身遥操作真机数据,资料显示数据规模超过 340 小时,包含 189 万条动作轨迹,并覆盖视觉、本体状态与动作信息。
- UnifoLM-X2-1.0:将世界-动作模型推进到全自主、高动态、强交互的人形机器人格斗场景。
这条路线的关键不只是发布一个新模型,而是尝试打通“数据采集—模型训练—世界模拟—动作规划—真机验证”的循环。对具身智能来说,模型能力最终要靠真实机器人反馈检验;而真实机器人数据昂贵、危险、采集速度有限,世界模型如果能够提供可信的动作后果预测,就有机会减少部分试错成本。
不过,仿真数据能否替代真实接触数据,仍然取决于模型对摩擦、柔性物体、碰撞、延迟和硬件误差的刻画能力。格斗展示能验证动态交互,但距离家庭、工厂和公共空间中的通用操作,还有很长距离。
与 JEPA、VLA 和传统强化学习的关系
**世界模型并不是某一个厂商独有的产品类别,而是一条让智能体学习环境动态规律的研究路线。**Meta 首席 AI 科学家 Yann LeCun 推动的 JEPA 系列强调在抽象表征空间中预测未来,而不是单纯重建每一个像素;V-JEPA 2 等工作则进一步探索视觉世界模型在机器人规划中的应用。
强化学习中的 Dreamer 系列同样会学习隐空间动态,并利用想象中的未来进行策略优化,但它更多服务于模拟环境和策略训练。Google 的 RT-2 则代表视觉语言模型直接生成机器人动作的路线,优势是能够利用大模型的语义理解能力,但并不天然包含一个显式的环境仿真模块。
宇树 UnifoLM 路线更偏向真实机器人:让世界预测与动作策略结合,并通过真实人形机器人验证高动态交互。它的优势是离工程落地更近,弱点则是对真机数据、实时算力和安全控制的要求更高。
| 技术路线 | 主要能力 | 优势 | 局限 | |---|---|---|---| | JEPA 类世界模型 | 在抽象空间预测未来表征 | 计算效率和表征学习潜力较好 | 需要进一步连接真实动作控制 | | Dreamer 类模型 | 在隐空间中想象并优化策略 | 适合强化学习和仿真训练 | 从模拟到真实硬件存在迁移难题 | | 视觉语言动作模型 | 根据视觉和语言生成动作 | 语义理解与任务泛化能力强 | 对连续物理后果的显式建模有限 | | UnifoLM 世界-动作路线 | 预测未来交互并生成动作 | 面向真实机器人闭环控制 | 实时性、数据规模和安全性仍待量化 |
最大看点:能否从格斗走向日常任务
格斗是一个非常适合展示模型闭环能力的场景,因为动作快、交互强、结果直观。但它也可能是一个相对受限的场景:参与者数量少,目标主要集中在保持平衡、攻击和防守,环境中的物体种类与任务目标并不复杂。
真正检验 UnifoLM-X2-1.0 的下一步,是它能否把高动态闭环能力迁移到更广泛的任务中。例如,机器人在物流场景中避让移动人员、在家庭环境中处理突然掉落的物品、在工业装配中根据接触力修正插入角度,或者在狭窄空间中一边移动一边完成双手操作。
**如果世界模型只能在特定格斗动作中工作,它更像一次成功的专项演示;如果它能迁移到不同机器人、不同任务和不同环境,才称得上通用具身模型的基础。**目前宇树公布的信息尚不足以回答后一个问题。
还有一个必须正视的现实:人形机器人格斗存在明显安全风险。公开演示通常需要经过场地隔离、动作约束和人工安全保障,机器人在真实环境中不可能以同样方式自由施加冲击力。未来如果世界模型进入家庭和工厂,系统需要提供动作边界、碰撞检测、失衡保护、紧急制动以及可追溯的决策记录。
OpenAI Hub 观察
宇树这次发布最值得关注的,不是又一段“会打拳”的机器人视频,而是世界模型开始从论文和实验室仿真,进入人形机器人高动态控制的实机闭环。这是具身智能从“看懂世界”走向“预测世界并立即行动”的一个清晰信号。
但行业也不应只用视频判断模型水平。接下来最关键的公开指标包括:模型端到端延迟、控制频率、预测时域、不同对手和不同动作下的成功率、跌倒率、恢复能力、训练数据规模,以及是否能在未见过的机器人平台和任务上泛化。
截至 2026 年 9 月 7 日,UnifoLM-X2-1.0 更适合被看作一次重要的工程里程碑,而不是人形机器人已经解决了通用运动智能。它证明了一个方向具备现实可行性:世界模型不再只是生成未来画面,而是可以参与真实机器人对未来状态的判断,并把判断转化为高动态动作。
如果这条路线继续沿着真机数据、仿真预测和全身控制推进,机器人竞争的重点将逐渐从“谁的硬件动作更快”转向“谁能更准确地预测动作后果”。对人形机器人来说,这可能比单纯增加参数规模更重要。



