宇树OminiA-0.3全模态再进化

宇树科技7月20日发布UnifoLM-OminiA-0.3,推动G1以单模型完成家居康养多任务。演示显示其已打通语言、视觉与动作闭环,但基准成绩、技术架构及开放方式仍未公布。
宇树把同一个模型塞进了多种家务任务
宇树科技今天(2026年7月20日)发布具身智能模型UnifoLM-OminiA-0.3,并在G1人形机器人上展示了家居与康养场景中的连续任务执行能力。根据宇树公布的演示,OminiA-0.3可以理解口头指令、识别物体颜色和数量、操作药盒与衣物、控制病床,并在执行过程中响应用户发出的停止命令。
UnifoLM-OminiA-0.3是宇树面向人形机器人推出的全模态交互具身智能模型,目标是让一个模型统筹环境感知、语言理解、任务规划和机器人动作。这里最值得关注的并不是G1又学会了几项家务,而是宇树强调这些任务由单模型统筹,并且能够在现实环境中自主完成。
具身智能是让AI通过机器人身体感知物理世界、作出决策并执行动作的技术路线。它与纯文本大模型的根本区别在于,回答错一个问题通常只是生成错误,而机器人拿错药盒、碰倒物品或没有及时停止,可能直接变成安全事故。

演示覆盖了哪些能力
OminiA-0.3此次展示的任务跨度明显超过单一抓取或固定流程复现。根据宇树演示以及IT之家对发布信息的整理,G1完成了以下几类操作:
- 物品搬运: 将地上的抱枕捡起并放到沙发上。
- 视觉问答: 回答抱枕的颜色,并识别药盒的数量与颜色。
- 空间指代: 理解“第三层蓝色药盒”等包含位置、顺序和属性的复合描述。
- 精细操作: 拿取指定药盒,将衣服放入脏衣篓,把盘子放进洗碗机。
- 设备控制: 调节病床高度,并在用户说“停”时立即终止运动。
- 连续任务: 在同一套家居康养环境中处理多种目标,而非只运行一个孤立动作。
全模态交互理解是模型联合处理语言、视觉、机器人状态和动作信息,并将这些信息映射为现实操作的能力。从公开演示能够确认的部分看,OminiA-0.3至少处理了语音或语言指令、视觉场景与机器人动作;至于触觉、力觉、深度信息是否作为统一模型的原生输入,以及各模态如何融合,宇树截至发稿尚未披露完整技术细节。
这组任务的难点不在于任何一个动作本身,而在于机器人必须连续解决“听懂—看见—定位—规划—执行—反馈”六个环节。比如“把第三层蓝色药盒拿到上面来”看似是一句简单指令,模型实际上要区分货架层级、识别多个药盒的颜色、解析“第三层”和“上面”的空间关系,再生成手臂与夹持动作。
| 演示任务 | 机器人需要的核心能力 | 现实中的主要风险 | |---|---|---| | 抱枕放到沙发 | 目标检测、可抓取区域判断、路径规划 | 抓空、遮挡误判、搬运中掉落 | | 识别药盒颜色和数量 | 视觉识别、计数、语言回答 | 重叠物体漏数、颜色受光照影响 | | 拿取第三层蓝色药盒 | 空间指代、属性绑定、精细抓取 | 拿错层、拿错药盒、碰倒相邻物体 | | 衣物放入脏衣篓 | 柔性物体识别、双臂或单臂操作 | 衣物形变、抓取点不稳定 | | 盘子放入洗碗机 | 易碎品操作、狭窄空间规划 | 碰撞、滑落、摆放位置错误 | | 调节病床并响应“停” | 设备交互、实时指令打断、安全控制 | 停止延迟、误触发、机械夹伤 |
“单模型统筹”比会做家务更重要
单模型统筹是由同一个核心模型处理多个任务和交互阶段,而不是为每项工作分别编写一套固定程序。传统机器人系统往往像一条由多个软件模块拼接起来的流水线:语音识别负责转文字,视觉模型负责找物体,规则引擎拆解任务,运动控制器再执行轨迹。
模块化方案的优势是可控、容易排查错误,但短板也很直接。只要上游把“第三层”识别成“第二层”,后续模块即使全部正确,机器人仍然会精准地拿错东西;每增加一种物体、家具或说法,工程团队还可能需要补充规则和重新适配。
OminiA-0.3试图解决的是任务之间的统一泛化问题。机器人不应只记住“把白色抱枕放到沙发”的动作模板,而应理解“某个物品应该被移动到某个位置”这一抽象意图,再根据现场物体、距离和障碍生成动作。
| 技术路线 | 决策方式 | 优点 | 典型短板 | |---|---|---|---| | 固定脚本与状态机 | 按预设条件切换动作 | 稳定、可解释、方便安全审查 | 场景稍变就可能失效,任务扩展成本高 | | 多模型串联系统 | 语音、视觉、规划和控制分别处理 | 模块可替换,工程边界清晰 | 误差逐级传递,端到端延迟较高 | | 单模型统筹 | 一个核心模型联合理解多模态信息并调度动作 | 更适合自然指令和跨任务泛化 | 数据需求大,错误原因更难定位 | | 端到端具身模型 | 从传感输入直接生成动作 | 链路短,可能学到复杂操作策略 | 安全验证、可解释性和长任务稳定性困难 |
单模型并不等于机器人内部只有一个神经网络。实际产品仍然需要关节控制、碰撞检测、急停机制和底层运动控制器,OminiA-0.3更可能承担高层理解与策略生成,再由G1的控制系统把目标转成稳定动作。
这种分层结构对人形机器人尤其重要。大模型适合判断“该做什么”,高频控制器则负责解决“每个关节下一毫秒怎么动”;如果让生成式模型直接承担所有实时安全控制,推理延迟和概率性输出都可能成为风险。
“停”得下来,是康养场景的关键指标
实时打断能力是机器人在动作执行过程中识别新指令,并覆盖或终止原有计划的能力。宇树特意展示用户在病床升降时说“停”,机器人随即停止,这个片段的实际价值可能比识别三盒药更高。
家居康养不是一个允许机器人完整演完预设动作的封闭舞台。老人可能突然改变主意,护理人员可能临时介入,儿童和宠物也可能进入运动范围;机器人必须持续感知环境,而不是在收到命令后进入无法干预的执行状态。
抗干扰能力同样不能只靠演示中的成功案例判断。真正的测试应包括背景噪声、多人同时说话、目标被遮挡、家具位置变化、用户说法不完整,以及机器人抓取过程中物体突然移动等情况。
宇树此次使用“全程自主、稳定执行抗干扰”的表述,说明团队已经把重点从单次动作成功转向长链路任务稳定性。问题是,官方目前没有公布任务成功率、连续运行时长、指令打断延迟、干扰测试设置和失败案例,因此外界暂时无法量化“稳定”到底处于什么水平。
从能走能跳,转向真正做事
OminiA-0.3标志着宇树正在补齐G1的软件大脑,而不再只强调本体的运动性能。宇树过去最鲜明的技术标签是四足机器人和人形机器人的动态控制,包括行走、奔跑、抗冲击与复杂动作;这些能力解决了机器人“身体是否好用”的问题,但商业落地还需要回答“机器人能否理解任务”。
感知—行动闭环是机器人根据传感器输入作出动作,并用动作产生的新环境信息继续修正决策的循环。一个完整闭环不是模型识别出桌上有盘子就结束,而是机器人靠近盘子、调整手部姿态、抓取、观察是否拿稳,再根据洗碗机的位置继续移动和放置。
G1给OminiA-0.3提供了现实检验场。仿真环境中的机械臂通常拥有固定底座、明确坐标和相对稳定的视角,而人形机器人移动后会引入机身晃动、视角变化、双臂协调和全身平衡等额外变量;模型在G1上完成任务,含金量高于只在桌面机械臂上展示单点抓取。
宇树同时掌握本体与模型研发,是这次发布最值得重视的竞争优势。具身模型的训练效果高度依赖机器人采集的数据,而本体厂商可以直接获得关节状态、相机画面、动作轨迹、失败记录和人工接管数据,再用这些数据迭代模型。
这种软硬件闭环也有明显成本。不同批次执行器、传感器误差和机械磨损都会改变动作分布,实验室中的成功率不一定能够原样复制到大量交付设备上;模型更新后是否影响旧任务,也需要类似自动驾驶回归测试的验证体系。
现在还不能把演示等同于通用能力
OminiA-0.3目前更像一次产品能力预告,而不是一份可以完整复现的模型发布。截至2026年7月20日发稿,宇树没有同步披露参数规模、训练数据量、上下文长度、视觉编码器、动作表示方式、推理算力需求和端侧运行配置。
官方也没有公布模型权重、技术报告、标准化基准成绩或商业授权方式。开发者暂时无法判断OminiA-0.3是否会开放下载、是否只随G1系统提供,以及它能否迁移到其他机器人本体。
以下信息将决定OminiA-0.3究竟是演示领先,还是具备可部署价值:
- 任务成功率: 同一任务至少重复数十次后的平均成功率,而非剪辑后的最佳样本。
- 长程稳定性: 连续执行五个或十个步骤时,错误是否会随任务长度快速累积。
- 打断延迟: 用户说出“停”到机器人实际停止运动之间需要多少毫秒。
- 陌生环境泛化: 更换房间、光照、物品外观和摆放位置后是否仍能完成任务。
- 人工接管率: 演示过程中有多少动作需要遥操作、预设轨迹或人工复位。
- 算力与功耗: 模型是在机器人本地运行、依赖边缘服务器,还是需要远端计算资源。
- 安全边界: 视觉失效、通信中断或模型输出异常时,底层控制器如何兜底。
模型版本号中的0.3也释放了一个信号:这套系统仍处于快速迭代阶段。版本号本身不能代表成熟度,但从命名看,宇树显然还没有把它包装成最终形态;对开发者而言,这意味着能力可能快速增加,接口和部署方式也可能继续变化。
我们怎么看:方向对了,证据还不够
OminiA-0.3是宇树从运动控制强项走向通用任务智能的一次关键升级。它展示的药盒识别、衣物收纳、洗碗机放置和病床控制并非科幻级任务,但正是这些琐碎、连续、充满变化的工作,决定了人形机器人能不能离开展台。
此次发布最有价值的部分是跨任务统一和执行中打断,而不是视觉问答本身。识别颜色和数量,成熟视觉模型早已可以完成;真正困难的是让识别结果可靠地约束机械动作,并在用户改变指令时及时停下。
此次发布最大的不足是缺少可核验数据。没有成功率、延迟、测试集和失败样本,外界看到的仍然是能力上限,而不是普通用户每天能够获得的稳定下限。
宇树下一步需要把“会做”转化为“可验证地反复做”。如果后续技术报告能够证明OminiA-0.3在陌生家庭环境、多轮口头指令和长程任务中的稳定性,并给出清晰的开发与部署方式,它会成为G1从高机动机器人走向通用工作平台的重要拼图。
现阶段更准确的结论是:OminiA-0.3已经让G1表现出更完整的感知—决策—行动闭环,但距离可规模化进入家庭和康养机构,还隔着可靠性、安全认证、部署成本与长期运维四道门槛。演示值得重视,却还不是终局。
参考来源
- IT之家:宇树发布UnifoLM-OminiA-0.3模型,支持全模态交互理解:整理了宇树7月20日发布信息及演示任务细节。
- Unitree Robotics GitHub组织页:宇树机器人相关开源项目与软件仓库的公开入口,可用于跟踪后续代码和技术资料更新。



