小米具身基座模型正式开源

小米今日开源 Xiaomi-Robotics-1,公开从真机后训练、Benchmark 评测到模型部署的完整流程。它的核心价值不是单项跑分,而是降低跨机器人本体落地的工程门槛。
小米把具身模型从“发布”推进到了“可复现”
**小米在 2026 年 8 月 5 日正式开源具身基座模型 Xiaomi-Robotics-1,并一次性放出从真机后训练、Benchmark 评测到模型部署的完整流程。**根据小米技术官方披露,该模型使用超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据完成后训练;代码托管于 GitHub,模型相关资源已同步至 Hugging Face。
**Xiaomi-Robotics-1 是一个面向真实机器人操作任务的具身基座模型。**具身基座模型是把视觉观察、语言指令与机器人动作连接起来的通用模型:输入当前场景和任务描述,模型输出一段可供机器人执行的动作序列,让环境从当前状态逐步转向目标状态。
**这次开源比 7 月的模型发布更重要,因为具身智能真正缺的往往不是演示视频,而是完整的训练与部署链路。**小米在今年 7 月首次发布 Xiaomi-Robotics-1 时,强调的是基于 10 万小时真实世界操作数据预训练,以及结合跨本体后训练实现“开箱即用”;一个月后,官方把项目推进到开放代码、模型资源和评测工具的阶段,开发者终于可以检查它如何适配真机,而不只是观看整理过的成功案例。

10 万小时数据,解决的是动作先验问题
**超过 10 万小时 UMI 数据构成了 Xiaomi-Robotics-1 通用操作能力的主要来源。**UMI 通常指 Universal Manipulation Interface,即一种面向真实世界操作示范的数据采集方式,它试图用相对统一的设备和流程记录人类操作中的视觉变化、末端执行器轨迹与状态信息,再把这些示范转换为机器人能够学习的数据。
**UMI 数据的价值在于把数据采集从“占用机器人”变成“先记录人怎么做”。**传统机器人示范数据往往依赖遥操作:研究人员控制机械臂完成抓取、摆放、折叠或开关抽屉等动作,机器人执行一遍,系统记录一遍。这种方式数据质量较高,但机械臂、场地和操作人员会被同时占用,采集速度很难扩张。
**大规模 UMI 数据更像是在给模型建立一个现实世界的“动作常识库”。**模型需要从大量轨迹中学会杯子应该从哪个方向抓、抽屉把手受力后会如何移动、柔性物体被拉动时会怎样变形,以及连续动作之间如何衔接。它学习的不是某一台机械臂固定关节的控制脚本,而是视觉状态变化与操作意图之间更通用的对应关系。
**10 万小时只能说明数据规模,不能单独证明模型能力。**具身数据存在明显的长尾问题:10 万小时如果集中在少量场景和重复动作上,覆盖面可能不如规模更小但物体、光照、视角和任务更丰富的数据集;连续轨迹中的相邻帧也高度相关,因此“小时数”不能直接换算成独立训练样本数量。小米此次公布了量级,但模型的数据构成、任务分布、清洗规则和去重方式,仍是判断其泛化能力时需要继续检查的部分。
**预训练阶段的直接目标是学习通用动作生成能力。**按照小米此前对模型的说明,Xiaomi-Robotics-1 在获得当前视觉观察和语言描述后,需要预测一段动作序列,使场景从当前状态向目标状态变化。一次生成一段连续动作通常被称为动作块或 action chunk,它比逐时刻只预测一个控制量更有利于表达完整操作意图,也能减少高层推理频率,但真实执行仍要面对误差累积和闭环纠偏问题。
1 万小时跨本体后训练,决定模型能不能真正上机
**超过 1 万小时跨本体数据承担的是从通用动作知识到具体机器人控制能力的转换。**跨本体后训练是使用来自不同机器人形态、机械结构和控制接口的数据,对预训练模型进行适配,使同一个基础模型能够服务于多种机器人平台。
**“本体不同”远不只是机械臂外形不同。**两台机器人可能拥有不同的关节数量、臂长、夹爪结构、相机位置、控制频率和动作坐标系;即使它们都执行“拿起桌上的杯子”,底层动作表示也可能完全不兼容。一个模型在某台双臂机器人上表现良好,并不意味着换成单臂平台后仍能直接运行。
**跨本体后训练的核心作用是建立统一动作语义与具体硬件控制之间的映射。**预训练模型可以理解“抓住杯柄并将杯子放到托盘里”,后训练则要解决这台机器人应该以什么末端位姿靠近、夹爪闭合多少、动作以多高频率下发,以及摄像头视角变化后如何重新定位目标。
**小米此次强调真机后训练流程,说明项目关注点已经越过离线训练,进入机器人开发最难的最后一公里。**在具身智能项目里,让模型在数据集上预测正确动作只是第一步;把动作送进真实控制器后,通信延迟、机械回差、相机曝光、夹爪摩擦力和安全边界都会改变结果。真机后训练流程是否清晰、数据如何回流、失败轨迹如何利用,往往比模型多几个百分点的离线准确率更影响实际可用性。
官方目前披露的训练与开放信息
| 环节 | 已披露规模或资源 | 主要目标 | 对开发者的价值 | 仍需重点验证 | |---|---:|---|---|---| | 通用预训练 | 超过 10 万小时 UMI 数据 | 学习视觉、语言与动作变化之间的通用规律 | 减少从零采集单任务数据的成本 | 数据多样性、长尾任务覆盖、清洗与去重方式 | | 跨本体后训练 | 超过 1 万小时跨本体数据 | 适配不同机器人形态和控制接口 | 降低更换机械臂或夹爪后的迁移门槛 | 支持的本体范围、动作空间对齐方式、少样本适配效率 | | 真机部署 | 开放完整流程 | 将模型输出接入真实机器人控制系统 | 缩短从训练结果到机器人执行的工程路径 | 推理延迟、控制频率、显存需求和异常恢复能力 | | Benchmark 评测 | 提供评测代码 | 用统一流程复现实验结果 | 避免只依赖官方演示视频判断能力 | 任务覆盖、真机重复次数、成功率统计口径 | | 模型资源 | GitHub 与 Hugging Face 已上线 | 提供代码、模型及相关项目文件 | 便于检查、复现和二次开发 | 具体权重、依赖项与使用边界应以仓库当前版本为准 |
**这里的两个数据规模不能简单相加成 11 万小时独立数据。**官方使用的是“超过 10 万小时”和“超过 1 万小时”两种口径,但目前公开信息不足以确认两部分数据是否完全独立、是否存在复用,以及跨本体数据中各平台所占比例,因此更严谨的表述是分别记录两个训练阶段的规模。
完整流程比单独放一个权重更有用
**Xiaomi-Robotics-1 此次开源的真正亮点,是把后训练、评测和部署放进同一个项目边界。**在大语言模型领域,下载权重后通常可以立刻进行文本推理;机器人模型则必须连接摄像头、标定坐标系、适配动作空间、处理控制频率,并设置碰撞检测和急停机制。只有模型权重而没有这些环节,开发者拿到的更像是一台没有变速箱和轮胎的发动机。
**Benchmark 是用于统一测量模型任务表现的评测基准。**小米同步提供相关 Benchmark 的评测代码,至少让研究者有机会核对输入预处理、动作输出、任务初始化和成功判定规则,减少不同团队各自选择统计口径带来的结果偏差。
**评测代码的开放并不等于模型已经通过充分的现实验证。**机器人任务具有较强随机性,同一个抓取任务可能因为物体初始位置相差几厘米而从成功变成失败;单次成功的视频几乎没有统计意义。更可信的结果应报告每项任务的重复执行次数、平均成功率、置信区间、失败类型,以及在未见物体、未见场景和未见语言指令上的泛化表现。
**部署流程的开放会直接决定 Xiaomi-Robotics-1 能否进入第三方实验室。**开发者真正关心的指标包括模型参数规模、推理所需显存、单次动作块生成延迟、可持续运行的控制频率、支持的相机数量,以及在消费级显卡或边缘计算设备上的量化能力。现阶段的发布信息尚未给出一组足以覆盖这些问题的统一数字,实际门槛需要结合官方仓库中的配置和后续社区复现判断。
它和传统单机器人策略的差别是什么
**Xiaomi-Robotics-1 试图把机器人开发从“每项任务重新训练”推进到“基座模型加本体适配”。**传统策略通常围绕一台固定机器人、一个固定场景和少数任务采集数据,环境稍有变化就可能需要重新标注或训练;具身基座模型则先用大规模数据获得通用动作先验,再通过后训练适配特定机器人和任务。
| 对比维度 | 传统单机器人策略 | Xiaomi-Robotics-1 的目标范式 | |---|---|---| | 数据范围 | 单一本体、有限任务和固定场景 | 10 万小时级 UMI 预训练,加 1 万小时级跨本体后训练 | | 能力形成方式 | 围绕具体任务从头学习 | 先学习通用动作能力,再进行本体适配 | | 更换硬件后的成本 | 通常需要重新采集大量示范 | 通过跨本体后训练复用基础能力 | | 交付形态 | 单项策略或实验代码 | 后训练、Benchmark 与部署流程一并开放 | | 主要风险 | 泛化范围窄 | 基座能力能否稳定迁移到陌生本体和真实环境 |
**这套范式的上限很高,但“开箱即用”仍应理解为工程目标,而不是无条件承诺。**机器人没有真正统一的硬件接口,不同平台的标定、控制器和安全约束差异很大;开发者即使使用同一模型,也大概率需要准备本体数据、调整动作表示,并针对工作空间设置安全限制。它更接近“提供一套可迁移的通用底座”,而不是下载后无需调试就能控制任何机器人。
小米为什么要在这个时间点开源
**小米开源具身基座模型,与其“人车家全生态”的硬件布局存在直接协同空间。**具身模型需要真实传感器、计算设备和大量可交互场景,而小米长期覆盖手机、智能家居、可穿戴设备和汽车,这些业务积累的硬件工程能力、供应链经验与端侧计算能力,都可能转化为机器人产品化的基础设施。
**开源也能帮助小米快速扩大模型支持的机器人本体范围。**仅靠一家公司内部采集数据,很难覆盖所有机械臂、夹爪、移动底盘和双臂平台;将后训练与部署流程交给高校、实验室和机器人企业使用,能够促使外部团队提交适配方案、暴露兼容问题,并形成更多真实环境下的复现结果。
**具身智能现阶段最稀缺的资产仍然是高质量真实数据和稳定部署经验。**算法架构可以被论文和代码快速复制,但物体滑落、遮挡、机械磨损和控制延迟等问题只能在长期真机运行中暴露。小米披露的 10 万小时级预训练规模很有吸引力,但项目最终能否形成行业影响力,要看这些数据训练出的能力是否能被第三方机器人稳定继承。
开发者现在应该关注什么
**开发者评估 Xiaomi-Robotics-1 时,首先应该检查开放边界,而不是只看“开源”两个字。**开源在这里是把项目资源按照官方仓库当前状态公开,但代码、模型权重、训练数据和商业使用许可是四个不同层面;哪些内容可以下载、哪些数据只用于训练披露、是否允许特定用途,应以 GitHub 仓库中的最新说明和许可证文件为准。
**第二个重点是检查模型对目标机器人动作空间的兼容程度。**如果目标平台的自由度、夹爪形式、相机布局或控制频率与官方配置差异较大,跨本体适配仍会成为主要工作量。模型理解任务,并不代表它天然知道某一台机械臂的运动学限制。
**第三个重点是用失败率而不是最好案例衡量模型。**真实部署应重点记录碰撞、抓空、物体滑落、动作超时、目标遮挡和指令误解等失败类型,并测试系统能否在中途状态偏离后重新规划。能够完成任务是一项能力,能够识别自己做错并恢复则是更接近产品的能力。
**第四个重点是核对推理成本与控制延迟。**具身模型输出动作的速度必须和机器人控制周期匹配,过高延迟会让视觉观察在动作执行前就已经过时;即使离线成功率较高,如果每次推理都需要大型服务器,也很难进入移动机器人或家庭环境。小米后续如果公布不同硬件上的显存占用、动作生成延迟和量化结果,将明显提升项目的工程参考价值。
判断:这是一份更接近“机器人开发套件”的开源模型
**Xiaomi-Robotics-1 当前最值得肯定的地方,不是宣称用了多少小时数据,而是开放范围覆盖了真机后训练到部署。**具身模型已经不缺概念验证,行业真正需要的是第三方能够下载、适配、测量和复现的完整系统;从这个标准看,小米此次开源比单独发布权重更有实际价值。
**Xiaomi-Robotics-1 当前最大的未知,也不是模型能否完成演示任务,而是跨本体泛化能否经受外部检验。**超过 1 万小时跨本体数据是一个积极信号,但支持多少类机器人、迁移时需要多少新增数据、陌生场景成功率如何、部署成本多高,仍需官方补充量化结果和社区复现。
**小米已经把进入具身模型赛道的门票摆到了桌面上,接下来要看的是真机运行账本。**如果外部团队能够用有限数据将模型迁移到不同机械臂,并在重复测试中获得稳定成功率,Xiaomi-Robotics-1 才可能从一次大厂开源事件,变成国内具身智能开发栈中的长期基础设施。
参考来源
- 小米具身基座模型 Xiaomi-Robotics-1 正式开源|IT之家:报道小米于 2026 年 8 月 5 日宣布开源,并披露预训练、后训练数据规模及开放范围。
- Xiaomi-Robotics-1 官方 GitHub 仓库:用于查看项目代码、部署说明、评测工具、更新记录及许可证信息。
- Xiaomi Robotics 官方 Hugging Face 合集:用于查看 Xiaomi-Robotics-1 相关模型资源与配置文件。



