HiPHI开源:617.5小时动作数据登陆HF

诺亦腾机器人近日发布 HiPHI 高精度人体运动数据集,总规模达617.5小时、约2.001亿帧,包含全身动作与人—物交互数据,并已用于宇树 G1 真机动作控制。
HiPHI 开源:617.5 小时高精度人体动作数据登陆 Hugging Face
诺亦腾机器人近日在 2026 世界机器人大会期间发布高精度人体运动数据集 HiPHI,并将数据同步上线 Hugging Face。数据集总时长达到 617.5 小时,包含约 2.001 亿帧运动数据,采集自 132 名动捕演员,目标用户覆盖人形机器人、数字人和计算机图形学研究者。
HiPHI 是一套面向人形机器人学习的高精度光学动作捕捉数据集,核心价值不只是“数据量大”,而是把人体姿态、动作语义、交互物体的位姿和三维网格放进了同一个可用于训练的物理数据框架中。基于这套数据训练的策略,已经在宇树 G1 人形机器人真机上实现跑步、坐下、爬行、搬运箱子和拖拉行李箱等动作。
这次发布发生在 8 月 19 日至 20 日前后,HiPHI 当前已可在 Hugging Face 数据集页面申请访问并获取文档、论文和数据说明。对具身智能研究来说,它更像是一块补齐了“人怎么动、物体怎么动、两者如何接触”这三个缺口的公共基础设施。

617.5 小时数据,重点不只是规模
HiPHI 是一个以 90 Hz 采集、达到亚毫米级光学动捕精度的人体运动数据集。90 Hz 意味着每秒记录 90 个动作状态,相比常见的视频级动作数据,它能够更细致地保留脚步落地、身体重心转移、膝踝联动以及手部接触物体时的瞬时变化。
从 Hugging Face 页面披露的统计看,HiPHI 共包含约 2.001 亿帧运动数据,其中 371.8 小时是全身人体运动,245.7 小时是人—物交互数据。后者占总时长约 39.8%,这也是 HiPHI 与许多传统人体动作数据集拉开差距的地方。
| 数据子集 | 时长 | 运动帧数 | 主要内容 | |---|---:|---:|---| | HiPHI 总体 | 617.5 小时 | 200.1M 帧 | 全身动作与人—物交互 | | Body-only | 371.8 小时 | 120.5M 帧 | 行走、跑步、姿态转换、平衡和全身协调 | | HOI | 245.7 小时 | 79.6M 帧 | 搬运、推动、拉取等人—物交互 |
Body-only 数据覆盖行走、跑步、跳跃、姿态转换、动态运动、平衡和全身协调等动作类型。它适合用于动作重定向、人体运动预测、动作生成、全身控制策略学习,也可以为数字人系统提供更自然的运动先验。
HOI 是 Human-Object Interaction 的缩写,指人—物交互数据。HiPHI 的 HOI 子集并非只给出“某个人正在搬箱子”的动作标签,而是同步记录人体 BVH 动作、物体六自由度运动轨迹以及物体三维网格信息。
六自由度运动轨迹是指物体在三维空间中的位置和旋转状态,通常包括三个平移维度与三个旋转维度。换句话说,数据不只告诉模型“手臂抬起来了”,还告诉模型箱子具体位于哪里、朝向如何变化,以及它在被搬运过程中怎样跟随人体运动。
为什么人—物交互数据对机器人更重要
对于人形机器人来说,只学习人体骨骼动作,往往不足以完成真实世界任务。机器人不是在空旷场地里表演动作,它需要判断物体的位置、重量、尺寸、接触关系和运动阻力。
以“拖拉行李箱”为例,人体动作本身包括向后倾斜、手臂保持牵引、髋部和腿部持续调整重心等变化;但如果训练数据没有行李箱的位姿、朝向和运动轨迹,模型就很难学到“施加多大力量、何时转向、如何避免被物体反向拉动”。缺少物体状态的数据,实际上只描述了动作的一半。
HiPHI 使用了 40 件真实物体,覆盖 12 个类别,并将人体与物体放在同一坐标系中采集。对于“拉”“推”“搬”等动作,研究者可以同时获得人体动作 BVH、物体六自由度轨迹和对应 OBJ 三维网格,这让数据更接近机器人在仿真和真机中需要处理的输入。
这类设计的价值在于,研究者不必再把人体动作和物体运动从不同数据源中拼接起来。不同数据集之间的坐标系、时间戳、物体尺度和接触阶段一旦对不上,训练出来的策略就容易在仿真中看似有效、落到真实机器人上却失效。
从“动作清单”走向可学习的运动空间
传统动作数据集经常用“走路、跑步、跳跃、坐下、转身”等动作标签组织内容,但动作名称本身并不等于机器人能力。一个模型知道数据里存在“坐下”,并不代表它知道面对不同身高、速度、地面摩擦和身体朝向时应该怎样保持平衡。
HiPHI 依据 FrameNet 的人类动作语义组织框架,将数据按照动作单元进行结构化整理。动作单元可以理解为比单一类别标签更细的语义片段,它关注动作中的角色、对象、过程和关系,例如谁在推动什么、动作从哪里开始、在什么状态下完成。
这种组织方式有助于把一段连续运动拆成可检索、可组合、可评估的训练样本。对动作生成模型而言,它可以提供更稳定的语义条件;对机器人控制而言,动作单元能够成为从高层任务指令走向低层关节控制的中间表示。
但需要明确的是,HiPHI 本身不是一个开箱即用的机器人控制模型。它首先是一套数据集,研究者仍然需要完成骨骼到机器人关节的动作重定向、仿真环境适配、动力学约束建模以及真机安全验证。
诺亦腾如何证明数据能转化为机器人动作
HiPHI 的公开价值不只在于发布了数据,也在于给出了从数据到真机的验证路径。诺亦腾团队先将人体动作重定向到人形机器人,再结合物理仿真和强化学习,让控制策略在关节限制、平衡约束和接触约束下学习复现动作。
动作重定向是把人体骨骼的运动映射到机器人关节空间的过程。人体和机器人在骨骼长度、关节数量、活动范围以及质量分布上都不同,因此不能简单复制角度数据,必须重新计算动作轨迹,避免机器人出现关节超限、脚底打滑或重心失稳。
根据诺亦腾披露的实验结果,在训练数据量相同的情况下,使用 HiPHI 随机采样的 3 小时或 20 小时验证子集训练控制策略,都能比相关方案更快学会动作,并以更高成功率完成运动跟踪。这里的关键不只是样本数量,而是每一帧数据的精度、动作覆盖度以及时空同步质量。
当训练数据从 3 小时扩大到 300 小时时,基于 HiPHI 的控制策略在四个未参与训练的外部动作数据集上的关节跟踪误差持续下降。这个结果说明,增加高质量动作数据并没有只带来训练集上的记忆,而是能够改善机器人对陌生动作的泛化能力。
当然,这些结果仍应被理解为数据集发布方披露的实验结论,后续还需要更多独立团队在不同机器人平台、不同仿真器和不同任务设置下复现。尤其是 G1 的成功部署,证明了数据具备工程转化潜力,但还不能直接等同于“任何人形机器人都能靠 HiPHI 学会这些动作”。
与现有动作数据相比,HiPHI 的优势在哪里
HiPHI 的优势主要集中在高精度、交互完整性和真机验证三个方面,而不是简单追求动作类别数量。
| 对比维度 | HiPHI | 常见人体视频或动作数据 | 对机器人学习的影响 | |---|---|---|---| | 采集方式 | 90 Hz 光学动捕 | 视频估计或低频动作记录 | 减少关键帧和关节轨迹误差 | | 精度 | 亚毫米级光学动捕精度 | 通常受遮挡、视角和估计模型影响 | 更适合高频控制与动作重定向 | | 数据内容 | 人体 BVH、物体轨迹、OBJ 网格 | 多数只包含人体姿态或视频 | 能建模物体状态与交互关系 | | 交互数据 | 245.7 小时,占 39.8% | 交互样本比例和物体信息有限 | 更接近搬运、推拉等真实任务 | | 组织方式 | 动作单元与语义索引 | 类别标签或视频片段 | 便于检索、组合和条件生成 | | 真机验证 | 已部署到宇树 G1 | 需研究者自行完成迁移 | 降低从数据到控制策略的验证门槛 |
HiPHI 的一个现实优势是标准化 BVH 文件、同步物体轨迹和语义化动作索引被一并公开。研究者不用从零开始搭建完整的数据清洗和格式转换流程,可以更快把精力放到动作先验、模仿学习、强化学习和控制策略上。
不过,HiPHI 也不是没有门槛。617.5 小时、2 亿帧数据对存储、下载、预处理和训练资源都有较高要求;高精度动捕数据通常还需要针对不同机器人形态进行重新适配。对于只想验证一个简单动作的团队,完整数据集可能过重,先使用元数据或筛选后的动作片段会更实际。
Hugging Face 已上线,但“开源”不等于无条件商用
HiPHI 已上线 Hugging Face 的 noitomrobotics/HiPHI 数据集页面,页面提供数据概览、文档、论文和访问说明。当前数据根据 ModalityNet Open Research License 向非商业科研社区免费开放,商业使用需要联系诺亦腾机器人获取授权。
这意味着 HiPHI 更准确的表述是“面向科研开放的数据集”,而不是对任何商业场景都无限制的公共领域数据。企业在将其用于商业机器人产品、商业数字人服务或闭源模型训练前,应当先核对许可证、数据使用范围和授权要求。
从使用方式看,研究者需要先在 Hugging Face 数据集页面申请访问权限,获批后再下载完整数据或查看元数据。数据体量较大,实际使用时建议先检查动作索引、子集规模和文件结构,再按任务筛选所需片段,而不是直接把全部压缩包加载进训练流程。
这次发布对具身智能意味着什么
HiPHI 的意义在于,它把“人体动作数据能否支撑机器人学习”从概念演示推进到了可公开评估的数据和真机案例阶段。
过去,具身智能领域经常面临一个数据矛盾:互联网视频数量巨大,但视频中的人体姿态、物体状态、接触关系和三维尺度并不完整;高质量实验室数据足够精确,却往往规模较小、格式不统一,或者无法被公开社区使用。HiPHI 试图在精度、规模和交互完整性之间找到一个更适合机器人学习的平衡点。
诺亦腾将其放在“World Compiler”理念下发布,背后的判断是,真实物理世界也需要像文本、图像和代码一样,被整理成机器可学习的数据。对于机器人而言,世界模型不只要理解“桌子是什么”,还要理解人如何绕过桌子、如何抓住箱子、物体被推动后如何移动,以及机器人怎样在这些约束下保持稳定。
更值得关注的是,诺亦腾表示,依托现有数据生产基础设施,公司每年可以为合作伙伴生产超过 10 万小时的高质量数据。如果这一产能能够持续转化为公开数据、行业基准或面向具体机器人的训练集,具身智能的数据瓶颈才可能从“有没有数据”转向“如何高效使用数据”。
OpenAI Hub 观点:数据质量正在成为下一轮竞争焦点
HiPHI 最值得肯定的地方,是它没有把人体动作简单包装成一串姿态序列,而是把动作发生时的物体和物理关系一起记录下来。对机器人来说,真正困难的不是模仿一个人的手臂轨迹,而是在接触、受力和重心变化中完成任务。
它的公开规模足够大,617.5 小时和 2.001 亿帧在高精度人体运动数据中具有明显吸引力;它的 HOI 数据占比达到 39.8%,也比只关注身体姿态的方案更接近真实操作场景。更重要的是,基于 HiPHI 训练的策略已经在宇树 G1 真机上完成了跑步、坐下、爬行、搬箱子和拖行李箱等动作验证。
但对研究者而言,真正需要观察的不是发布会上的动作展示,而是后续社区能否在 HiPHI 上得到稳定、可复现的结果。包括数据许可是否足够清晰、动作索引是否便于检索、不同机器人之间的重定向成本有多高,以及外部团队能否在更多任务上复现其泛化效果。
总体来看,HiPHI 不是一个替代仿真器或通用机器人基础模型的“万能数据集”,但它很可能成为当前具身智能研究中值得优先评估的一块高质量数据底座。对于正在做全身控制、动作生成、人—物交互或数字人运动建模的团队,HiPHI 的公开上线值得立即加入数据评测清单。
关键信息一览
- 数据集名称:HiPHI
- 发布方:诺亦腾机器人(Noitom Robotics)
- 上线平台:Hugging Face
- 总时长:617.5 小时
- 总帧数:约 2.001 亿帧
- 采集演员:132 名动捕演员
- 采集频率:90 Hz
- 动捕精度:亚毫米级光学动作捕捉精度
- 全身动作数据:371.8 小时、约 1.205 亿帧
- 人—物交互数据:245.7 小时、约 7960 万帧
- 交互物体:40 件真实物体、12 个类别
- 数据内容:标准化 BVH、物体六自由度轨迹、OBJ 三维网格、语义化动作索引
- 真机验证:宇树 G1 人形机器人
- 许可情况:非商业科研免费开放,商业使用需按许可要求获取授权
参考来源
- Hugging Face:noitomrobotics/HiPHI 数据集 —— 数据集页面、子集规模、文件说明与许可信息。
- IT之家:诺亦腾机器人发布 HiPHI,开源 617.5 小时高精度人体运动数据 —— 世界机器人大会发布消息及宇树 G1 真机部署情况。
- Hugging Face 官方动态 —— HiPHI 在 Hugging Face 平台公开上线的相关信息。



