具身数据底座,开始按件卖了

首发价5100元的具身数据底座把机器人数据采集从定制项目变成标准化产品。真正的变化不只是降价,而是具身智能的数据生产正在形成可复制的基础设施。
具身数据第一次有了明确的商品形态
机器人训练数据正在从按项目交付的服务,变成可以买到、部署并重复使用的标准化产品。
据量子位近日报道,一款面向具身智能开发的“具身数据底座”已经正式开卖,首发价格为 5100 元。这不是又一个数据标注平台,也不是把公开视频打包成数据集出售,而是试图把数据采集所需的硬件、传感器、操作接口和处理流程封装成一套可直接使用的基础设施。
**具身数据底座是一套用于采集、同步、整理机器人与真实环境交互数据的标准化软硬件系统。**它记录的不只是摄像头画面,还包括动作轨迹、末端位姿、关节状态、操作指令以及任务结果等信息,让开发者可以用这些数据训练视觉—语言—动作模型,也就是 VLA 模型。
5100 元这个价格本身值得关注,因为它把过去通常需要实验室自行搭建、企业按需求定制的系统,压到了高校课题组、创业团队甚至个人开发者可以决策采购的区间。对具身智能行业而言,这类似于深度学习早期 GPU 工作站开始普及:它不会直接解决模型能力问题,却可能让更多人获得生产训练数据的资格。

机器人缺的不是视频,而是动作与结果
**具身智能数据是描述智能体如何感知环境、采取动作并获得物理反馈的多模态时序数据。**一条可用于训练的轨迹,通常需要同时回答三个问题:机器人看到了什么、它采取了什么动作,以及这个动作是否成功。
这正是具身数据与互联网数据的根本区别。语言模型可以从网页、图书和代码仓库中获得大量现成文本,视觉模型也可以利用图片和视频训练;但公开视频只能告诉模型“人是怎么叠衣服的”,无法精确告诉机器人机械臂在每一帧应该移动多少、夹爪何时闭合、用了多大力度,以及衣服滑落后应当如何恢复。
财联社今年6月援引产业人士的说法称,DeepSeek-V4-Pro 预训练使用的数据量约为 33 万亿 Token,而 Open X-Embodiment 这一代表性的真实机器人数据集合,规模仍然只有百万级轨迹。两者不能直接按单位换算,但数量级差异足以说明问题:互联网已经积累了数十年的文本与图像,机器人可用的真实交互数据却仍处在早期开荒阶段。
**Open X-Embodiment 是由多家机构联合建设的跨机器人、跨任务数据集合。**它的重要意义不是单纯追求轨迹数量,而是尝试让不同机器人产生的数据进入同一种训练框架。机器人之间存在自由度、坐标系、控制频率、传感器和末端执行器差异,因此同样一个“抓杯子”动作,在两台机器人上的数据结构可能完全不同。
语言模型的数据扩张主要受存储、版权和清洗成本约束,机器人数据扩张则额外受到物理时间限制。人类操作员演示一次持续30秒的任务,至少要占用30秒真实时间;如果动作失败,设备复位、物体重新摆放和数据检查还会继续消耗人力。机械臂、相机和场景也不能像云服务器实例那样瞬间复制,这让真机数据天然昂贵。
5100元卖的不是一份静态数据
**这类数据底座的核心商品不是已经录好的数据,而是持续生产数据的能力。**静态数据集买回来只能覆盖既定场景,数据采集底座则允许开发者围绕自己的本体、任务和环境反复生成新轨迹。
这一区别决定了它更接近“生产设备”,而不是“内容光盘”。一家做仓储机器人的公司需要货架、纸箱和周转筐数据;一家做家庭服务机器人的公司需要杯子、衣物和抽屉数据。即使两家公司都训练抓取模型,它们需要覆盖的物体材质、遮挡关系、操作空间和失败模式也不一样。
首发价5100元首先改变的是试错门槛。过去,一支团队要自行采购相机、设计安装结构、标定坐标系、编写时间同步程序,再解决轨迹格式和数据清洗问题。任何一个环节发生漂移,采集几个小时后都可能只得到一批无法对齐的图像与动作记录。标准化底座的价值,就是把这些重复工程提前做掉。
但5100元不等于获得了低成本的“无限数据”。硬件只是数据生产链的入口,后续仍然需要场景搭建、操作人员、机器人本体、质量检查、存储和模型验证。对需要数万小时数据的企业来说,人力和设备利用率依然会成为主要成本,采购价只是总成本的一小部分。
| 数据获取方式 | 前期门槛 | 真实性 | 可扩展性 | 跨本体难度 | 更适合的阶段 | |---|---:|---|---|---|---| | 自建真机采集系统 | 高,需要自行集成硬件和软件 | 高 | 中,受设备与人力限制 | 高 | 有完整机器人团队的企业 | | 定制数据采集服务 | 通常按项目报价 | 高 | 中,扩容依赖供应商 | 中 | 任务明确、缺少数采团队的企业 | | 标准化具身数据底座 | 首发价5100元 | 高 | 较高,可复制部署 | 取决于数据格式与适配层 | 高校、创业团队和快速验证项目 | | 仿真合成数据 | 中,需要场景和资产 | 中,存在仿真到现实差距 | 高 | 中 | 预训练、长尾场景与策略验证 | | 公开视频或人类动作数据 | 低 | 环境真实但缺少机器人状态 | 高 | 高 | 表征学习和先验能力训练 |
标准化比低价更重要
**具身数据标准化是把不同设备产生的感知、动作和任务信息转换为统一语义与结构的过程。**价格可以让产品更容易卖出去,标准才能决定数据能否真正积累下来。
一套采集设备如果只能服务一种机械臂、一个相机型号或一套内部算法,它仍然只是更便宜的定制工具。真正的数据底座至少要处理时间同步、坐标系统一、设备标定、任务描述、数据版本、成功状态和异常轨迹等问题,还要保留足够完整的原始信息,避免未来更换模型后无法重新处理。
国家数据局在2025年公布的人形机器人具身操作数据集案例,已经展示了标准化生产的规模。该项目建设了超过 5000平方米 的训练场,引入超过 100台 多种构型机器人,累计形成超过 100万条、2.5PB 的高质量真机数据。其流程覆盖任务管理、采集、处理、标注和数据集管理,并通过AI检测、人工审核与模型验证形成质量闭环。
北京亦庄今年3月披露的数据则进一步说明,具身数据正在走向工业化生产。北京人形机器人创新中心的数据基地一期建筑面积接近 5000平方米,覆盖家居、商超、办公、工业、医药和康养等 30余个典型场景,配置 120余台 主流机器人设备,已交付数万小时数据,数据合格率达到 95%以上。
这些大型数据工厂与5100元的数据底座并不是替代关系。大型基地解决规模、复杂场景和项目交付,小型标准设备解决分布式采集、快速验证和研发普及;前者像集中式算力中心,后者更像开发者工作站。两者如果采用兼容的数据描述和质量规范,才可能形成真正的数据网络。
从数据服务走向产品,商业模式也变了
**数据服务是一种按客户场景组织人员和设备完成交付的项目制业务,而数据产品强调固定规格、重复销售和规模化部署。**前者收入与项目数量和交付人力高度相关,后者则有机会通过硬件销售、软件工具、数据管理和后续服务形成更稳定的产品收入。
这意味着具身数据公司的竞争重点会发生变化。过去,客户更关心供应商能否快速组织采集员、搭建场景并按时交付;当底座标准化后,客户会进一步比较设备覆盖多少种本体、每秒记录多少路数据、时间同步误差多大、标定是否稳定、输出格式能否直接进入训练框架,以及异常数据能否自动识别。
| 竞争维度 | 项目制数据服务 | 标准化数据产品 | |---|---|---| | 交付方式 | 按客户需求定制 | 固定规格采购与部署 | | 收入结构 | 人力与项目收入为主 | 硬件、软件和持续服务 | | 扩张约束 | 采集员和项目管理能力 | 供应链、兼容性与渠道 | | 客户切换成本 | 来自场景经验与交付关系 | 来自数据格式、设备管理与工作流 | | 核心护城河 | 大规模数据生产和质检 | 标准、生态、工具链和部署规模 |
5100元也可能是一种市场进入策略,而不是完整商业成本的体现。设备首发阶段通过低价扩大开发者覆盖,再围绕管理软件、数据治理、场景包和企业级支持获得收入,是开发工具行业常见的路径。判断这门生意是否成立,不能只看首批硬件销量,还要看设备投入使用后能否持续产生合格轨迹。
真机、仿真和人类演示不会三选一
**物理AI基础设施是连接真实数据采集、仿真训练、模型学习、机器人部署和效果评测的完整系统。**所谓“全栈”不应只是硬件品类多,而应让一条真实轨迹能够进入训练,让模型在仿真中迭代,再回到真机验证并产生新的数据。
真机数据的优势是物理真实性,摩擦、柔性形变、遮挡、碰撞和传感器噪声都会自然出现;缺点是速度慢、成本高,也不适合大量采集危险失败。仿真数据可以并行生成,适合覆盖罕见情况和训练基础策略,但再高保真的模拟也很难完整复现现实中的材料属性与接触过程。
人类演示数据则提供了另一条扩展路径。通过便携式采集设备记录人的操作,可以先获得任务语义、手眼协调和动作先验,再映射到具体机器人本体。它降低了对昂贵机器人的占用,却会引入人体与机器人形态不一致的问题:人的手腕、手指和视觉系统,与六轴机械臂加二指夹爪并不是同一种执行结构。
因此,最现实的路线是混合数据。开发者先利用人类演示和历史数据训练基础能力,再通过仿真扩大场景和失败样本,最后用少量高质量真机轨迹完成适配与验证。具身数据底座如果能同时接入这三类数据,并保留任务和动作的统一语义,其价值会明显高于单纯的录像设备。
这门生意仍有三个硬问题
**跨本体迁移是标准化具身数据产品必须解决的第一道门槛。**不同机器人关节数量、运动范围和控制接口不同,同一动作不能直接复制。数据格式统一只是第一步,还需要动作重定向、坐标变换和本体条件编码,否则“百万条轨迹”可能只是多个互不兼容的数据孤岛。
**质量评价是数据产品规模化后的第二道门槛。**机器人完成任务并不代表轨迹值得学习:操作员可能走了多余路径,夹爪可能发生短暂滑动,成功标签也可能掩盖危险动作。高质量数据需要检查视觉清晰度、传感器同步、动作平滑度、任务完成度和失败原因,并通过模型训练结果反向判断数据价值。
**数据权属是分布式采集无法绕开的第三道门槛。**真实场景可能包含人员面部、家庭环境、工厂布局和生产流程,机器人轨迹还可能暴露企业工艺。数据由设备购买者、场景提供方还是平台拥有,需要在采集前明确;脱敏、授权范围、存储位置和模型训练用途,也必须进入产品设计,而不能留到交付后补协议。
这三个问题决定了行业不会因为5100元硬件出现就立刻迎来数据爆发。设备便宜只能增加采集节点,真正决定数据资产价值的,是这些节点能否稳定输出兼容、可验证、可授权的数据。
具身智能开始补上自己的数据供应链
**这次产品开卖的行业意义,是机器人数据第一次显露出从手工作坊走向标准件的趋势。**它未必立刻造就一家平台型公司,却把竞争从“谁能接到数据项目”推进到“谁能定义数据生产方式”。
资本已经提前押注这一变化。财联社今年6月梳理发现,2026年5月至6月初,鹿明机器人、光轮智能、核数聚等具身数据相关公司密集获得融资;专业数据服务商简智机器人也完成数亿元级融资。资本追逐的并不是某一份数据集,而是未来机器人产业持续购买数据生产能力的可能性。
OpenAI Hub 的判断是,5100元的首发价有象征意义,但兼容性和数据闭环比售价更值得跟踪。若设备只能生成自有格式、依赖人工清洗,它只是降低了采集硬件成本;若它能够支持多种本体、统一任务语义,并与主流训练框架直接衔接,它才有机会成为物理AI时代的数据接口。
机器人行业过去几年重点解决的是“本体能不能动”,接下来要解决的是“机器为什么这样动,以及如何从每一次动作中继续学习”。当数据底座可以像开发板一样被采购,具身智能终于开始形成自己的工具链和供应链。
参考来源
- Open X-Embodiment:Google DeepMind 维护的跨机器人具身数据资源与工具仓库,用于了解多本体数据集合和统一训练的技术背景。
- LeRobot:Hugging Face 推出的真实机器人学习开源框架,包含数据集格式、策略训练和机器人硬件适配方案。
- ALOHA:低成本双臂遥操作数据采集系统的开源实现,可用于理解机器人模仿学习的数据生产流程。
- 事件与国内产业数据参考:量子位《具身数据底座开卖,首发5100元》、财联社《资本竞逐具身“新石油”》、国家数据局高质量数据集典型案例、北京人形机器人创新中心公开资料。相关页面因本文来源域名规范未附外链。


