AI 快讯Helix 2.5闯进30个陌生家庭
模型上新

Helix 2.5闯进30个陌生家庭

2026-09-18T04:05:48.838Z
Helix 2.5闯进30个陌生家庭

Figure 发布 Helix 2.5,机器人无需采集目标住宅数据,便可在30套陌生住宅中整理客厅、折叠毛巾和铺床,任务成功率由8%升至56%。

Helix 2.5闯进30个陌生家庭

Figure 在 9 月 18 日发布 Helix 2.5,并把搭载该模型的人形机器人直接送进旧金山湾区 30 套此前从未见过的住宅,让它自主整理客厅、折叠毛巾和整理床铺。按照 Figure 公布的测试结果,引入 Index 预训练后,机器人在陌生家庭中的任务成功率从 8% 提升到 56%,增加 48 个百分点,相当于原来的 7 倍。

这次发布最值得关注的并不是机器人又学会了三项家务,而是 Figure 开始验证一种更接近大模型的发展路径:先用大规模通用数据预训练,再用较少的任务数据完成适配,最后直接进入没有采集过数据的新环境工作。

Helix 2.5 是 Figure 面向人形机器人全身控制推出的新一代基础模型,目标是把人类行为经验迁移到机器人从未见过的现实场景。 Figure 对此次实验的核心问题描述得很直接:一个类人机器人能否走进陌生住宅,不重新采集这套住宅的数据,也不针对房间布局重做系统,就立即开始工作?

Figure 给出的阶段性答案是:可以,但目前还远没有达到家用产品所要求的可靠程度。

Figure 人形机器人在陌生住宅内整理床铺、折叠毛巾和收拾客厅的演示画面

不是“完全没训练”,而是没有针对这30套房子训练

Helix 2.5 的零样本泛化需要准确理解,它并不意味着机器人此前从未学习过家务。零样本全身泛化是指机器人没有使用目标环境的数据进行训练或调试,便能在该环境中调用已经学到的运动与操作能力。

Figure 首先在全球人类行为数据集 Index 上预训练 Helix 2.5,再将同一个基础模型适配为三种行为:整理客厅、折叠毛巾和整理床铺。完成这些训练后,Figure 才把机器人带进湾区 30 套住宅,并且事先没有采集这些住宅的图像、布局或操作数据。

因此,Figure 所说的“没有额外训练”,更准确的含义是没有进行住宅专属训练,而不是没有任务训练。机器人已经看过相关人类行为,也接受过三类任务的专用数据,只是没有提前记住某张床有多高、毛巾放在哪里,或者沙发与茶几之间应该怎么走。

这一区别非常重要,因为它决定了 Helix 2.5 究竟是在“重放演示”,还是在陌生空间中真正进行感知、判断和动作调整。前者接近录制一条稳定的自动化流程,后者才是家庭机器人的核心能力。

Index 把人类经验变成机器人的预训练材料

Index 是 Figure 用于训练机器人基础模型的全球人类行为数据集,其作用类似于语言模型预训练阶段使用的大规模文本语料。 语言模型从文本中学习词语、事实与推理模式,机器人基础模型则需要从人类行为数据中学习物体如何被抓取、双手如何配合,以及身体如何在移动过程中保持平衡。

传统机器人系统往往要为每个场景单独采集数据。开发团队先把机器人搬进目标房间,再反复遥操作,让它记住摄像头视角、家具位置、抓取轨迹和动作边界;换一套住宅后,桌椅高度、光照、物品材质和空间布局发生变化,原有策略便可能失效。

Helix 2.5 试图把这套流程倒过来。Figure 先让模型从更广泛的人类行为中获得通用先验,再用有限的机器人任务数据,把“人会如何铺床”转换为机器人身体能够执行的动作策略。

这种路线的价值不只是降低数据量,而是改变数据增长的边际成本。假如一个新技能每进入一套住宅都要重新采集和标注,家庭机器人就很难扩展;假如一个通用模型只需学习少量任务示范,便能迁移到大量房型,软件能力才可能像自动驾驶和大模型一样随着数据规模持续增长。

成功率从8%升到56%,数据有效但还不能交付

Index 预训练是此次实验中唯一被替换的主要变量。Figure 表示,在任务专用数据、模型架构、训练流程和评测方法保持不变的情况下,使用 Index 预训练将任务成功率从 8% 提高到 56%。

| 对比项 | 未使用 Index 预训练 | Helix 2.5 使用 Index 预训练 | 变化 | |---|---:|---:|---:| | 陌生环境任务成功率 | 8% | 56% | 增加 48 个百分点 | | 相对成功率 | 1 倍 | 7 倍 | 提升 600% | | 任务专用数据 | 保持一致 | 保持一致 | 无变化 | | 模型架构与训练流程 | 保持一致 | 保持一致 | 无变化 | | 目标住宅数据 | 未披露使用 | 进入前未采集 | Helix 2.5 强调零样本部署 |

56% 是一个能证明预训练有效、却不足以支持消费级部署的数字。家务机器人每天需要处理大量连续动作,只要其中一个环节失败,整项任务就可能中断;如果单项成功率只有 56%,用户仍要频繁介入,机器人也无法在无人看管时稳定工作。

这项结果更像是机器人领域的“预训练拐点”,而不是家务机器人已经成熟的证明。8% 到 56% 说明人类行为数据确实帮助模型获得了跨环境先验,但剩余 44% 的失败仍然可能对应掉落物品、抓取失败、床单纠缠、路径受阻或错误理解场景等现实问题。

Figure 暂未在已公开信息中给出每类任务的独立成功率、测试总次数、平均完成时长、人工接管率与失败类型分布。缺少这些数据意味着外界还无法判断 56% 是三类任务的平均值、整段任务的端到端成功率,还是由若干子任务指标汇总而来。

家务比工厂搬箱子难得多

家庭是机器人最难处理的开放环境之一。开放环境是指物体、布局、光照和任务状态无法被提前完全定义,机器人必须持续感知并根据变化调整动作的场景。

工厂可以固定货架尺寸、零件位置和机械臂工作范围,家庭却每天都不一样。毛巾可能搭在椅背上,也可能皱成一团;床单会发生不可预测的褶皱;玩具、杯子和抱枕的位置不断变化;狭窄通道还会要求机器人边移动边避障。

可变形物体尤其考验模型对物理世界的理解。杯子和遥控器属于刚性物体,其形状在抓取过程中基本不变;毛巾、床单和枕头属于可变形物体,同一个抓取点可能产生完全不同的折叠结果,机器人不能只记住一条固定轨迹。

双手协调同样是铺床和叠毛巾的必要能力。机器人需要一只手固定布料,另一只手拉平或折叠,同时调整躯干、手腕和站位;任何一处力度或时序错误,都可能使布料滑落,让此前动作全部失效。

主动感知则让机器人不再只是被动接收摄像头画面。主动感知是指机器人通过移动头部、身体或物体,主动寻找更有利的观察角度,以减少遮挡和不确定性。 当毛巾的一角被遮住时,机器人需要换一个位置观察,而不是在视觉信息不足时盲目抓取。

Helix 2.5真正升级的是泛化效率

Helix 2.5 相比 Helix 02 的关键进步不是多会做了几项动作,而是用更少的任务专用数据进入更多陌生环境。Figure 表示,Helix 2.5 只使用 Helix 02 一半的任务专用数据,就把相关行为泛化到了 30 个未见过的新环境。

| 维度 | Helix 02 | Helix 2.5 | |---|---|---| | 发布时间 | 2026 年 1 月 | 2026 年 9 月 18 日 | | 核心方向 | 单一神经网络驱动全身自主控制 | 从人类行为预训练中获得跨家庭泛化能力 | | 已展示场景 | 整理客厅等连续家务 | 整理客厅、折叠毛巾、整理床铺 | | 任务专用数据 | 作为比较基准 | 约为 Helix 02 的一半 | | 新环境规模 | 未在此次对比中公布 | 30 套此前未见的住宅 | | 公开成功率 | 此次未给出 | 使用 Index 后为 56% |

Helix 02 解决的是“一个神经网络能否同时控制走路、平衡和操作”,Helix 2.5 进一步追问“这套能力能否在换房间后继续工作”。前者重点是全身自主性,后者重点是全身智能的零样本迁移。

全身智能是指同一套模型协调视觉感知、移动、平衡、双臂操作和手部动作,而不是把导航与抓取拆成彼此独立的固定模块。 对人来说,端着物品绕过桌子再弯腰放下是一个连续动作;对传统机器人来说,这往往需要导航、站位、姿态规划、抓取与放置等多个模块依次交接。

单一模型的优势是减少模块间的信息损失。机器人看到床单正在滑落时,可以同时改变脚步、躯干姿态和手部力度,而不必等待视觉模块把结果交给规划模块,再由规划模块生成一段新轨迹。

单一模型的风险也同样明显。模块化系统出现故障时较容易定位问题,而端到端神经网络失败时,开发者可能很难判断错误来自视觉识别、空间理解、动作规划还是底层控制,这会直接增加安全验证和工程调试难度。

“首次自主做家务”需要加上限定条件

Figure 将 Helix 2.5 描述为首次证明全身智能能够从人类经验中学习并转移到新场景,但这一结论目前主要建立在公司自行公布的实验上。更严谨的说法是:Figure 首次公开展示其人形机器人在 30 套未提前采集数据的住宅中,使用同一套预训练基础模型执行三类家务。

“自主”也不等于机器人具备人类水平的通用常识。这里的自主主要指任务执行期间不需要逐动作遥控,模型根据视觉输入直接产生全身控制行为;它并不意味着机器人可以理解任意家庭指令,也不代表其能够自行处理所有异常情况。

“陌生家庭”同样不等于完全不受控制的消费者住宅。Figure 在湾区租用 30 套房子完成测试,这比公司实验室中的单一样板间更接近真实世界,但外界仍需要知道现场是否清理了高风险障碍物、是否限定了任务区域,以及失败后是否由工作人员重置环境。

这些限定并不会抹杀 Helix 2.5 的技术意义,却决定了它距离商品化还有多远。机器人演示最容易展示成功的一次,而产品必须面对每天数十次任务、长期运行磨损、宠物和儿童突然闯入,以及昂贵物品被误抓等低概率高损失事件。

Figure正在复制大模型的Scaling路线

Figure 的长期策略已经从单点演示转向数据规模化。该公司此前公布 Project Go-Big,目标是建设大规模人形机器人预训练数据集,并与拥有超过 10 万套住宅单元的 Brookfield 合作扩展现实场景数据。

这条路线本质上是在复制大语言模型的 scaling 逻辑:模型架构保持相对稳定,持续增加更广泛的数据,让一个基础模型覆盖更多任务。Helix 02 整理客厅时,Figure 已经强调没有为新场景更换算法,只是增加训练数据;Helix 2.5 则进一步把预训练来源扩展到人类行为,并把评测地点从少数演示空间扩大到 30 套陌生住宅。

机器人数据的扩展难度仍然远高于互联网文本。文本可以低成本复制和批处理,真实机器人数据却涉及设备折旧、现场人员、安全管理、动作标注与硬件差异,获取一小时高质量全身操作数据的成本可能远高于一小时视频本身。

人类行为也不能直接等价为机器人动作。人类拥有不同的关节结构、触觉反馈、力量范围和手部自由度,模型必须解决“形态映射”问题,把人类弯腰、捏取和借力的动作转化为 Figure 机器人实际可执行的控制信号。

真正的产品门槛是可靠性,而不是演示流畅度

Helix 2.5 已经证明预训练可以显著改善泛化,但 56% 的成功率说明 Figure 仍处于能力验证阶段。对研究原型而言,7 倍提升足够醒目;对进入家庭的产品而言,一半左右的成功率仍然不可接受。

家庭机器人要跨过商品化门槛,至少还需要公开五类指标:

  • 连续任务成功率: 机器人能否把收集物品、擦桌、整理沙发和归位工具作为完整链条一次完成。
  • 异常恢复率: 抓取失败、物体掉落或路径被挡后,机器人能否自己重新规划,而不是等待人工接管。
  • 每小时人工介入次数: 这一指标直接决定机器人到底在节省人力,还是把家务变成远程运维。
  • 任务耗时与能耗: 即使能够成功,若铺一次床耗时 40 分钟并消耗大量电量,产品价值仍然有限。
  • 安全事件率: 家庭中有人、宠物和易碎物品,误碰与夹伤风险必须以长时间统计而非单次视频评估。

Figure 此次没有公布 Helix 2.5 的推理延迟、单项任务耗时、续航影响和硬件售价,因此暂时无法计算它执行家务的经济性。家庭机器人最终要与保洁服务、专用家电和用户自己动手竞争,模型能力只是成本结构中的一部分。

Helix 2.5是关键一步,但不是家务机器人的终点

Helix 2.5 的真正价值是把人形机器人的竞争焦点,从“能不能完成一次任务”推进到“能不能在没见过的地方重复完成任务”。机器人行业过去并不缺折衣服、端盘子和收拾房间的视频,真正稀缺的是跨房型、跨物体摆放和跨光照条件的可复现数据。

30 套陌生住宅和 56% 成功率构成了一个有意义的起点。前者说明 Figure 已经开始离开高度可控的实验室,后者则诚实地暴露了现实场景仍然会让模型频繁失败。

我们的判断是,Helix 2.5 暂时不会让通用家务机器人立刻进入普通家庭,但它验证了“人类行为预训练+少量任务数据+零样本部署”这条路线确实有效。如果 Figure 能继续把成功率从 56% 提升到 90% 以上,并证明机器人能够自主恢复失败、长期安全运行,家用人形机器人可能才会从吸引眼球的演示,转变为真正能够交付的产品。

参考来源

相关推荐

查看全部