PhysBrain 1.5登顶开源物理AI榜

深度机智发布PhysBrain 1.5,8B版本在28项具身空间智能基准中取得72.5分,位列开源模型第一,并将2B、8B权重、技术报告和评测工具包向社区开放。
PhysBrain 1.5 登顶开源榜:物理 AI 开始冲击空间智能前沿
深度机智近日发布 PhysBrain 1.5,并将 2B、8B 两个版本的模型权重、技术报告与评测工具包向社区开放。根据公开报道和项目方披露,PhysBrain 1.5-8B 在覆盖 28 项任务的具身空间智能评测中取得 72.5 分,位列参评开源模型第一;它在 14 项测试中拿到开源第一,另有 10 项位列开源第二。
这不是一个只在单项榜单上刷出高分的模型。PhysBrain 1.5 的真正看点,是它试图把空间理解、动作生成和未来状态预测放进同一个“物理闭环”里。对机器人来说,模型不能只回答“桌上有什么”,还要继续判断“目标在哪里”“手应该怎么过去”“碰到障碍后会发生什么”,以及“上一步失败后怎样改”。这条从看见世界到改变世界的链路,正在成为物理 AI 与普通多模态模型之间最重要的分界线。

先看成绩:开源模型与闭源前沿的差距缩到 1 分以内
PhysBrain 1.5 是面向物理世界理解、规划与行动的基座模型。它并非单纯的视觉语言模型,也不是针对某一台机器人训练的专用控制器,而是试图为多种机器人和任务提供可迁移的空间智能基础能力。
本轮评测覆盖五类能力:基础视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性,以及视觉轨迹推理。这里的“可供性”是指模型判断物体能被怎样使用、环境允许怎样行动的能力,例如识别一个杯子可以被抓取、一个平面可以承接物体、一个狭窄通道不适合直接通过。
公开结果显示,PhysBrain 1.5-8B 综合得分为 72.5,领先开源对手 Hy-Embodied-VLM-1.0 的 66.0 分约 6.5 分,也高于 RynnBrain 1.1 的 63.1 分。作为参照,资料中列出的 GPT-6 Astra 得分为 73.3,Gemini 3.6 Flash 得分为 73.0,PhysBrain 1.5 与这两款闭源模型的差距分别只有 0.8 分和 0.5 分。
| 模型 | 类型 | 综合得分 | 与 PhysBrain 1.5-8B 差距 | |---|---|---:|---:| | PhysBrain 1.5-8B | 开源 | 72.5 | — | | GPT-6 Astra | 闭源 | 73.3 | +0.8 | | Gemini 3.6 Flash | 闭源 | 73.0 | +0.5 | | Hy-Embodied-VLM-1.0 | 开源 | 66.0 | -6.5 | | RynnBrain 1.1 | 开源 | 63.1 | -9.4 |
分项成绩也比较有代表性。PhysBrain 1.5 在 RoboSpatial-Home 空间理解任务中拿到 73.9 分,在 RoboRefit 视觉目标定位任务中达到 89.8 分。前者考验模型能否理解家庭环境中的相对位置、遮挡和布局,后者则更接近机器人执行任务前的“视觉锚定”:先在复杂场景里准确找到要操作的对象,再谈动作规划。
不过,榜单成绩仍然不能直接等同于真实世界的成功率。公开基准通常拥有明确任务边界和可重复的评测条件,而家庭、仓库和工厂里的物体摆放、光照、摩擦力与突发干扰都更复杂。PhysBrain 1.5 的分数说明模型的通用空间表征已经具备竞争力,但它能否在长时间、低人工干预的真实任务中稳定工作,还需要更多公开实验验证。
Physical Loop:机器人最缺的不是“眼睛”,而是闭环
Physical Loop 是一种让系统持续经历观察、理解、规划、执行和反馈修正的物理智能循环。传统机器人系统往往把这些环节拆给不同模块:视觉模型负责识别,规划器负责生成路径,控制器负责执行,异常处理则依赖人工编写规则。模块各自可用,并不意味着整台机器人能够在变化环境中连续工作。
例如,让机器人把苹果放进篮子,识别模型可能知道苹果在哪里,动作模型也可能生成一条抓取轨迹,但当苹果被挡住、篮子被移动,或者机械手第一次没有夹稳时,系统必须重新理解场景并修改计划。如果每个模块之间缺少共享的世界表征,机器人就容易陷入“看到了,但不会做;做错了,也不知道为什么错”的状态。
PhysBrain 1.5 的路线,是把空间关系、动作意图和结果预测放到统一基座中学习。它试图让模型不仅描述当前状态,还能预测某个动作可能带来的变化。对开发者而言,这种能力的价值不在于让机器人说出更长的解释,而在于减少从感知到控制之间的信息损耗。
ActionPiece:把动作切成模型能迁移的“词”
ActionPiece 是 PhysBrain 1.5 用于动作建模与状态预测的机制。它可以理解为面向物理世界的动作词元:模型学习的不只是“向左移动”“张开夹爪”这类低层指令,还要把动作与对象、空间位置、时间顺序和可能结果联系起来。
传统视觉-语言-动作模型,即 VLA,常常依赖针对具体任务采集的机器人数据。数据量不足时,模型可能只记住某个场景中的动作顺序;数据量足够大时,训练成本又会快速上升。更麻烦的是,针对单一任务的微调可能损害原本的通用理解能力,模型从“理解物理关系”退化成“背诵一段动作脚本”。
ActionPiece 的思路,是同时建模“接下来怎么做”和“做完以后世界会怎样”。资料显示,在团队内部实验中,PhysBrain 1.5 的动作预测能力从 24% 提升到 54%,提高了 30 个百分点,相对提升约 125%。这个结果属于内部实验,不能直接与公开榜单混为一谈,但它至少说明,动作与未来状态联合训练可能是提升物理推理的有效方向。
这种设计的关键不在于动作是否被切得更细,而在于动作是否拥有可复用的语义。例如“把物体推向容器”比“让关节 3 转动 0.2 弧度”更容易跨任务迁移。前者描述的是目标、对象和结果,后者只是某个机器人在某个时刻的控制信号。真正困难的是把高层语义稳定地映射到不同本体的关节、末端执行器和动力学约束上。
从人类第一视角视频出发,能否替代昂贵的机器人数据?
Ego-centric learning,即第一人称人类学习,是从人类视角的操作视频中提取物体、动作、目标和环境变化,用于训练机器人理解与规划的方法。PhysBrain 1.5 的一条核心路线,是减少对大规模真实机器人轨迹的依赖,让模型先从人类如何观察和操作世界中学习。
公开材料提到,相关 EgoLive 数据覆盖近 2000 种物体、1800 种动作,并涉及家庭、零售、物流等场景。团队还将一个“拿苹果”的动作拆解为时间关系、空间关系、物体属性、力学信息、目标推理、动作总结和轨迹描述七个维度。这样的数据处理不是简单给视频配一句字幕,而是把连续行为转成机器能够学习的结构化经验。
这条路线的优势很现实:人类视频比机器人真机采集更容易规模化,场景也更加丰富。机器人每采集一小时数据,都要承担设备折旧、场地维护、安全管理和人工遥操作成本;人类视频则天然包含大量关于遮挡、接触、顺序和失败修正的经验。资料称,相关体系以每月万小时级速度持续新增训练资源,如果数据质量和标注一致性能够维持,确实可能形成传统真机数据难以匹敌的覆盖面。
但人类视频不是机器人动作数据的直接替代品。人的手臂长度、手指自由度、肌肉力量和触觉反馈都与机械体不同,同一段“拿起杯子”的视频,不能直接转换成另一台机器人的关节轨迹。第一视角视频还往往缺少精确深度、力和接触状态。因而,最合理的路径不是只用人类数据,而是让人类数据负责提供任务语义和物理先验,再由仿真与真实机器人数据完成动作落地。
真实评测才是下一关:53.9% 与 90.48%意味着什么
SimplerEnv 是用于评估具身智能任务执行能力的环境或基准,RoboTwin 2.0 则更强调多任务机器人场景中的真实或接近真实的验证。补充材料显示,PhysBrain 1.5 在 SimplerEnv 仿真基准上的成功率为 53.9%,在 RoboTwin 2.0 真实世界基准上的成功率为 90.48%。另有资料提到,早期 PhysBrain 版本在 SimplerEnv 中达到 80.2%,并超过 Pi0.5 的 57.1%;由于不同版本、任务集合和评测设置可能不同,这些数字不宜直接横向拼接。
这组结果反映出一个重要事实:物理 AI 的“理解分数”和“执行成功率”不是一回事。模型可能正确指出目标位置,却因为夹爪姿态、摩擦力、控制延迟或碰撞风险而失败。反过来,一个针对固定场景优化的控制器可能在单一任务中成功率很高,却没有跨场景泛化能力。
因此,评估 PhysBrain 1.5 时,开发者应重点关注三项指标。第一是任务成功率,模型是否真的完成目标;第二是泛化范围,换物体、换位置、换光照后是否仍然有效;第三是失败恢复能力,动作出错后能否重新观察并选择不同策略。第三项往往比一次成功更接近真实部署,因为现实环境不会按照测试脚本保持整洁。
开源的价值:不只是多一个权重下载地址
PhysBrain 1.5 的全面开放,如果项目资料、评测工具和训练方法确实完整可复现,那么它的意义将超过发布一个 8B 权重文件。开发者可以在同一基座上比较不同数据配方、动作表示和机器人适配方案,研究者也能更容易复核“人类数据是否足以支持物理泛化”这一核心问题。
8B 参数规模对研究社区尤其具有吸引力。它不意味着普通笔记本就能流畅运行,也不代表推理成本已经低到可以忽略,但相比更大规模的闭源系统,8B 模型更适合在实验室、边缘设备和定制机器人上做压缩、量化与蒸馏。2B 版本则可能成为低算力部署和快速原型验证的入口。最终效果仍取决于视觉编码器、上下文长度、动作输出形式、显存需求和许可证条款,不能只看参数量。
对中国开发者而言,开源还降低了研究起点:无需从零搭建空间数据管线,也不必把所有预算投入到真机轨迹采集。更重要的是,公开评测工具能帮助社区发现模型真正擅长和不擅长的地方。一个可被复现、质疑和改进的模型,通常比一个只有宣传分数的系统更有长期价值。
我的判断:这是一次有分量的开源登榜,但还不是通用机器人拐点
PhysBrain 1.5 最值得肯定的地方,是它把开源物理 AI 的竞争从“某个任务能不能做”推进到“模型能否统一理解、行动与预测”。72.5 分、14 项开源第一和与头部闭源模型不到 1 分的差距,足以证明中国团队已经进入空间智能基础模型的第一梯队。
但“开源第一”仍然不等于“机器人通用智能已经实现”。目前公开信息还不足以回答几个关键问题:完整训练数据和数据许可是否开放,模型在不同机器人本体上的迁移成本是多少,长时序任务的失败率如何,推理延迟和硬件要求是否适合边缘部署,以及 90.48% 等成绩对应的任务数量和统计方式是什么。没有这些信息,榜单可以说明上限,却不能说明产品化成熟度。
更现实的落地顺序,可能是仓储分拣、零售补货、实验室操作和结构相对稳定的家庭任务。这些场景拥有较清晰的目标、可控的安全边界和较高的重复频率,适合让模型通过真实反馈逐步修正。养老、开放家庭环境和人与机器人高频共处,则需要更强的安全证明、触觉感知和异常处理能力,不能仅凭视觉空间分数进入部署。
PhysBrain 1.5 的发布说明,物理 AI 的竞争已经从单纯堆参数转向数据、模型和本体的协同。谁能持续获得高质量人类经验,谁能把经验转成跨本体可迁移的动作表示,谁又能在真实世界里建立稳定的反馈闭环,才更可能赢得下一阶段。
对开发者来说,现在最值得做的不是追逐“开源第一”的标签,而是下载权重和评测工具后,针对自己的机器人或仿真环境复测:看它能否理解你的场景、能否处理遮挡与失败、能否在没有任务级微调的情况下迁移。榜单让 PhysBrain 1.5 获得了关注,真实任务中的可复现性,才会决定它能否成为基础设施。
参考来源
- 知乎:缩小物理智能鸿沟——深度机智 PhysBrain 1.5 登顶开源,逼近 GPT-6 Astra ——介绍 Physical Loop、ActionPiece、人类第一视角数据路线及主要评测结果。
- 知乎 ——用于补充查看相关技术讨论与社区反馈;具体数据应以项目方技术报告为准。
- Hugging Face ——模型权重与开源评测资源的社区分发平台,实际项目地址需以 PhysBrain 官方公告为准。
注:本文根据截至 2026 年 9 月 14 日可获得的参考材料整理。不同材料对发布时间、评测版本及测试设置存在表述差异,文中已尽量区分公开榜单、内部实验和补充资料;部署前请以 PhysBrain 1.5 官方技术报告、模型许可证和评测仓库为准。



