万勋NOVA2.0冲向20ms具身实时控制

万勋科技今日发布第二代柔性具身大脑 NOVA2.0,模型参数规模超过 1B,支持 20ms 实时轨迹生成,并宣称已在 40 多个真实行业场景完成超过 1000 万次极限工况作业。
万勋NOVA2.0冲向20ms具身实时控制
万勋科技今日(2026 年 9 月 9 日)发布第二代柔性具身大脑 NOVA2.0,核心卖点不是又一个会对话、会规划的机器人“大模型”,而是一套面向真实机器人体控制的实时架构:参数规模超过 1B,支持 20ms 轨迹生成,并宣称已经在 40 多个真实行业场景完成超过 1000 万次多维度极限工况作业。
万勋将 NOVA2.0 定义为“开放世界全天候商业交付级具身智能架构”。这个定义的重点有三个:开放世界意味着它要处理训练数据之外的动态环境;全天候意味着系统需要面对光照、天气、遮挡和高频突变;商业交付级则意味着目标不只是 Demo 成功,而是持续运行、可维护和能适配不同机器人本体。
这套说法能否完全成立,还要看后续公开的测试协议、任务成功率、故障率和客户部署数据。但从产品路线看,NOVA2.0 瞄准的确实是具身智能落地中最难的一段:让机器人在物理世界里快速、稳定且不依赖重型推理链路地做出动作。

具身智能的瓶颈,不只是“看懂”和“想明白”
具身智能是让 AI 通过机器人身体感知环境并执行物理动作的技术体系,它要求模型同时解决感知、决策、控制和安全问题。
当前许多机器人系统采用视觉语言动作模型(VLA)或“大模型规划器+底层控制器”的组合。高层模型负责理解“把箱子放到货架上”这类任务,底层控制器负责把目标拆成关节角度、末端位姿和速度指令。这条路线具备较强的语义泛化能力,但也存在明显的时延和稳定性问题:模型推理可能需要数百毫秒甚至更长,而机器人面对碰撞、物体滑落或人员突然进入工作区时,往往只有几十毫秒完成修正。
20ms 轨迹生成意味着控制系统理论上每 20ms 就可以生成一轮新的动作轨迹,相当于控制频率达到 50Hz。需要注意的是,20ms 轨迹生成不等于整套机器人系统端到端响应只有 20ms,也不等于视觉采集、状态估计、通信和执行器响应都在 20ms 内完成。它更准确地描述了动作生成模块的计算速度,最终效果仍取决于传感器刷新率、控制周期、硬件驱动和系统延迟。
这一区别很关键。机器人能不能在动态环境里稳定工作,不能只看一个模型的推理时间,还要看从“发现变化”到“重新规划”再到“执行动作”的完整闭环。NOVA2.0 的价值,正在于把实时轨迹生成放在架构中心,而不是把所有任务都交给一个高延迟的通用大模型。
NOVA2.0 的核心:把动作控制拆成“潜意识”层
“潜意识多模态动作基”是 NOVA2.0 用于实时轨迹生成和场景适应的底层动作表示,它可以理解为机器人在高频控制阶段调用的一组可组合动作模式。
人类抓取一个正在滑落的物体时,并不会先完整描述环境、列出多步计划,再逐条执行;视觉、触觉、本体感觉和肌肉控制会在极短时间内共同完成反应。万勋所说的“肌体智能”,试图在机器人系统中复现类似的分层机制:高层负责任务意图和场景理解,低层通过多模态动作基快速完成局部运动、动态纠偏和碰撞应对。
根据官方披露,NOVA2.0 依托 20 多维的“潜意识动作空间”,支持 1B+ 海量动态参量组合。这里的“动态参量”并不只是模型参数规模,也包含动作轨迹、环境状态、接触关系和机器人本体状态等控制变量。其设计目标是让机器人不必针对每一种突发情况重新进行完整推理,而是从已有动作空间中快速组合、调整和生成轨迹。
这种思路和传统大模型的工作方式不同。通用大模型更像一个擅长解释和规划的“慢思考者”,而 NOVA2.0 的底层动作模块更像一个拥有大量运动经验的“小脑”。前者适合回答“下一步应该做什么”,后者更适合解决“物体突然偏移 3 厘米时,手臂现在应该怎么动”。
NOVA2.0 的潜在优势是把语义泛化和运动实时性分开处理。对于“检查风机叶片”“清洗建筑外墙”“完成柔性抓取”等任务,高层模型可以提供任务目标,底层动作基则负责持续适应局部环境,从而避免每个控制周期都调用大模型。
1B+ 参数不等于传统意义上的“大模型”
NOVA2.0 的 1B+ 参数规模应被理解为具身控制系统的模型容量,而不是简单对标 1B 参数语言模型的能力。
在语言模型领域,参数规模通常用于衡量模型容量、知识记忆和表达能力;在机器人控制领域,参数量还需要结合输入模态、动作空间、控制频率和本体形态来判断。一个 1B 级具身模型如果持续接收视觉、触觉、关节状态、力反馈和任务条件,并在 50Hz 左右的节奏下输出轨迹,其计算负担和工程约束与文本生成模型完全不同。
因此,NOVA2.0 的看点不在于“1B+”这个数字本身,而在于它是否能在有限算力下把多模态输入压缩成稳定的控制输出。对商业机器人来说,模型越依赖昂贵 GPU 和云端连接,部署成本、网络风险和维护复杂度就越高。如果模型能够在边缘侧完成主要轨迹生成,机器人就更可能进入电力巡检、建筑作业、制造车间等对可靠性要求较高的场景。
万勋此前长期强调柔性机器人路线。其官网公开资料显示,公司围绕 Pliabot 柔韧技术布局柔性肌肉、关节、手臂和机器人系统,并强调低数据、低算力、原生碰撞安全和多场景适配。NOVA2.0 是这条路线在算法层的集中体现:机器人身体不是固定的标准机械臂,控制模型也不能只围绕单一构型训练。
适配多种本体,解决具身智能的“身体差异”
机器人本体适配是具身智能商业化的关键难题,因为同一个动作模型在不同机械结构、自由度和执行器上不能直接照搬。
官方称,NOVA2.0 可以适配肌肉关节、柔性单臂、柔性双臂、柔性灵巧手以及仿生人等多种本体构型。不同构型的运动范围、负载、关节约束、末端工具和安全边界都不同,模型需要把任务目标转换成适合具体身体的动作轨迹。
传统做法往往需要为每类机器人重新标定、采集数据和训练控制策略。这样的工程流程并非不能实现,但一旦机器人从刚性单臂换成柔性双臂,或者从夹爪换成灵巧手,数据和控制逻辑很容易重新分叉。NOVA2.0 所宣称的“柔性具身大脑”,本质上是在尝试建立一层跨本体的控制抽象,让上层任务意图与下层身体执行解耦。
这类架构如果落地,价值会体现在两个方面。第一,机器人厂商可以更快复用任务能力,不必为每种硬件从零开始训练。第二,终端客户可以根据场景更换身体形态,例如在狭窄空间使用柔性单臂,在复杂装配中使用柔性双臂,在需要精细接触的任务中使用柔性灵巧手。
但“可适配”不等于“即插即用”。真实部署仍然需要完成本体标定、传感器对齐、动作边界配置和安全策略验证。尤其是柔性机器人存在形变、迟滞和负载变化,模型需要持续处理非刚性结构带来的状态不确定性。
从 Demo 到 1000 万次作业,商业化信号强于发布会参数
NOVA2.0 最值得关注的披露,是万勋宣称该模型已经在超过 1000 万次多维度极限工况作业中完成泛化应用。
这 1000 万次并不是一个公开标准化 Benchmark 分数,而是企业对真实业务运行规模的描述。万勋称相关应用覆盖地产建筑、电力能源、交通运输、智能驾驶、工业制造等领域,共计 40 多个真实行业场景。相比一次性展示抓取、行走或避障的演示,这类作业次数更接近商业系统需要面对的连续运行考验。
不过,作业次数本身仍不能直接等同于成功率或系统可靠性。要判断这项数据的含金量,还需要进一步了解以下指标:
- 任务成功率: 1000 万次作业中,有多少次无需人工干预完成;
- 异常恢复率: 遇到遮挡、打滑、碰撞或目标偏移后,系统能够自主恢复的比例;
- 长时间稳定性: 单台设备连续运行时长、平均无故障时间和维护周期;
- 数据分布: 40 多个场景是否覆盖不同天气、光照、材质、设备型号和作业规范;
- 实时性口径: 20ms 是单次轨迹生成耗时、平均延迟还是 P99 延迟;
- 安全边界: 系统在人员、障碍物和突发失控情况下的降速、停止与脱离策略。
因此,更严谨的判断是:1000 万次真实作业说明 NOVA2.0 至少把验证重点从“能不能做出来”推进到了“能不能在真实场景中反复运行”,但它还不足以单独证明系统已经在所有开放世界任务中实现通用可靠性。
与 VLA 路线相比,NOVA2.0 更像“快控制层”
VLA 模型是把视觉、语言和动作连接起来的机器人模型,通常用于根据图像和指令理解任务并输出动作决策。
VLA 的优势是语义能力强,适合处理开放式指令和复杂任务规划。例如,用户可以告诉机器人“找到工作台上的蓝色工具,并把它放到右侧托盘”,模型需要理解物体、空间关系和任务顺序。但 VLA 的弱点也很明显:如果每一次细微动作调整都依赖较重的模型推理,系统就容易受到延迟、算力和输出抖动影响。
NOVA2.0 并不一定要替代 VLA,更可能承担 VLA 下方的实时动作层。高层模型负责把自然语言或视觉任务转化成目标,NOVA2.0 则结合本体状态、环境反馈和动作基,在 20ms 级别持续生成轨迹。这种组合类似自动驾驶中的分层架构:高层规划路线,低层控制车辆在车道内实时修正,而不是每遇到一个小坑都重新规划整条路线。
| 对比维度 | 通用 VLA 高层模型 | NOVA2.0 柔性具身大脑 | 实际意义 | |---|---|---|---| | 主要职责 | 视觉理解、语言指令、任务规划 | 实时轨迹生成、动作组合、动态纠偏 | 高层决定目标,底层保证动作连续性 | | 典型优势 | 语义泛化和复杂任务理解 | 低时延和高频控制 | 更适合突发变化与接触任务 | | 关键输入 | 图像、语言、场景信息 | 视觉、触觉、本体状态、动作历史等多模态信息 | 更关注机器人自身状态与环境反馈 | | 官方披露参数 | 视具体模型而定 | 1B+ 参数 | 不能仅凭参数量直接比较能力 | | 官方披露时延 | 视推理硬件和模型而定 | 20ms 轨迹生成 | 理论上对应 50Hz 级动作更新 | | 适配对象 | 通常依赖训练数据和本体设定 | 肌肉关节、柔性单臂、柔性双臂、柔性灵巧手、仿生人等 | 目标是减少跨本体迁移成本 |
从这个角度看,NOVA2.0 的竞争位置不是“谁的语言理解更强”,而是谁能把机器人动作闭环做得更快、更稳、更便宜。它的直接竞品也不一定是另一个聊天式大模型,而可能是机器人控制器、模仿学习策略、运动规划器和厂商自研的实时控制软件栈。
真正的挑战:开放世界中的长尾和安全
开放世界是具身智能最难兑现的承诺,因为现实环境的变化组合远远超过实验室数据集。
建筑、电力和交通场景中的机器人可能遇到强光、雨水、粉尘、反光表面、狭窄空间、临时障碍物和非标准物体。柔性机器人虽然具备碰撞缓冲和形态适应优势,但柔性结构也会带来建模困难,动作结果可能受到材料疲劳、温度、负载和接触面变化影响。
20ms 级动作生成可以缩短系统反应时间,却不能自动解决感知错误。如果摄像头没有看见遮挡物,或者触觉信号没有准确传递给控制器,模型再快也可能快速做出错误动作。因此,NOVA2.0 的工程价值最终取决于它与传感器、执行器、边缘计算平台和安全冗余系统的协同,而不是单独的模型指标。
万勋官网资料强调其柔韧技术具备本体自感知和精准控制能力,并试图减少对复杂力传感器和视觉系统的依赖。这个方向对商业化有吸引力,因为传感器数量减少通常意味着硬件成本、装配复杂度和维护难度下降。但在高风险作业中,“减少依赖”不等于“取消冗余”,电力、高空和人机协作场景仍需要可验证的安全传感和独立急停机制。
对开发者和机器人厂商意味着什么
NOVA2.0 对开发者的最大启发,是具身智能系统不应把所有能力都堆到一个端到端大模型里。
对于机器人研发团队,比较现实的系统分工可能包括:
- 任务层: 解析自然语言、视觉目标和业务流程,决定机器人要完成什么;
- 技能层: 将任务拆分成抓取、接触、移动、检测、清洗等可复用技能;
- 动作层: 根据实时状态生成连续轨迹,并处理局部突变;
- 安全层: 对速度、力、距离、碰撞和人员进入进行硬约束;
- 数据层: 记录失败案例、异常状态和人工接管,用于后续迭代。
NOVA2.0 如果能够提供稳定的动作层,就可能降低机器人厂商自研底层控制算法的门槛。对于使用 VLA 的团队,它也可能成为高层模型下面的快速执行模块;对于做柔性硬件的团队,它则有机会成为跨设备复用任务能力的软件基础设施。
但开发者在评估时不应只看“1B+”和“20ms”两个宣传指标,至少还要确认模型是否支持本地部署、有哪些硬件要求、输入输出模态如何定义、是否提供仿真环境、如何进行本体标定,以及出现异常时能否回退到传统控制器。没有这些信息,模型能力很难从发布会语言转换成可执行的工程方案。
OpenAI Hub 判断:方向对,公开证据还需要继续补齐
NOVA2.0 的发布价值在于,它把具身智能竞争从“更大的模型”拉回到了“更快的闭环”和“更广的本体适配”。
从已披露信息看,NOVA2.0 有三个明确亮点:第一,1B+ 参数规模与 20ms 轨迹生成结合,说明万勋把计算效率和实时控制放在同等重要的位置;第二,20 多维潜意识动作空间试图解决开放世界中的局部突变和动态纠偏问题;第三,超过 1000 万次真实作业和 40 多个行业场景,至少表明其路线已经不止停留在实验室 Demo。
但它目前也有三个待验证点:第一,20ms 指标的测试口径和硬件环境尚未完整公开;第二,1000 万次作业缺少成功率、人工接管率和故障统计等关键细节;第三,多种本体适配的迁移成本、数据需求和部署流程仍不清晰。
我们的判断是,NOVA2.0 值得关注,但暂时不宜把它简单包装成“通用具身智能已经解决”。它更像是一套面向柔性机器人的实时控制基础设施:如果后续能开放更多 Benchmark、客户案例和开发工具,它有机会成为 VLA 与物理机器人之间的重要“快车道”;如果关键数据仍停留在参数量、作业次数和场景数量,行业还需要通过实际交付结果来检验其商业级能力。
对于今天的具身智能市场来说,真正有价值的发布不再是机器人在展台上完成一次漂亮动作,而是在没有人工托底的情况下,连续数月、数万小时地完成重复而危险的工作。NOVA2.0 已经把指标指向了这条路,接下来要回答的,是它能否把 20ms 的轨迹生成,转化为长期可复现的生产力。
参考来源
- IT之家:行业首个开放世界全天候商业交付级具身智能架构,万勋科技发布 NOVA2.0 柔性具身大脑 —— 介绍 NOVA2.0 的发布时间、参数规模、轨迹生成速度、适配本体和行业应用数据。



