英伟达让手术机器人开始做梦

NVIDIA 发布 Cosmos-H-Dreams,用实时生成的视频预测手术机器人动作结果。它让生成式世界模型从离线造数据,进一步进入机器人训练、策略评估和规划闭环。
NVIDIA 把生成式模拟推进手术机器人闭环
NVIDIA 近日发布 Cosmos-H-Dreams,将面向手术机器人的生成式模拟从离线视频生成推进到实时运行。Cosmos-H-Dreams 是一个面向手术机器人的实时动作条件生成式世界模型,可根据初始手术画面和机器人运动学动作,持续预测器械与组织交互后的未来视频。
这次发布的重点不是让视频模型生成一段“看起来像手术”的素材,而是让模型承担轻量级模拟器的角色:机器人给出下一步动作,模型立即生成可能出现的视觉结果,控制策略再根据结果继续决策。传统视频生成模型通常是提示词进去、整段视频出来;Cosmos-H-Dreams 则要进入逐步交互的控制循环,对延迟、动作一致性和长时稳定性提出了完全不同的要求。
截至 2026 年 7 月 27 日,NVIDIA 已通过 Hugging Face 官方技术文章、Cosmos-H-Surgical-Simulator 模型页面及配套 GitHub 仓库公开技术路径、模型资料、训练教程和评估流程。官方项目还提供从教师模型微调、长时序 Self Forcing 蒸馏到 Cosmos-H-Dreams 实时部署的完整工作流。

它生成的不是视频,而是动作后果
**动作条件生成是 Cosmos-H-Dreams 与普通文生视频模型最关键的区别。**模型接收的核心控制信号不是“夹住组织”这类自然语言,而是机器人末端执行器的位置、姿态和夹爪状态等运动学信息。
Cosmos-H 系列为不同手术机器人设计了一套统一的 44 维动作向量。根据官方仓库,目前系统覆盖 9 种机器人 embodiment,也就是 9 类具有不同机械结构和控制接口的机器人本体,相关数据来自 10 多家机构;CMR Surgical 的 Versius 系统是主要本体,同时还涉及 dVRK、MITIC 等研究或手术机器人平台。
**统一动作空间是跨机器人训练能够成立的基础设施。**不同平台的机械臂数量、坐标系、夹爪定义和控制频率并不相同,如果每台机器人都使用独立的数据格式,模型很难共享在缝合、牵拉和组织操作中学到的规律。Cosmos-H 将这些输入映射到统一的 44 维表示,相当于先给不同机器人设计一种共同语言,再让生成模型学习“说出这个动作后,画面会发生什么”。
官方模型覆盖的场景不只包括实验室里的夹取和穿环任务,还包括 Versius 临床手术数据中的胆囊切除、前列腺切除、腹股沟疝修补和子宫切除,以及缝合、组织牵拉、组织操作、peg transfer 等任务。这种数据广度很重要,因为真实软组织会变形、遮挡、反光甚至出血,远比刚性机械臂抓方块更难预测。
从 20 亿参数教师模型蒸馏出实时学生
**Cosmos-H-Surgical-Simulator 是 Cosmos-H-Dreams 的高质量教师模型。**它建立在公开的 NVIDIA Cosmos-Predict2.5-2B 之上,参数规模约为 20 亿,并在 Open-H 多本体手术基准上完成领域后训练。
教师模型的输入包括一张手术场景上下文帧和一段 44 维动作向量序列,输出则是执行这些动作后可能出现的未来视频。模型可以自回归展开完整手术轨迹,动作既可以来自人工设计的序列,也可以来自机器人策略。
**教师模型的优势是画面质量和物理先验,缺点则是难以直接满足实时控制。**扩散式或迭代式视频生成通常需要经过多轮去噪才能得到一组画面,即使最终结果足够逼真,数秒甚至更长的生成等待也无法进入机器人的高频决策回路。手术机器人不能在器械已经移动后,才等模拟器慢慢算出上一步会发生什么。
Cosmos-H-Dreams 采用的思路是教师到因果学生模型的蒸馏。**因果学生模型是只能利用当前与历史信息、并按时间顺序连续生成未来帧的模型。**它不再反复回看尚未生成的未来内容,而是像实时视频流一样逐帧推进,因此更适合持续接收机器人动作。
项目教程还引入了 Self Forcing。**Self Forcing 是一种让模型在训练时使用自身历史输出继续预测的长时序训练方法。**普通教师强制训练总是把真实上一帧喂给模型,但部署时模型只能看到自己生成的上一帧,两种状态之间的偏差会不断累积;Self Forcing 则提前让模型面对自己的误差,降低长轨迹中画面漂移、器械变形和动作失真的风险。
官方把 Cosmos-H-Dreams 定位为实时生成式模拟,但目前公开材料中的速度结论仍需结合具体 GPU、分辨率、上下文长度和部署配置理解。对开发者来说,真正有意义的指标不是一张演示视频是否流畅,而是端到端延迟能否稳定低于机器人控制周期,以及连续运行数百步后是否仍保持动作一致性。
Cosmos-H-Dreams 与传统方案有什么不同
**Cosmos-H-Dreams 的直接竞争对象不是某一个视频大模型,而是几类不同的手术机器人模拟方法。**传统物理模拟器擅长计算确定的刚体运动,但软组织建模成本高;真实手术视频最可信,却昂贵、稀缺且受隐私与伦理约束;普通生成视频模型画面逼真,却通常不理解精确的机器人动作。
| 方案 | 核心输入 | 输出与速度 | 主要优势 | 主要短板 | |---|---|---|---|---| | Cosmos-H-Dreams | 初始画面、统一 44 维机器人动作 | 实时连续预测未来视频 | 可进入策略交互闭环,覆盖多机器人本体 | 生成结果不等于可验证的物理真值 | | Cosmos-H-Surgical-Simulator | 初始画面、动作序列 | 高质量自回归手术视频 | 20 亿参数教师模型,适合造数据与蒸馏 | 推理成本更高,不以实时闭环为首要目标 | | 传统有限元或物理模拟 | 组织参数、网格、力和边界条件 | 数值状态及渲染画面 | 参数可解释,可计算力与形变 | 建模昂贵,难覆盖复杂组织和视觉细节 | | 真实机器人采集 | 实际器械动作与摄像头画面 | 真实手术或台架视频 | 真实性最高 | 成本高、风险高、数据共享困难 | | 通用视频生成模型 | 文本、图像或粗粒度控制条件 | 离线生成视频 | 视觉先验广,使用门槛较低 | 缺少精确运动学控制与手术领域约束 |
**生成式模拟的价值在于用神经网络近似复杂环境的视觉响应。**传统模拟器需要工程师明确写出组织材料参数、碰撞关系、摩擦和器械几何结构,Cosmos-H-Dreams 则从视频与动作数据中学习这些关系。它不一定知道组织的杨氏模量是多少,但可以学会某类器械向某个方向牵拉时,画面中的组织通常如何形变。
这种路线的上限很高,风险也同样清楚。视觉上合理不代表力学上正确,尤其在训练数据覆盖不足的动作区域,模型可能生成一段连贯但错误的视频。对娱乐视频而言,这只是瑕疵;对手术策略评估而言,这可能让系统错误判断一次牵拉或切割是安全的。
实时化改变了三个使用场景
**第一个直接场景是机器人策略的闭环评估。**研究人员可以让策略在生成式环境中连续输出动作,再观察模型预测的视觉后果,而不是每评估一次策略都占用真实机器人、离体组织或动物实验资源。
闭环评估比离线回放更有价值,因为策略会根据环境反馈改变下一步动作。只播放一批固定手术录像,只能判断模型是否理解已有轨迹;让策略与世界模型互动,才能暴露策略遇到偏移、遮挡或异常姿态后是否会继续犯错。
**第二个场景是大规模合成训练数据。**医疗机器人数据长期受到患者隐私、机构数据孤岛、标注成本和低频异常事件的限制,而 Cosmos-H 系列可以从初始场景和动作轨迹生成新的训练样本,用于视觉表征学习、策略预训练和罕见状态覆盖。
合成数据尤其适合补齐“接近失败但尚未造成伤害”的边界案例。真实系统不可能为了采集数据反复制造危险动作,但模拟器可以在受控环境中改变器械角度、进入位置和夹爪状态。不过,这些样本必须经过质量筛选,否则模型会把生成器的错误也一起学进去。
**第三个场景是术前规划和人机协作研究。**官方项目将 pre-operative planning 列为潜在用途,研究人员可以在给定视觉上下文中尝试不同器械轨迹,比较可能的画面变化,并用于训练操作者或验证流程。
术前规划在现阶段更适合被理解为研究工具,而不是临床决策系统。Cosmos-H-Dreams 预测的是基于训练分布的视觉未来,不是患者特异性的生物力学数字孪生;没有影像配准、组织参数校准和临床验证,它不能替代医生判断或经过认证的医疗软件。
9 种机器人不等于已经解决泛化
**多本体支持是 Cosmos-H 系列最值得关注的工程设计,但它不等于模型可以零成本适配所有手术机器人。**统一 44 维动作空间解决了输入格式问题,却没有自动解决相机位置、器械外观、控制频率、工作空间和组织类型差异。
CMR Versius 是当前主要本体,这意味着模型在该平台及对应临床程序上的数据密度可能更高。开发者若使用新的双臂结构、不同内窥镜成像系统或训练数据中没有出现的器械,仍需要收集本地数据进行微调,并重新检查长时序稳定性。
**动作到画面的对应关系比单纯视频质量更值得评估。**官方仓库给出了 FDS、GATC、TCD 等量化评估流程,开发者还应额外关注器械末端轨迹误差、夹爪开合一致性、组织接触发生时间、遮挡后的身份保持,以及长距离 rollout 后的累计漂移。
一个实用的测试方法是设计成对动作:保持初始场景不变,只改变一个动作维度,再检查输出是否出现方向正确、幅度合理的变化。如果机器人向左移动 5 毫米和向右移动 5 毫米生成了近似画面,那么即使视频足够清晰,这个模型也不能用于策略评估。
开放发布很重要,但别急着称它为手术大脑
**Cosmos-H-Dreams 更像是一个可交互的视觉想象器,而不是能独立做手术的控制模型。**它负责预测动作后果,至于下一步该做什么,仍需要机器人策略、规划器或人类操作者决定。
NVIDIA 这次真正有价值的部分,是把教师模型、动作空间、后训练、蒸馏、实时部署和评估放进同一条公开工作流。Cosmos-H-Surgical-Simulator 模型卡标明可用于商业和非商业场景,但具体使用仍应遵守其模型条款;“开放模型”也不应被简单等同于没有限制的传统开源软件。
**医疗场景中的世界模型必须接受比通用视频模型更严格的验证。**开发者至少需要区分视觉逼真度、动作忠实度、物理合理性和临床安全性,这四项指标并不是一回事:画面可以很像真的,动作响应却是错的;局部动作可以正确,长时序轨迹仍可能漂移;模拟评估表现很好,也不意味着可以直接部署到患者身上。
监管边界同样不能被忽视。当前模型更适合合成数据、研究训练、仿真评估和术前规划实验,而不是直接控制临床设备。凡是涉及真实患者和自主机器人动作,都需要额外的风险控制、硬件安全层、医生监督、数据治理及医疗器械合规验证。
这次发布的行业意义
**Cosmos-H-Dreams 标志着生成式世界模型开始从“生产训练素材”走向“参与机器人决策”。**过去一年,物理 AI 的核心叙事是用视频模型补充真实数据;现在更激进的方向,是让模型直接成为策略测试环境乃至规划器内部的预测模块。
手术机器人是验证这条路线的高难度场景。它同时包含精密机械控制、软组织形变、强遮挡、内窥镜反光和极低的容错率,如果生成式模拟能在这里提供稳定价值,那么相同方法也可能扩展到工业装配、微创介入和实验室自动化。
**NVIDIA 的优势是把 Cosmos 世界模型、GPU 推理、机器人训练和医疗生态连成一套技术栈。**相比只提供视频模型的厂商,它更容易把生成式模拟嵌入现有机器人开发流程;相比传统模拟器厂商,它又拥有大规模视频生成模型和加速硬件。不过,这也意味着实际性能会高度依赖 NVIDIA 的软件栈与高端 GPU,部署成本仍是研究机构需要核算的问题。
我们的判断是,Cosmos-H-Dreams 目前最现实的价值不是替代传统物理模拟器,而是补上后者最昂贵的一块:复杂组织交互的视觉生成。更可靠的方案可能是混合模拟——几何、碰撞和安全边界交给确定性物理引擎,难以建模的纹理、形变与视觉反馈交给生成式世界模型。
**实时只是进入控制闭环的门票,可信才是医疗机器人真正的门槛。**Cosmos-H-Dreams 已经证明手术视频生成可以从离线任务变成持续交互任务,但它接下来必须回答的,是在新器械、新患者和异常动作面前,模型究竟是在模拟物理世界,还是只是在生成一个看起来合理的梦。
参考来源
- NVIDIA Cosmos-H-Dreams 官方技术文章:介绍实时生成式手术模拟的发布背景、教师到学生模型路线及应用方向。
- Cosmos-H-Surgical-Simulator 模型页面:提供模型结构、44 维动作空间、支持本体、适用任务和许可信息。
- Cosmos-H-Surgical-Simulator GitHub 仓库:包含安装、推理、后训练、Self Forcing 蒸馏、实时部署和评估指南。
- NVIDIA 面向医疗机器人的开放物理 AI 模型介绍:中文资料,对 Cosmos-H 系列与医疗机器人应用进行了补充梳理。



