英伟达自动驾驶模型开放商用

NVIDIA 于 8 月 4 日开放 320 亿参数 Alpamayo 2 Super 商用,试图用可推理、可蒸馏的 VLA 教师模型解决 L4 自动驾驶最棘手的长尾场景。
NVIDIA 在 8 月 4 日宣布,Alpamayo 2 Super 现已开放商业使用。这款 320 亿参数的视觉—语言—动作模型,不只识别道路目标和预测轨迹,还能结合多摄像头视频、导航信息与驾驶上下文,对复杂交通局面进行推理、规划并输出行动。
这次更新的重点不是 NVIDIA 又发布了一个更大的自动驾驶模型,而是今年 6 月亮相的 Alpamayo 2 Super,开始从研究和验证阶段走向车企、一级供应商及自动驾驶公司的商业开发流程。对开发者来说,商业可用意味着模型终于有机会进入数据标注、场景分析、模型评测、教师蒸馏和车端部署等生产环节,而不只是停留在演示视频里。
**Alpamayo 2 Super 是一款面向自动驾驶的 320 亿参数推理型视觉—语言—动作模型,也就是 Reasoning VLA。**它由 NVIDIA 基于 Cosmos 架构构建,目标是为 L4 级无人驾驶出租车和自动驾驶汽车提供可解释的场景理解、驾驶推理与轨迹规划能力。

自动驾驶最难的不是直道,而是那些没见过几次的局面
**长尾场景是发生概率低、组合复杂,却可能直接影响安全的驾驶事件。**例如施工人员临时用手势改变通行方向、前车绕开一件被遮挡的掉落物、救护车从后方接近、无信号路口多车互相试探,或者行人与非机动车在视线遮挡区突然出现。
传统自动驾驶系统可以把常见驾驶任务拆成感知、预测、规划和控制多个模块,但长尾问题往往出现在模块之间。一个目标检测器可以识别出车辆、锥桶和行人,却未必能理解为什么前车正在跨越实线;一个轨迹预测器可以估计行人的移动方向,却未必知道交警手势在此时拥有高于红绿灯的通行优先级。
**Alpamayo 2 Super 想补上的正是从看见物体到理解局面的中间一层。**模型需要先判断异常现象的因果关系,再选择让行、停车或变道等宏观动作,最后为下游规划模块生成可执行轨迹。这更接近老司机处理意外状况的顺序,而不是看到一个目标就机械触发一条预设规则。
NVIDIA 给 Alpamayo 2 Super 增加了 360 度多摄像头场景理解能力,使其输入不再局限于前向视野。侧后方车辆是否正在加速、相邻车道是否存在可用空间、路口另一侧是否有车辆抢行,都会影响变道、汇入和无保护转向的决策;只看前方摄像头,很难完成这类推理。
**因果链推理是 Alpamayo 将驾驶判断转化为可读解释的机制。**模型不仅输出一条轨迹,还能描述产生该动作的依据,例如前方车道被静止车辆阻挡、左侧车辆正在切入,因此应该减速并为其让行。这里的解释并不能自动证明动作安全,但它至少给数据工程师和安全评估人员提供了可检查的中间结果。
从 100 亿到 320 亿参数,升级的不只是模型尺寸
**Alpamayo 2 Super 将 Alpamayo 系列教师模型的参数规模从 100 亿提高到 320 亿,参数量增加了 220 亿,达到此前的 3.2 倍。**NVIDIA 此前的 Alpamayo 1 Nano 和 Alpamayo 1.5 Nano 更偏向紧凑模型与轨迹生成,而 2 Super 被放在完整驾驶技术栈的上游,承担推理、自动标注、场景理解、模型评判和知识蒸馏等多种任务。
| 模型或方案 | 参数规模 | 主要定位 | 场景理解范围 | 输出能力 | 典型部署方式 | |---|---:|---|---|---|---| | Alpamayo 1 Nano | 100 亿 | 早期开放式驾驶 VLA | 多模态驾驶输入 | 推理轨迹、驾驶轨迹 | 研究、后训练与下游适配 | | Alpamayo 1.5 Nano | 100 亿 | Nano 系列迭代模型 | 驾驶场景理解 | 推理与轨迹生成 | 下游驾驶模型开发 | | Alpamayo 2 Super | 320 亿 | 高能力教师模型 | 360 度多摄像头、导航及驾驶上下文 | 因果推理、元动作、轨迹、自动标注、模型评判 | 数据中心训练与评估,再蒸馏到车端模型 | | 传统模块化方案 | 不适用 | 感知、预测、规划分别开发 | 取决于各模块传感器输入 | 目标、预测轨迹、规划轨迹 | 车端独立模块组合 |
**元动作是位于具体方向盘和踏板控制之上的高级驾驶决策。**Alpamayo 2 Super 可以输出让行、停车、变道等元动作,让下游规划器知道当前应该完成什么任务,再计算满足车辆动力学和安全约束的精细轨迹。
元动作的价值在于减少推理模型与传统规划栈之间的接口落差。一个大模型直接输出每一帧转向角和加速度,难以验证,也容易受生成波动影响;如果模型先表达保持车道、向左变道或为目标车辆让行,下游系统便能通过规则、优化器和安全检查器约束最终动作。
**带有二维定位信息的推理自动标注,则可能比模型本身更早产生商业价值。**自动驾驶公司每天会积累大量视频数据,但从视频里筛出特殊事件、定位关键目标并写出因果描述,需要昂贵的人工标注。Alpamayo 2 Super 可以作为上游标注模型,为画面中的车辆、行人、障碍物及其决策关系生成结构化解释,再由人工复核。
NVIDIA 宣称这套能力可以把部分复杂标注工作的周期从数月压缩至数天,但目前公开材料没有给出统一数据集、人工小时或单位场景成本等完整对照数字。因此,这一结论更适合被视为厂商给出的工程预期,而不是可以跨团队复现的标准化基准。
320 亿参数不会原样塞进汽车
**教师模型是负责生成高质量标签、推理过程和训练信号的大模型,不一定直接运行在最终设备上。**Alpamayo 2 Super 的实际角色更像自动驾驶团队里的高级教练:它在数据中心分析复杂场景、给出行动理由,并把这些知识传递给更小、更快的学生模型。
知识蒸馏则是把大模型能力迁移到小模型的训练方法。学生模型学习教师模型生成的动作分布、场景解释和轨迹,而不是仅靠原始驾驶记录做行为模仿;蒸馏完成后,紧凑模型才有机会运行在 NVIDIA DRIVE Hyperion 平台所采用的 DRIVE AGX Thor 车载计算环境中。
**这种教师—学生架构比让 320 亿参数模型直接控制车辆更现实。**汽车要求稳定的推理延迟、有限的功耗、确定性的降级策略和长时间热管理,不能接受云端大模型常见的延迟抖动。更重要的是,车端系统需要在网络断开时保持完整驾驶能力,因此核心决策不能依赖远程推理。
NVIDIA 同时提供后训练脚本,允许开发者用自己的道路数据、驾驶政策和地区场景调整模型。公开模型解决的是共同能力底座,但不同城市的交通法规、道路结构、驾驶习惯和传感器配置仍然需要本地数据适配;在旧金山学到的无保护左转策略,不能未经验证地复制到上海或东京。
开放商用不等于拿来就能上车
**商业可用描述的是许可边界,不代表模型已经通过量产车辆所需的安全认证。**开发团队仍需在采用模型前核对具体许可证中的地域限制、可接受用途、衍生模型分发、责任承担以及模型输出使用条件,不能把开放权重简单理解为无限制开源。
开放模型与真正的开放源代码也不是同一概念。行业通常会分别考察模型权重、训练代码、训练数据、评测集和许可证是否开放;即使权重和后训练脚本可以获得,完整预训练数据与训练配方未必全部公开。Alpamayo 2 Super 更准确的定位,是可获取并允许进入商业研发流程的开放式驾驶基础模型。
**L4 自动驾驶是车辆在限定运行设计域内无需人类接管即可完成全部动态驾驶任务的自动化等级。**限定运行设计域可能包含特定城市、道路类型、天气、速度和运营时间,因此一款支持 L4 开发的模型,并不等于可以在任何道路和天气下实现完全无人驾驶。
公开材料目前也没有提供足以直接比较安全性的统一闭环成绩,例如每千公里碰撞次数、接管间隔、交通规则违反率、长尾场景成功率或相对人类司机的风险变化。没有这些数字,就不能仅凭 320 亿参数、自然语言解释或演示案例,判断 Alpamayo 2 Super 已经比量产自动驾驶系统更安全。
NVIDIA 真正出售的是一条完整开发链
**Alpamayo 2 Super 的战略价值在于把 NVIDIA 的芯片、模型、仿真和数据工具连成一条自动驾驶流水线。**模型负责理解与推理,AlpaGym 用于封闭循环强化学习,AlpaSim 用于闭环仿真验证,Omniverse NuRec 和 OmniDreams 面向场景重建与生成,最终再把蒸馏后的模型部署到 DRIVE AGX Thor。
闭环仿真与普通视频回放的区别,是模型动作会改变后续环境。车辆如果选择强行并线,周围车辆会减速、避让或发生碰撞;模型如果提前制动,风险也会随之变化。只有把决策重新送回仿真环境,开发者才能观察一连串后果,而不是判断模型有没有复现人类司机记录中的单一轨迹。
**这套组合对中小型自动驾驶团队尤其有吸引力。**过去只有少数公司有能力自行收集海量道路数据、训练驾驶基础模型、搭建闭环仿真器并适配车载芯片;现在开发者可以从 NVIDIA 的共同底座开始,把资源集中在本地场景、车队运营和安全工程上。
NVIDIA 披露,Alpamayo 系列在今年 6 月发布阶段的累计下载量已接近 40 万次,并获得 COMPUTEX Best Choice Award 车辆技术和智能座舱类别奖。这个数字说明开放驾驶模型有显著开发者需求,但下载量既不等于活跃项目数,也不等于商业车辆部署量,不能当成市场占有率使用。
它最有用的地方,可能暂时不在方向盘上
**Alpamayo 2 Super 短期最成熟的用途,很可能是离线数据生产和模型评审,而不是直接接管车辆。**自动标注、长尾场景检索、驾驶行为解释、失败案例归类和学生模型蒸馏,对实时延迟与功能安全的要求相对较低,却能直接缩短数据闭环周期。
具体来说,开发者可以先用它从数百万段行车视频中筛选异常并线、遮挡行人、施工改道和紧急车辆等片段,再让模型生成场景摘要、关键目标定位和决策理由。人工团队只复核高风险样本,而不必逐帧浏览所有视频,这比直接让大模型控制方向盘更容易落地。
**长期影响则取决于推理是否能稳定转化为更低的闭环事故率。**自然语言解释很容易给人一种模型已经理解场景的感觉,但模型可能生成听起来合理、实际与控制动作不一致的理由。真正有效的可解释性必须与感知证据、规划输出和车辆执行结果对齐,并能被仿真测试和道路数据反复验证。
这也是 Alpamayo 2 Super 与聊天模型最根本的差别:聊天模型答错一道题,通常只损失时间;驾驶模型在长尾场景里做错一次判断,后果可能不可逆。NVIDIA 把自动驾驶从轨迹模仿推进到显式推理,是一个值得关注的方向,但是否构成安全跃迁,最终仍要看封闭循环指标、真实道路里程和监管审查,而不是看模型能否流畅解释自己。
我们的判断
**Alpamayo 2 Super 是目前开放自动驾驶模型中少见的完整平台型产品,而不是一个孤立权重文件。**320 亿参数、360 度场景理解、因果链推理、元动作输出和教师模型蒸馏,让它比单纯预测车辆轨迹的模型更接近自动驾驶基础模型。
**这次开放商用真正降低的是开发门槛,而不是安全门槛。**车企可以少走一段从零训练教师模型、搭建标注系统和开发蒸馏流程的路,但功能安全、冗余设计、数据合规、闭环验证和道路测试一项都不会因此消失。
Alpamayo 2 Super 因此不应该被理解为一位可以直接上岗的 AI 司机,而应该被看作一套培养、检查和压缩 AI 司机的基础设施。它已经开始触及自动驾驶最难的长尾复杂场景,但从能够解释一个危险局面,到在数百万公里中持续做对,仍然隔着整个汽车工业的验证体系。
参考来源
- NVIDIA Alpamayo GitHub 项目:Alpamayo 模型、开发资源及相关开放组件的官方项目入口。



