小鹏第二代VLA正式发布

小鹏第二代VLA今日正式发布,模型从视觉信号直接生成驾驶动作,依托3万卡云端算力、50PB训练数据和车端软硬协同,重点攻克复杂小路、无导航驾驶与长尾场景。随着GX两个月交付超1.5万台,小鹏正把AI智驾从功能竞争推向物理AI平台竞争。
小鹏第二代 VLA 正式发布:AI 智驾进入“物理模型”竞争
小鹏汽车今天正式发布第二代 VLA,并将其定义为首个量产的物理世界大模型;与此同时,小鹏 GX 上市两个月交付超过 1.5 万台,海外已获得超过 2000 台订单。对小鹏来说,这不是一次普通的辅助驾驶 OTA,而是一次从模型架构、训练数据到车端芯片的系统性重构。
VLA 是连接视觉、语言与动作的模型架构,传统 VLA 通常先理解画面,再通过语言或中间语义层规划,最后转换为车辆动作。小鹏第二代 VLA 的核心变化,是去掉“语言转译”环节,尝试让模型从视觉信号直接生成转向、制动、加速和避让等动作指令。
这条路线的价值在于缩短决策链路,但它也更考验数据规模、模型泛化能力和车端实时推理效率。小鹏不再满足于让车辆“看懂路牌、识别车辆”,而是希望模型直接学习真实世界中的交互规律:行人为什么会突然横穿、前车减速意味着什么、狭窄道路上应该让谁先通过,以及一个动作可能带来怎样的后果。

从“能开”转向“像老司机一样开”
小鹏第二代 VLA 的产品目标,是把辅助驾驶从固定道路功能扩展为覆盖更多真实道路的通用驾驶能力。官方披露,模型将覆盖园区小路、乡村土路、无导航道路、停车场和城区混行等场景,并支持原地起步,减少用户必须先手动驶出车位或驶入主路的限制。
复杂小路是第二代 VLA 最值得关注的落点,因为这里通常缺少清晰车道线,路面宽度变化大,参与者也更不可预测。小鹏称,基于第二代 VLA 的“小路 NGP”将显著改善复杂小路与混行环境表现,复杂小路平均接管里程(MPI)提升 13 倍。MPI 是衡量辅助驾驶稳定性的指标,数值越高,意味着车辆在相同类型道路上行驶更远才需要驾驶员接管。
小鹏还公布了 23% 的综合行车效率提升数据。这个指标并不等同于“车速提高 23%”,更可能综合了路线通行时间、变道决策、路口通过效率和不必要停车等因素。官方称,在广州晚高峰实测中,第二代 VLA 的通行效率超过传统 L2 智驾和 Robotaxi,并接近老司机人工驾驶水平。
从用户体验看,小鹏这次把“丝滑”放在了与安全同等重要的位置。模型重点优化重刹、急加速、连续犹豫和不必要让行等问题,并针对异形车辆、事故现场、起伏烂路、夜间小动物等场景做了更细的处理。小鹏甚至推出“洒了么”测试工具,为每一次行程生成舒适度评分,试图把过去依赖主观感受的“开得像不像老司机”,转化为可以比较的数据。
不过,舒适度评分不能替代安全指标。辅助驾驶是否真正可靠,最终仍要看接管率、误触发、极端天气表现、驾驶员监控和事故责任边界。小鹏披露的“整体综合体验提升近 5 倍”,来自其内部测试团队,具体依据是同一时间、同一路段、多个场景中的接管次数对比,并不是一个行业统一标准。因此,这个数字可以说明小鹏内部迭代幅度很大,但不能直接理解为第二代 VLA 在所有维度都领先竞品 5 倍。
真正的变化:VLA 不再只是“语言模型套壳”
小鹏第二代 VLA 的技术路线,本质上是在尝试把自动驾驶模型从“感知—规划—控制”的模块化系统,推进到端到端的动作生成系统。传统方案像一支分工明确的交响乐团:感知模块负责报幕,预测模块分析其他交通参与者,规划模块决定路线,控制模块负责执行;端到端模型则更像一个经验丰富的司机,直接根据眼前场景做出驾驶动作。
端到端并不意味着所有问题自动消失。它减少了模块之间的信息损耗,也可能让模型更好地学习复杂交互,但同时会带来可解释性、异常诊断、训练数据偏差和安全验证等新问题。尤其在真实道路上,某个看似合理的动作可能涉及法规、礼让规则和乘客舒适度,模型必须学会的不只是“怎么走”,还包括“什么时候不该走”。
小鹏称,第二代 VLA 可以理解并推演物理世界,能够基于已掌握的交互规律生成新的长尾场景,用于对抗训练。长尾场景是低频但高风险的异常情况,例如临时施工、交警手势、异形车辆占道、路面突然出现障碍物等。官方展示中,模型出现了识别交警手势、提前应对红绿灯通行等能力,这些能力并非简单依赖逐一标注的固定指令,而是模型泛化后的表现。
但“涌现能力”必须经过大规模实车验证,才能从发布会演示变成稳定产品。一个模型偶尔能识别交警手势,并不等于它在不同城市、不同光照、不同手势角度和多人混行场景下都能稳定处理。对小鹏而言,第二代 VLA 下一阶段的关键不是继续增加演示项目,而是证明这些能力可以持续复现,并且在错误发生前让系统安全降级。
数据与算力,决定模型能否真正上车
小鹏第二代 VLA 使用的数据规模已经接近自动驾驶行业的基础设施竞争。小鹏披露,模型训练数据接近 1 亿个 clips,累计使用约 50PB 训练数据,每秒处理约 53 亿字节视觉信息,每版模型的训练数据达到 4 万亿 Tokens。
这些数字意味着,小鹏的训练方式正在从人工标注驱动,转向海量真实驾驶视频与模型自学习结合。真实驾驶视频的优势是覆盖大量自然发生的细节,缺点是噪声更大、驾驶员行为不一定正确、场景标签不完整。模型要从视频中学到可迁移的物理规律,需要更强的数据筛选、自动标注、轨迹重建和闭环评测能力。
小鹏还拥有约 3 万张 GPU 的云端算力集群,集群运行效率长期保持在 90% 以上,并部署了 720 亿参数规模的基座模型。官方称,该基座模型可以每 5 天完成一次全链路迭代。自 2025 年科技日以来,小鹏已经开发 468 版十亿参数级模型,平均每天接近 4 个版本。
训练速度本身不是竞争力,能够把有效训练结果快速转化为车端能力才是。小鹏披露,单颗 GPU 的训练效率从每秒 0.1 个样本提升到每秒 1.11 个样本,单任务训练效率提升 43 倍,GPU 计算单元利用率从约 40% 提升至 90%。这些基础设施指标说明,小鹏正在搭建一套高频迭代的数据闭环,而不是只依赖某一版模型的单点突破。
车端部署则是第二个难关。小鹏在 2250TOPS 的 Ultra 版车型上,运行数十亿参数规模的第二代 VLA;官方称,行业普遍车端模型仍以千万级参数为主。这里的 TOPS 是芯片理论整数运算能力,不能直接等同于实际驾驶性能,真正决定体验的是模型结构、内存带宽、算子效率、摄像头输入延迟和系统调度能力。
小鹏为图灵 AI 芯片重新开发编译器和软件栈,并对“芯片—算子—模型”进行全链路优化。相关资料称,车端运行效率提升 12 倍,硬件算力利用率从通用方案的 22.5% 提升至 82.5%。这类优化的意义在于,同样的名义算力可以承载更大模型、更高帧率和更低延迟,但具体效果仍需通过量产车辆长期运行和公开测试验证。
第二代 VLA 与竞品的差异在哪里
当前智驾竞争已经从“有没有领航辅助”转向“模型是否能覆盖开放道路”。不同厂商的技术名词不完全一致,不能简单按 VLA、端到端或世界模型的标签判断高下,最终还是要看数据闭环、车端算力和实际接管表现。
| 对比维度 | 小鹏第二代 VLA | 传统 L2/模块化智驾 | Robotaxi 方案 | |---|---|---|---| | 决策方式 | 视觉信号直接生成动作,减少语言转译环节 | 感知、预测、规划、控制多模块协同 | 通常依赖更高规格传感器与限定运营区域 | | 重点场景 | 复杂小路、乡村土路、无导航道路、城区混行 | 高速、城市主干道和规则较清晰道路 | 固定区域内的城市道路运营 | | 训练数据 | 近 1 亿 clips、约 50PB 数据,支持真实驾驶视频训练 | 更依赖结构化标注与模块数据 | 依赖高精地图、运营数据和专用采集体系 | | 车端部署 | 2250TOPS Ultra 车型运行数十亿参数规模模型 | 多为更小模型和模块化组合 | 通常配备更高成本的传感器及计算平台 | | 公开指标 | 复杂小路 MPI 提升 13 倍,综合行车效率提升 23% | 各厂商口径不同,难以横向比较 | 强调限定区域无人化和运营安全 | | 主要挑战 | 泛化稳定性、验证体系、老车型适配和责任边界 | 长尾场景能力和模块协同效率 | 成本、运营范围、法规和规模化商业化 |
与特斯拉 FSD 这类持续依赖大规模道路数据迭代的方案相比,小鹏的优势是更强调中国道路环境和本土复杂交通场景,也更积极推进无导航辅助驾驶。小鹏发布的 Super LCC+ 支持不依赖导航,在全球范围开启,车辆可以协同完成变道和转向。它的实际价值是减少用户对高精地图和预设路线的依赖,但“无导航可用”不等于“任何道路都能自动驾驶”,系统仍应受限于车辆配置、软件版本、法规和驾驶员监管。
与 Robotaxi 相比,量产车智驾必须在成本和硬件限制下工作。Robotaxi 可以部署更昂贵的传感器、冗余计算平台和限定区域运营,而普通消费者车辆需要面对雨雪、隧道、地下车库、临时施工和信号不稳定等更复杂的日常环境。第二代 VLA 如果能在量产车上持续提升能力,影响会比一套只在运营区内运行的无人车方案更广。
GX 交付数据,为模型提供了真实反馈入口
小鹏 GX 上市两个月交付超过 1.5 万台,为第二代 VLA 的规模化数据闭环提供了现实基础。根据小鹏汽车公布的数据,GX 在阿联酋等海外区域已获得超过 2000 台订单,首批 300 台车辆将在今年 8 月发运海外。
GX 车主的使用数据也呈现出明显的区域差异。在成都,GX 车主车均零重力座椅开启时长、昆仑云境双拼色版本选购占比,以及第二代 VLA 节假日跨城出行车均使用里程均位居全国第一。这些数据一方面说明成都用户对舒适性、个性化配置和跨城智驾的接受度较高,另一方面也说明辅助驾驶的真实使用频率会受到城市道路结构、节假日出行和用户画像影响。
海外订单则是另一项考验。阿联酋等市场的道路规则、驾驶习惯、城市规划和极端高温环境,与中国一线及新一线城市并不相同。小鹏如果要把第二代 VLA 推向全球,必须解决模型跨区域泛化、法规适配、数据合规和本地服务体系等问题。把中国道路上训练出来的模型直接复制到海外,技术上和商业上都不现实。
小鹏押注的不是一款车,而是物理 AI 平台
小鹏第二代 VLA 的更大野心,是成为跨设备的物理 AI 底座。物理 AI 是能够感知真实环境、理解物理规律并控制实体设备完成任务的人工智能系统;它与只生成文本或图像的模型不同,输出必须作用于现实世界,并承担动作后果。
小鹏计划让第二代 VLA 跨域驱动汽车、Robotaxi、人形机器人和飞行汽车,并宣布向全球商业伙伴开源,德国大众成为其首发客户,同时小鹏图灵 AI 芯片获得大众定点。若这一策略落地,小鹏的商业模式就不再局限于卖车,而是尝试输出模型、芯片、编译器和整套物理 AI 技术栈。
这条路线的想象空间很大,但难度也远高于单一车型的辅助驾驶升级。汽车、机器人和飞行汽车面对的动力学约束不同,传感器形态、动作频率和安全标准也不同。一个在车辆转向任务上表现优秀的模型,并不能自然迁移到机械臂抓取或飞行器姿态控制。所谓跨域复用,真正的难点在于共享世界模型和数据基础设施,同时为不同本体保留独立的控制与安全层。
小鹏还在推进 VLA 与 VLM 的融合。VLM 是视觉语言模型,擅长理解图像、视频和自然语言;VLA 更强调把感知直接转化为动作。两者融合后,车辆有机会同时具备更强的座舱交互、环境解释和驾驶控制能力,汽车也可能从“会执行指令的设备”变成可以主动规划任务的智能体。不过,座舱 Agent 与驾驶控制系统必须严格隔离权限,聊天能力越强,不代表车辆就应该获得更高的自动执行权限。
这次发布值得关注,但还不是终局答案
小鹏第二代 VLA 的最大价值,是把量产车智驾竞争从功能堆叠推进到模型、数据和算力的系统竞争。去掉语言转译、直接从视觉生成动作,配合近 1 亿 clips、50PB 数据和数十亿参数车端模型,确实代表了小鹏在端到端自动驾驶上的激进押注。
但它目前最需要证明的,仍然是量产后的稳定性,而不是发布会上的峰值能力。第二代 VLA 是否能在不同城市长期保持低接管率,是否能在雨雪、夜间、施工和复杂人车混行中稳定运行,是否能让老款车型获得足够接近的体验,以及出现错误时能否清晰降级,这些问题将直接决定它能否从“先进技术”变成“国民智驾”。
从时间线看,小鹏此前已计划在 2025 年底邀请先锋用户共创,并在 2026 年第一季度向 Ultra 车型全量推送;今年 3 月又开启媒体和门店试驾,3 月下旬逐步面向用户推送。因此,今天的“正式发布”更应理解为第二代 VLA 进入规模化商业传播与量产扩张阶段,而不是模型第一次出现在公众视野中。
小鹏给出的下一个目标,是在今年年底让能力再提升 5 至 10 倍。这个目标足够大胆,也意味着模型将继续高频迭代。对用户而言,真正值得关注的不是每一版模型的宣传口号,而是 OTA 后接管里程是否持续增加、重刹是否持续减少、无导航场景是否真正可用,以及不同车型之间的体验差距是否缩小。
AI 智驾的下一轮竞争已经开始从“谁先把功能做出来”,转向“谁能持续把真实世界数据转化为更可靠的行动能力”。小鹏第二代 VLA 站在这条路线的前排,但它能否拉开代际差距,最终仍要由大规模用户道路数据和公开、可复现的长期测试来回答。
参考来源
- IT之家:小鹏 GX 上市 2 个月交付超 1.5 万台,在阿联酋等区域已斩获超 2000 台订单:提供 GX 交付、海外订单及首批出口信息。
- 小鹏汽车官方第二代 VLA 发布及技术资料:本文关于模型架构、训练数据、云端算力、车端部署和功能规划的技术信息主要据此整理;由于原始页面域名不在本文限定的参考链接域名范围内,未直接附链。
注:文中“提升 13 倍”“提升 23%”“综合体验提升近 5 倍”等数据均为小鹏汽车或其内部测试口径,不等同于统一行业标准,实际表现还需结合车型、软件版本、道路环境和用户测试结果判断。



