小鹏TuringViT重做视觉编码器

小鹏发布两款TuringViT视觉编码器,以线性注意力、数据治理和动态分辨率降低高分辨率视觉计算成本。1536×1536输入下,18L版本吞吐量达到Seed1.5-ViT的3.04倍。
小鹏TuringViT重做视觉编码器
小鹏集团在今天(2026年7月21日)发布了高效视觉编码器 TuringViT,试图从架构、数据和训练流程三个层面,重做面向 VLM 与 VLA 的视觉前端。首批模型包括 TuringViT-18L 和 TuringViT-24L,其中前者在 1536×1536 分辨率下的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,官方称其相较 SigLIP2-ViT-L 提升 2.16 倍。
TuringViT 是小鹏为高分辨率图像、多摄像头和长时序视频输入设计的一组视觉 Transformer 编码器。 它不会直接生成文字或车辆控制指令,而是先把摄像头捕获的像素压缩成机器可处理的视觉特征,再交给语言模型、动作模型或其他下游网络继续推理。
这次发布真正值得关注的地方,不是小鹏又做了一个 ViT,而是汽车公司开始把竞争推进到视觉基础设施层。智能驾驶、智能座舱和人形机器人面对的都是高分辨率、连续、多路视觉流,标准 Transformer 的注意力成本会随着视觉 Token 数量迅速上升;如果视觉编码器不够高效,后面的 VLM 或 VLA 再强,也会被延迟、显存和功耗卡住。

两个版本,都以线性注意力为主
TuringViT 首次公布的两个版本分别由 18 层和 24 层注意力模块组成。 TuringViT-18L 包含 3 组 Turing Block,总计 15 层 TLA 与3层 MHA;TuringViT-24L 包含4组 Turing Block,总计20层 TLA 与4层 MHA。
TLA 是 TuringViT 中负责高效全局建模的线性注意力层。 按照小鹏披露的架构,它承担绝大多数视觉计算,以避免所有视觉 Token 两两计算相关性所带来的二次复杂度;官方目前没有在公开材料中完整展开 TLA 的算子公式,因此还不能把它简单等同于已有的某一种线性注意力实现。
MHA 是多头注意力(Multi-Head Attention),即标准 Transformer 用多个注意力头并行捕捉不同位置关系的机制。 MHA 的优势是表达能力成熟、全局交互直接,但输入序列越长,计算量和中间矩阵占用通常越高。
| 型号 | Turing Block组数 | TLA层数 | MHA层数 | 总层数 | 主要定位 | |---|---:|---:|---:|---:|---| | TuringViT-18L | 3 | 15 | 3 | 18 | 动态分辨率下的高效部署 | | TuringViT-24L | 4 | 20 | 4 | 24 | 在保持线性计算主导的同时增强表征能力 |
TuringViT 的核心取舍不是彻底删除标准注意力,而是让线性注意力承担主干计算、让少量 MHA 保留全局交互能力。 18L 中 TLA 占 83.3%,24L 中 TLA 同样占 83.3%,两种规格都把标准 MHA 控制在总层数的六分之一。这比“全盘线性化”更保守,也更符合工程模型的思路:先拿走最昂贵的部分,再用少量标准模块兜住表征上限。
这种混合架构可以类比为城市交通系统。线性注意力像高吞吐的主干快速路,负责让大量视觉 Token 低成本通过;MHA 则像少量关键枢纽,允许来自不同区域的信息充分交换。全部使用枢纽会堵塞,全部使用快速路又可能削弱复杂关系建模,混合配置是在吞吐量和精度之间找平衡。
1536分辨率下,吞吐量是关键指标
TuringViT-18L 目前最突出的公开成绩,是在 1536×1536 输入下表现出的吞吐优势。 按小鹏公布的实测数据,18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍;官方同时表示,其相较 SigLIP2-ViT-L 提升 2.16 倍。
| 视觉编码器 | 对比输入分辨率 | TuringViT-18L吞吐表现 | 已公布绝对吞吐量 | 已公布测试硬件 | |---|---:|---:|---:|---:| | Seed1.5-ViT | 1536×1536 | 达到其3.04倍 | 未披露 | 未披露 | | SigLIP2-ViT-L | 1536×1536 | 官方表述为提升2.16倍 | 未披露 | 未披露 | | 标准Softmax ViT | 分辨率递增测试 | 延迟增长曲线更平缓 | 未披露 | 未披露 |
这组数字说明了方向,但还不足以完成严格的横向复现。 截至发稿,小鹏在现有公开信息中尚未给出测试芯片、精度格式、Batch Size、编译后端、输入预处理时间和绝对吞吐量,也没有说明不同模型是否在完全相同的参数规模及视觉 Token 预算下比较。因此,3.04 倍更适合被理解为官方测试中的架构效率结果,而不是对所有部署环境都成立的固定倍数。
高分辨率会把视觉模型的计算压力快速放大。 一张 1536×1536 图像包含约236万像素;如果模型采用固定尺寸 Patch 切分,分辨率变成原来的2倍时,视觉 Token 数会接近原来的4倍。对标准 Softmax 自注意力而言,注意力矩阵还会随 Token 数量呈平方级增长,因此空间分辨率翻倍,相关注意力计算最坏可能增加约16倍。
线性注意力的价值在高分辨率、多摄像头和视频场景中会被进一步放大。 一辆车可能同时处理多个摄像头画面,人形机器人还需要连续观察环境并保留时间上下文;这相当于把多张高分辨率图片拼成更长的视觉序列。传统 ViT 可以通过压缩图片、减少帧数或缩小 Token 数来控制成本,但代价往往是交通标志、小目标、仪表文字和手部动作等细节被抹掉。
TuringViT 的效率提升如果能在车端硬件上保持,将比单纯提高分类跑分更有实际价值。 智能驾驶系统要求固定时间窗口内完成感知和决策,吞吐量提高意味着同样的算力可以处理更清晰的图像、更多摄像头或更多历史帧,也可能为后续语言推理与动作生成腾出计算预算。
动态分辨率不是“把图片统一缩小”
原生动态分辨率是模型直接接收不同尺寸和长宽比图像的能力。 它避免把所有输入强制拉伸或裁剪到同一尺寸,使模型可以按场景保留实际需要的细节,同时减少无意义的填充计算。
固定分辨率训练对互联网图片尚可接受,对物理世界感知却经常不够用。 前视摄像头、环视摄像头、座舱屏幕截图和机器人第一视角的长宽比并不相同;如果全部裁成正方形,可能切掉道路边缘、行人或界面元素,如果统一缩放则可能引入形变。
TuringViT 把动态分辨率放进原生训练流程,而不是只在部署阶段临时适配。 这意味着模型在训练时就需要学习不同尺寸、不同 Token 数量和不同长宽比下的稳定视觉表征。对 VLM 来说,它有利于 OCR、图表、GUI 和文档理解;对 VLA 来说,它更重要的意义是让不同传感器画面进入统一视觉骨干,而不必为每类摄像头单独训练编码器。
动态分辨率与线性注意力实际上是一组配套设计。 只支持动态尺寸但仍使用高成本的标准注意力,模型会在遇到大图时迅速变慢;只使用线性注意力却始终把图片压到低分辨率,又无法充分兑现效率优势。小鹏将两者同时设计,目标是让模型在需要细节时敢于增加 Token,而不是先把视觉信息压掉再谈效率。
VISTA-Curation押注数据质量,而不是继续堆量
VISTA-Curation 是小鹏为图像与视频训练数据设计的多模态数据治理流水线。 它的目标不是简单扩大样本总数,而是提高单个样本提供的监督信息,让视觉编码器从更准确、更具体、歧义更少的图文配对中学习。
图文预训练中的常见问题不是没有图片,而是图片与字幕之间只有弱关联。 例如,一张繁忙十字路口的图片如果只标注“城市街道”,模型几乎学不到红绿灯状态、车辆方向、行人位置与道路结构;如果字幕出现图片中不存在的物体,错误监督还会让模型形成视觉幻觉。
VISTA-Curation 对图文数据采用三阶段筛选。 现有公开信息披露的流程包括:
- 过滤低分辨率、模糊和低纹理图片,先移除视觉信息不足的样本;
- 使用多模型和多种提示词生成候选字幕,并交叉验证字幕与图像的一致性;
- 在统一对比池中,根据相对图文对齐度、文本信息量和歧义度综合评分,保留视觉贴合度与语义密度更高的标注。
多模型生成再交叉验证,解决的是单个字幕模型容易自说自话的问题。 同一张图片由不同模型、不同提示方式生成描述后,如果多份候选都指出相同对象和关系,这些信息的可信度通常更高;如果某个候选独自声称画面中有特殊目标,系统则可以降低其权重或直接淘汰。
相对评分比设置单一绝对阈值更适合清洗复杂视觉数据。 “一张图片与一句字幕的匹配分达到多少才算好”很难跨领域统一,但把同一批候选放进对比池,比较谁更贴合画面、谁包含更多可验证细节、谁的指代更明确,往往更容易找到高价值监督。
小鹏对视频数据的完整清洗细节目前仍披露不足。 已有发布信息确认 VISTA-Curation 面向多模态数据治理,但公开报道中对视频采样、镜头切分、时序一致性验证、重复片段去除和动作标签生成等环节没有给出足够参数。对于智能驾驶和机器人而言,这些部分甚至比静态图文清洗更关键,后续技术报告是否公开值得关注。
它要服务的不是聊天机器人,而是物理世界模型
VLM 是视觉语言模型,即同时理解视觉输入和语言信息的多模态模型。 它通常由视觉编码器、跨模态连接模块和语言模型组成,可用于图片问答、文档解析、视频理解与界面操作。
VLA 是视觉—语言—动作模型,即把视觉观察、语言指令和物理动作放进同一个学习与推理系统。 在汽车中,动作可能是转向、制动和加速;在人形机器人中,动作可能是移动、抓取和操作工具。
TuringViT 在小鹏体系中的定位,是为智能驾驶、智能座舱和 IRON 人形机器人提供统一视觉底座。 三类业务的任务不同,但都需要从真实世界图像中提取稳定特征,因此共用视觉骨干可以降低重复训练成本,也有利于把道路、室内空间、物体关系和人类行为等知识跨场景迁移。
统一视觉编码器的难点在于,不同业务对信息的需求并不一致。 智能驾驶重视远距离小目标、几何关系和连续时序;智能座舱可能更关心人物状态、语音交互与屏幕内容;人形机器人则需要理解手眼协调、物体可供性和三维空间。TuringViT-18L 与24L提供了效率和表征能力两种取向,但能否真正做到一套编码器跨业务复用,还需要下游任务结果证明。
“低成本SOTA”还需要更多证据
小鹏把 TuringViT 描述为一条可复现、低成本训练 SOTA 级视觉 Transformer 的路径,但当前发布更像技术预告而非完整复现包。 SOTA 是 State of the Art 的缩写,指在特定公开任务与统一评测条件下达到当前最佳或接近最佳水平,而不是一个脱离数据集、硬件和指标的通用标签。
现阶段最缺少的是模型效果、训练成本和开放方式三组数据。 小鹏已经公布高分辨率吞吐倍数,却尚未在现有材料中系统列出 ImageNet 分类、图文检索、OCR、视频理解、目标检测或多模态综合基准结果,也没有披露训练所用 GPU 数量、训练时长、数据规模、参数量和总计算量。
“可复现”也不能只靠架构层数表来成立。 一套真正可复现的训练路径通常至少需要完整论文、模型配置、数据处理规则、训练超参数、评测脚本和可下载权重;如果数据集受版权或业务隐私限制,还需要提供可替代的数据构建流程。截至7月21日发稿,公开报道尚未确认 TuringViT 的代码、权重、许可证和完整技术报告是否已经发布。
TuringViT 与 Seed1.5-ViT、SigLIP2-ViT-L 的比较目前主要回答了“跑得多快”,还没有完整回答“看得多准”。 视觉编码器的效率竞争至少要同时比较吞吐量、显存占用、参数量、输入 Token 数和任务精度;如果模型通过减少 Token 或缩小隐藏维度获得速度,精度可能随之下降。只有在相近精度或相近参数规模下,吞吐倍数才具有更强说服力。
| 评估维度 | TuringViT当前披露情况 | 判断 | |---|---|---| | 架构配置 | 已披露18L、24L的TLA/MHA层数 | 信息较明确 | | 高分辨率吞吐 | 已披露1536×1536下的相对倍数 | 有价值,但缺测试环境 | | 下游任务精度 | 尚无系统公开表格 | 无法确认SOTA范围 | | 参数量与FLOPs | 现有信息未披露 | 无法判断同规模效率 | | 训练数据规模 | 现有信息未披露 | 无法量化数据效率 | | 训练总成本 | 现有信息未披露 | “低成本”尚待验证 | | 代码与权重 | 现有报道未确认 | 暂不能判断开放程度 | | 商业部署表现 | 宣布支持三大业务 | 尚需量产结果验证 |
小鹏这次抓住了正确的问题
TuringViT 抓住的是 VLM 与 VLA 走向真实设备后最难绕开的成本问题。 当行业从单张图片问答转向长视频、多摄像头和持续运行的智能体,视觉 Token 会成为推理账单中的大头,视觉编码器也会从“配套模块”变成决定系统上限的核心组件。
小鹏选择线性注意力、动态分辨率和数据治理三条线同时推进,思路比单纯替换一个注意力算子更完整。 架构负责降低每个 Token 的计算成本,动态分辨率负责按场景分配 Token,VISTA-Curation 则负责提高每个训练样本和每个 Token 的监督密度,三者共同指向单位算力产出的提升。
这项发布的短板同样明显:工程指标亮眼,科学证据还不完整。 3.04 倍吞吐足以让人关注,但没有绝对速度、硬件环境、精度曲线和训练预算,外界暂时无法判断它究竟是全面领先,还是在特定配置下占优。
TuringViT 是否真正重构视觉大模型训练范式,要看小鹏接下来是否把方法变成行业可验证的公共资产。 如果完整论文、训练配方、评测脚本与模型权重随后公开,并且第三方能在相近精度下复现高分辨率吞吐优势,它有机会成为汽车与具身智能团队可直接采用的视觉底座;如果技术长期停留在架构图和相对倍数层面,它更像小鹏内部模型工厂的一次阶段性展示。
参考来源
- IT之家:小鹏集团发布 TuringViT,宣称重构视觉大模型训练范式——披露 TuringViT-18L、24L 的架构配置、1536×1536分辨率吞吐对比及 VISTA-Curation 图文数据治理流程。


