「打响AI视觉技术独立第一枪」
目录
01 小鹏为何非要自研?
02 拆解TuringViT (一) 算力减负,靠“5+1”混合架构
03 拆解TuringViT (二) VISTA数据流水线,以少胜多的“胜负手”
04 拆解TuringViT (三) 原生动态分辨率,为“上车”而生
05 实验数据
零样本分类与检索
冻结密集预测迁移
下游VLM对比
缩放律
06 写在最后
近日,小鹏正式发布自研视觉基础模型TuringViT。
最震撼的结果是:仅使用0.85B(8.5亿)图文对数据,就在六项零样本分类任务上,以83.6%的平均分,反超了使用近10B(100亿)数据训练的谷歌SOTA模型SigLIP2-L。
用不到十分之一的数据,实现性能反超!
图 | 各视觉Transformer编码器的零样本性能、训练数据规模与1K分辨率吞吐量对比。TuringViT仅用10%的训练数据即实现了更强的准确率-效率权衡
TuringViT的发布,不仅补上了小鹏“物理AI”全栈布局中最关键的感知入口,更重要的是,它向全行业证明:顶尖的视觉模型,不再是谷歌等巨头靠无限资源堆砌的专利。
这背后,是一套从架构、数据到训练全链路优化的“降本增效”方法论。
01 小鹏为何非要自研?
在TuringViT之前,几乎所有车企和AI公司都在走“拿来主义”路线——直接复用谷歌SigLIP、OpenAI CLIP等现成的ViT模型作为视觉编码器。
这条路好走,但对小鹏而言,正面临三道致命的“枷锁”,不打破就无法掌握自己的AI命运。
- 算力枷锁:标准ViT的注意力计算量随像素的二次方暴涨,在2K、4K高清图像成为常态的今天,这是一条算力死胡同。对于需要同时处理多路高清摄像头、连续视频帧的自动驾驶和机器人来说,复用现有模型意味着无法承受的训练和推理成本。
- 数据枷锁:SigLIP2用10B数据,其他开源模型动辄几十亿。这种“数据霸权”为科技巨头构筑了难以逾越的护城河,中小玩家连复现的入场券都拿不到。更关键的是,单纯堆砌网络爬取的“脏数据”,边际效益递减,无法满足特定场景(如驾驶)的精细化需求。
- 应用枷锁:绝大多数ViT在固定的低分辨率(如224x224)上预训练,而实际应用(智驾、座舱)需要处理各种动态分辨率和长宽比的图像。这种“训练-应用”的错配,就像穿着不合脚的鞋跑步,每次适配都要付出额外成本,且效果打折。
TuringViT的诞生,就是为了砸开这三把锁。为小鹏的智驾、座舱、人形机器人三大业务,打造一个成本可控、场景可控、性能领先的统一视觉底座。
02 拆解TuringViT (一)算力减负,靠“5+1”混合架构
要降低算力,最直接的办法是用计算量呈线性的“线性注意力”替代二次方复杂度的“标准注意力”。
但纯线性注意力会过度平滑图像细节,导致精度下降。
TuringViT没有走极端,而是选择了一条极为务实的“5+1”混合架构:
用5层计算高效的线性注意力(TLA)作为主力,负责全局信息建模;再穿插1层精度有保障的标准注意力(MHA),负责精准的局部细节交互。
这种设计,如同大兵团作战,线性注意力是负责大范围覆盖和推进的“主力部队”,而标准注意力则是进行关键目标“精准点射”的“狙击手”。
图 | TuringViT块架构与模型配置。(左)主干由重复Turing Block构成,TLA聚合全局上下文,序列长度感知归一化与输入依赖门控稳定可变token训练并保持高频局部细节。(右)TuringViT-18L(3组Block,15层TLA+3层MHA)与TuringViT-24L(4组Block,20层TLA+4层MHA)的配置
为了让这支“混合部队”不出乱子,TuringViT还设计了两个“稳定器”:
- 序列长度感知归一化:确保输入不同分辨率的图片时,模型内部的数值稳定性。
- 输入依赖的门控机制:给线性注意力开了一条“后门”,把可能被平滑掉的局部高频信息再补回来。
结果如何?在1536x1536的高分辨率下,TuringViT的推理吞吐量是谷歌SigLIP2-L的2.16倍。这意味着在车端、机器人端等算力受限的场景,TuringViT能以更低的延迟处理更高清的图像,这是“能用”和“好用”的本质区别。
图 | 推理延迟随输入分辨率和视觉token数量的缩放曲线。延迟在RTX 3080 Ti上用FP16 TensorRT测量,TuringViT的高分辨率延迟缩放远平缓于标准ViT基线
03 拆解TuringViT (二)VISTA数据流水线,以少胜多的“胜负手”
如果说混合架构解决了“训得起”的问题,那么VISTA-Curation数据治理流水线则直接回答了“如何用10%的数据训得更好”的核心问题。这正是TuringViT以少胜多的“胜负手”。
VISTA的核心思想,是从“数据大锅饭”转向“营养定制餐”,让每一条数据都提供更密集的监督信号。它分为图文和视频两条线:
图文线:三步精炼,优中选优
- 过滤:先筛掉低分辨率、模糊、低纹理的“垃圾图片”。
- 生成与验证:用多个大模型为一张图生成多个候选标题,再交叉验证标题与画面的匹配度。
- 对比排序:把所有候选标题放入一个“对比池”,不仅要选和图片最配的,还要选最有区分度的,避免选出“一只狗在草地上”这种放之四海而皆准的废话描述。
图 | 图文数据治理引擎总览。流水线过滤低质量图片,生成并验证多样化候选字幕,在统一对比池中排序,选出视觉贴合、语义丰富且具有区分度的字幕用于CLIP式预训练
视频线:时序感知,去粗取精
- 切分与采样:将长视频按内容变化切成短片,提取关键帧。
- 双重过滤:通过语义一致性(画面内容是否连贯)和运动一致性(光流变化是否合理)过滤掉静止、冗余的片段。
- 融合标注:结合单帧画面的描述和整个视频片段的摘要,生成包含时间变化信息的标注。
图 | 视频语言数据治理流水线总览。原始视频被分解为时序连续的短视频,经语义-运动一致性过滤后,局部帧级字幕与全局视频级字幕融合验证,产出简洁且时序贴合的视频-语言对
消融实验显示,仅“重标注”一步,就让模型性能暴涨11.3%。这证明了VISTA的巨大价值:高质量的数据治理,其效果远胜于盲目堆砌十倍的原始数据。
图 | TuringViT-18L预训练策略消融实验。平均分基于ImageNet-1K、ObjectNet、ImageNet-v2、ImageNet-A、ImageNet-R、ImageNet-Sketch六项零样本分类
04 拆解TuringViT (三)原生动态分辨率,为“上车”而生
传统ViT“低分预训练、高分微调”的范式,对于小鹏来说无法接受。
TuringViT从设计之初就贯彻“为真实应用而生”的理念,采用四阶段渐进式训练,让模型天生就能适应多变的输入。
- 阶段一(视觉初始化):先用MIM蒸馏的方式,让模型快速学习到丰富的底层视觉特征。
- 阶段二(低分可变训练):在256-512的较低分辨率范围内,让模型初步适应可变长度的输入,成本可控。
- 阶段三(高分原生精调):放开分辨率限制,让模型在真实世界的分辨率上进行训练。
- 阶段四(视频数据注入):加入经过VISTA治理的视频数据,让模型从静态理解升级到动态时序理解。
这种“原生支持”的设计,彻底消除了预训练和下游应用之间的鸿沟,无需任何额外的插值或适配操作,模型就能即插即用,性能和效率都达到最优。
图 | 四阶段渐进式ViT预训练配置。H800 GPU-hours表示总训练成本(H800数量×挂钟训练时长),此表对应TuringViT-24L的预训练设置
05 实验数据
零样本分类与检索
TuringViT-24L六项零样本分类平均83.6%,略超SigLIP2-L的83.4%;COCO和Flickr30K检索平均78.9%,同样领先。
图 | 零样本分类与检索基准性能。所有数值为百分比,越高越好,最优结果加粗
0.2pp的优势在高方差评测中不构成统计显著差距。真正有说服力的是:用10%的数据达到同等水平,说明数据治理确实在起作用,而非模型架构本身更强。
冻结密集预测迁移
冻结视觉编码器,只训轻量任务头,测深度估计、语义分割和零样本目标跟踪。TuringViT-24L在ADE20K语义分割mIoU 43.5%(SigLIP2-L 42.3%),DAVIS-2017零样本跟踪J&F 50.3%(SigLIP2-L 32.4%)。
图 | 冻结密集视觉表征评估。冻结各编码器后在单目深度估计、语义分割和零样本视频目标跟踪上评测迁移能力
跟踪任务18pp的领先值得关注——这和第四阶段视频训练直接相关,说明视频数据治理带来的时序表征提升可以迁移到下游密集预测。
下游VLM对比
在统一VLM训练流水线下(Qwen2.5-1.5B作LLM骨干),TuringViT-24L在目标定位(RefCOCO 90.4 vs 88.9)、OCR(OCRBench V1 798 vs 781)、通用VQA(MMVet 49.1 vs 47.0)上均优于SigLIP2-L。
图 | 统一VLM训练流水线下不同视觉编码器的下游多模态性能对比,最优结果加粗
但在多模态推理(MMMU、MathVista)和长视频理解(LongVideoBench)上优势不明显甚至略输。这是合理的——这些任务的瓶颈在LLM推理能力和时序聚合策略,视觉编码器的贡献被稀释。
缩放律
从20M到850M数据规模,零样本性能沿幂律持续上升,850M处未出现饱和迹象。
图 | TuringViT-18L训练数据缩放结果。预训练数据从20M增至850M图文对时的零样本性能,所有模型用相同配方训练10个epoch
这意味着如果继续扩大治理后的数据规模,性能还有提升空间。但缩放律曲线的斜率决定了收益的性价比——从20M到850M提升约27pp,后续每增加一个量级的边际收益会递减,是否值得投入需要看具体任务需求。
06 写在最后
TuringViT的发布,对小鹏而言,意味着智驾、座舱、机器人三大核心业务终于有了统一、高效、自主可控的“眼睛”。这是从依赖外部“输血”到实现内部“造血”的关键一步。
但其更深远的意义在于,它向整个AI行业,尤其是非巨头玩家,提供了一条清晰且可复现的技术路径:顶尖的AI基础模型,并不一定需要“无限算力 + 海量数据”的暴力美学。
通过对架构、数据、训练流程的系统性、精细化设计,中型团队同样可以在可控的成本内,打造出SOTA级别的定制化模型。
83.6%的零样本分数不是终点,0.2pp的领先也不构成壁垒。TuringViT真正的贡献,是它所代表的方法论和精神——一种敢于挑战巨头、追求极致效率、回归工程本质的务实精神。
Ref
论文:TuringViT: Making SOTA Vision Transformers Accessible to All
论文地址:https://arxiv.org/abs/2606.24253
项目主页:https://turingvit.github.io/