news 2026/7/24 11:47:22

小鹏自研视觉基础模型发布!只用10%数据,“干翻”谷歌百亿模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
小鹏自研视觉基础模型发布!只用10%数据,“干翻”谷歌百亿模型

打响AI视觉技术独立第一枪

目录

01 小鹏为何非要自研?

02 拆解TuringViT (一) 算力减负,靠“5+1”混合架构

03 拆解TuringViT (二) VISTA数据流水线,以少胜多的“胜负手”

04 拆解TuringViT (三) 原生动态分辨率,为“上车”而生

05 实验数据

零样本分类与检索

冻结密集预测迁移

下游VLM对比

缩放律

06 写在最后


近日,小鹏正式发布自研视觉基础模型TuringViT。

最震撼的结果是:仅使用0.85B(8.5亿)图文对数据,就在六项零样本分类任务上,以83.6%的平均分,反超了使用近10B(100亿)数据训练的谷歌SOTA模型SigLIP2-L。

用不到十分之一的数据,实现性能反超!

图 | 各视觉Transformer编码器的零样本性能、训练数据规模与1K分辨率吞吐量对比。TuringViT仅用10%的训练数据即实现了更强的准确率-效率权衡

TuringViT的发布,不仅补上了小鹏“物理AI”全栈布局中最关键的感知入口,更重要的是,它向全行业证明:顶尖的视觉模型,不再是谷歌等巨头靠无限资源堆砌的专利。

这背后,是一套从架构、数据到训练全链路优化的“降本增效”方法论。

01 小鹏为何非要自研?

在TuringViT之前,几乎所有车企和AI公司都在走“拿来主义”路线——直接复用谷歌SigLIP、OpenAI CLIP等现成的ViT模型作为视觉编码器。

这条路好走,但对小鹏而言,正面临三道致命的“枷锁”,不打破就无法掌握自己的AI命运。

  • 算力枷锁:标准ViT的注意力计算量随像素的二次方暴涨,在2K、4K高清图像成为常态的今天,这是一条算力死胡同。对于需要同时处理多路高清摄像头、连续视频帧的自动驾驶和机器人来说,复用现有模型意味着无法承受的训练和推理成本。
  • 数据枷锁:SigLIP2用10B数据,其他开源模型动辄几十亿。这种“数据霸权”为科技巨头构筑了难以逾越的护城河,中小玩家连复现的入场券都拿不到。更关键的是,单纯堆砌网络爬取的“脏数据”,边际效益递减,无法满足特定场景(如驾驶)的精细化需求。
  • 应用枷锁:绝大多数ViT在固定的低分辨率(如224x224)上预训练,而实际应用(智驾、座舱)需要处理各种动态分辨率和长宽比的图像。这种“训练-应用”的错配,就像穿着不合脚的鞋跑步,每次适配都要付出额外成本,且效果打折。

TuringViT的诞生,就是为了砸开这三把锁。为小鹏的智驾、座舱、人形机器人三大业务,打造一个成本可控、场景可控、性能领先的统一视觉底座。

02 拆解TuringViT (一)算力减负,靠“5+1”混合架构

要降低算力,最直接的办法是用计算量呈线性的“线性注意力”替代二次方复杂度的“标准注意力”。

但纯线性注意力会过度平滑图像细节,导致精度下降。

TuringViT没有走极端,而是选择了一条极为务实的“5+1”混合架构:
用5层计算高效的线性注意力(TLA)作为主力,负责全局信息建模;再穿插1层精度有保障的标准注意力(MHA),负责精准的局部细节交互。

这种设计,如同大兵团作战,线性注意力是负责大范围覆盖和推进的“主力部队”,而标准注意力则是进行关键目标“精准点射”的“狙击手”。

图 | TuringViT块架构与模型配置。(左)主干由重复Turing Block构成,TLA聚合全局上下文,序列长度感知归一化与输入依赖门控稳定可变token训练并保持高频局部细节。(右)TuringViT-18L(3组Block,15层TLA+3层MHA)与TuringViT-24L(4组Block,20层TLA+4层MHA)的配置

为了让这支“混合部队”不出乱子,TuringViT还设计了两个“稳定器”:

  • 序列长度感知归一化:确保输入不同分辨率的图片时,模型内部的数值稳定性。
  • 输入依赖的门控机制:给线性注意力开了一条“后门”,把可能被平滑掉的局部高频信息再补回来。

结果如何?在1536x1536的高分辨率下,TuringViT的推理吞吐量是谷歌SigLIP2-L的2.16倍。这意味着在车端、机器人端等算力受限的场景,TuringViT能以更低的延迟处理更高清的图像,这是“能用”和“好用”的本质区别。

图 | 推理延迟随输入分辨率和视觉token数量的缩放曲线。延迟在RTX 3080 Ti上用FP16 TensorRT测量,TuringViT的高分辨率延迟缩放远平缓于标准ViT基线

03 拆解TuringViT (二)VISTA数据流水线,以少胜多的“胜负手”

如果说混合架构解决了“训得起”的问题,那么VISTA-Curation数据治理流水线则直接回答了“如何用10%的数据训得更好”的核心问题。这正是TuringViT以少胜多的“胜负手”。

VISTA的核心思想,是从“数据大锅饭”转向“营养定制餐”,让每一条数据都提供更密集的监督信号。它分为图文和视频两条线:

图文线:三步精炼,优中选优

  • 过滤:先筛掉低分辨率、模糊、低纹理的“垃圾图片”。
  • 生成与验证:用多个大模型为一张图生成多个候选标题,再交叉验证标题与画面的匹配度。
  • 对比排序:把所有候选标题放入一个“对比池”,不仅要选和图片最配的,还要选最有区分度的,避免选出“一只狗在草地上”这种放之四海而皆准的废话描述。

图 | 图文数据治理引擎总览。流水线过滤低质量图片,生成并验证多样化候选字幕,在统一对比池中排序,选出视觉贴合、语义丰富且具有区分度的字幕用于CLIP式预训练

视频线:时序感知,去粗取精

  • 切分与采样:将长视频按内容变化切成短片,提取关键帧。
  • 双重过滤:通过语义一致性(画面内容是否连贯)和运动一致性(光流变化是否合理)过滤掉静止、冗余的片段。
  • 融合标注:结合单帧画面的描述和整个视频片段的摘要,生成包含时间变化信息的标注。

图 | 视频语言数据治理流水线总览。原始视频被分解为时序连续的短视频,经语义-运动一致性过滤后,局部帧级字幕与全局视频级字幕融合验证,产出简洁且时序贴合的视频-语言对

消融实验显示,仅“重标注”一步,就让模型性能暴涨11.3%。这证明了VISTA的巨大价值:高质量的数据治理,其效果远胜于盲目堆砌十倍的原始数据。

图 | TuringViT-18L预训练策略消融实验。平均分基于ImageNet-1K、ObjectNet、ImageNet-v2、ImageNet-A、ImageNet-R、ImageNet-Sketch六项零样本分类

04 拆解TuringViT (三)原生动态分辨率,为“上车”而生

传统ViT“低分预训练、高分微调”的范式,对于小鹏来说无法接受。

TuringViT从设计之初就贯彻“为真实应用而生”的理念,采用四阶段渐进式训练,让模型天生就能适应多变的输入。

  • 阶段一(视觉初始化):先用MIM蒸馏的方式,让模型快速学习到丰富的底层视觉特征。
  • 阶段二(低分可变训练):在256-512的较低分辨率范围内,让模型初步适应可变长度的输入,成本可控。
  • 阶段三(高分原生精调):放开分辨率限制,让模型在真实世界的分辨率上进行训练。
  • 阶段四(视频数据注入):加入经过VISTA治理的视频数据,让模型从静态理解升级到动态时序理解。

这种“原生支持”的设计,彻底消除了预训练和下游应用之间的鸿沟,无需任何额外的插值或适配操作,模型就能即插即用,性能和效率都达到最优。

图 | 四阶段渐进式ViT预训练配置。H800 GPU-hours表示总训练成本(H800数量×挂钟训练时长),此表对应TuringViT-24L的预训练设置

05 实验数据

零样本分类与检索

TuringViT-24L六项零样本分类平均83.6%,略超SigLIP2-L的83.4%;COCO和Flickr30K检索平均78.9%,同样领先。

图 | 零样本分类与检索基准性能。所有数值为百分比,越高越好,最优结果加粗

0.2pp的优势在高方差评测中不构成统计显著差距。真正有说服力的是:用10%的数据达到同等水平,说明数据治理确实在起作用,而非模型架构本身更强。

冻结密集预测迁移

冻结视觉编码器,只训轻量任务头,测深度估计、语义分割和零样本目标跟踪。TuringViT-24L在ADE20K语义分割mIoU 43.5%(SigLIP2-L 42.3%),DAVIS-2017零样本跟踪J&F 50.3%(SigLIP2-L 32.4%)。

图 | 冻结密集视觉表征评估。冻结各编码器后在单目深度估计、语义分割和零样本视频目标跟踪上评测迁移能力

跟踪任务18pp的领先值得关注——这和第四阶段视频训练直接相关,说明视频数据治理带来的时序表征提升可以迁移到下游密集预测。

下游VLM对比

在统一VLM训练流水线下(Qwen2.5-1.5B作LLM骨干),TuringViT-24L在目标定位(RefCOCO 90.4 vs 88.9)、OCR(OCRBench V1 798 vs 781)、通用VQA(MMVet 49.1 vs 47.0)上均优于SigLIP2-L。

图 | 统一VLM训练流水线下不同视觉编码器的下游多模态性能对比,最优结果加粗

但在多模态推理(MMMU、MathVista)和长视频理解(LongVideoBench)上优势不明显甚至略输。这是合理的——这些任务的瓶颈在LLM推理能力和时序聚合策略,视觉编码器的贡献被稀释。

缩放律

从20M到850M数据规模,零样本性能沿幂律持续上升,850M处未出现饱和迹象。

图 | TuringViT-18L训练数据缩放结果。预训练数据从20M增至850M图文对时的零样本性能,所有模型用相同配方训练10个epoch

这意味着如果继续扩大治理后的数据规模,性能还有提升空间。但缩放律曲线的斜率决定了收益的性价比——从20M到850M提升约27pp,后续每增加一个量级的边际收益会递减,是否值得投入需要看具体任务需求。

06 写在最后

TuringViT的发布,对小鹏而言,意味着智驾、座舱、机器人三大核心业务终于有了统一、高效、自主可控的“眼睛”。这是从依赖外部“输血”到实现内部“造血”的关键一步。

但其更深远的意义在于,它向整个AI行业,尤其是非巨头玩家,提供了一条清晰且可复现的技术路径:顶尖的AI基础模型,并不一定需要“无限算力 + 海量数据”的暴力美学。

通过对架构、数据、训练流程的系统性、精细化设计,中型团队同样可以在可控的成本内,打造出SOTA级别的定制化模型。

83.6%的零样本分数不是终点,0.2pp的领先也不构成壁垒。TuringViT真正的贡献,是它所代表的方法论精神——一种敢于挑战巨头、追求极致效率、回归工程本质的务实精神。

Ref

论文:TuringViT: Making SOTA Vision Transformers Accessible to All

论文地址:https://arxiv.org/abs/2606.24253

项目主页:https://turingvit.github.io/

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/24 11:44:02

一文读懂 SGP.32 与 eIM:海量 IoT 设备自动激活与远程管理

凌晨一点,一位用户在 Reddit 上发帖求助。 他刚拿到一部新 iPhone,准备把旧手机的数据迁移过来。按运营商的说法,这只需要点几下屏幕。 但迁移开始后,加载圆圈转了几分钟就停住了。旧手机失去信号,新手机也显示“无服…

作者头像 李华
网站建设 2026/7/24 11:42:23

TI AM572x高速接口时序详解:从参数到PCB设计与调试实战

1. 项目概述与核心价值在工业控制、边缘计算和高端嵌入式设备的设计中,我们常常会与TI的AM572x这类高性能异构多核处理器打交道。这类芯片的魅力在于其强大的集成度,USB 3.0、SATA、PCIe、千兆以太网、CAN等高速接口一应俱全,为构建复杂的通信…

作者头像 李华
网站建设 2026/7/24 11:41:36

如果不小心把“数字钱包”弄丢了,我该怎么向警察叔叔报案?这份最全“链上报警指南”请收好

我先甩一个真事把你震醒: 2025年5月,武汉市民刘先生被"剁币"骗局坑走价值20万元的虚拟币——对方收了币,翻脸说不收到,拒付人民币。刘先生立刻报警,把被骗经过、嫌疑人信息、关键的区块链交易哈希值一股脑交给武汉网警。警方迅速介入,锁定了资金流向。 你猜怎…

作者头像 李华
网站建设 2026/7/24 11:40:37

AI如何助力本科毕业论文写作:从选题到格式的全流程优化

1. 毕业论文写作的痛点与现状本科毕业论文写作一直是让无数大学生头疼的"终极挑战"。每到毕业季,图书馆、自习室里总能看到学生们对着电脑屏幕抓耳挠腮的场景。为什么一篇本应展现四年学习成果的论文,会变成让学生们"憋"到崩溃的&qu…

作者头像 李华
网站建设 2026/7/24 11:39:30

C++实现A*寻路算法:从原理到工程实践详解

1. 项目概述:为什么A*算法值得你花时间实现?如果你对游戏开发、机器人路径规划或者任何需要“找路”的场景感兴趣,那么A*(A-Star)算法绝对是你绕不开的一个经典。它不像深度优先搜索(DFS)那样可…

作者头像 李华
网站建设 2026/7/24 11:39:17

工业风道测速通病:堵灰、磨损、数据跳变?解决方案解析

在火电、水泥、化工脱硫脱硝系统中,风道、烟道风速风量是机组燃烧优化、风机变频调节、环保监测的关键工艺参数。现场运维常会遇到一个技术难题:风速变送器、线路校验正常,但测量数据频繁卡死、跳变、归零,重复性差,成…

作者头像 李华