您的位置:首页 >小鹏集团发布TuringViT,宣称重构视觉大模型训练范式
发布于2026-08-01 阅读(0)
扫一扫,手机访问
小鹏集团今天发布了一款名为 TuringViT 的高效视觉编码器,这可不是一次普通的迭代——它从架构设计、数据范式到训练流程,几乎是针对 VLM/VLA 时代做的系统性重构。
有意思的是,TuringViT 的定位不仅仅局限于智能驾驶。根据官方说法,它将全面支撑智能驾驶、智能座舱,以及小鹏的 IRON 人形机器人这三个业务场景。换句话说,这是一个为“视觉大模型普惠化”铺路的技术路径,目标是把过去只有头部团队才能玩转的 SOTA 级视觉 Transformer,推向更广泛的行业应用。

▲ TuringViT 的块架构和模型配置
从技术层面来看,TuringViT 的突破点是“线性注意力主导 + 高质量数据治理 + 原生动态分辨率”这三个维度的同步推进。简单说,就是既要效果好,又要反赌,还得能落地。
它目前推出了两个规格版本:
一个是 TuringViT-18L,包含 3 组 Turing Block(共 15 层 TLA + 3 层 MHA),主打动态分辨率下的高效部署;另一个是 TuringViT-24L,包含 4 组 Turing Block(共 20 层 TLA + 4 层 MHA),在保持线性计算主导的前提下,进一步提升了表征能力。
实测数据很能说明问题。随着输入分辨率提升,TuringViT 的延迟增长曲线比标准 softmax ViT 平缓得多,高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到了 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 也提升了 2.16 倍。这个成绩,直接为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。
不过,真正值得关注的,是它在数据方面的思路。行业里常见的做法是“堆数据规模”,但 TuringViT 走了一条完全不同的路。它打造了一套名为 VISTA-Curation 的多模态数据治理流水线,核心逻辑是:通过提升单样本的监督价值,实现数据效率的量级提升——从“用更多数据”转向“用更优质的监督”。
针对图文数据,这套流水线通过三步精细化筛选来保证质量:
第一步,过滤掉低分辨率、模糊、低纹理的低质量图片;第二步,通过多模型、多提示词生成多样化候选字幕,并交叉验证视觉一致性;第三步,在统一对比池中,根据相对图文对齐度、文本信息量、歧义度综合打分,筛选出视觉贴合度高、语义信息密度高的优质标注,同时淘汰掉那些模糊、泛化、弱对齐的样本。

▲ 图像-文本筛选及处理流程
针对视频数据,流水线同样进行了全流程治理:先是将长视频切分为连续短片段并均匀采样代表帧;再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段;最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型能从连续画面中学习更鲁棒的视觉表征。

▲ 视频-语义筛选及处理流程
最终结果很有说服力:TuringViT 仅用 0.85B 图文对进行训练(这大约是 SigLIP2-L 训练数据规模的 10%),就在 ImageNet-1K 等六项零样本分类基准上,取得了 83.6% 的平均准确率,超越了使用 10B 数据训练的主流开源基线。在 COCO、Flickr30K 图文检索任务上,优势同样显著——这才是真正的“十分之一数据,更优效果”。

此外,TuringViT 还采用了四阶段渐进式原生动态分辨率训练范式。从预训练之初就适配下游 VLM/VLA 的输入特性,彻底告别了“固定分辨率预训练 + 事后适配”的传统模式。
在应用场景上,TuringViT 的布局相当清晰:在智能驾驶领域,它是第二代 VLA 模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉 token;在智能座舱与驾泊一体化场景中,它的 VLM 原生特性让视觉特征与语言模型实现了更高效的对齐,能提供更高的识别精度,以及不同画幅和比例的视觉输入,支撑更多未来车辆与用户的交互功能;而在小鹏 IRON 人形机器人的技术体系中,TuringViT 则充当着“视觉视网膜”的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9