发布于2026-08-03 阅读(0)
扫一扫,手机访问
这项由斯坦福大学、图宾根AI中心、马克斯·普朗克信息研究所、谷歌、ETH苏黎世、华盛顿大学等数十家顶尖机构联合完成的研究,于2026年6月以arXiv预印本形式发布,论文编号为arXiv:2606.28551。
一个有意思的发现是:当AI已经能读懂图片、回答各种问题、分析图表时,我们往往只关心它的表现,却很少追问——到底喂了什么样的“食材”才让它变得这么聪明?其实,整个AI研究圈也在为这个问题挠头。就像一位厨师,花了大量时间钻研火候与刀工,却始终没想清楚:到底该用什么食材,各种食材该放多少,才能做出最好吃的那道菜?
这项研究,正是冲着这个核心问题去的。它给视觉语言模型——也就是那种既能看图、又能说话的AI——的“食谱”研究,提供了迄今为止最系统、最全面的参考答案。
这类AI在生活中越来越常见。它们能描述一张照片的内容,能读懂图表里的数字,甚至能回答“这张X光片有没有问题”这样的专业问题。然而,训练这类模型需要海量数据,而关于“数据该怎么选、怎么搭配”,整个研究圈一直缺乏一个公认的、可重复的实验框架。这个项目,被称为DCVLM(DataComp for VLMs),就是来填补这个空白的。
在讲实验结论之前,先得理解研究团队搭建了一个多大的“原料仓库”。他们将公开可用的160个数据集整理成一个统一的数据池,总量达到6万亿个多模态词元——可以粗略理解为6万亿个“信息片段”,包括文字和图像内容。这是一个极其庞大的规模。
这160个数据集被划分为四大类型,就像厨房里的四种基础食材。
第一类是**图文配对数据**,也就是一张图片配一段文字说明,比如网络上的图片和它对应的说明文字。这类数据数量最为庞大,代表性来源包括DataComp-1B和ReLAION-2B这样经过初步筛选的网络爬取数据集,以及PixMo-Cap这种高质量的人工标注数据集。
第二类是**多模态交织文档**,即网页、PDF、学术论文等形式中,图片和文字混合出现的内容。来源包括MINT-1T和OmniCorpus等。这类数据原汁原味、未经太多加工,但质量也参差不齐。
第三类是**纯文字数据**,目的是防止AI在学会“看图”之后,忘记怎么“说话”。包括FLAN、SlimOrca等指令微调数据集,以及数学、编程等专业领域文本。
第四类是**多模态指令微调数据**,这是最精华的部分。由人工编写或AI生成的“问答对”组成,每道题都对应一张或多张图片,覆盖知识问答、图表理解、数学推理、OCR文字识别、医学影像等八大能力方向。
整个数据池被刻意设计得极为多元——语言超过20种(以英文和中文为主),图像类型涵盖自然照片、合成图、表格、手写文字等,质量层次从未经处理的网络爬取内容到精心制作的专家标注都有。这种多样性是故意为之的,目的是让研究者在真实的、充满变数的环境中测试各种数据处理策略。
研究团队还特别对整个数据池做了“防作弊”处理——通过图像相似度检索和文本哈希比对,将训练数据中与52个评测基准有重叠的内容全部剔除,以确保实验结论的可靠性。
DCVLM这个基准框架的核心逻辑,其实和一个控制变量实验一模一样。研究团队固定了AI模型的结构和训练方法——他们采用了一种仿照InternVL3设计的模型架构,由一个视觉编码器(负责“看图”)、一个小型连接模块,以及Qwen2.5系列的语言模型(负责“说话”)组合而成,三个部分在训练过程中全部同步更新。锅灶定好了,就专心研究食材配方。
为了让不同资源条件的研究者都能参与,研究团队定义了四个规模级别,就像餐厅的四种套餐档次:
四个规模之间的算力差距大约是8倍递增,构成了一个系统的“缩放阶梯”。每个规模对应的候选数据池大小都是训练预算的30倍,这个设定是为了保证即使做最激进的筛选,数据重复率也不会过高。
评测体系同样经过精心设计。研究团队从65个候选基准中,通过两轮筛选得到最终的评测集:第一轮剔除那些在不同规模下不能稳定改善的基准(比如随机性太高的),第二轮剔除种子敏感性过高的基准(比如POPE,三次运行的标准差高达16%,不具有参考价值)。最终,52个基准构成扩展评测集,其中33个核心基准用于主要实验对比,13个基准构成快速验证集。这33个核心基准覆盖通用理解、知识问答、OCR与图表、视觉感知、多语言、纯文本理解六大类,确保对模型能力的全面衡量。
研究团队做的第一件事,就是检验一个在AI圈子里几乎被当作常识的做法:**通过质量筛选来提升数据质量**。这就好比在做菜前把食材里的坏叶子挑掉——直觉上当然合理。
他们测试了超过60种筛选配置,涵盖三大类主流方法。第一类是CLIP分数筛选,用图文匹配模型给每个图文对打分,只保留高分样本;第二类是文字质量分类器,包括DCLM的FastText分类器、英伟达的Nemotron和Mixtral教育质量评分器;第三类是多模态综合质量评估工具,包括UniFilter模型(分别基于Qwen2.5-1.5B和Qwen3-0.6B)以及基于困惑度的方法(文字困惑度、多模态困惑度,以及衡量图片对文字理解贡献的条件互信息)。
为了区分“筛选本身的效果”和“筛选改变了数据比例的效果”,研究团队设计了两种筛选方式:**局部筛选**(在每个子数据集内部按比例筛选,保持整体数据比例不变)和**全局筛选**(在全部数据中统一设定阈值,不同来源的数据被筛去的比例各不相同,实际上改变了数据构成)。
结果令人意外。在中等规模(20亿参数、250亿词元)的实验中,几乎没有任何筛选方法能在局部筛选条件下显著超过“不筛选”的基线,多数方法反而让性能下降,下降幅度最高达到3.3个百分点。表现最好的是SigLIP-2全局筛选,提升了0.8个百分点——但这点提升在研究团队看来远低于人们对质量筛选的期望。在最小规模的实验中,情况类似,甚至有方法让性能下降了11个百分点。
为什么会这样?研究团队给出了一个很有说服力的解释:与DCLM等直接在原始网络爬取数据上做筛选的研究不同,DCVLM数据池里的160个数据集,大多数已经经过了各自原始来源的“上游筛选”——比如DataComp-1B本身就已经过CLIP分数过滤,不少指令微调数据集更是经过人工精心构建。在这种“原料本身已经过初步加工”的情况下,再额外筛选的边际收益极低,就像一块已经洗干净切好的食材,你再反复冲洗也不会让菜更好吃。
研究团队用一个对照实验验证了这个假设:他们将原始数据池替换为含有不同比例“原始未筛选数据”的版本。当原始数据占比25%时,额外筛选能带来2.4个百分点的提升;当占比降至完全使用已筛选数据时,额外筛选的收益只剩0.6个百分点。这条递减曲线清晰地说明:筛选有用,但只对“原料不干净”的情况有用,对已经经过加工的现代数据集效果递减。
既然筛选作用有限,研究团队把注意力转向了另一个维度:**数据混合比例**。这个问题可以用烹饪来类比:同样是做一道杂粮饭,大米、小米、玉米各放多少,决定了最终口感,而不是你把这些粮食洗了几遍。
研究团队沿着一个核心轴线设计实验:在固定多模态文档占5%、纯文字数据占15%的前提下,调整图文配对数据和指令微调数据的比例。他们设定了三种典型配方:
然后用3种模型规模(10亿、20亿、40亿参数)× 3个训练量(62.5亿、125亿、250亿词元)构成一个9格的实验矩阵,系统观察不同配方在不同规模下的表现。
结果呈现出一个戏剧性的交叉模式。在最小规模(10亿参数、62.5亿词元)下,“指令为主”配方是三种配方中最差的;但随着模型变大、训练量增加,“指令为主”的性能增长斜率明显更陡。到了中等规模(20亿参数、250亿词元),“指令为主”已经超越其他两种配方;在大规模(40亿参数、250亿词元)下,同样是“指令为主”稳居第一。
这个交叉现象揭示了一个容易被忽视的陷阱:如果只在小规模上做实验来决定数据配方,选出的最优配方到了大规模可能反而是最差的。研究团队明确指出,这种规模依赖性意味着数据配方研究不能只在一个规模上做,必须沿着“缩放阶梯”验证多个规模点,才能得出可靠结论。
研究团队还检验了一个实际操作层面的担忧:指令微调数据集通常比图文配对数据集小得多,70%的占比意味着这些数据会被反复重复使用,而数据重复过多会导致模型“死记硬背”,性能下降。实验表明,重复2倍时性能从51.7%降至50.2%,重复4倍降至49.8%,重复8倍才降至48.6%。关键发现是:重复2倍的“指令为主”配方(50.2%)和使用全新数据的“图文为主”配方(50.3%)性能几乎持平——换句话说,好的配方带来的好处,足以抵消适度重复带来的坏处。
在把实验结论推到更大规模之前,研究团队做了两组控制实验来验证结论的普遍性。
第一组测试的问题是:预训练阶段的数据配方,在经过监督微调(SFT,即后续用专门的对话数据进一步调整模型行为)之后,优劣顺序还会保持吗?这是一个很合理的担心,毕竟微调阶段也会用到指令数据,可能会“覆盖”预训练阶段数据的影响。研究团队把此前27个预训练模型(3种配方×3种规模×3个训练量)全部用LLaVA-665K数据集进行微调,又用Mammoth-VL-12M做了一次相同实验,总共54次微调运行。结果非常清晰:预训练性能和微调后性能之间的皮尔逊相关系数达到0.99,近乎完美的线性关系,排名顺序完全保持不变。这证明,研究团队在预训练阶段得出的数据配方结论,在经过微调后依然成立。
第二组测试的问题是:结论是否依赖于特定的语言模型?研究团队默认使用的是Qwen2.5-Base系列(基础版,未经指令微调),他们将2B规模的完整实验(3种配方×3个训练量)重做了一遍,改用Qwen2.5-Instruct(已经过语言层面指令微调的版本)。结果显示皮尔逊相关系数为0.97,配方排名几乎相同,尤其在较大训练量下两种初始化的差异可以忽略不计。这说明研究结论对语言模型的初始化版本不敏感。
基于上述发现,研究团队将最优配方——10%图文配对、5%多模态文档、15%纯文字、70%指令微调——应用到四个规模上,创建了**DCVLM-Baseline**数据集,并系统对比了当前公开的最优VLM训练数据集。
对比对象包括三个:LLaVA-OneVision-1.5的预训练数据(共8500万样本)、NVIDIA的Nemotron-VL-2公开数据,以及迄今为止规模最大的开源VLM预训练数据整合项目FineVision。参照点还包括InternVL系列的开源权重模型(InternVL-2.5、InternVL-3、InternVL-3.5),这些模型使用了非公开的私有数据集,作为上界参考。
在33个核心基准的平均分上,DCVLM-Baseline在每个规模上都超越了FineVision:小规模超出0.3个百分点,中等规模超出1.1个百分点,大规模超出4.7个百分点,最大规模超出5.4个百分点——而且提升幅度随规模递增,这与“指令为主配方在大规模下优势更明显”的发现完全吻合。
最引人注目的一个数据点是:用DCVLM-Baseline训练的40亿参数模型(训练1000亿词元,即large规模),在核心基准上的得分为58.9%,超过了用FineVision训练的80亿参数模型训练2000亿词元后的得分58.2%。这意味着用正确的数据配方,可以用少4倍算力(模型小一半、训练量也少一半)达到同等甚至更好的性能。在各能力维度上,DCVLM-Baseline在通用理解(最大规模73.0% vs 63.5%)、视觉感知(63.5% vs 49.6%)、多语言(56.0% vs 48.4%)等方面优势明显;FineVision则在OCR与图表(57.5% vs 53.4%)和推理(44.4% vs 39.5%)上保持领先,这被研究团队归因于FineVision中包含更多高分辨率文档类数据。
在安全性上,DCVLM-Baseline表现较弱(安全基准比FineVision低近20个百分点),这是研究团队在局限性部分坦诚承认的问题,留待后续工作改善。
研究团队还做了一系列“不太有效的干预”的附加实验,以完整记录哪些路走不通。在训练数据的采样温度上,默认的长度比例采样(等比例按数据集大小采样)已经接近最优,无论是向“大数据集主导”还是“均匀采样”调整都会降低性能。对DataComp-1B的图片重新配上AI生成的精细描述(合成重标注),在已有高质量指令数据的前提下收益极低,原始图文对已经足够。在在线筛选的工程实现上,研究团队展示了一个重要的基础设施成果:通过预计算筛选分数、在线动态过滤的方式,即使拒绝90%的样本,训练吞吐量只下降3.5%以内;同时运行3个筛选器,额外开销也只有10%。这解决了DataComp和DCLM等先前工作中“不得不离线预处理、重新打包数据”的工程痛点。
说到底,这项研究给出了一个既出人意料又合乎情理的答案:**当你手里的原料已经不差了,问题不在于怎么洗菜,而在于怎么搭配。** 160个数据集、超过1000次实验、跨越四个规模档次的系统测试,最终指向了同一个结论:在现代VLM训练中,数据配方(尤其是指令数据的比例)是最有力的旋钮,而质量筛选在原料已经过基础处理的今天,收效正在递减。
这对普通人意味着什么?每次用AI回答一张图片里“这个公式是什么意思”、“帮我看看这张合同有没有问题”、“这道菜的食材是什么”,背后都是这类研究在推动AI变得更聪明、更可靠。更重要的是,研究团队把所有实验用的数据池、评测工具、模型检查点都开源发布,这意味着任何研究者都可以在同一个平台上验证和挑战这些结论,推动整个领域向更透明、更可重复的方向发展。
你或许会想:如果指令数据这么重要,那直接用全部指令数据不就行了?研究团队的实验表明,极端化并不奏效,图文配对和多模态文档依然扮演着不可缺少的基础角色,只是它们的最优比例比过去大多数模型使用的要低得多。如何进一步优化这个配方、如何将海量的原始多模态文档转化为高质量的指令数据、如何在更大规模(万亿词元量级)上验证这些结论,都是研究团队明确指出的值得继续探索的方向。有兴趣深入了解的读者,可以直接通过arXiv编号2606.28551检索到完整论文。
Q1:DCVLM数据池里的数据筛选实验为什么发现筛选几乎没用?
A:因为DCVLM数据池里的160个数据集大多已经经过原始来源的“上游筛选”,比如CLIP分数过滤或人工审核。在原料本身已经相对干净的情况下,再额外筛选的提升空间极小,实验中最好的筛选方案也只带来0.8个百分点的提升,多数方法反而让性能下降。只有当数据池里有大量原始未筛选数据时,额外筛选才能带来显著收益。
Q2:DCVLM-Baseline用的“指令为主”配方里70%指令数据会不会导致数据重复太多?
A:会有一定重复,但影响可控。实验表明,重复2倍时核心基准均分从51.7%降到50.2%,重复4倍降至49.8%。关键发现是:重复2倍的“指令为主”配方(50.2%)和用全新数据的“图文为主”配方(50.3%)性能几乎相同。好的配方带来的收益足以抵消适度重复的损失,到重复约8倍时性能才出现明显下滑。
Q3:为什么DCVLM-Baseline的OCR和推理能力比FineVision弱?
A:研究团队认为这与FineVision数据集中包含更多高分辨率扫描文档和PDF来源的数据有关,这类数据对模型识别密集排版文字、理解数学公式和表格结构有直接帮助。DCVLM-Baseline在这两个维度分别落后约5个和5个百分点,是该研究明确指出的局限性之一,也是后续改进的方向。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9