商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > ICML26 重磅成果!清华 UDS 智能筛选训练样本,大模型微调算力直接减半

ICML26 重磅成果!清华 UDS 智能筛选训练样本,大模型微调算力直接减半

  发布于2026-08-22 阅读(0)

扫一扫,手机访问

大模型监督微调SFT,过去一直被当作一个“数据越多越好”的活儿。但如果你真的在一线跑过训练,就会知道这个直觉有多离谱。2026年的产业数据很清楚:国内大模型训练的整体算力有效利用率,连五成都不到。大量GPU资源,其实都消耗在那些重复、低信息量、甚至带偏见的冗余样本上。

从根子上讲,全量样本训练不仅直接推高了GPU采购和云算力租赁的成本,更麻烦的是,它容易把模型喂出过拟合,甚至放大认知偏差。金融、医疗、工业这些垂直领域,企业做定制化微调,动不动就是几十万条标注数据,时间和资金成本高得吓人。算力浪费,已经成了制约中小AI企业迭代模型的核心瓶颈。

业内其实早就意识到智能筛选样本的价值,也出现过MaxLoss、MaxGrad、GREATS这类在线批次选择方案。但问题在于,这些方案各有各的硬伤。多数方法只盯着样本的“训练难度”,光挑损失值高的,完全忽略了样本之间、甚至样本内部的信息多样性。结果就是,筛选出来的批量样本高度同质化,训练越跑,偏差越叠加。还有些方案,需要额外引入验证集、外部参考模型,甚至要多次反向传播算梯度,额外开销比全量训练还大,根本没法在工业场景里落地。行业一直缺的,就是一个能兼顾效率、精度和轻量化的一体化筛选框架。

这次清华团队在ICML 2026上提出的UDS框架,思路确实跳出了传统套路。核心创新在于,它直接复用前向传播时生成的logits矩阵,不需要额外计算,就能同步完成两个维度的打分。一方面,用logits矩阵的核范数来算单条样本内部的重要性,量化它自己的信息丰富度和训练增益;另一方面,通过低维投影压缩样本特征,再配合缓存缓冲区,算算当前样本跟历史训练数据的距离,保证批次内的样本足够差异化。两个分数加权融合,选出最优样本。整套流程不依赖外部数据集,也不需要第三方模型,LoRA微调、全参微调、长上下文推理,都能直接适配。

工程上还有个很现实的难题:海量logits矩阵的存储。如果直接完整存下原始logits向量,千级样本就能吃掉几十GB显存,训练集群的并发规模直接受限。UDS用随机投影算法压缩特征维度,在几乎不损失样本距离判断精度的前提下,把内存开销压到了极低水平,配合FIFO内存缓存,这套设计很巧妙。

消融实验也验证了,两大核心模块缺一不可。单独靠样本效用分数或者多样性距离,只能小幅提升精度;两者结合,模型综合能力就有了跨越式增长。团队选了Llama-3.1-8B和通义千问Qwen-2.5-7B这两个主流开源基座,在MMLU通用知识、ScienceQA科学问答、GSM8K数学推理、HumanEval代码生成四个权威基准上,做了多轮对照实验。结果很直观:以国产Qwen-2.5-7B为例,用UDS筛选样本训练后,MMLU准确率达到63.34%,比此前最优方案GREATS高出5.15个百分点,ScienceQA、数学、代码评测也全面领跑。训练吞吐量显著高于全量SFT模式,相同硬件条件下,单位时间能处理更多有效样本,精度和速度实现了双向提升。

泛化能力与产业落地

这套技术的泛化能力也很强,不受训练参数规模、上下文长度、微调模式的限制。实验分别验证了8/16不同批次大小、LoRA低秩微调、全参数微调、2048超长文本推理、分布外OOD泛化测试等多种工况,UDS在所有测试条件下都稳定优于全量训练、随机采样、传统loss筛选等基线方案。对比离线样本筛选算法FisherSFT,在同等样本选取比例下,四大基准指标全面领先,这说明在线动态筛选比事前离线过滤更贴合实时训练的真实需求。

站在产业发展的视角,UDS的落地时机正好。2026年AI产业的竞争逻辑,已经从比拼硬件算力规模,转向了单位算力产出的模型效能。IDC预测,未来推理和微调的算力需求还会持续暴涨,HBM高端存储、GPU硬件成本长期维持高位,中小企业很难持续承担全量数据集训练带来的巨额开销。清华这套原生轻量化筛选框架,不需要改造底层算力硬件,仅靠算法优化就能砍掉半数算力消耗,这对垂直行业定制模型的落地门槛,是一次实打实的降低。

对于国内开源产业来说,通义千问、Llama系列已经是企业微调的主流基座,UDS可以直接无缝接入现有训练流水线,不需要重构数据处理架构。政务、制造、金融这些垂直领域的服务商,不需要再囤积大规模高端算力集群,靠少量GPU就能完成高质量模型微调,产品迭代周期大大缩短。算力资源有限的科研团队和初创AI公司,也能用更低的试错成本,推动细分场景的专用小模型快速落地,进一步激活国内AI的长尾创新活力。

综合来看,清华UDS在ICML 2026上拿出的这套方案,标志着大模型监督微调正式告别“数据堆砌”的粗放阶段。这套依托原生logits、兼顾样本效用与多样性、极低额外开销的在线筛选框架,既解决了全量训练算力浪费、模型过拟合等行业共性痛点,又适配了国内外主流开源基座和各类工业微调场景。随着技术逐步开源落地,大模型训练将迈入“精准选样本、高效练模型”的精细化时代,全行业的算力成本压力有望持续缓解,人工智能技术在千行百业的规模化落地,也更值得期待了。

本文转载于:https://www.163.com/dy/article/L0JJOG4405118HA4.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注