商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 浙江大学等机构携手开发的"万能分割学习器"究竟有多强?

浙江大学等机构携手开发的"万能分割学习器"究竟有多强?

  发布于2026-05-30 阅读(0)

扫一扫,手机访问


这项由浙江大学、华南理工大学、南京大学和北京大学联合开展的研究,发表于2026年4月,论文预印本编号为arXiv:2604.24575。

图像分割听起来或许有些专业,但它的身影早已渗透到日常生活的方方面面。当你用手机拍出背景虚化的人像,当AI系统在CT影像中勾勒出病灶轮廓,或是自动驾驶汽车精准区分道路与行人时,背后都离不开这项技术——它本质上就是教会计算机看懂图片,并准确指出“哪一块是猫,哪一块是桌子”。

然而,这个领域长期存在一个痛点:模型往往“专事专办”。为医疗影像训练的模型,拿到农田里就认不出杂草;看懂城市街景的模型,换个环境可能就失灵。打造一个真正通用的、能应对各种场景的分割系统,一直是业界努力攻克的难题。

最近,来自国内顶尖高校的联合研究团队提出了一个颇具启发性的思路:当前火热的扩散模型——也就是各类AI绘画工具的核心技术——在“学习绘画”的过程中,其实已经默默掌握了理解图像的深层能力。他们发现,这种能力可以被巧妙地“改造”成一个强大的通用分割引擎。这个新系统被命名为DiGSeg,全称是“Diffusion Models as a Generalist Segmentation Learner”。

一、扩散模型究竟是什么,为何它藏着理解图像的秘密

要理解DiGSeg的巧妙之处,得先弄明白扩散模型是怎么工作的。不妨把它想象成一位经过海量训练的“画作修复师”。训练时,研究人员会将一张清晰的图片逐步添加噪点,直到它变成一片随机雪花,然后反复让模型学习如何将这些噪点一步步去除,还原出原图。这个过程,好比把一幅名画一层层涂上白漆,再训练一位专家将白漆层层剥除,恢复画作原貌。

像Stable Diffusion这样的AI绘画工具正是如此炼成的。它们见识过互联网上无数的图像,在亿万次“破坏-重建”的练习中,其内部已经积累了关于视觉世界的丰富知识:哪些像素通常相伴出现,何种轮廓对应何种物体,颜色与纹理背后蕴含着什么语义。

过去,大家主要把这些模型当作“生成器”来创造新图像。但研究团队洞察到一个关键点:这位“画家”在学会“修复画作”的漫长过程中,其实已经把整个视觉世界的逻辑内化于“心”。这些内化的知识,就像一位精通所有食材特性的大厨,即便不做原本的招牌菜,也能轻松驾驭新的菜系——比如,完成图像分割这项任务。

二、过去的方法为何总是“差那么一点”

在DiGSeg之前,已有研究者尝试利用扩散模型做分割。当时的主流思路是“窥探”模型的注意力图。注意力图可以理解为模型在处理图像时,对不同区域的“关注”热力图。例如,当模型思考“猫”这个词时,图片中猫所在的区域就会高亮。于是人们想,直接把这些高亮区域当作分割结果不就行了?

这个想法听起来合理,但实际效果却不尽如人意。根本原因在于,这些注意力图只是扩散模型生成图像过程中的“副产品”,并非为精准分割而设计。它们往往分辨率低、边界模糊,且结果具有随机性,需要大量后期处理才能使用,好比用安全锤去雕刻精细的花纹,有力但失之精准。此外,这类方法通常局限于特定任务,泛化能力有限。

DiGSeg团队选择了一条截然不同的路径:与其“窥探”模型的中间状态,不如直接“教导”它产出明确的分割结果。

三、DiGSeg的核心思路:把画家训练成分割专家

DiGSeg的核心思想可以用一个类比来理解:假设有一位天赋极高的美术生,经过学院派训练,对图像的理解已臻化境。现在想让他转行做地图标注员,在卫星图片上划出道路和建筑。你不需要他从头学起,只需进行专项训练,引导他将脑中已有的深刻图像理解,转化为标注地图这项具体技能。DiGSeg所做的,正是这样的“技能迁移”。

整个框架由三个紧密协作的部分构成。

首先是视觉潜在通路。团队借助扩散模型自带的图像编解码器,将输入的彩色图片和对应的分割标注图,都转换成一种紧凑的“潜在表示”。这就像把一本大百科全书压缩成一张信息卡片,核心内容得以保留,但处理起来更高效。由于分割标注图通常是单通道(黑白)的,而编解码器是为三通道彩色图像设计的,团队采用了一个简单却有效的技巧:将单通道标注复制三份,“伪装”成彩色图像再输入。验证表明,这样处理后的还原误差极小,完全可行。

其次是CLIP对齐文本条件模块。CLIP是OpenAI的一项技术,能让计算机同时理解图像和文本,并建立两者间的联系。DiGSeg将CLIP的文本理解能力嫁接进来,使得模型在生成分割结果的全过程中,都有文字描述在一旁“校准语义”。其妙处在于,当你输入“请分割出道路”,系统能理解“道路”的含义,从而在图像中找到对应区域。这使得DiGSeg天然支持开放词汇分割——无需预先定义固定类别,使用时可以临时输入任何描述。

最后是经过改造的“发动机”——去噪U-Net。U-Net是扩散模型中用于从噪点还原图像的核心网络。DiGSeg对其进行了精心的微调训练:在训练时,系统先向分割标注的潜在表示中加入随机噪点,然后让U-Net在原始图像信息和文本描述的共同指导下,一步步将噪点还原为正确的分割标注。这个训练目标直接指向“输出分割图”,而非“生成逼真图像”,因此模型学到的是如何产生高质量的分割掩模。

值得注意的是,训练时团队冻结了模型绝大部分参数,仅调整U-Net中的交叉注意力层(负责融合视觉与文本信息)和一个小的投影层。这样做最大程度地保留了模型从海量图像中学到的通用视觉知识,只在此基础上叠加了分割能力。

四、推理阶段:从随机噪点到精准分割图的完整旅程

系统训练完成后,实际使用流程如下:给定一张待分割图片,系统先将其编码为潜在表示,并生成一团随机噪点作为起点。随后,去噪U-Net在图像和文本信息的双重引导下,逐步将这团噪点“雕刻”成分割标注的潜在表示,最终由解码器还原成像素级的分割图。

这里有一个提升效率的关键细节。团队发现,传统的DDIM加速采样方法在步骤安排上存在训练与推理的不匹配问题。他们采用了“尾随时间步”策略,使两者对齐。这一改动带来了显著的效率提升——仅需一步去噪就能得到相当不错的结果,这对于通常需要几十甚至上百步的扩散模型而言,相当惊人。

此外,团队引入了“测试时集成”技巧:用不同的随机噪点种子对同一张图片进行多次推理,然后在潜在空间对结果取平均,再解码输出。这好比多位评委打分后取平均,结果更为稳定。测试表明,集成8次的效果明显优于单次,超过10次后收益递减。

在开放词汇场景下,系统还有一套额外的“候选词筛选”流程。对于新图片,系统先用CLIP扫描预设的类别词汇表,找出相关度高的候选类别。为避免遗漏小目标,图片还会被切分成小块单独评估。确定候选类别后,系统对每个类别分别进行分割推理,得到每个类别的概率图,最终在每个像素位置选取概率最高的类别作为归属。

五、一个小阈值的大学问:τ参数的影响

系统输出的是0到1之间的连续概率值,因此需要设定一个阈值τ(tau),高于阈值则判定属于该类别,反之则不属于。

研究发现,不同类别的最佳阈值其实不同。例如,体型大、颜色均匀的“牛”,在较高阈值(约0.76)时表现最好;而形状细长的“瓶子”,则在较低阈值(约0.66)时效果更佳。阈值过低,小物体区域容易过度膨胀;阈值过高,又会损失边界细节。

为了保持系统的简洁与通用性,团队并未为每个类别单独调参(那会引入复杂性),而是选择了一个在各类任务上综合表现良好的固定值:τ=0.7。在语义分割、开放词汇分割等多种下游任务中,这个单一阈值都展现了稳定的性能。

六、一套特别的噪点配方:多分辨率退火噪点

训练中使用的噪点看似微不足道,实则大有讲究。团队提出了“多分辨率退火噪点”策略。

普通训练噪点是均匀的随机干扰,如同向画布均匀撒上细沙。而多分辨率噪点则是混合了不同颗粒的“沙子”——既有细密的高频扰动,也有成片的低频扰动。高频扰动帮助模型学习精细的边界细节,低频扰动则有助于保持对大范围语义区域的整体把握。

“退火”意味着这两种成分的比例随时间动态变化:在训练早期(噪点较多时),高频成分主导,迫使模型关注细节;随着去噪进行(噪点减少),低频成分比重增加,引导模型把握整体结构。这种动态调配机制使训练更稳定,产出的分割边界也更平滑、准确。

消融实验验证了这一设计的价值。使用标准高斯噪点,在COCO和ADE20K数据集上的得分分别为48.9和56.7;加入退火机制后小幅提升至49.2和57.1;使用多分辨率噪点则提升至49.7和57.6;两者结合时,取得了最佳成绩50.8和58.6。

七、用数字说话:DiGSeg在各类测试中的表现

研究团队在多个标准测试集上对DiGSeg进行了全面评估,结果颇具说服力。

在开放词汇分割的五个常用基准测试(A-847, PC-459, A-150, PC-59, Cityscapes)中,评价指标为mIoU(平均交并比,数值越高越好)。使用强大的CLIP ViT-L/14视觉基础模型时,DiGSeg在五个数据集上分别取得19.9、29.2、43.2、68.4和38.5的mIoU,均超越此前最优方法,领先幅度在0.6到2.8个百分点之间。即使使用更轻量的CLIP ViT-B/16模型,DiGSeg同样在所有测试集上领先。值得注意的是,许多对比方法针对特定测试集进行过数据或结构上的专门优化,而DiGSeg始终使用同一套通用配置。

在传统的闭集语义分割任务上,DiGSeg在COCO数据集上取得50.8的mIoU,在ADE20K上取得58.6,分别超出此前最佳结果2.1和1.3个百分点。

跨领域测试的结果同样亮眼。在遥感道路提取(DeepGlobe数据集)任务中,DiGSeg取得了65.78的道路交并比,比专为遥感设计的最优方法高出8.5个百分点。在农业图像分割(Phenobench数据集,区分作物与杂草)任务中,DiGSeg的总体mIoU达到76.66,超出次优方法约1.8个百分点。这两项成绩都是在未对网络结构做任何领域特定调整的情况下取得的,证明了其真实的通用能力。

然而,在医学图像分割(REFUGE-2眼底数据集)上,DiGSeg的表现相对平淡,IoU仅为34.5,远低于专门医学模型(最优可达79.1)。团队对此给出了坦诚的解释:CLIP模型在互联网数据上训练,其中医学影像极少,导致系统对医学专业概念的图文对齐能力很弱。这是当前方法的一个明确局限,未来需要针对医学领域进行专门适配。

八、数据省着用:少量标注下的惊人表现

团队还进行了一项极具实用价值的实验:探究在训练数据不充分时,系统的性能衰减情况。

他们在ADE20K数据集上,依次使用全量数据的1/2、1/4、1/8和1/16进行训练。结果显示,使用一半数据时,性能与使用全量数据几乎无异;即使仅用四分之一数据,结果依然相当强劲。这表明,扩散模型在预训练中积累的视觉知识是真实有效的,只需少量任务特定的标注数据,就能快速激活并迁移到分割任务上。

这种数据高效性对于标注成本高昂的领域(如医学影像)意义重大。当然,如前所述,医学领域还需解决CLIP图文对齐不足的问题,但至少从数据需求的角度看,DiGSeg的框架本身是相当“经济”的。

九、速度代价与加速技巧

作为一个基于扩散模型的系统,DiGSeg的速度确实比传统的前向传播式分割模型要慢。团队对此非常坦率,并公布了详细的性能-速度数据。

在最快配置下(单次推理、单步去噪),系统处理速度约为每秒11.27张图片,在COCO和ADE20K上的mIoU分别为48.2和56.8。常用的高质量配置(8次推理集成、每次2步去噪),速度降至每秒3.15张,但mIoU提升至50.8和58.6。如果采用完整的50步去噪、20次推理,速度会骤降至每秒0.12张,而mIoU仅微升至50.9和58.8,性价比极低。

对于大多数非实时应用场景(如批量医学影像分析、遥感处理),每秒3到11张的速度是可以接受的。并且,扩散模型加速是当前的研究热点,团队指出,未来应用知识蒸馏、一致性模型等技术,速度还有很大的提升空间。

十、跨领域迁移的选择题:训练数据的相关性比数量更重要

团队还做了一个有趣的实验,探究“用什么数据预训练的模型,迁移到新领域效果更好”。他们分别用仅COCO数据、仅ADE20K数据、以及两者混合数据训练的模型,在城市驾驶场景数据集Cityscapes和BDD100K上进行测试。

结论非常明确:仅用ADE20K训练的模型,在两个驾驶数据集上的表现(mIoU分别为41.22和37.55)全面优于仅用COCO训练(37.80, 35.76)和两者混合训练(38.74, 36.89)的版本。

原因在于,ADE20K包含了极其丰富的场景类别和细粒度标注,对室外街景的语义覆盖更全面。而混合COCO数据后,反而因为COCO的标注风格和类别分布与驾驶场景不完全匹配,带来了干扰。这个结果提示我们,在选择预训练数据时,数据与目标领域的相关性,往往比数据的绝对数量更为重要。

总结与展望

说到底,DiGSeg这项研究的核心价值,在于它对“生成模型”与“理解模型”之间那道传统界限提出了有力质疑。长期以来,业界默认这两类任务应该分开处理。但扩散模型在学习“修复图像”的过程中,已经不可避免地深度理解了图像本身,而这种理解恰恰是分割等感知任务所需要的。

DiGSeg的实践意义,不仅在于它在多项评测中取得了领先,更在于它指明了一条新路径:未来或许无需为每个视觉任务从头收集大量数据、设计专用架构。相反,可以从已具备海量视觉知识的生成模型出发,以相对低的成本迁移到各种理解任务上。这对于标注数据稀缺的专业领域(如医学、农业、遥感),意味着切实可行的降本增效方案。

当然,DiGSeg也揭示了一些待解的挑战。在医学图像上的表现短板,说明完全依赖CLIP的通用图文对齐来处理专业领域是远远不够的。此外,与传统模型相比,其速度仍是软肋,尽管已有加速手段。扩散模型本质上的概率生成特性导致的输出随机性,在要求确定性的场景下也需要额外处理。

Q&A

Q1:DiGSeg和普通图像分割模型有什么本质区别?

传统分割模型是专门为“识别并划定区域”这个任务从零开始训练的,类别固定,跨领域泛化能力通常有限。DiGSeg则是对“生成图像”的扩散模型进行改造而来,它充分利用了扩散模型在预训练中内化的大量通用视觉知识。这带来了两大优势:一是对任务专属标注数据的需求量小,二是天然支持用自然语言描述任意类别进行分割,不受训练时预设类别的限制。

Q2:DiGSeg在医学图像上效果为什么不好?

核心原因在于其文本理解模块CLIP是在互联网通用图像-文本对上训练的,其中医学影像数据极其稀少。因此,系统难以建立“视神经盘”、“肿瘤边界”等专业医学概念与对应图像区域之间的准确关联。相比之下,专门在大量医学影像上训练的分割模型,在这方面自然具备先天优势。

Q3:DiGSeg速度够快吗,能用于实时场景吗?

在最快的配置下(单次推理、单步去噪),DiGSeg的处理速度约为每秒11张图片,这对于非严格实时的批量处理场景(如遥感分析、医学筛查)是足够的。但如果追求最高精度(采用8次推理集成),速度会降至每秒约3张,难以满足自动驾驶等需要每秒数十帧处理的实时应用需求。不过,扩散模型加速技术正在快速发展,未来通过模型蒸馏等手法,其速度有望得到显著提升。

本文转载于:https://www.163.com/dy/article/KSOQS2JN0511DTVV.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注