当前位置:

首页 > 硬件相关 > 当AI视觉系统"眼中只有背景"时,工程师们是怎么解决这个麻烦的?

当AI视觉系统"眼中只有背景"时,工程师们是怎么解决这个麻烦的?

提出REBASE框架,通过从参考图背景提取“噪音指纹”并消除,解决视觉AI系统受背景污染导致识别偏差的问题。无需重新训练模型,结合相似度加权最远点采样与稠密掩码先验驱动SAM分割,在医学图像上显著提升精度,自然图像与精细部件分割亦表现优异。

先说一个核心判断:现代视觉AI系统正面临一个极其现实的困境——当你想让它识别一张新图片里的目标时,它根本不知道“新”意味着什么。传统做法是,每遇到一个新类别,就得重新训练一次模型。这就像你每次遇到一种新蔬菜,都要从头上一遍烹饪课,费时、费钱不说,还得等着训练完成才能上线。在医院里突然出现一种罕见结构需要检测,或者工厂里新来了一种零件需要识别,这种“等待重新训练”的机制,确实太笨拙了。

CamCom Technologies的研究团队为此提出了一个名为REBASE的框架,全称是“Reference-Background Subspace Elimination”,直译就是“参考图背景子空间消除”。这个框架的核心思路很直接:只需给它一张标注过的参考图片,它就能在新的查询图片里找到同类目标,整个过程完全不需要重新训练模型,也不需要更新任何参数。更关键的是,它解决了一个此前被研究者们普遍忽视的根本性问题——“背景污染”。

一、当AI的眼睛被背景“迷惑”

我们可以用个非常直观的方式来理解REBASE要解决什么问题。设想你是一个从未见过猫的外星人,正在学习识别猫。你的老师给你看了一张参考图:一只猫坐在沙发上。然后你被要求在一张新图里找到同类的动物。问题是,新图里也有沙发。你的大脑会不会因为看到沙发就觉得“这附近肯定有猫”?对于当前大多数AI视觉系统来说,答案是肯定的——它们会被共同的背景元素误导。

这种现象在专业上叫“背景相关性污染”。猫经常和沙发一起出现,所以模型学到的“猫的特征”里,实际上混进了大量沙发的特征。当它去新图片里找猫时,沙发区域会获得虚高的匹配分数,让系统以为那里也藏着目标。对于医学图像来说,这个问题更严重:所有胸部X光片都有相似的背景结构,所有皮肤镜图像都有相似的皮肤纹理。这些共同的“场景上下文”方向会系统性地抬高非目标区域的相似度,让AI的判断产生系统性偏差。

现有的主流方法,比如PerSAM、Matcher、GF-SAM,以及基于层次聚类的INSID3,尽管设计思路各有不同,但都绕不开这个共同的短板:它们的表现上限被跨图像相似度图的质量所限制。只要这张相似度图是“被污染”的,后续的一切操作都是在错误的基础上修修补补。

REBASE的出发点就是:与其在污染之后想办法补救,不如在一开始就把污染源头消除掉。

二、从背景里提炼“噪音指纹”

理解REBASE的工作原理,可以借用一个音频处理的比喻。录音师在录制人声时,会先在完全安静的环境下录一段“底噪”,然后用专业软件把这段底噪的“声纹”从整个录音里减掉,这样人声就变得干净了。REBASE做的事情本质上是一样的:先从参考图的背景区域里提炼出“背景噪音的指纹”,然后把这个指纹从参考图和查询图的特征里同时消除掉。

具体来说,整个流程是这样运作的。首先,研究团队使用一个叫做DINOv2的预训练视觉特征提取器,对参考图和查询图分别进行处理。DINOv2是一种自监督训练的视觉变换器,它能够把图像中每一个小区域(称为“图像块”或patch)转换成一个高维的数字向量,这个向量捕捉了该区域的视觉语义信息。

接着,系统识别出参考图中属于背景的那些图像块。参考图有一个二值化的标注掩码(前景是白色,背景是黑色),背景图像块就是那些掩码覆盖度低于某个阈值的区域。把这些背景图像块的特征向量堆叠成一个矩阵,然后对这个矩阵做“奇异值分解”——这是线性代数中的一种经典操作,可以理解为把这个矩阵分解成若干个“主方向”,这些主方向按重要性排列,前几个方向代表了背景特征中最主要的变化模式。

只取前几个最重要的主方向,组成一个“背景子空间基底”,记为B。然后构造一个投影算符,它的作用是把任何向量里平行于B的分量彻底清除掉,只保留垂直于B的分量。用数学语言表达就是:新特征 = 原特征 × (单位矩阵 - B × B的转置)。把这个操作同时应用到参考图和查询图的所有图像块特征上,就完成了“背景子空间消除”。

这里有一个关键的设计决策值得细说:背景子空间是从当前这一对图像(也就是当前这个“episode”)的参考图背景里实时估计的,而不是事先从一大堆图像里统计好的。这意味着,对于每一次新的分割任务,系统都会根据眼前这张参考图的具体背景来定制消除策略。如果今天参考图的背景是草地,就消除草地方向的特征干扰;如果明天参考图的背景是医疗设备,就消除医疗设备方向的干扰。这种“按需定制”的策略,比事先固定一个通用噪音模板要精准得多。

还有一个超参数需要确定:到底保留多少个背景主方向来构成子空间基底?研究团队提出了一种自适应方案:基底的秩(也就是保留的主方向数量)与参考图中背景图像块的数量成正比,比例系数r = 0.005。这意味着背景区域越大,消除的维度就越多,反之则越少,让方法能够自适应地处理不同构图的图像。

从实验结果来看,这个设计非常稳健。研究团队在FSS-1000和PASCAL-Part两个数据集上系统地测试了不同r值的影响,发现在极低秩的范围内(r从0.005到0.01),性能几乎不变,变化幅度在0.7个百分点以内。随着r继续增大,性能逐渐下降,当r超过0.5时下降尤为明显——这说明保留太多背景方向会开始把目标物体自己的特征也消掉。r = 0.005在所有测试数据集上都接近最优,体现了这个参数跨数据集的良好泛化性。

三、从“相似度地图”到精准提示

背景噪音被清除之后,系统会计算一张更干净的相似度图。具体方法是:把参考图中所有前景区域的图像块特征,按照各自在标注掩码中的覆盖面积做加权平均,得到一个前景原型。然后计算查询图中每个图像块与这个前景原型的余弦相似度,就得到了一张覆盖整个查询图的相似度图——颜色越“热”(越亮)的地方,越有可能是目标物体所在的位置。

这张相似度图随后需要被转化为能驱动SAM(Segment Anything Model,一个通用分割网络)工作的提示信号。SAM是由Meta AI开发的通用图像分割模型,它接受点、框或粗略掩码作为输入,然后输出高质量的精细分割结果。它不理解语义,但它的“手”非常稳、非常精准——只要给它指对地方。

如何从相似度图里选出“指点”的位置,是一个颇有技巧的问题。最朴素的做法是取相似度最高的那个点作为正提示。PerSAM就是这么做的,再加上相似度最低的点作为负提示。这种方法对于简单、紧凑的目标勉强够用,但对于细长的、关节化的或者精细的部件目标来说远远不够——SAM收到一个点之后,只能“猜”这个点附近的整个物体是什么形状,一个点提供的空间信息太少了。

另一种容易想到的改进是取前K个相似度最高的点作为多个正提示。但这个方法有一个致命的问题:相似度最高的那些点往往扎堆在同一个高响应区域里,K个点全部挤在一起,等于还是只提供了一个位置的信息,覆盖面积没有任何改善。

研究团队提出的解决方案叫做“相似度加权最远点采样”(SW-FPS)。这个名字听起来复杂,但思路非常直观:在选点时,同时考虑两件事——这个点的相似度有多高(要尽量选相似度大的点),以及这个点距离已经选过的点有多远(要尽量让点分散开来)。具体来说,第一个点选相似度全局最高的那个;从第二个点开始,每次都选一个综合得分最高的点,综合得分是“归一化相似度”和“到最近已选点的归一化距离”的加权和,权重系数α控制二者的平衡,α = 0时退化为纯粹的Top-K选法,α = 1时退化为纯粹的最远点采样,α = 0.5在两者之间取得平衡。整个系统固定使用K = 8个正提示点,α = 0.5,在所有数据集上保持一致。

除了点提示,研究团队还充分利用了SAM的另一个输入接口:掩码提示通道。SAM有一个辅助输入端口,可以接受一张低分辨率的逻辑图(logit map)作为稠密的空间先验。然而,此前几乎所有训练无关的方法都完全忽略了这个接口,只依赖点提示来驱动SAM。研究团队认为这是一种信息浪费,于是把清洁后的相似度图直接注入这个接口。注入之前,相似度图先做标准化(均值为零、方差为一),再以图像均值为阈值区分前景和背景,前景区域保留相似度值,背景区域统一赋值为-2(一个代表“这里是背景”的常数),最后再做3×3的椭圆形态学腐蚀来去除边缘上的细小噪点,然后双线性插值到SAM要求的256×256输入尺寸。这样,SAM在收到离散点提示的同时,还接收到了一张粗粒度的“热力图”,相当于同时给了它“哪几个点是目标”和“目标大致在哪个区域”两种信息,分割精度自然更高。

四、实验数据说明了什么

研究团队在五个风格迥异的基准数据集上对REBASE进行了全面评估,覆盖了自然图像分割、精细部件分割和医学图像分割三类场景。FSS-1000包含1000个细粒度物体类别,用标准的240类测试集评估。PASCAL-Part包含15个类别的56种物体部件。PACO-Part包含75个类别的303种物体部件。ISIC 2018是皮肤病变分割数据集。胸部X光肺部数据集用于肺部分割。所有结果都以mIoU(平均交并比,越高越好)报告。

在医学图像领域,REBASE取得了最为显著的提升。在ISIC皮肤病变数据集上,它达到了63.8%的mIoU,比此前最好的训练无关方法INSID3高出9.4个百分点,比GF-SAM高出15.1个百分点,甚至超过了需要训练的SegIC和DiffewS等方法。在胸部X光数据集上,REBASE达到了86.3%的mIoU,比INSID3高出7.5个百分点,仅比需要完整训练的SegGPT低1.2个百分点。这两项医学图像上的大幅提升,与REBASE的设计逻辑高度吻合:医学图像里的背景极其结构化——皮肤镜图片的背景几乎都是均匀的皮肤纹理,X光片的背景几乎都是相同的放射学底色。这类高度一致的背景,恰恰是背景子空间消除最能发挥威力的场景。

在通用自然图像数据集FSS-1000上,REBASE达到88.2%,比GF-SAM高0.2个百分点,比INSID3高4.5个百分点,并且超越了SegGPT(85.6%)和SegIC(86.8%)这两个需要训练的方法——这对于一个完全不需要训练的系统来说相当难得。

在精细部件分割领域,REBASE在PACO-Part上达到39.3%,比INSID3高0.6个百分点,比GF-SAM高3.0个百分点。在PASCAL-Part上,REBASE达到46.6%,排名第二,与第一名INSID3的50.5%存在3.9个百分点的差距。研究团队分析,这个差距可能部分来自于INSID3使用了更新版本的DINOv3-L特征提取器,而REBASE主要使用的是DINOv2-L。

消融实验清晰地揭示了每个模块的独立贡献。从最基础的“只取相似度最高点作为提示”的基线出发,仅仅替换为SW-FPS多点采样,在PACO-Part上提升3.69个百分点,在ISIC上提升9.07个百分点。在此基础上加入稠密掩码先验,在PACO-Part上再提升1.64个百分点,在ISIC上再提升12.37个百分点。最后加入背景子空间消除(REBASE核心模块),在PACO-Part上再提升4.41个百分点,在ISIC上再提升3.93个百分点。每个模块都有实质性贡献,且模块之间存在协同效应。

研究团队还测试了背景子空间消除是否应该同时应用于参考图和查询图(对称)还是只应用于参考图(非对称)。结果显示,对称应用略优于非对称应用,在ISIC上分别为63.77%对63.73%,在PASCAL-Part上分别为46.64%对46.40%。差距很小,但一致,因此采用对称方式作为默认设置。

五、换个零件还好用吗——对不同模型组件的兼容性测试

一个方法如果只在某一种特定的模型组合下有效,它的实用性就要大打折扣。研究团队专门测试了REBASE在不同组件下的表现,结果相当令人放心。

当把DINOv2-L换成更新的DINOv3-L时,REBASE在七个数据集中的六个上依然带来正向提升。X光数据集上提升幅度最大,达到19.70个百分点;LVIS-92i(一个更复杂的语义分割数据集)提升8.20个百分点;COCO-20i提升7.10个百分点;PASCAL-Part提升6.35个百分点;PACO-Part提升4.33个百分点;ISIC提升1.34个百分点。唯一的例外是FSS-1000,DINOv3-L的基线已经达到89.52%,几乎没有提升空间,REBASE带来的变化为-0.27个百分点,可以视为统计噪声。

当把SAM ViT-H换成SAM 2时,REBASE在COCO-20i、PASCAL-Part和ISIC三个数据集上分别带来6.25、5.82和3.22个百分点的提升,与使用原版SAM的结果非常接近,说明方法对SAM的迭代升级具有良好的适应性。换成SAM 3之后,提升幅度缩小到1.09、1.18和0.21个百分点,整体基线性能也偏低。研究团队认为这是因为SAM 3的设计主要针对自然语言和概念提示,与稀疏点提示和稠密先验的交互模式不够匹配,这是未来可以继续探索的方向。

研究团队还考察了REBASE与INSID3的位置偏差消除(positional debiasing)之间的关系。INSID3通过从一张合成噪声图像里估计全局的位置特征方向,并将其从DINOv3特征里消除,来改善分割性能。REBASE则是从每张参考图的背景里估计语义噪声方向。两者都是正交投影,但消除的对象不同。

实验结果显示,在INSID3的推理框架内,用REBASE替换位置去偏操作,在PASCAL-Part和COCO-20i等自然图像数据集上会造成明显性能下降,降幅分别为13.19和5.94个百分点。这说明REBASE不是位置去偏的替代品——在这些场景下,位置偏差是更主要的干扰源。当把REBASE叠加在位置去偏之后使用时,在自然图像数据集上几乎没有额外收益,但在ISIC医学图像数据集上提升了1.66个百分点,且叠加优于仅用REBASE替换(1.24个百分点的差距)。由此可见,对于医学图像,参考图特定的背景偏差和全局位置偏差是两种相互补充的独立噪声来源,同时消除两者才能获得最佳效果;而对于自然图像,两种方法消除的方向高度重叠,叠加收益有限。

六、计算开销:281毫秒一张图,值不值

在单张NVIDIA A100 GPU上,整个REBASE流水线处理一对参考-查询图像的总时间约为281毫秒。其中,DINOv2-L对两张图的特征提取合计37.6毫秒;SVD计算和特征投影(也就是REBASE的核心操作)耗时84.5毫秒;相似度图计算和SW-FPS采样耗时16.3毫秒;SAM ViT-H的图像编码耗时135.9毫秒;SAM的掩码解码耗时6.6毫秒。可以看出,REBASE本身(SVD和投影)占总时间约30%,是流水线中第二大耗时步骤,主要代价在于奇异值分解。整体而言,对于一个不需要训练、能够处理任意新类别的系统来说,每张图不到300毫秒的推理时间是完全可以接受的工业级指标。

说到底,REBASE做的事情用一句话可以概括:在让AI“看”新图之前,先教它“忽略”两张图共有的背景干扰。这个思路听起来朴素,但从实验结果来看,它对提升跨图像语义匹配质量有着实实在在的效果,尤其在背景结构高度一致的医学图像领域,提升幅度尤为突出。对于希望将AI视觉能力快速部署到新领域(比如特定产品检测、新型医学结构标注)而不想承受大量训练开销的团队来说,这套框架提供了一个值得认真考虑的技术路径。当然,在PASCAL-Part等精细部件分割数据集上与INSID3(使用DINOv3-L)之间仍有差距,背景子空间消除对于短促、细密的目标边界的效果也仍有提升空间。随着DINOv3等更强大特征提取器的成熟,以及更精细的提示策略的演进,训练无关分割方法的天花板可能还远没到。

Q&A

Q1:REBASE和INSID3的背景去偏方法有什么本质区别?

A:INSID3的位置去偏是从一张合成噪声图估计全局的位置特征方向,提前固定好,对所有图像用同一个偏差方向来消除。REBASE则是在每一次分割任务中,实时从当前参考图的背景区域估计该场景特有的语义噪声方向,针对每对参考-查询图像定制消除策略。前者消除的是空间位置偏差,后者消除的是场景语义背景偏差,两者方向不同,在医学图像场景里叠加使用效果更好。

Q2:REBASE为什么在医学图像上提升特别大?

A:因为医学图像(如皮肤镜、X光)的背景极度结构化,不同图片之间的背景几乎一模一样。这种高度一致的背景正好形成了一个低秩的特征子空间,非常适合用SVD来捕捉并消除。消除之后,目标区域(病变、肺部)和背景区域的特征区分度大幅提升,相似度图更干净,SAM收到的提示质量也随之提高。

Q3:SW-FPS相比直接取Top-K点提示有什么优势?

A:直接取Top-K点时,相似度最高的K个点往往全都集中在同一个高响应区域,覆盖面积非常有限,SAM只能从一个局部区域推断整个目标形状。SW-FPS在选点时同时考虑相似度大小和与已选点的空间距离,让K个点均匀散布在目标区域的不同部位,SAM因此能获得目标多个位置的空间信息,对于细长、关节化或精细部件目标的分割效果明显更好。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。