当前位置:

首页 > 系统应用 > 卷积核越大性能越强?一文解读RepLKNet模型

卷积核越大性能越强?一文解读RepLKNet模型

在CVPR2022中,一篇专注于优化卷积核大小的分类网络论文吸引了大量的关注,这就是由清华和旷视提出的RepLKNet[1]。RepLKNet与目前流行的CNN模型背道而驰,其核心模块由31×31的大卷积核构成。在Vision Transformer (ViT) 流行的大背景下,RepLKNet以纯

在CVPR2022中,一篇专注于优化卷积核大小的分类网络论文吸引了大量的关注,这就是由清华和旷视提出的RepLKNet[1]。RepLKNet与目前流行的CNN模型背道而驰,其核心模块由31×31的大卷积核构成。在Vision Transformer (ViT) 流行的大背景下,RepLKNet以纯CNN的架构获得了超过Swin Transformer( Top-1 acc: 87.3%)的性能。今天就来深入解读下这篇被CVPR2022收录的论文,以及使用飞桨框架实现RepLKNet。

介绍

卷积神经网络曾是现代计算机视觉系统里编码器的常见选择。然而近两年,Vision Transformer在图像分类任务及其下游任务(如目标检测和语义分割等任务)中不断冲击着CNN的地位。

为什么ViTs如此强大?一些研究认为,多头自注意(MHSA)机制在ViTs中起着关键作用。一些工作认为MHSA具有CNN缺乏的获取长期依赖的能力,能够对输入的特征进行全局建模,因此单个MHSA层的每个输出都能够获取全局信息。但是CNN中,除了第一层外很少会采用较大的卷积核,一般都是通过多个小卷积核叠加来增加感受野,只有一些比较老的网络和采用神经网络搜索搜索出来的网络结构会使用较大的卷积核(大于5x5)。

那么问题来了:如果使用大卷积核而不是小卷积核会怎么样呢?在这个问题的基础上,作者系统地研究了CNN的大卷积核设计方式。遵循了一个非常简单的理论:只需将具有从3×3到31×31不等大小的大卷积核的深度可分离卷积(DepthWise convolution) 引入到CNN模型中即可。

作者通过一系列实验,总结了五条有效使用大卷积核的经验准则。

大的卷积核也可以很有效的进行计算

大卷积核首先带来的问题就是大量的参数和浮点运算量,大多数现有的深度学习框架对大卷积核的支持很差,无法有效率地进行卷积运算。为了解决参数量和浮点运算量的问题,作者运用了深度可分离卷积。

深度可分离卷积分为DepthWise(DW) convolution、PointWise(PW) convolution两部分。DepthWise(DW) convolution是输入通道和输出通道以及分组数都相同的卷积形式,与传统的卷积不同的是,DW卷积的每一个卷积核只计算对应的一张特征图,参数量和计算量是原来的1/n(n为输入通道数)。虽然DW卷积能够减少大量的参数,但会减少不同层特征像素点之间的信息交互,最终会带来精度上的损失。PointWise(PW) convolution是输出为n通道的1×1卷积,用来尽量弥补DW卷积缺少的特征交互过程,PW实际上对所有的特征图进行了点对点的乘加运算,尽量地结合不同特征图的信息。

残差结构对于大卷积核模型至关重要

大卷积核需要依靠残差连接。作者使用MobileNetV2作为基线网络进行实验。将基线网络中深度可分离卷积的3×3大小的卷积核替换为13×13大小的卷积核,重新训练后分类准确率增加了0.77%。但是在去掉模型中的残差结构后,准确率只有53.98%。可以得出结论:残差结构对大卷积核的收益远大于小卷积核,因此在具有大卷积核的模型中,残差结构至关重要。

使用小卷积核重参数化来补优化问题

如下表所示,用9×9和13×13的卷积核代替MobileNet V2中的3×3卷积核后效果下降,于是使用小卷积核进行重参数化,模型性能有了显著的提高(13好于9)。

大卷积核在下游任务中表现更加优秀

重参数化后的mIoU提升幅度大于分类的幅度,这可以总结为以下的几点:

  • 像分割这种需要精细化像素级切割的任务,感受野越大越好,大卷积核可以带来更大的感受野。

  • 大的卷积核可以提取到更加深层的语义信息,这有助于确定目标的位置,所以在像素级分割的任务上表现会更好。

大卷积核在小特征图上依然效果显著

在MobileNetV2的模型中,将224×224尺寸的图像作为输入,MobileNetV2中由bottleneck组成的stage层会对图像进行特征提取以及尺寸缩减,最后一个stage层输入的是7×7尺寸的特征,再对这个特征进行卷积、池化、分类的操作就可以得到分类结果。 作者将MobileNetV2结构中最后一个stage层的卷积核变为7×7和13×13的大小。结果如下表所示,发现对比原模型,修改后的模型效果依然有明显的增加。这说明了大卷积核在小特征图同样有效。

RepLKNet网络结构介绍

在上一节所述的5条经验准则的指导下,作者构建如下图所示的RepLKNet。

图片处理主要包括三个层次:

Stem层:

在处理输入图像时,steam层由步长为2的3×3卷积、深度可分离卷积以及步长为2的DW卷积依次组成。这一steam层的作用,是对输入图像进行升维和尺寸缩减操作。我们假设输入图像的尺寸为H和W,其中H代表图像的高度,W代表图像的宽度。那么经过steam层处理后,输出的特征尺寸将变为H/4×W/4×C1,这里的C1就是升维后的通道数。

Stage层:

RepLKNet的核心层,由RepLK Block以及ConvFFN堆叠而成。RepLK Block 包含了归一化层、1×1卷积和深度可分离卷积。以及最重要的残差连接。FFN是在Transformer中常用的操作:包括了两个全连接层。这里的ConvFFN则是使用了1×1卷积替代全连接层。同样的ConvFFN也使用了层间的残差连接。

Transition层:

结构简单,主要为PW卷积以及步长为2的DW卷积,用于图像下采样。以下是用飞桨框架来实现的RepLK Block和ConvFFN层演示。

如下表所示,用于分类和分割的RepLK Blocks的数量为[2, 2, 18, 2], 通道数分别为[128, 256, 512, 1024],采用不同大小的卷积核来测试不同的性能。不同层RepLK Blocks的数量比为1:1:9:1,与ConvNeXt和Swin Transformer的配置保持一致,通道数则是采取了经典了尺寸缩减,通道数翻倍的思想。Stage1-4分别为128, 256, 512, 1024。为了性能与参数量的平衡,作者选择了128作为RepLKNet-B第一个stage的通道数。

随着卷积核变大,ADE20K的mIoU在逐渐变高,因此作者采用了31组作为最终模型,即RepLKNet-B。此外,作者通过增加通道数设计了不同版本的RepLKNet,即四个stage分别为192,384,768,1536通道数的RepLKNet-L以及有着256,512,1024,2048通道数的RepLKNet-XL。

性能介绍

分类性能

将RepLKNet与Swin Transfomer进行全方面的比较,如下表所示,可以看到,RepLKNet系列无论是在准确率上还是参数量上都略优于Swin Transformer系列。RepLKNet-XL虽然计算量和参数量都大于Swin-L,但也取得了87.8%的Top-1准确率。

检测与分割性能

语义分割数据集为Cityscapes和ADE20K。RepLKNet以UperNet的经典分割模型作为网络结构,与多种模型进行了对比,并取得了state-of-the-art的效果。目标检测数据集为COCO,RepLKNet以Cascaded Maks R-CNN的经典目标检测模型作为网络结构。在于其他模型的对比下,同样达到了SOTA的效果。

讨论

讨论一:大卷积核拥有更大的感受野

感受野是一个在分割和检测领域上备受关注的概念,正如人的视野一样,感受野体现的是卷积核对当前输入特征图的感知范围,如果范围很小,那么接收的信息是片面的、局部的。如果增大感受野,那么就可以获得更多的全局信息,从而更有利于对当前局面的判断。现有的CNN模型都通过堆叠的卷积核与池化层来扩充感受野的大小,有些模型甚至有成百上千个卷积,那么为什么这么多的小卷积,比不过大卷积核呢?

有效感受野(Effective Receptive Field ,ERF)的大小与卷积核的大小K和模型深度L有关,与K成正比,与L成反比:

可以看到,ERF对K的大小更敏感,增加深度没有增加卷积核大小直观。另外,增加深度还会引起优化问题。虽然ResNet解决了网络退化的问题,但是ResNet的有效感受野仍不一定很大。

从上表能看出,RepLKNet的感受野比ResNet大得多,这就是RepLKNet效果优于ResNet的原因。作者在ImageNet上选了50张图像,缩放到1024×1024大小,接着测试模型输出最后特征中心点和输入图像相关区域点的比例,发现随着ResNet深度增加,有效感受野没有显著变化(见下图)。

讨论二:大卷积VS空洞卷积

空洞卷积在相邻的卷积核中插入孔洞,使得原卷积核拥有了更大的感受野。ASPP模块堆叠了多种具有不同大小孔洞率的空洞卷积,从而获取到具有不同感受野的多级特征,多级特征有助于模型更好地理解输入的特征信息。然而,空洞卷积会造成不可避免的局部特征损失,从而导致预测图出现网格状的缺失。RepLKNet用深度可分离卷积重新思考了大卷积核的使用,同样是扩大感受野,RepLKNet则取得了更好的效果。如下表所示,纯空洞卷积组成的MobileNet V2效果比原模型更差。

讨论三:局限性

尽管大卷积核的设计可以改善模型在ImageNet和下游任务的效果,但是随着数据和模型规模的增加,RepLKNet的效果开始落后于Transformer,例如,RepLKNet-31L在ImageNet 的Top-1 比Swin-L低0.7%(虽然在分割和检测数据集上的效果仍具有可比性)。作者仍在探索这方面的原因并且提出解决方法,例如,研究一个更强大的CNN基线(例如ConvNeXt)是否有助于在大卷积核的设计中超越ViT的上限。

参考文献:

[1] Ding X , Zhang X , Zhou Y , et al. Scaling Up Your Kernels to 31x31: Revisiting Large Kernel Design in CNNs[J]. arXiv e-prints, 2022.

关注【飞桨PaddlePaddle】公众号

获取更多技术内容~

本文同步分享在 博客“飞桨PaddlePaddle”(CSDN)。
如有侵权,请联系 support@oschina.cn 删除。
本文参与“OSC源创计划”,欢迎正在阅读的你也加入,一起分享。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
系统应用
相关文章 更多
Win11专业版和家庭版安装流程有什么区别
Win11专业版和家庭版安装流程有什么区别

Windows 11 家庭版和专业版在安装步骤上并无本质差异,主要区别在于产品密钥激活和功能解锁。本教程指导你如何检查硬件兼容性、使用官方媒体创建工具制作安装盘,以及在安装过程中正确选择版本。同时解析安装后如何验证激活状态,以及从家庭版升级到专业版的正规路径,确保系统稳定且合规。

除了界面,Windows11和Win10还有哪些实质差异
除了界面,Windows11和Win10还有哪些实质差异

除了开始菜单的变化,Windows 11在TPM 2.0安全要求、窗口贴靠布局、驱动兼容性以及系统更新策略上与Windows 10有显著不同。本文详解两者实质差异,助你判断是否值得升级。

win10专业版和家庭版关闭更新方法差别在哪
win10专业版和家庭版关闭更新方法差别在哪

详解Windows 10家庭版和专业版在关闭或暂停自动更新时的操作区别。涵盖通用的暂停更新、活动时间设置,以及专业版独有的组策略管理入口,帮助不同版本用户合理控制更新节奏,避免系统安全风险。

win10暂停更新最长可以设置多少天怎么操作
win10暂停更新最长可以设置多少天怎么操作

想知道Win10暂停更新最长能设多久?官方支持最长暂停35天。本文图文演示如何在设置中开启暂停、确认生效日期,以及到期后如何恢复更新或调整活动时间以避免打扰。

win10怎么屏蔽win10系统更新的弹窗提醒
win10怎么屏蔽win10系统更新的弹窗提醒

本教程介绍如何在Windows 10中通过暂停更新、设置活动时间及安排重启时间来减少更新弹窗提醒。包含通知隐藏技巧及更新失败排查步骤,帮助你在保持系统安全的同时减少工作打扰。

win10更新后台占用CPU过高怎么关闭自动更新
win10更新后台占用CPU过高怎么关闭自动更新

Windows 10 更新时 CPU 占用过高怎么办?本教程演示如何通过任务管理器确认更新进程,使用“暂停更新”功能临时停止后台活动,并设置“活动时间”防止自动重启干扰工作。提供安全的故障排查步骤,避免直接禁用系统服务带来的风险。

win10正在玩游戏弹出更新重启怎么禁止
win10正在玩游戏弹出更新重启怎么禁止

Win10玩游戏时突然弹出更新重启提示?不要强制关机。本文教你如何通过设置“活动时间”避免自动重启,利用“安排重启”规划空闲时间,以及合理使用“暂停更新”功能。区分不同状态下的应对策略,既保护游戏进度又维持系统安全。

win10自动更新抢占网络带宽该怎么处理
win10自动更新抢占网络带宽该怎么处理

Win10自动更新抢占带宽导致游戏卡顿或网页打不开?本教程教你通过任务管理器确认更新进程,利用暂停更新、按流量计费连接和传递优化带宽限制,精准控制Windows Update下载速度,解决网络拥堵问题。

win10家庭版有没有简单办法阻止强制更新
win10家庭版有没有简单办法阻止强制更新

Win10家庭版用户常受强制更新困扰。本文详解如何利用系统自带的暂停更新、活动时间和安排重启功能,在不破坏系统稳定性的前提下减少更新打扰,并分析注册表修改的风险及系统支持现状。

win10升级新版本后取消开机密码失效怎么修复
win10升级新版本后取消开机密码失效怎么修复

Windows 10更新后开机突然要求输入密码?本文解析自动登录失效的真实原因,提供通过netplwiz重新保存凭据、关闭Windows Hello干扰及排查账户策略的完整步骤,助你恢复免密进入桌面。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。