当前位置:

首页 > 业界资讯 > 令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

Transformer最初是为自然语言处理任务而设计的,但现在已经被广泛应用于视觉任务。视觉Transformer在多个视觉识别任务中展现出了出色的准确性,并在图像分类、视频分类和目标检测等任务中取得了当前最佳的表现视觉Transformer的一大缺点是计算成本高。典型的卷积网络(CNN)处理每张图像需要数十GFlops,而视觉Transformer所需的往往会多上一个数量级,达到每张图像数百GFlops。在处理视频时,由于数据量巨大,这个问题更为严重。高昂的计算成本让视觉Transformer难以被部署

Transformer最初是为自然语言处理任务而设计的,但现在已经被广泛应用于视觉任务。视觉Transformer在多个视觉识别任务中展现出了出色的准确性,并在图像分类、视频分类和目标检测等任务中取得了当前最佳的表现

视觉 Transformer 的一大缺点是计算成本高。典型的卷积网络(CNN)处理每张图像需要数十 GFlops,而视觉 Transformer 所需的往往会多上一个数量级,达到每张图像数百 GFlops。在处理视频时,由于数据量巨大,这个问题更为严重。高昂的计算成本让视觉 Transformer 难以被部署到资源有限或有严格延迟需求的设备上,这就限制了这项技术的应用场景,否则我们已经有一些激动人心的应用了。

在近期一篇论文中,威斯康星大学麦迪逊分校的三位研究者 Matthew Dutson、Yin Li 和 Mohit Gupta 首先提出可以在后续输入之间使用时间冗余来降低视觉 Transformer 在视频应用中的成本。他们也发布了模型代码,其中包含用于构建 Eventful Transformer 的 PyTorch 模块。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

  • 论文地址:https://arxiv.org/pdf/2308.13494.pdf
  • 项目地址:http://wisionlab.com/project/eventful-transformers

时间冗余:首先假设有一个视觉 Transformer,其可以逐帧或逐视频片段地处理视频序列。这个 Transformer 可能是简单的逐帧处理的模型(如目标检测器)或是某个时空模型的中间步骤(如 ViViT 的分解式模型的第一步)。不同于一个输入就是一个完整序列的语言处理 Transformer,在这里,研究者的做法是随时间为 Transformer 提供多个不同的输入(帧或视频片段)。

自然视频包含显著的时间冗余,即后续帧之间的差异很小。尽管如此,包括 Transformer 在内的深度网络通常都会「从头开始」计算每一帧。该方法会丢弃之前推理获得的潜在相关信息,浪费极大。故而这三位研究者设想:是否可以复用之前计算步骤的中间计算结果来提升处理冗余序列的效率?

自适应推理:对于视觉 Transformer 以及一般意义上的深度网络而言,推理成本通常由架构决定。然而在现实应用中,可用的资源可能会随时间而变化,比如可能因为存在相竞争的进程或电源发生变化。如此一来,可能就存在运行时修改模型计算成本的需求。在这项新成果中,研究者设定的一大主要设计目标便是适应性 —— 其方法可实现对计算成本的实时控制。下图 1(底部)给出了在视频处理过程中修改计算预算的示例。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

事件化Transformer:本文提出了事件化Transformer,该Transformer可以利用输入之间的时间冗余来实现高效且自适应的推理。事件化这个术语的灵感来自事件相机(event camera),这种传感器能够在场景变化时离散地记录影像。事件化Transformer会跟踪随时间发生的令牌层面的变化情况,并在每个时间步骤有选择性地更新令牌表示和自注意力映射图。事件化Transformer的模块中包含一种门控模块,用于控制更新令牌的数量

该方法适用于现有的模型(通常无需重新训练),并且适用于许多视频处理任务。研究人员还进行了实验证明,结果显示 Eventful Transformer 可以用于现有的最佳模型,同时大大降低计算成本并保持原有的准确性

Eventful Transformer

重写后的内容:这项研究的目标是加速用于视频识别的视觉Transformer。在这个场景中,视觉Transformer需要反复处理视频帧或视频片段,具体的任务包括视频目标检测和视频动作识别等。提出的关键思想是利用时间冗余,即复用之前时间步骤的计算结果。下面将详细描述如何通过修改Transformer模块来使其具备感知时间冗余的能力

token 门控:检测冗余

本节将介绍研究者提出的两种新模块:token 门和 token 缓冲器。这些模块使得模型能够识别和更新自上次更新以来发生明显变化的 token

门模块:该门会从输入 token N 中选择一部分 M 发送给下游层执行计算。其记忆中维护着一个参照 token 集,记为 u。这种参照向量包含每个 token 在其最近一次更新时的值。在每个时间步骤,比较各个 token 与其对应的参照值,其中与参照值相差较大的 token 获得更新。

现在将该门的当前输入记为 c。在每个时间步骤,按照以下流程更新门的状态并决定其输出(见下图 2):

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

1. 计算总误差 e = u − c。

2. 对误差 e 使用一个选取策略。选择策略返回一个二元掩码 m(相当于一个 token 索引列表),表示其中哪 M 个 token 应被更新。

3. 提取出上述策略选取的 token。图 2 中将其描述为乘积 c×m;在实践中则是通过沿 c 的第一个轴执行「gather」操作来实现。这里将收集到的 token 记为令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径,这就是该门的输出。

4. 将参照 token 更新成所选 token。图 2 将这个过程描述为令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径;在实践中使用的操作则是「scatter」。在第一个时间步骤,门会更新所有 token(初始化 u ← c 并返回 c˜ = c)。

缓冲器模块:缓冲模块维护着一个状态张量令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径,其跟踪的是每个输入 token 

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径时,该缓冲器将来自 f (c˜) 的 token 分散到其在 b 中对应位置。然后它返回更新后的 b 作为其输出,参见下图 3。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

研究人员将每个门与其后的缓冲器组成一对。以下是一种简单的使用模式:门的输出

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径被传递给一系列针对各个 token 的运算 f (c˜);然后将所得到的张量令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径传递给一个缓冲器,其将恢复完整的形状。

重构可感知冗余的Transformer

为了利用上述时间冗余,研究者提出了一种对 Transformer 模块的修改方案。下图 4 展示了 Eventful Transformer 模块的设计。该方法可以加速针对各个 token 的运算(如 MLP)以及查询 - 键值和注意力 - 值乘法。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

在针对各个 token 的运算 Transformer 模块中,很多运算都是针对各个 token 的,也就是说它们不涉及到 token 之间的信息交换,其中包括 MLP 和 MSA 中的线性变换。为了节省计算成本,研究者表示可以跳过未被门选取的 token 的面向 token 的运算。由于 token 之间的独立性,这不会改变对所选 token 的运算结果。参见图 3。

具体来说,研究者们在处理每个token的运算时,包括W_qkv变换、W_p变换和MLP,使用了一对门-缓冲器的连续序列。需要注意的是,在进行skip连接之前,他们还添加了缓冲器,以确保两个加法操作数的token能够正确对齐

对于每个令牌的运算成本与令牌数量成正比。通过将数量从N减少到M,下游对每个令牌的运算成本将减少N/M倍

现在让我们来看一下查询-键值积 B = q k^T 的结果

下图 5 展示了稀疏地更新查询 - 键值积 B 中一部分元素的方法。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

这些更新的总体成本为2NMD,相比之下,从头开始计算B的成本为N^2D。请注意,新方法的成本与M成正比,即所选取的令牌数量。当M < N/2时(即更新的令牌数量不到总量的一半),可以节省计算量

注意力 - 值的积:研究者为此提出了一种基于增量 ∆ 的更新策略。

图 6 展示了一种新提出的高效计算三个增量项的方法

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

当M小于N的一半时,可以减少计算量

token 选取策略

Eventful Transformer 的一大重要设计是其 token 选取策略。给定一个门误差张量 e,这样一个策略的目标是生成一个掩码 m,其中指示了应当被更新的 token。具体的策略包括:

Top-r 策略:该策略选取 r 个误差 e 有最大范数的 token(这里使用的是 L2 范数)。

阈值策略:该策略会选择所有误差 e 的范数超过阈值 h 的令牌

重写后的内容:其他策略:采用更复杂精细的令牌选择策略可以实现更好的准确度-成本权衡,例如可以使用一个轻量级的策略网络来学习策略。然而,训练策略的决策机制可能会面临困难,因为二元掩码m通常是不可微分的。另一种思路是使用重要度分数作为选择的参考信息。但是,这些想法仍需进一步研究

实验

研究人员对新提出的方法进行了实验评估,具体应用于视频目标检测和视频动作识别任务

下图 7 展示了视频目标检测的实验结果。其中正轴是计算节省率,负轴是新方法的 mAP50 分数的相对减少量。可以看到,新方法用少量的准确度牺牲换来了显著的计算量节省。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

在下图8中展示了针对视频目标检测任务的方法比较和消融实验结果

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

下图 9 给出了视频动作识别的实验结果。

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

在下表2中,显示了在一台CPU(Xeon Silver 4214, 2.2 GHz)和一台GPU(NVIDIA RTX3090)上运行的时间结果(以毫秒为单位)。可以观察到,在GPU上的时间冗余带来了1.74倍的速度提升,而在CPU上的提升则达到了2.47倍

令人惊讶的时间冗余方法:降低视觉Transformer计算成本的新途径

更多技术细节与实验结果参见原论文。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯
相关文章 更多
4TB数据搬运:物理传输更高效
4TB数据搬运:物理传输更高效

在千兆宽带、5G通信与云服务深度普及的2026年,大众普遍以为超大文件传输已步入“秒级时代”,但现实远未达到这般畅快。当面对数TB乃至数十TB级别的庞大数据集时,当下最可靠、最迅捷且兼顾安全性的传输方案,依然是“物理位移”——依靠人工携带存储介质完成跨地域交付。一位来自河南信阳的用户讲述了真实经历:他曾需将4TB资料从信阳送往郑州,首次尝试纯网络传输,系统预估总耗时近72小时;最终改用专人驱车运送,单程仅需约2.5小时,当天即完成取件与送达,整体效率显著超越线上方式。该实例迅速引发热议,多位资深IT博主随

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程
每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程

现在,请大家一起来数一下"1"、"2"。OK,仅仅2秒的时间,一个接近万亿规模的MoE大模型就已经掌握了如何解答一道高等数学难题的方法!而且呢,这个大模型还是完全依靠国产设备进行训练的,整个流程都体现了浓浓的“国产”特色。这就是华为借助"昇腾+PanguUltraMoE"这一组合实现的成果——不仅达成了国产算力与国产模型在全流程上的自主可控训练闭环,还在集群训练系统的性能方面达到了行业顶尖水平。有多顶尖?来看一组数据:预训练阶段:昇腾Atlas800TA2万卡集群的MFU提升

美团推出首个语音GUI智能体,端到端语音训练更优
美团推出首个语音GUI智能体,端到端语音训练更优

只需动动嘴,就能操控GUI代理?由美团与浙江大学联合推出的GUIRoboTron-Speech——让你彻底解放双手,直接对设备“发号施令”。这是首个可以直接通过语音指令和屏幕截图进行端到端(End-to-End)决策的自主GUI智能体,致力于为用户提供更自然、高效且无障碍的人机交互方式。从文本到语音,智能代理的新一轮进化目前,基于大语言模型(LLMs)的自主GUI智能体已经能够通过文本指令自动完成跨应用、多步骤的复杂操作,显著提升用户效率。然而,这种依赖文本输入的方式在某些场景中存在明显局限

雷克沙ArmorSD卡测评:全金屬防護三防加持存储更安心
雷克沙ArmorSD卡测评:全金屬防護三防加持存储更安心

无论是专业摄影师还是摄影爱好者,相机内存储卡的可靠性都至关重要,尤其是在恶劣的拍摄环境中,数据存储的安全性更是不可忽视。尽管市场上有多种支持三防功能的移动存储设备用于数据备份,但最常用的SD存储卡由于采用塑料外壳,长期使用后容易出现破损,导致数据损坏,甚至可能损坏相机的存储卡槽,带来的损失不可估量。国际存储品牌雷克沙推出了全新的Armor系列SD存储卡,不仅读写速度快,还采用了不锈钢材质的外壳,具有优异的防水、防尘和防跌落性能,为相机的原始拍摄数据提供了可靠的保护。雷克沙ArmorSD存储卡分为GOLD

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第一章:计算机系统全方位概述
第一章:计算机系统全方位概述

1.1计算机发展历程[计组]1.0_你好,我是计算机组成原理我们生活在一个信息化程度极高的世界中,我们每天的生活都离不开电脑和手机,这些设备实际上都属于计算机的范畴。计算机的底层结构由硬件构成,在硬件之上,我们会安装操作系统,再在操作系统上运行各种应用软件,这样就能得到一个易于使用的计算机系统。通过计算机网络,这些设备实现了信息的互联互通,这正是我们现在生活的信息化世界的缩影。计算机组成原理这门课研究的就是这些计算机硬件在底层如何协同工作。既然我们要研究硬件,不妨先来看一下大家日常生活中常见的一些硬件

vivo 获批模块化智能手表专利 可调传感器以获得更精准数据
vivo 获批模块化智能手表专利 可调传感器以获得更精准数据

近日,vivo的一项智能手表专利正式获得批准并公开展示。该专利采用模块化设计,通过磁力锁扣和滑动限位槽,用户可以手动调整传感器的位置,以确保健康数据的精准收集。vivo这项专利的核心亮点是其模块化结构。手表由可穿戴主体和可拆卸设备主体两部分组成,用户可以通过滑动限位槽和磁力锁扣,旋转或移动内部传感器模块,将其调整到最佳佩戴位置。这种设计有效提高了健康数据的监测准确性,如心率和血氧等关键指标。对于不同体型和佩戴习惯的用户来说,这种可调节性尤为重要,能够确保传感器与皮肤的紧密接触,减少因位置偏差导致的误差

LCD硬件操作原理详解
LCD硬件操作原理详解

本文参考自百问网-韦东山驱动大全,旨在探讨当前手机中常见的LCD屏幕。LCD与OLED的区别关于LCD和OLED的区别,可以参考以下链接:https://www.zhihu.com/question/22263252/answer/410201820不同接口的LCD硬件操作原理应用工程师眼中的LCDLCD由一个个像素组成,每行有xres个像素,共有yres行,其分辨率为xres*yres。只要我们能够控制任意一个像素的颜色,就可以在LCD上绘制文字和图片。像素的颜色表示像素的颜色通常用红绿蓝三色来表示

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。