发布于2026-08-16 阅读(0)
扫一扫,手机访问
7月9日消息,欧洲计算机视觉顶级会议ECCV 2026放榜,阿里云与上海交通大学张林峰教授团队合作的3篇论文被主会收录,研究方向均聚焦Diffusion Transformer(DiT)架构下的高效推理加速,覆盖了时序误差校正、自适应特征分解、时空令牌筛选三条不同的技术路线。在高分辨率图片生成场景下,这些成果能将算力需求缩短近90%,综合提速最高可达14.76倍。
这个会议到底有多牛?ECCV是计算机视觉领域公认的三大国际顶级学术会议之一,目标检测、图像分割、视觉Transformer等多项影响行业走向的核心技术,都曾在这里首次亮相。而DiT作为当前主流视觉生成模型的通用架构,在文生图、文生视频、图像编辑等场景中应用广泛,但推理成本高、生成耗时长的问题也日益突出,被行业视为AIGC规模化落地的核心瓶颈。

3篇论文入选视觉顶会ECCV 2026
先说第一篇,《Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache》,核心思路是搞定时序缓存误差校正。DiT生成一张图片通常需要跑几十甚至上百步去噪,业界常用的“特征缓存”策略虽然能跳步复用,但预测偏差会像滚雪球一样越滚越大。团队发现缓存残差在局部严格服从零均值高斯分布,于是用高斯过程回归搭了一个轻量级校正模块,可以直接挂载到主流时序缓存算法后面。与TaylorSeer结合后,在Qwen-Image上能将计算量再降19.3%,同时PSNR提升0.9dB,LPIPS从0.65降至0.29,生成效果更快也更清晰,算是破解了长区间预测漂移这个老大难问题。

对比不同基线缓存方法与GP-Refiner结合前后生成图像的视觉效果
第二篇《LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching》提出了一个基于可学习可逆网络的特征缓存框架,名字叫LinCa。它首次系统性地揭示了扩散特征演化的异质性——这个异质性不仅存在于跨模型之间,还同时存在于跨去噪阶段和跨特征维度三个层面。LinCa的做法是将原始特征沿通道维度拆解成不同“性格”的子分量,对连续性强的用高阶预测器外推,对突变性强的就直接复用。单卡GPU训练1小时就能完成适配。测试数据很漂亮:FLUX.1-dev实现5.51倍加速,Qwen-Image达到6.95倍,HunyuanVideo视频模型实现5.50倍加速,画质指标全面领先现有方案。

在Qwen-Image-Edit上,LinCa表现出更优的提示理解能力,并生成高保真图像,同时保持未编辑区域的一致性
动态分辨率是高分辨率DiT推理的核心加速方向之一,但传统方案有个尴尬的地方:分辨率切换时会统一上采样全部隐式令牌,导致大量背景和低语义区域产生冗余计算;现有的局部上采样方法呢,又大多依赖边缘、纹理这类底层视觉特征,难以匹配文本语义和编辑指令的需求,关键区域的细节容易丢失。
阿里云和交大合作的第三篇论文《A ViTS: Adaptive Spatiotemporal Token Selection for Efficient DiTs with Dynamic Resolution》提出了一种时空动态令牌筛选框架,通过“低分辨率打底—选择性上采样—全分辨率精修”三阶段生成流程,巧妙地砍掉了背景与低语义区域的冗余算力。这个方法完全在推理阶段执行,不需要重新训练,而且和特征缓存、模型蒸馏、量化等加速技术完全正交。实验数据显示,A ViTS在FLUX模型上最高实现6.34倍推理加速,编辑场景FLOPs削减近9倍;叠加步骤蒸馏后,综合提速最高能达到14.76倍。

A ViTS 整体架构:包含时空重要度计算模块与三级分辨率递进调度流程
据了解,上述3项技术已经完整集成到阿里云自研的WuYingDiT推理加速引擎,并且全量落地至无影灵构一站式AIGC创研平台,服务于游戏美术、电商设计、影视制作、新媒体等行业客户。这套引擎原生适配FLUX、Qwen、混元视频等主流生成基座,客户不需要改造现有工作流就能一键启用。
阿里云方面表示,未来将持续在端侧生成式AI前沿技术方向开展研究,把真实业务场景中的技术难题与学术研究结合在一起,不断迭代WuYingDiT加速引擎,进一步降低端侧和边缘场景下高保真生成式AI的应用门槛。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9