商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > CVPR 2026 | 支撑春晚合肥 7 分钟的4K画面奇观 PS-SR让视频超分不用在速度与质量间为难

CVPR 2026 | 支撑春晚合肥 7 分钟的4K画面奇观 PS-SR让视频超分不用在速度与质量间为难

  发布于2026-06-08 阅读(0)

扫一扫,手机访问

鱼灯破水,凌空游城;火狮踏焰,奋跃腾空;一群剪纸奔马通体透亮,在壁中狂奔;一纸诗词垂挂成瀑,于天幕间翻卷——2026年央视春晚合肥分会场《合韵满江淮》,用一连串美轮美奂的超现实奇观,刷新了虚实融合的想象边界。
很多人不知道的是,支撑这些4K级画面的技术核心,来自智象未来团队提出的PS-SR,一个“伪单步”(Pseudo-Single-Step)视频超分框架。凭借这一突破性工作,该成果已被计算机视觉顶级会议CVPR 2026接收。 把天马行空的创意落地为春晚级的播出画面,不仅需要在4K画质下高效处理海量实拍与生成素材,更重要的是,60帧率下,每一帧都要经得起逐秒推敲。鱼灯的鳞片反光必须与水波同频,奔马的筋肉在疾驰中不能有丝毫畸变,AI生成的特效要与真人实景严丝合缝地“长”在一起——仿佛它们本就属于那个时空。 而这所有一切的前提,离不开一项基础能力:视频超分。没有足够清晰、稳定、真实的底层4K画面,那些极致的细节和虚实融合,根本无从谈起。 当视频超分辨率(Video Super-Resolution, VSR)走向真实应用,一个绕不开的问题出现了:模型究竟应该更快,还是更好? 单步模型速度快,适合部署,却往往难以补出真实高清视频中的高频纹理;多步扩散模型细节丰富、视觉质量强,却因为反复迭代而计算昂贵。对于长视频、高清分辨率和接近实时的增强场景而言,这个矛盾尤为尖锐。 智象未来团队提出的PS-SR,一个“伪单步”视频超分框架,恰好瞄准了这个问题。它并不简单地把多步扩散压缩成一次前向传播,而是重新分配扩散采样中的计算角色:强大的base model(基础模型)只执行最关键的一步,确定全局结构与内容一致性;轻量的draft model(草稿模型)再接力完成后续细节增强。通过这种投机扩散(Speculative Diffusion),PS-SR试图同时获得接近单步模型的速度,以及多步扩散模型擅长的视觉丰富度。
论文标题:PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion ## 视频超分的老难题:快与好,为什么总要二选一? 视频超分不只是把低分辨率画面放大。真实的低清视频通常同时包含压缩伪影、噪声、模糊、纹理缺失和运动退化。模型不仅要恢复单帧纹理,还要保证连续帧之间不闪烁、不漂移。 基于CNN或Transformer的传统VSR方法效率较高,也能保持较强的输入输出一致性,但面对严重退化时,往往只能给出偏平滑的安全结果。扩散模型虽然带来了更强的生成先验,可以在低清人脸、车辆结构、衣物纹理等区域补出更自然的细节,却需要多步采样,推理成本居高不下。 近年来,单步扩散蒸馏方法试图破解这个困局,但单步模型很难完整继承多步扩散的迭代创造力。复杂纹理本是在多轮更新中逐渐形成的,一次性生成时,模型容易退回到更平均、更保守的预测。 PS-SR的核心判断是:真正昂贵的计算,未必每一步都需要。视频超分中的第一步最关键——它要稳住语义、结构和低频内容;后续步骤更多是在稳定基础上补充高频细节。因此,与其让大模型完整跑多步,不如让大模型先打好地基,再让轻模型快速补纹理。 ## PS-SR:用投机扩散制造“伪单步”体验 PS-SR的推理流程由两个不对称模型协作完成。 第一阶段由基础模型(base model)执行。该模型初始化自Wan2.1-T2V-1.3B视频扩散模型,并通过LoRA适配到视频超分任务。它只进行一次全面采样,负责恢复画面的全局结构、语义内容和低频一致性。换句话说,这一步决定“画面应该是什么”。 第二阶段由草稿模型(draft model)接管。草稿模型来自基础模型的轻量化版本,论文中采用从30个DiT blocks中裁剪20个的配置。为了让轻模型仍能获得强表征,PS-SR将基础模型对应层特征拼接给草稿模型,再通过全连接层恢复维度。这样一来,草稿模型不需要重新理解整个视频,只需在强模型给出的基础上推测并补充细节。 训练上,基础模型先在latent space中学习从低质量视频到高质量视频的速度场,并结合VSD和对抗损失增强分布对齐与视觉真实感;随后进入pixel-space training,通过L2损失与LPIPS损失提升局部质量。草稿模型则更聚焦于refinement,主要通过像素空间的L2损失与LPIPS损失学习高频细节恢复。 最终,PS-SR形成一种“1+x”式的采样体验:一个完整的基础模型采样步,加多个轻量草稿模型细化步。它不是严格意义上的单步模型,却在效率上接近单步,并保留了多步细化的空间。
## 频域更新:只补细节,不改内容 多步扩散的优势在于能不断细化纹理,但风险也在这里:模型可能越改越清晰,却越改越不像原视频。为了避免这种语义漂移,PS-SR提出了频域更新规则(Frequency-Domain Update Rule)。 这条规则的目标很直接:草稿模型后续步骤只允许注入高频细节,低频结构必须继承自前一步。具体做法是,将当前视频和新预测视频转换到YUV色彩空间,在亮度通道上提取高频成分,再通过自适应权重融合高频信息,最后与原有低频内容和色度通道组合回RGB空间。 也就是说,基础模型确定骨架,草稿模型补充纹理,而频域更新规则负责守住边界:让增强发生在细节层面,而不是变成内容重绘。 消融实验也从可视化上验证了这一点。去掉频域更新规则后,模型更容易产生看似更锐利、但与原视频结构不完全一致的细节,局部纹理和边缘会出现偏移或重绘。下图展示了FDU的作用:它不是单纯追求锐度,而是在补充高频纹理的同时约束低频内容,让视觉丰富度与内容一致性保持平衡。
## 实验结果:质量、速度和时序稳定性的平衡 PS-SR在YouHQ数据集上训练,评测覆盖合成数据集UDM10、SPMCS、YouHQ40,以及真实世界低质量互联网视频数据集VideoLQ。对比方法包括多步扩散模型STAR、SeedVR,以及单步扩散类方法DLoRAL、SeedVR2和DOVE。 在有高质量GT的数据集上,PS-SR展现出很强的重建能力。以UDM10为例,PS-SR取得SSIM 0.7547、LPIPS 0.2444、DISTS 0.1277,均为对比方法中的最佳结果;在SPMCS上,PS-SR取得PSNR 22.092、SSIM 0.6287、LPIPS 0.2940、DISTS 0.1454,同样体现出稳定优势;在YouHQ40上,PS-SR获得PSNR 21.772、SSIM 0.5873、LPIPS 0.3011和NIQE 3.7508等有竞争力的结果。
论文同时强调,PS-SR并不盲目追求无参考锐度指标最高。一些方法在CLIP-IQA或MUSIQ上更高,但可能伴随过度锐化和输入偏离。PS-SR的目标是在重建准确性、视觉细节和内容一致性之间取得更均衡的结果。
时序一致性方面,PS-SR在多个合成与真实视频场景中,都表现出更稳定的帧间对齐。下图的可视化直观展示了这一点:相邻帧之间的结构漂移和纹理闪烁更少,说明PS-SR在增强细节的同时,也能更好地维持连续运动中的内容稳定性。
速度方面,PS-SR的“伪单步”优势更直观。在NVIDIA A800 GPU上,对29帧、720×1280分辨率视频进行推理,STAR耗时98.61秒,SeedVR耗时188.93秒,DOVE作为单步方法耗时20.43秒;而PS-SR采用1+3步投机扩散,耗时仅21.11秒。也就是说,它只比最快的单步方法带来很小的额外开销,却相比50步的SeedVR快了约9倍,相比15步的STAR快了约4.7倍。
## 结语:面向高保真视频增强的新范式 PS-SR的意义,不只在于提出一个新模型,更在于给扩散式视频超分提供了一种全新的计算组织方式。 过去,视频超分常常被迫在两端摇摆:要么选择快速但偏平滑的单步模型,要么选择质量更好但昂贵的多步扩散模型。PS-SR证明,这个选择并非绝对。强模型可以只完成最关键的全局一步,轻模型可以接力补足细节,而频域更新规则则保证这些细节不会越界成语义漂移。 这正是“伪单步”的价值所在:它不否认多步生成的必要性,而是让多步生成以更轻、更受控、更接近实际部署的方式发生。对于视频修复、低清素材增强、在线内容生产和高清化播放等场景,PS-SR展示了一个兼顾速度、质量与稳定性的扩散式视频增强方向。
本文转载于:https://www.163.com/dy/article/KUTCFAU805118HA4.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注