当前位置:

首页 > 业界资讯 > 加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

最近,扩散模型(DiffusionModel)在图像生成领域取得了显著的进展,为图像生成和视频生成任务带来了前所未有的发展机遇。尽管取得了令人印象深刻的结果,扩散模型在推理过程中天然存在的多步数迭代去噪特性导致了较高的计算成本。近期出现了一系列扩散模型蒸馏算法来加速扩散模型的推理过程。这些方法大致可以分为两类:i)轨迹保持蒸馏;ii)轨迹重构蒸馏。然而,这两类方法会分别受到效果天花板有限或者输出域变化这两个问题的限制。为了解决这些问题,字节跳动技术团队提出了一种名为Hyper-SD的轨迹分段一致性模型。H

最近,扩散模型(Diffusion Model)在图像生成领域取得了显著的进展,为图像生成和视频生成任务带来了前所未有的发展机遇。尽管取得了令人印象深刻的结果,扩散模型在推理过程中天然存在的多步数迭代去噪特性导致了较高的计算成本。近期出现了一系列扩散模型蒸馏算法来加速扩散模型的推理过程。这些方法大致可以分为两类:i)轨迹保持蒸馏;ii)轨迹重构蒸馏。然而,这两类方法会分别受到效果天花板有限或者输出域变化这两个问题的限制。

为了解决这些问题,字节跳动技术团队提出了一种名为 Hyper-SD 的轨迹分段一致性模型。Hyper-SD 的开源也得到了Huggingface首席执行官Clem Delangue的认可。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

该模型是一种新颖的扩散模型蒸馏框架,结合了轨迹保持蒸馏和轨迹重构蒸馏两种策略的优点,在压缩去噪步数的同时保持接近无损的性能。与现有的扩散模型加速算法相比,该方法取得了卓越的加速效果。经过大量实验和用户评测的验证,Hyper-SD+在 SDXL 和 SD1.5 两种架构上都能在 1 到 8 步生成中实现 SOTA 级别的图像生成性能。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

  • 项目主页:https://hyper-sd.github.io/

  • 论文链接:https://arxiv.org/abs/2404.13686

  • Huggingface 链接:https://huggingface.co/ByteDance/Hyper-SD

  • 单步生成 Demo 链接:https://huggingface.co/spaces/ByteDance/Hyper-SDXL-1Step-T2I

  • 实时画板 Demo 链接:https://huggingface.co/spaces/ByteDance/Hyper-SD15-Scribble加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

引言

现有用于扩散模型加速的蒸馏方法大致可以分为两大类:轨迹保持蒸馏和轨迹重构蒸馏。轨迹保持蒸馏技术旨在维持扩散对应的常微分方程(ODE)的原始轨迹。其原理是通过迫使蒸馏模型和原始模型产生相似的输出来减少推理步骤。然而需要注意的是,尽管能够实现加速,由于模型容量有限以及训练拟合过程中不可避免的误差,这类方法可能导致生成质量下降。相比之下,轨迹重构方法则直接利用轨迹上的端点或真实图像作为监督的主要来源,忽略了轨迹的中间步骤,能够通过重建更有效的轨迹来减少推理步骤的数量,并在有限的步骤内探索模型的潜力,将其从原始轨迹的约束中解放出来。然而,这通常会导致加速模型与原始模型的输出域不一致,从而得到不理想的结果。

本论文提出了一种结合轨迹保持和重构策略优点的轨迹分段一致性模型(简称 Hyper-SD)。具体而言,该算法首先引入轨迹分段一致性蒸馏,在每个段内强制保持一致性,并逐渐减少段的数量以实现全时一致性。这一策略解决了由于模型拟合能力不足和推理误差累积导致的一致性模型性能次优的问题。随后,该算法利用人类反馈学习(RLHF)来提升模型的生成效果,以弥补加速过程中模型生成效果的损失,使其更好地适应低步数推理。最后,该算法使用分数蒸馏来增强一步生成性能,并通过统一的 LORA 实现理想化的全时间步数一致扩散模型,在生成效果上取得了卓越的成果。

方法

1. 轨迹分段一致性蒸馏

一致性蒸馏(CD)[24] 和一致性轨迹模型(CTM)[4] 都旨在通过一次性蒸馏将扩散模型转换为整个时间步范围 [0,T] 的一致性模型。然而,由于模型拟合能力的限制,这些蒸馏模型往往达不到最优性。受到 CTM 中引入的软一致性目标的启发,我们通过将整个时间步范围 [0, T] 划分为 k 段并逐步执行分段一致模型蒸馏来细化训练过程。

在第一阶段,我们设置 k=8 并使用原始扩散模型来初始化 加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了。起始时间步加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了是从加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了中均匀随机采样的。然后,我们对结束时间步加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了进行采样,其中加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了计算如下:

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

训练损失计算如下:

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

其中加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了通过公式 3 进行计算,加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了表示学生模型的指数滑动平均(EMA)。

随后,我们恢复上一阶段的模型权重并继续训练加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了,逐渐将 k 减少到 [4,2,1]。值得注意的是,k=1 对应于标准 CTM 训练方案。对于距离度量 d,我们采用了对抗性损失和均方误差 (MSE) 损失的混合。在实验中,我们观察到,当预测值和目标值接近时(例如,对于 k=8, 4),MSE 损失更为有效,而对抗性损失则随着预测和目标值之间的差异增加而变得更加精确(例如,对于 k=2, 1)。因此,我们在整个训练阶段动态增加对抗性损失的权重并减少 MSE 损失的权重。此外,我们还集成了噪声扰动机制来增强训练稳定性。以两阶段轨迹分段一致性蒸馏(TSCD)过程为例。如下图所示,我们第一阶段在 加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了 时间段内执行独立一致性蒸馏 ,然后基于之前的两段一致性蒸馏结果,进行全局一致性轨迹蒸馏。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

完整的算法流程如下:

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

2. 人类反馈学习

除了蒸馏之外,我们进一步结合反馈学习以提高加速扩散模型的性能。具体来说我们通过利用人类审美偏好和现有视觉感知模型的反馈来提高加速模型的生成质量。对于审美反馈,我们利用 LAION 审美预测器和 ImageReward 中提供的审美偏好奖励模型来引导模型生成更具美感的图像,如下所示:

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

其中加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了是审美奖励模型,包括 LAION 数据集和 ImageReward 模型的审美预测器,c 是文本提示,加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了与ReLU函数一起作为铰链损失 。除了来自审美偏好的反馈之外,我们注意到嵌入有关图像的丰富先验知识的现有视觉感知模型也可以作为良好的反馈提供者。根据经验,我们发现实例分割模型可以指导模型生成结构合理的物体。具体来说,我们首先将潜在空间中图像加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了上的噪声扩散到加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了,之后,类似于 ImageReward,我们执行迭代去噪,直到 特定时间步加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了并直接预测加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了。随后,我们利用感知实例分割模型通过检查真实图像实例分割标注与去噪图像的实例分割预测结果之间的差异来评估结构生成的性能,如下所示:

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

其中加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了是实例分割模型(例如 SOLO)。实例分割模型可以更准确地捕获生成图像的结构缺陷并提供更有针对性的反馈信号。值得注意的是,除了实例分割模型之外,其他感知模型也适用。这些感知模型可以作为主观审美的补充反馈,更多地关注客观生成质量。因此,我们用反馈信号优化扩散模型可以定义为:

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

3. 一步生成强化

由于一致性损失的固有限制,一致性模型框架内的一步生成并不理想。正如 CM 中分析的那样,一致性蒸馏模型在引导位置图片处的轨迹端点图片方面表现出卓越的准确性。因此,分数蒸馏是一种合适且有效的方法来进一步提升我们的 TSCD 模型的一步生成效果。具体来说,我们通过优化的分布匹配蒸馏(DMD)技术来推进一步生成。DMD 通过利用两个不同的评分函数来增强模型的输出:来自教师模型分布加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了和来自假模型的加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了。我们将均方误差 (MSE) 损失与基于分数的蒸馏结合起来,以提高训练稳定性。在这个过程中,前面提到的人类反馈学习技术也被集成进来,用来微调我们的模型以有效地生成具有保真度的图像。

通过集成这些策略,我们的方法不仅能够实现在 SD1.5 和 SDXL 上都实现卓越的低步数推理效果(并且无需 Classifier-Guidance),同时能够实现理想的全局一致性模型,无需针对每个特定的步数训练 UNet 或者 LoRA 实现统一的低步数推理模型。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

实验

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

在 SD1.5 和 SDXL 上和目前现有的各种加速算法的定量比较,可以看到 Hyper-SD 显著优于当前最先进的方法

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

此外,Hyper-SD 能够用一个模型来实现各种不同低步数的推理,上面的定量指标也显示了我们方法在使用统一模型推理时的效果。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

在 SD1.5 和 SDXL 上的加速效果可视化直观地展示了 Hyper-SD 在扩散模型推理加速上的优越性。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

大量的 User-Study 也表明 Hyper-SD 相较于现有的各种加速算法的优越性。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

Hyper-SD 训练得到的加速 LoRA 能够很好地兼容不同的风格的文生图底模。

加速扩散模型,最快1步生成SOTA级图片,字节Hyper-SD开源了

同时,Hyper-SD 的 LoRA 也能适配现有的 ControlNet,实现低步数下高质量的可控图像生成。

总结

论文提出了 Hyper-SD,一个统一的扩散模型加速框架,可以显著提升扩散模型的在低步数情况下的生成能力,实现基于 SDXL 和 SD15 的新 SOTA 性能。该方法通过采用轨迹分段一致性蒸馏,增强了蒸馏过程中的轨迹保存能力,实现接近原始模型的生成效果。然后,通过进一步利用人类反馈学习和变分分数蒸馏提升模型在极端低步数下的潜力,从而产生了更优化、更高效的模型生成效果。论文还开源了用于 SDXL 和 SD15 从 1 到 8 步推理的 Lora 插件,以及专用的一步 SDXL 模型,旨在进一步推动生成式 AI 社区的发展。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 字节跳动
相关文章 更多
字节跳动 AI Agent 平台扣子 2.0 发布
字节跳动 AI Agent 平台扣子 2.0 发布

扣子2.0发布四项核心能力:AgentSkills将业务场景和工具链封装为技能包;AgentPlan支持设定中长期目标并自主规划执行;AgentOffice提供上下文理解和决策级洞察;AgentCoding实现自然语言驱动的云端一体化开发环境。

字节跳动赠送努比亚 M153豆包手机每月68元会员权益至12月31日有效
字节跳动赠送努比亚 M153豆包手机每月68元会员权益至12月31日有效

此次字节跳动专门为每位努比亚M153“豆包手机”用户赠送的每月价值68元的标准版会员,其有效期至2026年12月31日,该会员权益随豆包账号通用,将默认发放给设备上最活跃的账户。

字节跳动考虑采用百度昆仑芯?接近人士:字节没有与其合作意向
字节跳动考虑采用百度昆仑芯?接近人士:字节没有与其合作意向

据悉,百度旗下昆仑芯计划港股上市,估值约500亿美元。腾讯已成其客户,字节跳动评估其AI芯片但接近人士否认合作。其P800芯片已完成规模化验证,支撑文心5.1大模型训练。

百度昆仑芯传赴港上市,字节跳动否认合作意向
百度昆仑芯传赴港上市,字节跳动否认合作意向

百度旗下AI芯片公司昆仑芯传赴港上市,腾讯已为其客户,但字节跳动否认合作意向。火山引擎总裁谭待称自研芯片不重要,模型能力才是核心竞争力。昆仑芯已完成六轮融资,三代产品亮相。

字节CEO梁汝波发全员信:管理者要深入一线 直面真实业务问题
字节CEO梁汝波发全员信:管理者要深入一线 直面真实业务问题

字节跳动CEO梁汝波时隔四年更新十条领导力原则,新增“做有高度的事”等条目,强调管理者深入一线、信息透明优先于控制,并直接纳入晋升与考核标准,以整治形式化和业务空转。

字节跳动更新领导力原则
字节跳动更新领导力原则

字节跳动近期更新领导力原则,围绕“勇攀高峰”方向,在原有基础上新增“做有高度的事”“敢于设定高目标”,将“有危机感”“深入一线”独立成条,并强调信息共享与有效控制。更新后共十条原则。

字节跳动与新加坡国立大学联手打造
字节跳动与新加坡国立大学联手打造"AI调色师"

字节跳动等机构提出DanceOPD框架,将文字生图、局部编辑和全局编辑统一为速度场,采用硬路由、在线取经和单次语义侧取经策略,使模型同时掌握多种能力且互不干扰。实验表明,该框架在编辑和生成任务上显著优于现有方法。

香港大学与字节跳动联手:教机器人
香港大学与字节跳动联手:教机器人"看"人类动作来学习新技能

香港大学与字节跳动联合提出“桥接动作”方法,仅保留手腕三维平移轨迹,丢弃旋转信息,从人类操作视频学习机器人技能。在15个双臂任务上,经三阶段训练后平均成功率达60%,进度分72%。该方法有效解决人类与机器人运动机制差异问题。

字节跳动基于ClickHouse优化实践之Upsert
字节跳动基于ClickHouse优化实践之Upsert

更多技术交流、求职机会、试用福利,欢迎关注字节跳动数据平台微信公众号,回复【1】进入官方交流群相信大家都对大名鼎鼎的ClickHouse有一定的了解,它强大的数据分析性能让人印象深刻。但在字节大量生产使用中,发现了ClickHouse依然存在了一定的限制。例如:缺少完整的upsert和delete操

(G-G) Gemini Omni Flash 登顶 Video Arena 盲测榜 领先字节 Seedance 2.0 Mini 模型 101 Elo
(G-G) Gemini Omni Flash 登顶 Video Arena 盲测榜 领先字节 Seedance 2.0 Mini 模型 101 Elo

DeepMind的GeminiOmniFlash模型以1404Elo登顶VideoArena盲测榜,领先字节Seedance2.0Mini达101Elo,较自家Veo提升7位。盲测基于用户真实投票,谷歌在视频生成领域实现显著突破。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。