发布于2026-05-30 阅读(0)
扫一扫,手机访问
AI 给无声视频配乐已经不是什么新鲜事了——只要给一段画面,模型就能自动生成匹配的声音。效果好的时候,甚至能让人有种“原片就带音效”的错觉。
不过,问题也随之而来:如果模型只会看画面猜声音,创作者就基本没法控制输出的结果。换个说法就是,我想让它给这段画面配个脚步声,它非得配上风声——而且你还改不了。
视频音效生成的下一步,显然需要从“看画面配声音”走向“按意图配声音”。这正是小米大模型应用团队近期开源项目 ControlFoley 的核心价值所在。

ControlFoley 的定位明确:不只是一个“视频生音频”模型,而是一个面向创作控制的多模态音频生成框架。它一次性支持三种不同的任务场景:
这意味着,用户可以根据自己的实际需求,灵活选择控制方式。不是“模型替我决定”,而是“我告诉它我想要什么”。

视频音效生成中,视觉信息往往非常强势——画面本身就自带很强的语义提示,极易在多模态融合时压制文本输入。为了解决这个问题,团队专门重新设计并自训练了一个全新的时空音视频编码器 CA V-MAE-ST,用来增强模型对动作节奏和音视频时间对应关系的理解。

简单说,CLIP 擅长理解视觉与文本之间的通用语义关系;而 CA V-MAE-ST 更专精于“动作什么时候发生、声音应该什么时候出现”这类音视频时空匹配问题。两者结合后,ControlFoley 在画面和文本冲突时,不会一股脑被画面牵着走,更能听进用户的控制指令。
参考音频控制的一个老大难问题是:一段声音里既包含“听起来像什么”(音色),也包含“什么时候发生”(节奏)。如果模型直接原样使用这个参考,很容易把参考里的时间结构带进来,反而破坏了和视频画面的匹配。
ControlFoley 的解法是采用时间-音色解耦策略,抑制参考音频里冗余的时间信息,只保留关键的全局音色特征。这样,声音“像什么”由参考音频说了算,声音“什么时候响”照样由视频画面决定,互不干扰。
实际使用场景里,用户能提供的条件各式各样——有时只有视频,有时有视频和文本,偶尔还会加上参考音频。如果模型只为一个条件组合优化,到了不同场景就容易水土不服。
ControlFoley 通过随机模态 dropout 和统一多模态表示对齐训练,让模型在面对不同输入组合时都能稳定输出。再配合统一的 REPA 对齐目标,保证生成音频的内部表示与多模态条件高度一致,语义对齐和控制鲁棒性都有明显提升。
在常规视频配音任务 TV2A 上,ControlFoley 在 VGGSound-Test、Kling-Audio-Eval、MovieGen-Audio-Bench 等多个 benchmark 上均拿下开源 SOTA 表现,效果对比非常直观——语义对齐、时间同步、声音质量指标全线领先。

不止刷榜,下图的频谱对比可以发现,在乐器演奏和体育运动这两类典型的场景中,ControlFoley 生成的音频不仅在关键时刻精准对齐视频节奏,还保留了更多的高频细节。相比之下,某些方法会出现声音事件错位、漏掉关键动作音效、甚至生成与画面完全不匹配的声音。说白了,ControlFoley 不止能“配上声音”,而且配得更准、更细。

此外,对标商业闭源系统 Kling-Foley 的结果同样值得注意——在语义对齐、时间同步和声音质量等关键体验指标上,ControlFoley 表现出稳定的竞争力,完整客观指标可见技术报告。

售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9