浙江大学联手京东研究院:让AI视频训练快6倍的"闪电秘诀"
浙江大学、京东未来研究院与清华大学团队提出“Flash-GRPO”方法,通过“同时段分组”和“时间梯度校正”技术,在保证视频生成质量的同时,将AI训练速度提升6倍,显著降低训练成本与应用门槛,并在不同规模模型上验证了其有效性。

那些栩栩如生的AI生成视频,背后往往隐藏着一个惊人的数字:训练一个140亿参数的视频模型,动辄需要消耗数百个GPU日。这相当于让一台高端电脑不眠不休地工作好几年。如此高昂的成本,不仅让独立研究者望而却步,即便是大型科技公司也得精打细算。
正是这个横亘在技术普及面前的成本难题,催生了一项颇具巧思的研究。来自浙江大学、京东未来研究院和清华大学的研究团队,在2026年的第43届国际机器学习大会(ICML)上,发表了一篇编号为arXiv:2605.15980v1的论文。他们提出了一种名为“Flash-GRPO”的新方法,据称能将视频AI的训练速度提升6倍,同时还能让生成视频的质量不降反升。
这项研究究竟是如何做到“既要快,又要好”的?我们不妨用最通俗的方式,来拆解一下这个“闪电训练法”的核心秘密。
一、视频AI训练为什么这么“烧钱”
要理解Flash-GRPO的价值,得先看看当前视频AI是怎么“学习”的。
可以把训练过程想象成教一个学徒画连环画。一开始,学徒画出来的东西就像电视的雪花屏,一片混沌。他的任务,是把这个混沌的画面,一步步“擦拭”清晰,最终形成一段流畅的视频。这个过程通常要分几十步,每一步都让画面清晰一点点。
麻烦就出在这里。传统的训练方法,比如“GRPO”(群体相对策略优化),要求老师对学徒的“擦拭”过程进行全程监督——每擦完一步,就要立刻打分、纠正。这就好比学厨时,师傅不仅看你最后端出的菜,还要在切菜、炒菜、调味的每一个环节都盯着你。这种“贴身指导”效果固然好,但代价是极其耗费时间和精力。
映射到AI训练上,这种“全程陪练”模式消耗的计算资源是天文数字。一个140亿参数的模型做一次实验,成本堪比一辆豪车。这成了技术发展和普及的巨大障碍。
于是,很自然地就有人想:能不能别每一步都指导,只挑其中几步呢?这就是此前一些“滑动窗口”训练法的思路。但问题随之而来:这种“偷懒”式的训练,让模型的学习变得极不稳定,生成效果时好时坏,甚至越练越差。研究界似乎陷入了一个两难境地:要么烧钱保质量,要么省钱牺牲效果。
二、罪魁祸首:两个被忽视的“坑”
为什么“偷懒训练”会失败?研究团队像侦探一样深挖下去,发现了两个隐藏的“陷阱”。
第一个陷阱,叫做“时间点混淆问题”。还是用画连环画来比喻,从模糊到清晰的几十个阶段,难度天差地别。早期画面模糊,好坏难辨;后期画面清晰,优劣一目了然。如果老师把学徒在“模糊阶段”的作品,和另一个学徒在“清晰阶段”的作品放在一起评分,那分数就完全失去了意义——前者得分低可能只是因为阶段难,后者得分高可能只是阶段简单。
传统的“偷懒”训练法就犯了这种错误。它将不同时间点生成的样本混在一起计算平均分,导致评分体系混乱,模型根本不知道朝哪个方向改进才是正确的。
第二个陷阱更为隐蔽,称为“梯度尺度失衡问题”。这听起来有点抽象,但可以这样理解:老师在不同阶段纠正学徒的“力度”是不均匀的。在某些阶段轻轻一点,在另一些阶段却用力猛推。这种力度的差异,并非源于学徒在那个阶段犯错更严重,而纯粹是训练方法本身的数学结构导致的——就像一台秤,称羽毛时极其灵敏,称西瓜时反而迟钝了。
研究团队从数学上证明,传统方法中存在一个隐藏系数 λ(t),它在不同时间点的数值可以相差好几个数量级。结果就是,一些次要的早期时间点,反而主导了整个训练过程;而那些真正决定画面质量的关键后期时间点,其贡献却被严重稀释了。这好比课堂上,几个嗓门大的学生总是吸引老师全部注意力,而真正需要帮助的安静学生却被忽略了。
三、第一把钥匙:让评分变公平的“同时段分组法”
针对第一个陷阱,研究团队开出的药方是“同时段分组”。
具体来说,新方法规定:对于同一个文字提示(例如“画一只猫”),所有用于训练的样本,都必须在视频生成的同一个阶段被评分。这次大家全在“模糊阶段”画猫,下次全在“清晰阶段”画猫。这样,评分就完全公平了,因为所有人面临的难度基准是一致的,胜负只取决于各自的“笔力”。
技术上,每次训练时,每个提示词会被随机分配一个特定的时间点,该提示词下产生的所有样本都在这个相同的时间点接受评估。不同的提示词可以被分配到不同的时间点,从而保证整个训练批次仍然覆盖了生成过程的所有阶段。
这就好比厨艺大赛改革了规则:不再把“正在切菜的选手A”和“正在炒菜的选手B”混在一起打分,而是规定所有做同一道菜的选手,必须在同一个烹饪环节(如切配环节)同时接受评判。如此,评分才真正反映了选手在该环节的真实水平。
更巧妙的设计在于,在生成完整视频时,只有那个被选中的“评分时间点”采用带有随机性的探索模式,其他所有时间点都采用稳定、确定的模式。这确保了最终生成的视频质量足够高,从而能为模型提供更准确、更有价值的评分信号。
四、第二把钥匙:让纠正力度均衡的“梯度校正法”
针对第二个力度失衡的陷阱,解决方案是“时间梯度校正”。
还记得那个导致“秤”不准的λ(t)系数吗?研究团队的办法直接而有效:在计算损失函数时,直接除以这个λ(t)。这就相当于给秤装上了自动校准器,无论称什么,灵敏度都保持一致。
从数学上看,这一操作将每个时间点对模型参数更新的贡献拉平到了同一水平线上。从此,视频生成的每个阶段都能均等地参与到“教学”过程中,再也没有哪个阶段能“霸占话筒”。
这个看似简单的操作,背后有严谨的数学推导作为支撑。研究团队从随机微分方程的离散化过程出发,完整推导了策略梯度的表达式,最终证明λ(t)这个系数源于数值计算中的离散化伪影,并不反映真实的学习需求。将其消除,合情合理,且不会丢失任何有效信息。
实验效果立竿见影。训练过程中梯度的波动从原来的剧烈震荡变得平缓稳定,原先时常出现的“训练崩溃”现象彻底消失,整个学习曲线变得平滑而稳健。
五、实战检验:从1.3B到14B模型的全面胜利
理论再漂亮,也得靠实验说话。研究团队在开源的Wan2.1视频模型上进行了全面测试,涵盖了13亿参数和140亿参数两种规模。
在视频AI领域的“高考”——VBench评测中,使用350个GPU小时训练的Wan2.1-1.3B模型,Flash-GRPO在美学质量上得分66.43,在主体一致性上高达98.70,综合表现超越了所有对比方法。相比之下,传统的Flow-GRPO方法在同等资源下,整体表现不如Flash-GRPO均衡。而那个简单的“偷懒版”Flow-GRPO-Fast1,成像质量得分仅为65.96,明显低于全程训练的Flow-GRPO(68.60分),这再次证实了粗暴省事的代价就是质量损失。
训练过程的动态对比更具说服力。当关闭额外的稳定措施(KL正则化)时,传统偷懒方法Flow-GRPO-Fast1的训练奖励分数从接近3一路暴跌至2以下,且曲线剧烈震荡;而Flash-GRPO的奖励分数则从3平稳上升至接近5。这仿佛是两位登山者,一位步履蹒跚甚至不断滑坠,另一位则稳步向上攀登。
在HPSv3评分上,Flash-GRPO达到了约5.4分,而Flow-GRPO-Fast1仅徘徊在4.6左右,差距显著。即便是与完整的Flow-GRPO相比,Flash-GRPO也在更短的训练时间内达到了更高的质量上限(约5.4分对5.1分)。
视频的灵魂在于“动”。研究团队特别测试了动作质量,结果显示Flash-GRPO将模型的动作分数从-0.55提升至-0.28,而对比方法仅能达到-0.34左右。这意味着新方法生成的视频,在动作流畅度和物理合理性上确实更胜一筹。
最令人振奋的是,这套方法在140亿参数的“巨无霸”模型上同样奏效。当模型规模急剧扩大,传统方法的训练成本呈指数级增长,但Flash-GRPO依然保持着稳定的性能增长曲线。这证明它并非小打小闹的技巧,而是具备工业级应用潜力的扎实方案。
六、看得见的差异:视频效果的直观对比
数字指标之外,肉眼可见的差异更有冲击力。
在一段“蒸汽火车穿越雪山”的场景中,原版模型生成的火车仿佛被“冻”在画面里,运动僵硬;而Flash-GRPO版本的火车则呼啸着穿过山谷,蒸汽袅袅,动感十足。在“钢铁侠飞行”的场景中,原版效果更像一个模糊的人偶悬在空中,而Flash-GRPO版本则盔甲质感清晰,飞行姿态自然,云层细节也更为丰富。
那个有趣的“小猫进食”场景,原版生成的小猫与食盆略显不协调,画面有些凌乱;Flash-GRPO版本则准确捕捉了小猫埋头吃饭的姿态,食盆和毛发细节都更加逼真。
在动画风格测试中,例如“两只熊猫在竹林读论文”这样充满想象力的提示,Flash-GRPO不仅准确呈现了双熊猫并坐的构图,还细致地刻画了它们不同的神态——一只若有所思,一只好奇张望。在“卡通牛与大象站在草地”的场景里,Flash-GRPO甚至补充了原版遗漏的细节(如蝴蝶),显示出对复杂提示更精准的理解能力。
这些直观对比清晰地表明,Flash-GRPO的优势不止于冰冷的分数,更体现在最终生成的、肉眼可辨的视觉质量上。
七、消融实验:每个零件都不可或缺
为了厘清两项改进各自的贡献,研究团队进行了系统的“拆解”实验。
以最朴素的单步训练为起点,其HPSv3奖励分数仅为4.64,甚至略低于未训练的原模型(4.67)。这再次印证了简单“偷懒”的弊端。当加入“同时段分组”后,分数立刻跃升至5.31,证明了消除时间混淆带来的巨大收益。在此基础上再加入“梯度校正”,分数进一步提升到5.42,并且训练过程从波动转为平稳。
这一系列递进实验,像拼图一样清晰地展示了每个技术组件的独立价值与协同效应。两者结合,才成就了Flash-GRPO的完整威力。
八、这项研究对普通人意味着什么
看到这里,或许你会问:这听起来很高深,跟我有什么关系?
关系可能比想象中更近。视频生成AI正快速渗透日常生活,从短视频创作、广告制作,到游戏开发、电影特效,乃至教育内容生成,其身影无处不在。每一次训练成本的实质性降低,都意味着这项技术离普通创作者、中小公司更近一步,而不再只是科技巨头的专属玩具。
Flash-GRPO将训练效率提升6倍,意味着原本需要耗费百万级资源的实验,未来可能只需十几万就能完成。成本门槛的降低,很可能催生出一大批新的创意应用:个性化的视频生成工具、更亲民的影视后期方案、更智能的视频教学助手……想象空间正在被打开。
归根结底,这项研究的核心智慧在于:它发现了视频AI训练系统中两个长期被忽视的“系统性偏差”,并用优雅的数学方法将其校正。这种“以少胜多”的策略——仅在单个时间点训练,却能获得媲美全程训练的效果——本身就像一场精妙的工程艺术。
未来,这种方法还有优化空间吗?训练速度能否再上一个台阶?这些都是值得期待的方向。或许在不远的将来,生成一段电影质感的AI视频,会变得像今天编辑一条朋友圈那样简单。技术的每一次跃进,最终都是为了更好地服务于人。
Q&A
Q1:Flash-GRPO是什么?它解决了什么问题?
A:Flash-GRPO是一种针对视频生成AI模型的训练加速方法,由浙江大学、京东未来研究院等机构于2026年提出。它核心解决的是训练成本过高的问题:传统方法训练一个140亿参数的高质量视频模型需消耗数百个GPU日。Flash-GRPO通过创新的“单步训练”架构,将训练速度提升了6倍,同时保证了生成质量不妥协甚至更优。
Q2:Flash-GRPO的两个核心技术是什么?
A:其核心技术有两项:一是“同时段分组”,确保同一提示词下的所有训练样本都在视频生成的相同阶段进行评估,避免了不同难度阶段混评带来的不公;二是“时间梯度校正”,通过数学手段消除了训练过程中因离散化引入的梯度尺度失衡,使得每个生成阶段对模型更新的贡献度保持一致,从而保障了训练稳定性。
Q3:Flash-GRPO的实际效果如何?
A:在权威的VBench评测中,采用Flash-GRPO训练的Wan2.1-1.3B模型,在美学质量和主体一致性上均取得领先分数。其HPSv3奖励分数达到约5.4,显著高于传统简化训练方法的约4.6。更重要的是,该方法在140亿参数的大模型上同样表现稳定,验证了其在大规模工业场景下的实用性和有效性。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















