当前位置:

首页 > 硬件相关 > 浙江大学联手京东研究院:让AI视频训练快6倍的"闪电秘诀"

浙江大学联手京东研究院:让AI视频训练快6倍的"闪电秘诀"

浙江大学、京东未来研究院与清华大学团队提出“Flash-GRPO”方法,通过“同时段分组”和“时间梯度校正”技术,在保证视频生成质量的同时,将AI训练速度提升6倍,显著降低训练成本与应用门槛,并在不同规模模型上验证了其有效性。


那些栩栩如生的AI生成视频,背后往往隐藏着一个惊人的数字:训练一个140亿参数的视频模型,动辄需要消耗数百个GPU日。这相当于让一台高端电脑不眠不休地工作好几年。如此高昂的成本,不仅让独立研究者望而却步,即便是大型科技公司也得精打细算。

正是这个横亘在技术普及面前的成本难题,催生了一项颇具巧思的研究。来自浙江大学、京东未来研究院和清华大学的研究团队,在2026年的第43届国际机器学习大会(ICML)上,发表了一篇编号为arXiv:2605.15980v1的论文。他们提出了一种名为“Flash-GRPO”的新方法,据称能将视频AI的训练速度提升6倍,同时还能让生成视频的质量不降反升。

这项研究究竟是如何做到“既要快,又要好”的?我们不妨用最通俗的方式,来拆解一下这个“闪电训练法”的核心秘密。

一、视频AI训练为什么这么“烧钱”

要理解Flash-GRPO的价值,得先看看当前视频AI是怎么“学习”的。

可以把训练过程想象成教一个学徒画连环画。一开始,学徒画出来的东西就像电视的雪花屏,一片混沌。他的任务,是把这个混沌的画面,一步步“擦拭”清晰,最终形成一段流畅的视频。这个过程通常要分几十步,每一步都让画面清晰一点点。

麻烦就出在这里。传统的训练方法,比如“GRPO”(群体相对策略优化),要求老师对学徒的“擦拭”过程进行全程监督——每擦完一步,就要立刻打分、纠正。这就好比学厨时,师傅不仅看你最后端出的菜,还要在切菜、炒菜、调味的每一个环节都盯着你。这种“贴身指导”效果固然好,但代价是极其耗费时间和精力。

映射到AI训练上,这种“全程陪练”模式消耗的计算资源是天文数字。一个140亿参数的模型做一次实验,成本堪比一辆豪车。这成了技术发展和普及的巨大障碍。

于是,很自然地就有人想:能不能别每一步都指导,只挑其中几步呢?这就是此前一些“滑动窗口”训练法的思路。但问题随之而来:这种“偷懒”式的训练,让模型的学习变得极不稳定,生成效果时好时坏,甚至越练越差。研究界似乎陷入了一个两难境地:要么烧钱保质量,要么省钱牺牲效果。

二、罪魁祸首:两个被忽视的“坑”

为什么“偷懒训练”会失败?研究团队像侦探一样深挖下去,发现了两个隐藏的“陷阱”。

第一个陷阱,叫做“时间点混淆问题”。还是用画连环画来比喻,从模糊到清晰的几十个阶段,难度天差地别。早期画面模糊,好坏难辨;后期画面清晰,优劣一目了然。如果老师把学徒在“模糊阶段”的作品,和另一个学徒在“清晰阶段”的作品放在一起评分,那分数就完全失去了意义——前者得分低可能只是因为阶段难,后者得分高可能只是阶段简单。

传统的“偷懒”训练法就犯了这种错误。它将不同时间点生成的样本混在一起计算平均分,导致评分体系混乱,模型根本不知道朝哪个方向改进才是正确的。

第二个陷阱更为隐蔽,称为“梯度尺度失衡问题”。这听起来有点抽象,但可以这样理解:老师在不同阶段纠正学徒的“力度”是不均匀的。在某些阶段轻轻一点,在另一些阶段却用力猛推。这种力度的差异,并非源于学徒在那个阶段犯错更严重,而纯粹是训练方法本身的数学结构导致的——就像一台秤,称羽毛时极其灵敏,称西瓜时反而迟钝了。

研究团队从数学上证明,传统方法中存在一个隐藏系数 λ(t),它在不同时间点的数值可以相差好几个数量级。结果就是,一些次要的早期时间点,反而主导了整个训练过程;而那些真正决定画面质量的关键后期时间点,其贡献却被严重稀释了。这好比课堂上,几个嗓门大的学生总是吸引老师全部注意力,而真正需要帮助的安静学生却被忽略了。

三、第一把钥匙:让评分变公平的“同时段分组法”

针对第一个陷阱,研究团队开出的药方是“同时段分组”。

具体来说,新方法规定:对于同一个文字提示(例如“画一只猫”),所有用于训练的样本,都必须在视频生成的同一个阶段被评分。这次大家全在“模糊阶段”画猫,下次全在“清晰阶段”画猫。这样,评分就完全公平了,因为所有人面临的难度基准是一致的,胜负只取决于各自的“笔力”。

技术上,每次训练时,每个提示词会被随机分配一个特定的时间点,该提示词下产生的所有样本都在这个相同的时间点接受评估。不同的提示词可以被分配到不同的时间点,从而保证整个训练批次仍然覆盖了生成过程的所有阶段。

这就好比厨艺大赛改革了规则:不再把“正在切菜的选手A”和“正在炒菜的选手B”混在一起打分,而是规定所有做同一道菜的选手,必须在同一个烹饪环节(如切配环节)同时接受评判。如此,评分才真正反映了选手在该环节的真实水平。

更巧妙的设计在于,在生成完整视频时,只有那个被选中的“评分时间点”采用带有随机性的探索模式,其他所有时间点都采用稳定、确定的模式。这确保了最终生成的视频质量足够高,从而能为模型提供更准确、更有价值的评分信号。

四、第二把钥匙:让纠正力度均衡的“梯度校正法”

针对第二个力度失衡的陷阱,解决方案是“时间梯度校正”。

还记得那个导致“秤”不准的λ(t)系数吗?研究团队的办法直接而有效:在计算损失函数时,直接除以这个λ(t)。这就相当于给秤装上了自动校准器,无论称什么,灵敏度都保持一致。

从数学上看,这一操作将每个时间点对模型参数更新的贡献拉平到了同一水平线上。从此,视频生成的每个阶段都能均等地参与到“教学”过程中,再也没有哪个阶段能“霸占话筒”。

这个看似简单的操作,背后有严谨的数学推导作为支撑。研究团队从随机微分方程的离散化过程出发,完整推导了策略梯度的表达式,最终证明λ(t)这个系数源于数值计算中的离散化伪影,并不反映真实的学习需求。将其消除,合情合理,且不会丢失任何有效信息。

实验效果立竿见影。训练过程中梯度的波动从原来的剧烈震荡变得平缓稳定,原先时常出现的“训练崩溃”现象彻底消失,整个学习曲线变得平滑而稳健。

五、实战检验:从1.3B到14B模型的全面胜利

理论再漂亮,也得靠实验说话。研究团队在开源的Wan2.1视频模型上进行了全面测试,涵盖了13亿参数和140亿参数两种规模。

在视频AI领域的“高考”——VBench评测中,使用350个GPU小时训练的Wan2.1-1.3B模型,Flash-GRPO在美学质量上得分66.43,在主体一致性上高达98.70,综合表现超越了所有对比方法。相比之下,传统的Flow-GRPO方法在同等资源下,整体表现不如Flash-GRPO均衡。而那个简单的“偷懒版”Flow-GRPO-Fast1,成像质量得分仅为65.96,明显低于全程训练的Flow-GRPO(68.60分),这再次证实了粗暴省事的代价就是质量损失。

训练过程的动态对比更具说服力。当关闭额外的稳定措施(KL正则化)时,传统偷懒方法Flow-GRPO-Fast1的训练奖励分数从接近3一路暴跌至2以下,且曲线剧烈震荡;而Flash-GRPO的奖励分数则从3平稳上升至接近5。这仿佛是两位登山者,一位步履蹒跚甚至不断滑坠,另一位则稳步向上攀登。

在HPSv3评分上,Flash-GRPO达到了约5.4分,而Flow-GRPO-Fast1仅徘徊在4.6左右,差距显著。即便是与完整的Flow-GRPO相比,Flash-GRPO也在更短的训练时间内达到了更高的质量上限(约5.4分对5.1分)。

视频的灵魂在于“动”。研究团队特别测试了动作质量,结果显示Flash-GRPO将模型的动作分数从-0.55提升至-0.28,而对比方法仅能达到-0.34左右。这意味着新方法生成的视频,在动作流畅度和物理合理性上确实更胜一筹。

最令人振奋的是,这套方法在140亿参数的“巨无霸”模型上同样奏效。当模型规模急剧扩大,传统方法的训练成本呈指数级增长,但Flash-GRPO依然保持着稳定的性能增长曲线。这证明它并非小打小闹的技巧,而是具备工业级应用潜力的扎实方案。

六、看得见的差异:视频效果的直观对比

数字指标之外,肉眼可见的差异更有冲击力。

在一段“蒸汽火车穿越雪山”的场景中,原版模型生成的火车仿佛被“冻”在画面里,运动僵硬;而Flash-GRPO版本的火车则呼啸着穿过山谷,蒸汽袅袅,动感十足。在“钢铁侠飞行”的场景中,原版效果更像一个模糊的人偶悬在空中,而Flash-GRPO版本则盔甲质感清晰,飞行姿态自然,云层细节也更为丰富。

那个有趣的“小猫进食”场景,原版生成的小猫与食盆略显不协调,画面有些凌乱;Flash-GRPO版本则准确捕捉了小猫埋头吃饭的姿态,食盆和毛发细节都更加逼真。

在动画风格测试中,例如“两只熊猫在竹林读论文”这样充满想象力的提示,Flash-GRPO不仅准确呈现了双熊猫并坐的构图,还细致地刻画了它们不同的神态——一只若有所思,一只好奇张望。在“卡通牛与大象站在草地”的场景里,Flash-GRPO甚至补充了原版遗漏的细节(如蝴蝶),显示出对复杂提示更精准的理解能力。

这些直观对比清晰地表明,Flash-GRPO的优势不止于冰冷的分数,更体现在最终生成的、肉眼可辨的视觉质量上。

七、消融实验:每个零件都不可或缺

为了厘清两项改进各自的贡献,研究团队进行了系统的“拆解”实验。

以最朴素的单步训练为起点,其HPSv3奖励分数仅为4.64,甚至略低于未训练的原模型(4.67)。这再次印证了简单“偷懒”的弊端。当加入“同时段分组”后,分数立刻跃升至5.31,证明了消除时间混淆带来的巨大收益。在此基础上再加入“梯度校正”,分数进一步提升到5.42,并且训练过程从波动转为平稳。

这一系列递进实验,像拼图一样清晰地展示了每个技术组件的独立价值与协同效应。两者结合,才成就了Flash-GRPO的完整威力。

八、这项研究对普通人意味着什么

看到这里,或许你会问:这听起来很高深,跟我有什么关系?

关系可能比想象中更近。视频生成AI正快速渗透日常生活,从短视频创作、广告制作,到游戏开发、电影特效,乃至教育内容生成,其身影无处不在。每一次训练成本的实质性降低,都意味着这项技术离普通创作者、中小公司更近一步,而不再只是科技巨头的专属玩具。

Flash-GRPO将训练效率提升6倍,意味着原本需要耗费百万级资源的实验,未来可能只需十几万就能完成。成本门槛的降低,很可能催生出一大批新的创意应用:个性化的视频生成工具、更亲民的影视后期方案、更智能的视频教学助手……想象空间正在被打开。

归根结底,这项研究的核心智慧在于:它发现了视频AI训练系统中两个长期被忽视的“系统性偏差”,并用优雅的数学方法将其校正。这种“以少胜多”的策略——仅在单个时间点训练,却能获得媲美全程训练的效果——本身就像一场精妙的工程艺术。

未来,这种方法还有优化空间吗?训练速度能否再上一个台阶?这些都是值得期待的方向。或许在不远的将来,生成一段电影质感的AI视频,会变得像今天编辑一条朋友圈那样简单。技术的每一次跃进,最终都是为了更好地服务于人。

Q&A

Q1:Flash-GRPO是什么?它解决了什么问题?
A:Flash-GRPO是一种针对视频生成AI模型的训练加速方法,由浙江大学、京东未来研究院等机构于2026年提出。它核心解决的是训练成本过高的问题:传统方法训练一个140亿参数的高质量视频模型需消耗数百个GPU日。Flash-GRPO通过创新的“单步训练”架构,将训练速度提升了6倍,同时保证了生成质量不妥协甚至更优。

Q2:Flash-GRPO的两个核心技术是什么?
A:其核心技术有两项:一是“同时段分组”,确保同一提示词下的所有训练样本都在视频生成的相同阶段进行评估,避免了不同难度阶段混评带来的不公;二是“时间梯度校正”,通过数学手段消除了训练过程中因离散化引入的梯度尺度失衡,使得每个生成阶段对模型更新的贡献度保持一致,从而保障了训练稳定性。

Q3:Flash-GRPO的实际效果如何?
A:在权威的VBench评测中,采用Flash-GRPO训练的Wan2.1-1.3B模型,在美学质量和主体一致性上均取得领先分数。其HPSv3奖励分数达到约5.4,显著高于传统简化训练方法的约4.6。更重要的是,该方法在140亿参数的大模型上同样表现稳定,验证了其在大规模工业场景下的实用性和有效性。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。