发布于2026-08-20 阅读(0)
扫一扫,手机访问
这项由北京大学与DP Technology联合完成的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.27978,感兴趣的读者可以通过这个编号查阅完整原文。
想象一下你用手机拍下一张照片,屏幕上那些红黄蓝绿的小点,就是像素。一张256×256分辨率的图,包含了超过六万五千个这样的点。如果一台AI想从零开始“画出”这张图,它需要理解这些像素之间错综复杂的关系——哪里该是天空的蓝,哪里该衔接草地的绿,哪里的猫毛该有怎样的纹理。这事儿听起来简单,做起来却像是在漆黑的房间里,用一根手指拼一幅一万块的拼图。每放下一块,都得凭记忆猜测下一块该放在哪儿。
北京大学与DP Technology的研究团队,就是在解决这样一个看似不可能的难题。他们提出了一种叫做“并行展开近似”(Parallel Rollout Approximation,简称PRA)的新框架,让一个只有1.35亿参数的模型,就能超越那些拥有十几亿参数的竞争对手。这意味着,想要获得同样出色的图像生成能力,所需要的计算资源却大幅减少了。
要理解这项研究的价值,得先搞清楚研究者们到底在做什么。
生成图像的AI有好几种流派。其中有一类叫“扩散模型”,它的工作方式就像把一张图片先用噪声模糊成一团雪花,然后再一步步把雪花还原成清晰的图像,整个过程是全局同步进行的,每一步都在调整整张图的所有像素。另一类则叫“自回归模型”,它的工作方式完全不同,更像是一位画家从左上角开始,一块一块地往右往下画,每画一块都要参考之前已经画好的部分,来决定接下来怎么画。
自回归模型在语言领域大获成功——GPT系列就是这个思路,它一个词一个词地生成,每个新词都参考前面所有的词。把这个思路用到图像上,就是把图片切成一个个小方块(称为“补丁”),然后让模型一个补丁接一个补丁地生成,每生成一块就把它加入“已知区域”,作为生成下一块的参考。
然而,这里藏着两个让研究者头疼已久的麻烦,而这两个麻烦还会相互加剧,形成一种恶性循环。
第一个麻烦来自“输出端”:每个像素补丁的维度非常高。以16×16大小的补丁为例,每块包含16×16×3=768个数值,模型需要在一次预测中同时确定768个数字。这就像让一个人在一次猜测中,同时猜对768道题,出错的概率自然很高,而且每一次的误差都相当大。
第二个麻烦来自“输入端”:训练时和推断时的条件不一样。在训练阶段,模型每次都在参考“真实的、标准的”已知补丁来预测下一块——就好像学生每道题都能看标准答案再做下一道。但在实际使用时,模型只能参考自己之前生成的补丁,而那些补丁本身就包含了误差。这种训练和使用之间的脱节,学术上叫“训练-推断差距”,通俗点说就是“练习时用真题标准答案,考试时却要靠自己做的错题来推断”。
更糟糕的是,这两个问题会互相放大:输出时误差大,生成的补丁质量差;质量差的补丁又成了下一块的输入参考,导致下一块误差更大;如此循环,图像到后期往往会崩坏得一塌糊涂。研究团队通过一系列精心设计的对比实验,清晰地证明了这两个问题的存在。他们在两种分辨率下测试了同一个框架:一种是64×64分辨率配4×4的小补丁(补丁只有48维),另一种是256×256分辨率配16×16的大补丁(补丁高达768维)。两种设置的生成步数完全相同,都是256步,区别只在于每步要预测的维度。结果,低维时自回归模型还能和扩散模型打个平手,一旦换成768维,自回归模型的图像质量指标(FID值,数字越小越好)就从4.06急剧攀升到7.68甚至更高,而扩散模型几乎不受影响。
面对上述两个问题,此前研究界也提出了一些“打补丁”的方案,但研究团队指出,这些方案都只能部分缓解问题,无法根治。
针对输出端误差大的问题,有研究者借鉴了扩散模型中的“x预测”技巧,让模型直接预测目标值本身,而不是预测某种速度方向。这确实有帮助——FID从9.70降到了7.68——但和扩散模型的4.56相比,差距依然很大,高维输出的根本困难并没有解决。
针对输入端的训练-推断差距,有研究者提出向训练时的输入补丁加入随机噪声,让模型在训练中也能见识到“不完美的输入”,从而增强鲁棒性。这个方法同样有效,但有一个根本缺陷:这些噪声是随机的、独立的,而推断时模型遇到的“不完美输入”是有结构的,是由模型自己之前的错误所决定的。这就好比你在练习考试时,老师故意把标准答案里随机打几个错别字给你看——这种干扰,和真正考试时你自己答题的错误,是完全不同的两回事。
最彻底的解决办法是“真正的展开训练”:在训练时就让模型真的跑一遍自回归生成,把生成的补丁作为输入再继续训练,这样训练条件就和推断条件完全一致了。理论上这很完美,但实践中完全行不通——因为每个补丁的生成本身需要调用扩散头(diffusion head)做多步采样,生成256个补丁就意味着需要顺序执行几万步计算,训练成本高得无法承受。
PRA的设计思路是把上述两个问题同时正面解决,而不是各自打补丁。
核心思路可以用一个烘焙比喻来理解。假设你要烤256个不同造型的蛋糕,每烤好一个都要把它的照片拿给下一步的烤制作参考。问题是:第一,每个蛋糕造型太复杂了,一次成型误差很大;第二,你在练习时参考的是理想状态的蛋糕照片,而实际操作时只能参考自己已烤好的(可能形状有点歪)的蛋糕照片。
PRA的解决思路是这样的:与其直接烤出完整的蛋糕,不如先做出一个“蛋糕胚子”(低维中间状态),这个胚子比完整蛋糕简单得多,更容易做好;然后用一台专门的“成型机”(像素解码器)把胚子变成完整蛋糕。而且,在训练时,这台成型机不只处理完美的胚子,还会处理故意弄歪了的胚子,这样产出的“练习用蛋糕照片”就和真正操作时看到的照片更接近了。
具体到技术层面,PRA包含四个互相配合的模块,全部端到端训练,不依赖任何预训练的外部工具。第一个是“因果自回归变换器”,这是整个系统的主干,负责根据已生成的像素补丁序列来计算当前位置的隐藏状态;第二个是“中间状态编码器”,它把当前的真实补丁和主干的隐藏状态合并,压缩成一个只有16维的低维向量,称为中间状态;第三个是“像素解码器”,它把(可能带有噪声的)中间状态序列解码回768维的像素补丁;第四个是“扩散头”,它基于主干的隐藏状态,学习如何生成中间状态的概率分布。
这里有一个关键的设计细节,值得深入理解。中间状态编码器不只是简单地把当前补丁压缩成16维,它同时还参考了主干已经计算好的“前缀表示”,也就是对所有已知补丁的理解摘要。这使得中间状态不只是当前补丁的局部压缩,还包含了上下文信息,更适合作为自回归预测的目标。为了防止编码器过度依赖当前补丁(那样主干就学不到东西了),训练时会随机把当前补丁替换成一个可学习的“掩码嵌入”,概率是50%,强迫中间状态更多地利用前缀信息。实验表明,这种“前缀感知的中间目标”比纯粹的局部压缩,能把FID从3.08进一步降低到2.88。
中间状态的维度选择也经过了仔细调试。太小(比如8维)会导致信息不够,解码器无法还原出质量够好的像素补丁;太大(比如64维)则让扩散头又回到了预测高维向量的困境,误差重新变大。16维是甜蜜点——既足够紧凑以降低生成难度,又足够丰富以支撑像素解码。
解决了输出端的问题之后,研究团队还需要应对输入端的训练-推断差距。PRA的解法很聪明:既然推断时模型看到的是“由中间状态解码出来的像素补丁”,那就在训练时也给它看这样的东西。
具体操作是:对每个位置的目标中间状态,先故意加入一些噪声(按照扩散过程的插值方式),把它变成一个“有些模糊的中间状态”;然后把这个模糊状态送进像素解码器,得到一个“有些模糊的像素补丁”;把这样的补丁作为训练时的输入序列。由于这个补丁经历了和推断时完全相同的“中间状态到像素”的解码路径,它的“模糊方式”和推断时模型看到的自己生成的补丁,是非常接近的,远比随机加噪声更真实。
更妙的是,这个构建过程可以在所有位置同时并行完成——每个位置的“模糊中间状态”是独立采样的,不需要等待前面位置的结果。这就避免了“真正展开训练”那种昂贵的顺序采样,而仍然给了模型接近展开训练的训练信号。因此这个方法得名“并行展开近似”,它是一种对完整展开训练的高效近似,而非完整展开训练本身。
训练时的噪声强度也需要仔细控制。用一个参数tmin来设定噪声下界:这个值越大,加入的噪声越少,生成的训练输入越接近干净的真实补丁;越小则噪声越多,训练输入越不可靠。实验发现,tmin=0.5是最优选择,太干净或太嘈杂都不如适中。
整个训练流程在每次迭代中包含两个并行的前向计算阶段。第一阶段是“教师强制阶段”:主干接受真实像素补丁序列,计算隐藏状态,编码器用这些隐藏状态和真实补丁生成中间状态,然后加噪并用解码器生成“推断-like的像素输入序列”。第二阶段是“AR训练阶段”:主干接受第一阶段生成的那批“推断-like的像素输入序列”(停止梯度,不反向传播),计算新的隐藏状态,扩散头学习从这些隐藏状态生成之前算好的干净中间状态。整个系统的训练损失结合了扩散头的流匹配损失、像素解码器的重建损失(包括像素级的L1损失和感知相似度LPIPS损失)以及一个辅助表示损失,所有权重均等,无需手动调优。
研究团队在ImageNet-1K数据集上对PRA进行了系统评测,这个数据集包含来自1000个类别的超过120万张训练图像,是图像生成领域公认的标准测试场。所有生成质量用FID(弗雷歇感知距离)来衡量,这个指标衡量生成图像和真实图像在统计特征上的差距,数字越小说明生成质量越好。
PRA提供了三种规模:PRA-S(1.35亿参数),PRA-B(2.50亿参数),PRA-L(5.11亿参数)。评测结果非常亮眼。此前最好的像素空间自回归模型是FARMER-1.9B/8,拥有19亿参数,FID为3.60。而PRA-S只用了1.35亿参数,FID就达到了2.58,直接超越了这个19亿参数的前辈。这相当于用约7%的参数量取得了更好的效果。随着模型规模增大,PRA-B达到2.21,PRA-L进一步达到1.94,在像素空间自回归模型中确立了新的最优水平。
如果把目光放到更广阔的生成模型范畴来看,PRA-L的1.94也已经超过了像素空间扩散模型中的JiT-L(FID为2.36)和PixNerd-L(FID为2.64),接近了一些依赖预训练tokenizer的两阶段扩散模型(如PixelFlow-XL的1.98)。需要指出的是,PRA在这个更宽的比较中还没有达到最优——顶尖的两阶段扩散模型如RAE-XL/2可以达到1.13——但PRA是在完全不依赖预训练外部编码器、直接处理原始像素的约束下完成的,这个定位下的1.94是相当有竞争力的成绩。
在训练效率方面,PRA-S在8块A100 GPU上训练400个epoch约需3.125天,PRA-B约需6天,PRA-L约需14.3天,计算开销在合理范围内。
为了让人信服PRA的每个设计选择都真正有用,研究团队进行了一系列“拆零件”的消融实验,系统地验证各个组件的贡献。
在输出端的实验中,他们对比了四种中间目标的构建方式。第一种是用现成的LDM编码器(一个来自Stable Diffusion的预训练模型)提取特征作为中间目标,结果FID为3.37;这说明一个为其他任务训练的通用特征空间,并不适合作为自回归预测的目标。第二种是只用当前补丁本身来定义中间状态(纯局部编码),FID降到3.08,有进步但有限。第三种是加上前缀感知(同时参考主干的隐藏状态),FID进一步降到2.88,这验证了中间目标应该和自回归上下文对齐,而不仅仅是局部的自编码压缩。
在输入端的实验中,对比结果更为戏剧性。用干净真实像素作为训练输入,FID高达42.36——这证明了即使输出端已经改用中间状态,输入端的训练-推断差距本身就能让模型崩坏。对真实像素加噪声,FID降到32.60,有帮助但仍然很差。用真实中间状态作为输入(改变了外部接口),FID降到3.21,说明中间状态空间对自回归建模更友好;但这实际上把模型变成了一种潜在空间AR模型,失去了像素输入输出的统一接口。在真实中间状态上加噪,FID进一步降到3.05。最后,PRA的“解码像素输入”方案在保持像素输入输出接口的前提下,将FID做到了2.88,是所有方案中最优的,同时也是唯一保留了完整像素接口的方案。
这项研究还有一个让人意外的发现:PRA训练出的模型不只善于生成图像,还善于理解图像。
研究团队在PRA-L的主干上直接做了线性分类探测(linear probing)——就是冻结所有模型参数,只训练一个线性分类器,看模型学到的特征有多少能用于图像分类。结果,PRA-L在ImageNet分类任务上达到了68.80%的Top-1准确率,显著超过了潜在空间AR模型SphereAR-L的52.19%,以及像素空间扩散模型JiT-L的42.76%,甚至远超DiT-XL/2的43.28%。
这个结果的意义在于,PRA直接在原始像素上建模,没有经过任何压缩或变换,因此模型被迫学习图像内容本身的语义信息,而不是某个中间编码空间的统计规律。这种“贴近原始信号”的特性,可能正是它在理解任务上表现更好的原因。
说到底,PRA这项研究的核心贡献可以用一句话概括:找到了像素空间自回归图像生成的两个根本性瓶颈,并用一套统一的框架同时化解了它们。
第一个瓶颈是每步预测的维度太高、误差太大,PRA通过端到端学习16维的低维中间状态来解决,用简单的步骤替代困难的直接预测。第二个瓶颈是训练时的条件和推断时的条件不匹配,PRA通过并行构建“解码像素输入”来解决,让训练时的输入条件尽可能贴近推断时模型真正会遇到的条件,同时避免了顺序展开的巨大开销。
这项研究表明,像素级的自回归建模并非没有前途的死路,而是此前缺少正确的方法来攻克其内在困难。1.35亿参数超越19亿参数的结论,也说明模型的质量更多来自于方法设计是否对症,而不仅仅是规模堆砌。
当然,这项工作还留有若干未完成的方向。PRA在训练阶段需要运行两次并行的前向计算,这比标准的教师强制训练稍贵。框架目前只在256×256分辨率的ImageNet上得到验证,是否能平滑迁移到更高分辨率、文本条件生成或视频等更宽泛的领域,仍有待未来工作的探索。这些开放问题,或许正是下一批研究者可以接力探索的方向。有兴趣深入了解技术细节的读者,可以通过arXiv编号2606.27978找到完整论文,代码也已在GitHub的MangataX/PRA仓库公开发布。
Q1:PRA模型在训练时比普通自回归模型慢多少?
A:PRA在训练时需要执行两次并行前向计算(一次用于构建中间状态和解码像素输入,一次用于AR主干的实际训练),相比标准的单次前向教师强制训练会增加一定开销。不过两次都是并行操作,不需要顺序采样,因此训练成本仍处于可接受范围。以PRA-S为例,在8块A100 GPU上训练400个epoch约需3.125天,PRA-L约需14.3天。
Q2:PRA中的像素解码器和常见的VAE解码器有什么区别?
A:最关键的区别在于PRA的像素解码器是和整个模型端到端联合训练的,不是预训练好再固定使用的外部组件。它是一个因果变换器结构,能利用当前位置之前所有已生成的中间状态序列来解码当前补丁,输出是标准的768维像素补丁,因此整个系统保持了“像素输入、像素输出”的统一接口。VAE解码器通常是在独立阶段预训练的,针对重建质量优化,不考虑自回归生成的特殊需求。
Q3:PRA的中间状态维度为什么选16,而不是更小或更大?
A:这是通过消融实验确定的。当中间状态维度取8时,信息量不足,像素解码器无法还原出质量够好的补丁,FID为3.36;取16时FID最低为2.88;取32时FID反弹到3.50,取64时更是急剧恶化到7.03——这是因为维度变大后,扩散头又面临了预测高维向量的困难,单步误差重新变大,与最初不用中间状态时遇到的问题如出一辙。16维恰好是在“足够紧凑以降低预测难度”和“足够丰富以支持像素解码”之间取到的平衡点。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9