发布于2026-05-25 阅读(0)
扫一扫,手机访问

强化学习,本质上是一种让智能体通过“试错”来学习决策的技术。这个过程,很像训练一只小狗:做对了给予奖励,做错了则没有。智能体在虚拟环境中不断尝试,根据反馈调整策略,最终找到最优的行动路径。然而,这个“数字小狗”的学习效率是个老大难问题——它通常需要数百万乃至数亿次的交互才能掌握一项简单技能。若想在现实世界中收集如此海量的数据,成本之高往往令人望而却步。
正因如此,如何让机器“学得更快”一直是研究的前沿。一个颇具前景的思路是“基于模型的表示学习”:让机器在学会动作的同时,也理解环境的内在运行规律。换句话说,机器不仅要记住“在什么情况下做什么能得分”,更要构建一个关于“世界如何因我的行动而改变”的内部模型。这种将环境动力学知识编码进智能体感知系统的方法,理论上能大幅提升样本效率。
但这条路走得并不平坦。来自腾讯混元、麦吉尔大学与北京大学的研究团队发现,现有方法在核心环节上存在两处系统性偏差,制约了最终性能。为此,他们提出了名为DR.Q的新算法,全称是“Debiased model-based Representations for Q-learning”。这项研究已被第43届国际机器学习大会(ICML 2026)接收。下面,我们就来拆解这两个核心问题,看看DR.Q是如何巧妙应对的。
要理解DR.Q的贡献,首先得弄清楚机器是如何构建对世界的认知的。在基于模型的表示学习中,智能体会将“当前状态”和“计划执行的动作”压缩成一个紧凑的内部表示,然后用这个表示去预测“下一刻世界会变成什么样”。
其背后的逻辑很直观:如果一个表示能准确预测未来,那它必然抓住了环境中那些最关键的因果信息。现有方法通常通过最小化预测状态与真实状态之间的欧氏距离来训练这个表示——让预测值在数值上尽可能接近真实值。
这听起来合理,但研究团队通过严格的数学论证指出,这里存在一个根本性漏洞:数值上的接近,并不等同于信息上的关联。 这就好比两个人为了站得近,都走到了同一个错误的地点,虽然距离近了,但彼此间并没有真正理解对方的意思。
更形式化地说,“最小化两个向量间的距离”与“最大化它们之间的互信息”是两件不同的事。互信息衡量的是,知道一个变量能让你对另一个变量减少多少不确定性。纯粹的距离最小化存在“作弊”的可能——例如,将所有表示都推向同一个常数点,距离固然为零,但互信息也同时归零,学习到的表示毫无用处。
DR.Q的第一个核心创新,就是在传统的距离最小化目标之外,显式地增加了一个最大化互信息的目标。这就好比要求两个人不仅要站得近,还要能高效地交流,彼此心意相通。通过引入这个目标,机器学到的表示不仅能准确预测未来,更能确保预测与真实情况在信息层面深度绑定,从而滤除冗余噪声,提取出更本质的环境特征。
在实现上,由于高维空间中的互信息难以直接计算,DR.Q采用了InfoNCE损失函数作为替代。其思路类似于对比学习:将正确的“下一刻状态”表示作为正样本,同一批次中的其他状态表示作为负样本,训练模型拉近正样本对的距离,同时推远负样本对。这就像在一堆歌词片段中,为给定的旋律精准匹配最合适的那一段。
解决了表示学习的质量问题,DR.Q面临的第二个挑战来自训练数据的利用方式,即“经验回放”中的偏差。
强化学习中的智能体会将过往经历存入一个“经验回放缓冲区”。训练时,从中随机抽取批次进行学习,这有助于稳定训练、打破数据间的时序相关性。然而,这里潜藏着一个“首因偏差”问题:训练初期,智能体策略幼稚、行为随机,收集到的经验质量普遍较低。但这些早期经验会长期滞留在缓冲区中,持续影响后续学习,就像人类过于依赖童年模糊记忆来做成年决策一样。
常见的应对策略主要有两种。一是优先经验回放(PER),根据预测误差(时序差分误差,TD误差)的大小来决定经验被抽中的概率,误差越大,优先级越高。二是遗忘机制,简单地为旧经验赋予随时间衰减的权重,迫使模型关注近期数据。
但这两种策略各有弊端。纯粹的PER会让智能体反复咀嚼那些令其“最惊讶”的经历,但这些经历可能来自早期低效的探索策略,与当前的最优策略已相去甚远。而纯粹的遗忘机制则可能“误伤”那些虽然发生较早、但本身价值极高的罕见成功经验。
DR.Q的第二个核心创新,是将两者融合,提出了“渐进式优先经验回放”策略。其原理直观而有效:一条经验的最终被抽取概率,由它的TD误差(信息价值)和它的存储时间(新鲜度)共同决定,两者相乘。时间越久,权重衰减越多,但不会归零;价值越高,被抽中的基础概率越大。
用一个更形象的比喻:传统的PER像是一位图书管理员,只根据书籍的评分来摆放,无视出版年代;而单纯的遗忘机制则只按出版日期排序。DR.Q的策略则像一位更聪明的管理员:优先推荐那些“评分高且出版新”的书籍,但对于评分极高的经典旧著,依然会保留一定的展示机会。
研究团队从数学上证明了该策略的几个优良性质:在TD误差相同的情况下,新经验总比旧经验有更高优先级;任何经验被重复抽取的期望次数存在上界,避免了无限循环;同时,每条经验的被抽概率均大于零,确保了没有经验会被彻底遗忘。此外,在实现细节上,DR.Q采用了改进版的LAP优先级计算,并为时间衰减权重设置了底限,进一步保护了高价值历史经验。
DR.Q的整体框架基于MR.Q算法,但在表示学习和数据利用两个关键环节进行了革新。其训练流程可分为紧密耦合的两部分。
在表示学习部分,智能体维护着两个编码器网络:一个将原始环境状态编码为紧凑的表示向量,另一个则将“状态表示”与“动作”联合编码。此外,还有一个线性预测器,负责从联合表示中预测下一时刻的状态表示和即时奖励。
训练这一系统需要最小化三个损失函数的加权和: 1. 奖励预测损失:确保对即时奖励的预测准确,借鉴了DreamerV3的“两端热编码”方法,增强了对奖励尺度变化和稀疏奖励的鲁棒性。 2. 潜在动力学一致性损失:继承自MR.Q,通过均方误差使预测的下一个状态表示与目标网络计算出的真实表示在数值上对齐。 3. 互信息损失:DR.Q新增的核心,使用InfoNCE损失最大化当前状态-动作表示与下一状态表示之间的互信息。
这三个损失各司其职,共同塑造出一个高质量的内部表示:奖励损失聚焦决策收益,动力学损失保证时间上的连贯性,而互信息损失则致力于提取纯净、高信息量的环境本质特征。训练通常在多步序列上进行,以捕捉更长期的动态规律。
在决策学习部分,DR.Q采用经典的确定性策略梯度框架。策略网络根据状态表示输出动作,并添加少量噪声以鼓励探索。价值函数由两个评论家网络评估,并采用“截断双Q学习”策略(取两个评论家输出的较小值)来避免价值高估。同时,使用多步回报进行更新,加速奖励信号的传播。
值得一提的是,DR.Q在设计上追求极简与通用。它没有引入复杂的归一化层、参数重置或针对特定任务的精细调参技巧。从简单的连续控制到复杂的全身机器人任务,DR.Q均使用同一套超参数,展现了强大的泛化能力。
为了全面评估DR.Q的性能,研究团队在三大标准基准测试集的共73个任务上进行了 rigorous 的实验。
1. MuJoCo经典控制任务:在包括蚂蚁、半猎豹、单腿跳、类人行走等五个经典任务上,DR.Q在100万步的预算内,平均表现超越了MR.Q及多数基线方法。尽管在“单腿弹跳”任务上表现稍弱,但这被认为是使用统一超参数所付出的代价。
2. DeepMind Control Suite (DMC):在21个中等难度任务上,DR.Q平均得分0.886,小幅领先于MR.Q、SimBaV2等对手。而在包含四足犬和类人机器人的7个高难度任务集上,其优势更为明显,IQM得分达到0.917,领先第二名约4个百分点。特别地,在极具挑战的“四足犬奔跑”任务中,DR.Q在100万步内取得了平均721分的成绩。据研究团队所知,这是该任务在同等预算下首次突破700分的公开记录。
3. HumanoidBench 类人机器人基准:该基准使用Unitree H1机器人,任务复杂。在不带灵巧手的14个任务上,DR.Q的IQM得分为0.864,保持领先。而在带灵巧手的更高难度版本(观测与动作空间急剧膨胀)中,DR.Q的优势被放大到惊人的程度:IQM得分0.452,远超第二名SimBaV2的0.298,领先幅度接近60%。这充分证明了互信息损失在过滤高维冗余信息方面的关键作用。
4. 视觉输入任务:在12个以像素图像为输入的DMC任务上,DR.Q同样表现出色,IQM得分0.494,相比其他方法有超过50%的领先优势。
为了厘清每个设计选择的具体作用,研究团队进行了系统的消融实验。
互信息损失的作用:当移除InfoNCE损失后,在输入维度高、信息冗余严重的带手类人机器人任务上,性能出现显著下降;而在简单的半猎豹任务上,影响则较小。这验证了互信息最大化在高维复杂场景中的必要性。同时,即便移除了该损失,DR.Q凭借其他改进,性能仍与MR.Q相当。
渐进式经验回放的作用:分别测试“仅用遗忘机制”和“仅用LAP优先级”的变体。结果显示,任何单一机制都可能在某些任务上失效,而两者的结合提供了最鲁棒的性能。特别是在类人机器人任务上,移除基于TD误差的优先级采样会导致性能严重崩塌。
动力学一致性损失的作用:移除原始的均方误差损失后,在部分任务上影响有限,但在带灵巧手的复杂任务上性能显著下滑。这表明互信息损失与动力学一致性损失是互补而非替代的关系。
此外,通过t-SNE可视化可以发现,DR.Q学习到的状态-动作表示在二维空间中的分布更加连续、紧凑,而MR.Q的表示则更为分散、存在空白区域。这直观地展示了DR.Q所学表示的平滑性与结构性更优。另一个有趣的实验是,在状态向量后拼接50维随机高斯噪声以制造冗余,结果显示DR.Q受到的性能损害远小于MR.Q,再次印证了其抗噪声和提取本质特征的能力。
研究团队在论文中也坦诚讨论了对比的公平性与方法的局限性。
首先,DR.Q使用了比原始MR.Q稍大的网络规模。对照实验表明,即使为MR.Q匹配相同的超参数,其性能仍显著落后于DR.Q,证明性能提升主要源于算法创新而非算力增加。
其次,DR.Q在“单腿弹跳”任务上表现不佳,在“类人机器人视觉跑步”任务上同样失败。但后者在1M步预算内对所有方法都是挑战,而前者则可能是统一超参数在特定任务上的折衷。这反映了通用算法与任务特异性调参之间的经典权衡。
目前,DR.Q的设计重心是连续控制任务,尚未在需要复杂探索策略的任务或非马尔可夫决策过程中验证,也未在如Atari游戏等离散动作空间基准上进行测试,这些是未来的探索方向。
归根结底,DR.Q贡献了两个朴素而强大的核心思想:一是评估一个内部表示的好坏,不能只看它预测的数字是否接近,更要看它是否与真实世界建立了深刻的信息关联;二是在选择学习哪些历史经验时,需要兼顾其信息价值与时间新鲜度。这两个原则具有相当的通用性,有望被整合到更广泛的强化学习框架中,持续推动机器更高效、更智能地学习与决策。
Q1:DR.Q算法里的互信息损失具体解决了什么问题?
A:它解决了传统基于模型的表示学习中,只优化预测值与真实值之间的数值距离,而无法保证两者蕴含信息相互关联的根本缺陷。互信息损失强制要求模型学到的表示不仅能“拟合”未来,更能“理解”未来,从而提取出更纯净、更本质的环境动力学特征,尤其在输入信息冗余时效果显著。
Q2:渐进式优先经验回放和普通优先经验回放有什么区别?
A:主要区别在于对经验“年龄”的考量。普通PER只根据经验的预测误差(TD误差)决定优先级,容易过度依赖训练早期积累的低质量经验。渐进式PER则同时考虑误差大小和存储时间,为新经验赋予更高权重,同时为高价值的旧经验保留学习机会,实现了信息价值与时间新鲜度的平衡。
Q3:DR.Q在哪类任务上效果最明显?
A:在观测和动作空间维度高、信息冗余严重的复杂连续控制任务上,DR.Q的优势最为突出。例如,在带灵巧手的类人机器人任务中,其领先幅度接近60%。这类任务充满了与当前目标无关的细节信息,正是DR.Q的互信息损失发挥“去噪”和“聚焦”作用的理想场景。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9