当前位置:

首页 > 硬件相关 > 腾讯与北大:让强化学习机器人"既见树木,又见森林"的新方法

腾讯与北大:让强化学习机器人"既见树木,又见森林"的新方法

腾讯与北大等提出强化学习新算法DR.Q,通过引入互信息损失帮助智能体理解环境本质特征,并结合经验价值与新鲜度设计数据采样策略,平衡历史经验利用。在多项复杂任务测试中,该方法显著提升了学习效率,尤其在处理高维冗余信息时表现优异。


强化学习,本质上是一种让智能体通过“试错”来学习决策的技术。这个过程,很像训练一只小狗:做对了给予奖励,做错了则没有。智能体在虚拟环境中不断尝试,根据反馈调整策略,最终找到最优的行动路径。然而,这个“数字小狗”的学习效率是个老大难问题——它通常需要数百万乃至数亿次的交互才能掌握一项简单技能。若想在现实世界中收集如此海量的数据,成本之高往往令人望而却步。

正因如此,如何让机器“学得更快”一直是研究的前沿。一个颇具前景的思路是“基于模型的表示学习”:让机器在学会动作的同时,也理解环境的内在运行规律。换句话说,机器不仅要记住“在什么情况下做什么能得分”,更要构建一个关于“世界如何因我的行动而改变”的内部模型。这种将环境动力学知识编码进智能体感知系统的方法,理论上能大幅提升样本效率。

但这条路走得并不平坦。来自腾讯混元、麦吉尔大学与北京大学的研究团队发现,现有方法在核心环节上存在两处系统性偏差,制约了最终性能。为此,他们提出了名为DR.Q的新算法,全称是“Debiased model-based Representations for Q-learning”。这项研究已被第43届国际机器学习大会(ICML 2026)接收。下面,我们就来拆解这两个核心问题,看看DR.Q是如何巧妙应对的。

一、为什么机器的“世界观”会出错

要理解DR.Q的贡献,首先得弄清楚机器是如何构建对世界的认知的。在基于模型的表示学习中,智能体会将“当前状态”和“计划执行的动作”压缩成一个紧凑的内部表示,然后用这个表示去预测“下一刻世界会变成什么样”。

其背后的逻辑很直观:如果一个表示能准确预测未来,那它必然抓住了环境中那些最关键的因果信息。现有方法通常通过最小化预测状态与真实状态之间的欧氏距离来训练这个表示——让预测值在数值上尽可能接近真实值。

这听起来合理,但研究团队通过严格的数学论证指出,这里存在一个根本性漏洞:数值上的接近,并不等同于信息上的关联。 这就好比两个人为了站得近,都走到了同一个错误的地点,虽然距离近了,但彼此间并没有真正理解对方的意思。

更形式化地说,“最小化两个向量间的距离”与“最大化它们之间的互信息”是两件不同的事。互信息衡量的是,知道一个变量能让你对另一个变量减少多少不确定性。纯粹的距离最小化存在“作弊”的可能——例如,将所有表示都推向同一个常数点,距离固然为零,但互信息也同时归零,学习到的表示毫无用处。

DR.Q的第一个核心创新,就是在传统的距离最小化目标之外,显式地增加了一个最大化互信息的目标。这就好比要求两个人不仅要站得近,还要能高效地交流,彼此心意相通。通过引入这个目标,机器学到的表示不仅能准确预测未来,更能确保预测与真实情况在信息层面深度绑定,从而滤除冗余噪声,提取出更本质的环境特征。

在实现上,由于高维空间中的互信息难以直接计算,DR.Q采用了InfoNCE损失函数作为替代。其思路类似于对比学习:将正确的“下一刻状态”表示作为正样本,同一批次中的其他状态表示作为负样本,训练模型拉近正样本对的距离,同时推远负样本对。这就像在一堆歌词片段中,为给定的旋律精准匹配最合适的那一段。

二、机器为何会对“早年经历”念念不忘

解决了表示学习的质量问题,DR.Q面临的第二个挑战来自训练数据的利用方式,即“经验回放”中的偏差。

强化学习中的智能体会将过往经历存入一个“经验回放缓冲区”。训练时,从中随机抽取批次进行学习,这有助于稳定训练、打破数据间的时序相关性。然而,这里潜藏着一个“首因偏差”问题:训练初期,智能体策略幼稚、行为随机,收集到的经验质量普遍较低。但这些早期经验会长期滞留在缓冲区中,持续影响后续学习,就像人类过于依赖童年模糊记忆来做成年决策一样。

常见的应对策略主要有两种。一是优先经验回放(PER),根据预测误差(时序差分误差,TD误差)的大小来决定经验被抽中的概率,误差越大,优先级越高。二是遗忘机制,简单地为旧经验赋予随时间衰减的权重,迫使模型关注近期数据。

但这两种策略各有弊端。纯粹的PER会让智能体反复咀嚼那些令其“最惊讶”的经历,但这些经历可能来自早期低效的探索策略,与当前的最优策略已相去甚远。而纯粹的遗忘机制则可能“误伤”那些虽然发生较早、但本身价值极高的罕见成功经验。

DR.Q的第二个核心创新,是将两者融合,提出了“渐进式优先经验回放”策略。其原理直观而有效:一条经验的最终被抽取概率,由它的TD误差(信息价值)和它的存储时间(新鲜度)共同决定,两者相乘。时间越久,权重衰减越多,但不会归零;价值越高,被抽中的基础概率越大。

用一个更形象的比喻:传统的PER像是一位图书管理员,只根据书籍的评分来摆放,无视出版年代;而单纯的遗忘机制则只按出版日期排序。DR.Q的策略则像一位更聪明的管理员:优先推荐那些“评分高且出版新”的书籍,但对于评分极高的经典旧著,依然会保留一定的展示机会。

研究团队从数学上证明了该策略的几个优良性质:在TD误差相同的情况下,新经验总比旧经验有更高优先级;任何经验被重复抽取的期望次数存在上界,避免了无限循环;同时,每条经验的被抽概率均大于零,确保了没有经验会被彻底遗忘。此外,在实现细节上,DR.Q采用了改进版的LAP优先级计算,并为时间衰减权重设置了底限,进一步保护了高价值历史经验。

三、DR.Q的完整架构:如何协同运作

DR.Q的整体框架基于MR.Q算法,但在表示学习和数据利用两个关键环节进行了革新。其训练流程可分为紧密耦合的两部分。

在表示学习部分,智能体维护着两个编码器网络:一个将原始环境状态编码为紧凑的表示向量,另一个则将“状态表示”与“动作”联合编码。此外,还有一个线性预测器,负责从联合表示中预测下一时刻的状态表示和即时奖励。

训练这一系统需要最小化三个损失函数的加权和: 1. 奖励预测损失:确保对即时奖励的预测准确,借鉴了DreamerV3的“两端热编码”方法,增强了对奖励尺度变化和稀疏奖励的鲁棒性。 2. 潜在动力学一致性损失:继承自MR.Q,通过均方误差使预测的下一个状态表示与目标网络计算出的真实表示在数值上对齐。 3. 互信息损失:DR.Q新增的核心,使用InfoNCE损失最大化当前状态-动作表示与下一状态表示之间的互信息。

这三个损失各司其职,共同塑造出一个高质量的内部表示:奖励损失聚焦决策收益,动力学损失保证时间上的连贯性,而互信息损失则致力于提取纯净、高信息量的环境本质特征。训练通常在多步序列上进行,以捕捉更长期的动态规律。

在决策学习部分,DR.Q采用经典的确定性策略梯度框架。策略网络根据状态表示输出动作,并添加少量噪声以鼓励探索。价值函数由两个评论家网络评估,并采用“截断双Q学习”策略(取两个评论家输出的较小值)来避免价值高估。同时,使用多步回报进行更新,加速奖励信号的传播。

值得一提的是,DR.Q在设计上追求极简与通用。它没有引入复杂的归一化层、参数重置或针对特定任务的精细调参技巧。从简单的连续控制到复杂的全身机器人任务,DR.Q均使用同一套超参数,展现了强大的泛化能力。

四、实战检验:跨越73个任务的全面评测

为了全面评估DR.Q的性能,研究团队在三大标准基准测试集的共73个任务上进行了 rigorous 的实验。

1. MuJoCo经典控制任务:在包括蚂蚁、半猎豹、单腿跳、类人行走等五个经典任务上,DR.Q在100万步的预算内,平均表现超越了MR.Q及多数基线方法。尽管在“单腿弹跳”任务上表现稍弱,但这被认为是使用统一超参数所付出的代价。

2. DeepMind Control Suite (DMC):在21个中等难度任务上,DR.Q平均得分0.886,小幅领先于MR.Q、SimBaV2等对手。而在包含四足犬和类人机器人的7个高难度任务集上,其优势更为明显,IQM得分达到0.917,领先第二名约4个百分点。特别地,在极具挑战的“四足犬奔跑”任务中,DR.Q在100万步内取得了平均721分的成绩。据研究团队所知,这是该任务在同等预算下首次突破700分的公开记录。

3. HumanoidBench 类人机器人基准:该基准使用Unitree H1机器人,任务复杂。在不带灵巧手的14个任务上,DR.Q的IQM得分为0.864,保持领先。而在带灵巧手的更高难度版本(观测与动作空间急剧膨胀)中,DR.Q的优势被放大到惊人的程度:IQM得分0.452,远超第二名SimBaV2的0.298,领先幅度接近60%。这充分证明了互信息损失在过滤高维冗余信息方面的关键作用。

4. 视觉输入任务:在12个以像素图像为输入的DMC任务上,DR.Q同样表现出色,IQM得分0.494,相比其他方法有超过50%的领先优势。

五、拆解分析:每个改进究竟贡献几何

为了厘清每个设计选择的具体作用,研究团队进行了系统的消融实验。

互信息损失的作用:当移除InfoNCE损失后,在输入维度高、信息冗余严重的带手类人机器人任务上,性能出现显著下降;而在简单的半猎豹任务上,影响则较小。这验证了互信息最大化在高维复杂场景中的必要性。同时,即便移除了该损失,DR.Q凭借其他改进,性能仍与MR.Q相当。

渐进式经验回放的作用:分别测试“仅用遗忘机制”和“仅用LAP优先级”的变体。结果显示,任何单一机制都可能在某些任务上失效,而两者的结合提供了最鲁棒的性能。特别是在类人机器人任务上,移除基于TD误差的优先级采样会导致性能严重崩塌。

动力学一致性损失的作用:移除原始的均方误差损失后,在部分任务上影响有限,但在带灵巧手的复杂任务上性能显著下滑。这表明互信息损失与动力学一致性损失是互补而非替代的关系。

此外,通过t-SNE可视化可以发现,DR.Q学习到的状态-动作表示在二维空间中的分布更加连续、紧凑,而MR.Q的表示则更为分散、存在空白区域。这直观地展示了DR.Q所学表示的平滑性与结构性更优。另一个有趣的实验是,在状态向量后拼接50维随机高斯噪声以制造冗余,结果显示DR.Q受到的性能损害远小于MR.Q,再次印证了其抗噪声和提取本质特征的能力。

六、讨论与展望

研究团队在论文中也坦诚讨论了对比的公平性与方法的局限性。

首先,DR.Q使用了比原始MR.Q稍大的网络规模。对照实验表明,即使为MR.Q匹配相同的超参数,其性能仍显著落后于DR.Q,证明性能提升主要源于算法创新而非算力增加。

其次,DR.Q在“单腿弹跳”任务上表现不佳,在“类人机器人视觉跑步”任务上同样失败。但后者在1M步预算内对所有方法都是挑战,而前者则可能是统一超参数在特定任务上的折衷。这反映了通用算法与任务特异性调参之间的经典权衡。

目前,DR.Q的设计重心是连续控制任务,尚未在需要复杂探索策略的任务或非马尔可夫决策过程中验证,也未在如Atari游戏等离散动作空间基准上进行测试,这些是未来的探索方向。

归根结底,DR.Q贡献了两个朴素而强大的核心思想:一是评估一个内部表示的好坏,不能只看它预测的数字是否接近,更要看它是否与真实世界建立了深刻的信息关联;二是在选择学习哪些历史经验时,需要兼顾其信息价值与时间新鲜度。这两个原则具有相当的通用性,有望被整合到更广泛的强化学习框架中,持续推动机器更高效、更智能地学习与决策。

Q&A

Q1:DR.Q算法里的互信息损失具体解决了什么问题?

A:它解决了传统基于模型的表示学习中,只优化预测值与真实值之间的数值距离,而无法保证两者蕴含信息相互关联的根本缺陷。互信息损失强制要求模型学到的表示不仅能“拟合”未来,更能“理解”未来,从而提取出更纯净、更本质的环境动力学特征,尤其在输入信息冗余时效果显著。

Q2:渐进式优先经验回放和普通优先经验回放有什么区别?

A:主要区别在于对经验“年龄”的考量。普通PER只根据经验的预测误差(TD误差)决定优先级,容易过度依赖训练早期积累的低质量经验。渐进式PER则同时考虑误差大小和存储时间,为新经验赋予更高权重,同时为高价值的旧经验保留学习机会,实现了信息价值与时间新鲜度的平衡。

Q3:DR.Q在哪类任务上效果最明显?

A:在观测和动作空间维度高、信息冗余严重的复杂连续控制任务上,DR.Q的优势最为突出。例如,在带灵巧手的类人机器人任务中,其领先幅度接近60%。这类任务充满了与当前目标无关的细节信息,正是DR.Q的互信息损失发挥“去噪”和“聚焦”作用的理想场景。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
硬件相关 强化学习
相关文章 更多
显示器色温怎么调不刺眼?色温调多少看着最舒服
显示器色温怎么调不刺眼?色温调多少看着最舒服

详解显示器色温的舒适调节区间、刺眼的核心诱因,以及在不同使用场景与环境光下的具体调节步骤与校准方法。

显卡风扇不转怎么回事判断是否正常及解决方法
显卡风扇不转怎么回事判断是否正常及解决方法

发现显卡风扇不转先别慌,这很可能是正常的智能启停功能。本文详解如何区分待机静音与硬件故障,提供从软件检测到物理清理的完整解决思路。

笔记本加内存条后无法开机怎么办及解决方法
笔记本加内存条后无法开机怎么办及解决方法

笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

电脑主机前置usb不能用怎么解决排查修复教程
电脑主机前置usb不能用怎么解决排查修复教程

针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

无线鼠标充不进电解决办法及故障排查步骤
无线鼠标充不进电解决办法及故障排查步骤

遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

蓝牙游戏手柄连接教程吃鸡
蓝牙游戏手柄连接教程吃鸡

想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

显示器画面模糊抖动怎么解决及排查方法教程
显示器画面模糊抖动怎么解决及排查方法教程

遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

小米智能门锁换电池后怎么开机
小米智能门锁换电池后怎么开机

小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

电视机声音怎么连接到外置音响
电视机声音怎么连接到外置音响

想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
Figma macOS版
Figma macOS版
Mac

Figma 是面向产品团队的界面与原型设计平台,Mac 客户端支持 Intel 和 Apple 芯片,可直接调用本机字体。它将矢量绘制、自动布局、组件库、交互原型、评论及多人实时编辑集中在统一工作区。

Final Cut Pro macOS版
Final Cut Pro macOS版
Mac

Final Cut Pro 是 Apple 面向 Mac 用户推出的专业视频剪辑软件,提供磁性时间线、媒体资源库、多机位剪辑、字幕生成、对象跟踪、调色、音频处理和多格式输出等工具。软件针对 Apple 芯片优化。

FreeCAD macOS版
FreeCAD macOS版
Mac

FreeCAD是一款免费开源的三维参数化建模软件,可通过草图、约束和特征历史构建尺寸精确且便于修改的模型。软件提供零件设计、装配、工程制图、建筑信息模型、有限元分析、数控加工及三维打印等工作台,并支持插件、宏和Python脚本扩展。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。