arXiv 2607.01880v2 · 发布 2026-07-02

强化学习中分类评论家的支撑集学习

Learning the Supports for Categorical Critic in Reinforcement Learning

AUTHORS Jen-Yen Chang, Takayuki Osa, Tatsuya Harada
EVIDENCE 深度强化学习中基于分类直方图损失的critic设计
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-08 21:38:03 UTC

📝 TLDR

基于直方图的强化学习值函数估计方法(如HL-Gauss)将标量Bellman目标编码为高斯平滑的分类分布,但需预先固定支持区间,而强化学习中目标值的非平稳性使区间难以合理设定。本文提出动态学习支持上下界的方法,将其与分类表示联合优化。理论分析表明该目标构成均方贝尔曼误差的上界,且比固定支持下的HL-Gauss上界更紧。实验在连续控制任务上验证该方法无需预设区间即可稳定自适应,性能匹配或部分超越HL-Gauss基线算法。

🧭 速览

动机

HL-Gauss等直方图损失需预定义支持区间,但RL目标值非平稳,固定区间难以覆盖真实分布,影响估计精度。

方法

提出可学习的支持区间,联合优化上下界与分类参数,目标为均方贝尔曼误差的上界。

结果

在连续控制任务上无需预设区间即可稳定自适应,性能匹配HL-Gauss并在部分任务上有所提升。

结论

动态学习支持区间缓解了手工调参负担,理论证明上界更紧,为直方图类critic方法提供了更优方案。

📊 论文图表(共 8 张)

展开查看 8 张图

TL;DR

本文针对基于直方图的强化学习值函数估计方法(如 HL-Gauss)中支撑区间必须预先固定这一根本性难题,提出一种名为 DySEL 的算法,通过引入支撑网络与拉格朗日对偶机制,让支撑上下界与价值分类表示联合学习。理论证明该目标构成均方贝尔曼误差的上界,且比固定支撑的上界更紧;实验表明该方法在 DeepMind Control Suite 的多个连续控制任务上无需预设区间即可稳定自适应,性能匹配或部分超越 HL-Gauss 基线。

研究背景与动机

在基于 [[actor-critic]] 的深度强化学习中,价值函数的精确估计是策略优化的基石。传统做法将价值函数视为回归问题,通过最小化相对于自举目标值的均方误差来训练。然而近年来,分布式强化学习(Distributional RL)另辟蹊径,不再满足于估计回报的期望值,而是对回报的完整分布进行建模。C51、QR-DQN 等方法将回报分布离散化为固定支撑上的分类分布,通过最小化分布间的 KL 散度来训练,实验表明这种做法往往能带来更丰富的梯度信号和更好的最终性能。

本文关注的是一类名为高斯直方图损失(HL-Gauss)的方法,它将每个标量贝尔曼目标编码为支撑区间上的高斯平滑分类分布,再用交叉熵进行学习。这种做法兼具直方图的离散化便利性与高斯平滑的梯度平滑优势,在 Atari 等离散控制任务上展现出更稳定的训练动态和更好的可扩展性。

然而,HL-Gauss 及其同类方法面临一个根本性困境:支撑区间 必须在训练前预先固定。这在强化学习场景下尤为棘手——真实回报的分布具有高度非平稳性,早期探索阶段与最终收敛阶段所涉及的回报量级可能相差数倍甚至数十倍。若支撑设定过窄,真实回报会被截断,产生系统性偏差;若支撑设定过宽,则在固定箱数 下每个箱的宽度增加,导致量化误差增大、分辨率下降。更关键的是,不存在任何单一固定区间能够适应训练全程所有策略阶段的需求。这一矛盾构成了本文研究的出发点:能否让支撑区间随训练动态调整,使其既能覆盖真实回报分布以保证无偏性,又能保持足够紧凑以获得紧致上界?

方法

作者首先建立 HL-Gauss 与均方贝尔曼误差之间的理论联系,这是 DySEL 方法的逻辑起点。通过严格的数学推导,论文证明如下不等式成立(对应原文 Eq. 11):

该上界由三项组成:支撑宽度项、分布匹配项(通过 [[KL 散度]] 度量预测分布 与目标分布 之间的差异)、以及截断偏差项。关键洞察在于:支撑越窄,上界越紧——这并非显而易见,因为直觉上更窄的支撑可能导致更严重的截断,但理论分析表明宽度惩罚项占主导地位。这直接驱动了算法设计的核心思路:主动学习最窄可行的支撑。

然而,直接优化这个上界会遭遇数学困难——宽度惩罚与交叉熵之间存在非凸乘积关系。借鉴优化理论中的经典技巧,作者利用 AM-GM 不等式引入一个正的缩放常数 ,将乘积转化为可处理的和形式(对应原文 Eq. 12)。同时,利用全期望定律,截断偏差项被等价转化为对"漏出质量" 的控制,其中 表示高斯平滑后的目标分布落在支撑内的概率。

最终,完整的学习目标被建模为带约束的优化问题:最小化支撑宽度,但需满足质量覆盖约束 。通过引入拉格朗日乘子 ,问题转化为 minimax 优化(对应原文 Eq. 16):

其中 为评论家网络参数, 为支撑区间网络参数(输出两维并排序以保证 ),而 作为拉格朗日乘子通过单独的优化器最大化约束违反量。这种对抗博弈机制精妙地平衡了两股力量:一方面, 的梯度会推动支撑扩张以吸收漏出质量;另一方面,宽度惩罚项 则反向压缩支撑。两股力量的对立使得系统趋于一个动态平衡——支撑既不过宽(浪费量化分辨率)也不过窄(产生截断偏差)。

在实现层面,支撑网络采用标准三隐层 MLP,最终输出 2 维向量并通过排序操作保证顺序关系。高斯平滑的标准差 与 bin 宽度 成正比,设定 sigma-to-width 比例为 0.75,并设置最小裁剪 以防止过小的 导致数值问题。值得注意的是,虽然理论分析中使用了 这一对称形式,但实际实验中学习到的支撑确实呈现出近似对称的特性——这是当前方法的一个隐性假设,也构成了后续改进的空间。

实验与结果

实验在 DeepMind Control Suite 的 11 个连续控制任务上进行,涵盖从简单运动(cheetah-run)到复杂人形控制(humanoid-run)的广泛难度范围。所有任务的最大回报设定为 1000,这为评估提供了统一的归一化基准。算法基线包括:标准 TD3(标量回归)、TD3+HLG(固定支撑 bins)、以及 TD3+DySEL(本文方法)。评估协议采用每任务 10 个随机种子、训练 300 万步、每万步评估 20 个回合,使用 IQM(跨种子分位均值)与 95% bootstrap 置信区间进行统计分析。

核心实验结果回答了四个关键问题。首先,在性能层面,TD3+DySEL 在大多数任务上与 TD3+HLG 持平,并在 humanoid 系列任务(四足 runner/walker、fish-swim)上展现出明显优势。这一结果颇为有趣——humanoid 类任务恰恰是回报分布变化范围最大、最需要动态支撑的任务类型。其次,通过可视化支撑区间的训练动态,作者发现不同任务呈现出两类截然不同的行为模式:finger-turn_hard、hopper-hop 等任务支撑保持相对稳定,而 cheetah-run、humanoid 类、四足任务则呈现支撑逐渐扩张的趋势。这种差异反映了不同任务在训练过程中回报分布演化模式的本质区别。

消融实验进一步验证了各组件的必要性。去宽度惩罚项后,支撑发散至无穷大——交叉熵通过不断扩大支撑区间使漏出质量趋于零,从而被虚假地最小化;去质量约束项后,支撑在需要扩张的任务上变得过窄,量化误差主导了误差来源。完整 DySEL 的表现始终优于两个消融版本,印证了对抗博弈设计的必要性。

一个设计精巧的"反哺"实验进一步验证了学到支撑的合理性:将 DySEL 训练末期学到的支撑区间喂给固定支撑的 HL-Gauss,在支撑稳定的任务上后者性能有所提升,而在需要支撑扩张的任务上仍劣于 DySEL 本身。这既说明 DySEL 学到的支撑确实捕捉到了任务特性,也说明静态切换支撑无法替代全程动态适应。

关于超参敏感性,论文进行了 的网格搜索,发现 是唯一需要调优的关键参数—— 越大,初始支撑越窄,对应更强的宽度惩罚; 越小,支撑越宽,质量约束的权重相对提升。初始化支撑区间(测试了 三种)对最终性能影响有限,说明算法对初始假设具有较强的鲁棒性。

讨论与可借鉴点

论文的局限性与未解决的问题同样值得关注。理论层面,当前上界基于 min-max Lagrangian 鞍点优化,双学习率(评论家网络与对偶变量 的学习率分开设置)对训练稳定性有显著影响,作者在附录中承认这是一个敏感点。未来方向之一是采用 PID-controlled Lagrangian 等自适应对偶更新机制替代朴素的拉格朗日乘子法,以期获得更稳健的训练动态。

设计上, 这一对称结构隐含了对称支撑的先验假设,无法表达真实回报分布中常见的非对称性。若将上界推广至非对称形式,可能在某些任务上获得更紧的界。此外,高斯核宽度 当前仍由 bin 宽度 决定,未能与支撑区间独立学习,这意味着对于折扣因子动态变化或奖励尺度差异悬殊的任务,同一套 配置可能并非最优。

从更宏观的视角看,本文的方法论提供了一个可迁移的范式:当某个正则项与损失函数的乘积难以优化时,将其转化为带约束的 minimax 问题往往是一个可行方向。具体到强化学习中的函数逼近,上界越紧意味着优化目标与真实目标之间的代理误差越小,这不仅有助于提升最终性能,还能使训练过程更加透明和可预测——实验中美中不足的是算力信息的缺失,这使得独立复现的成本难以评估。

总体而言,DySEL 在理论与实践两个层面都做出了有效贡献:理论上建立了直方图损失与贝尔曼误差之间的定量联系,指出"支撑宽度决定上界紧度"这一核心洞察;实践上提供了无需预设区间的端到端解决方案,且消融实验充分、超参敏感度透明。对于关注分布式强化学习、函数逼近精度、以及损失函数设计的从业者而言,这项工作提供了值得借鉴的思路与可复用的实现框架。

摘要

价值函数是基于行动者-评论家(actor-critic)的深度强化学习(RL)中的核心组成部分。通常,这些函数被训练为一个回归任务,通过最小化相对于自举目标值的均方误差(MSE)来实现。同时,在分布式强化学习中,基于分布式 Bellman 算子对回报分布进行建模。本工作研究了一种近期提出的方法——高斯直方图损失(HL-Gauss),该方法通过将每个标量 Bellman 目标编码为高斯平滑的分类目标,将价值估计重新表述为分类问题。尽管该方法具有潜力,但将基于直方图的损失应用于强化学习存在固有的挑战,最显著的是需要预先定义一个固定的支撑区间,而这一需求往往因强化学习任务中目标值通常具有非平稳和随机的特性而变得复杂。在本工作中,我们提出了一种动态学习支撑上下界的方法,而非事先指定它们。我们推导出一个目标函数,该函数在学习标量值的分类表示的同时联合学习这些边界,并证明该目标函数构成了均方 Bellman 误差的一个上界。我们的理论分析进一步表明,该界比 HL-Gauss 中非学习支撑的相应界更紧。实验上,所提出的目标函数能够稳定地自适应调整支撑区间,在大多数连续控制任务上与基于 HL-Gauss 的行动者-评论家算法表现相当,并在部分任务上有所改进,且无需预先指定支撑区间。

Abstract

Value functions are an essential component in actor-critic based deep reinforcement learning (RL). Conventionally, these functions are trained as a regression task by minimising the mean squared error (MSE) relative to bootstrapped target values. Meanwhile, in distributional RL, a distribution of returns is modelled based on the distributional Bellman operator. This work investigates the Gaussian Histogram Loss (HL-Gauss), a recent approach that reframes value estimation as classification by encoding each scalar Bellman target as a Gaussian-smoothed categorical target. Despite its potential, applying histogram-based losses to RL presents inherent challenges, most notably the requirement to pre-define a fixed support interval, which is often complicated by the non-stationary and stochastic nature of target values typically found in RL tasks. In this work, we propose an approach that dynamically learns the lower and upper bounds of the support instead of assigning them beforehand. We derive an objective that jointly learns these bounds whilst learning the categorical representation of the scalar values, and we show that this objective forms an upper bound on the mean-squared Bellman error. Our theoretical analysis further shows that this bound is tighter than that of non-learned supports of HL-Gauss. Empirically, the proposed objective enables stable adaptation of the support interval and matches HL-Gauss-based actor-critic algorithms on most continuous-control tasks whilst improving on a subset, without requiring a pre-specified support interval.


论文详细总结(自动生成)

论文总结:强化学习中分类评论家的支撑集学习

1. 核心问题与研究动机

在基于 actor-critic 的深度强化学习中,价值函数的精确估计至关重要。传统方法通过最小化均方 Bellman 误差(MSE Bellman)进行标量回归训练,而分布式 RL 则建模回报的完整分布。近年来,高斯直方图损失(HL-Gauss) 将标量回归重新表述为分类问题:把每个标量 Bellman 目标编码为支撑区间 上的高斯平滑分类分布,再用交叉熵进行学习。HL-Gauss 已在 Atari 等任务中展现出更平滑的梯度和更好的可扩展性。

然而,HL-Gauss 等直方图方法存在一个根本性局限:必须预先固定支撑区间。在 RL 中这带来了难以调和的矛盾:

  • 过窄:真实回报被截断(truncation bias),丢弃极端但可能极有价值的信息;
  • 过宽:在固定 bin 数 下每个 bin 变宽,量化误差增大,分辨率下降(quantisation bias )。

更棘手的是:RL 中回报分布因策略演化而高度非平稳,早期探索策略与最终收敛策略所诱导的回报量级可能差异巨大,不存在任何单一固定区间适合所有训练阶段的策略。这正是本文要解决的核心问题。


2. 方法论:DySEL 算法

2.1 理论动机:HL-Gauss 是 MSE Bellman 误差的上界

作者首先将 MSE Bellman 误差与 HL-Gauss 联系起来,证明如下分解(Eq. 11):

该上界由三项组成:绝对支撑宽度分布匹配项(KL 散度)、截断偏差。关键洞察:支撑越窄,上界越紧——这直接驱动算法去主动寻找最窄可行的支撑。

2.2 化为约束优化问题

为处理上界中宽度惩罚 × 交叉熵的非凸乘积(Boyd & Vandenberghe, 2004),作者利用 AM-GM 不等式 引入正缩放常数 (Eq. 12):

同时,利用全期望定律将截断偏差等价转化为对漏出质量 的控制(Eq. 13-14)。最终问题被建模为带约束的优化(Eq. 15):最小化宽度,但需满足

2.3 Min-Max 对抗优化目标

通过引入拉格朗日乘子 ,目标变为 minimax Lagrangian(Eq. 16):

  • :评论家网络参数;:支撑区间网络参数(标准三隐层 MLP,最终输出 2 维并排序保证 );:拉格朗日乘子(即"对手"网络)。
  • 拉格朗日乘子 通过单独的 Adam 优化器(学习率 )最大化约束违反量,迫使支撑扩张以吸收漏出质量;而宽度惩罚 则反向压缩支撑,从而形成对抗。

2.4 实现细节

  • 高斯标准差 与 bin 宽 成正比(sigma-to-width = 0.75),并设最小裁剪 ,防止 退化作弊。
  • 支撑网络最终层按初始支撑区间 初始化。
  • 与 Chen et al. (2025) 的区别:他们采用纯最小化方法;本文转为带约束的 min-max,保证宽度压缩与质量覆盖同时成立。

3. 实验设计

  • 算法框架:在 TD3(Fujimoto et al., 2018)基础上,将 critic 替换为 HL-Gauss 或 DySEL,记为 TD3+HLGTD3+DySEL
  • 基准测试:DeepMind Control Suite(Tunyasuvunakool et al., 2020)共 11 个连续控制任务,最高回报 1000:cheetah-run、finger-turn_hard、fish-swim、hopper-hop、hopper-stand、humanoid-run、humanoid-stand、humanoid-walk、quadruped-run、quadruped-walk、walker-run。
  • 基线对比
  • TD3(标量回归 baseline);
  • TD3+HLG(固定支撑 bins)。
  • 评估协议:每任务 10 seeds(0–9),训练 3M 步,每 10k 步评估 20 个回合,使用 IQM(interquantile mean)与 95% bootstrap 置信区间(Agarwal et al., 2021 推荐)。
  • 超参选择 经网格搜索选定;(所有任务统一未再调)。

4. 资源与算力

论文与附录未明确说明所用 GPU 型号、数量、训练墙钟时间等算力信息。实现基于 JAX 0.6.2(Bradbury et al., 2018)、MuJoCo 3.3.7、dm_control 1.0.34、gym 0.23.1,参考了 JAXRL 与 high-replay-ratio 的 TD3 实现。作者表示代码将在发表后开源。算力信息缺失是本文的一个轻微不足,读者难以估计复现成本。


5. 实验数量与充分性

  • 主实验:11 任务 × 10 seeds × 3 方法 = 约 330 条训练曲线(每条 3M 步),覆盖范围较广。
  • 辅助实验 / 消融(共 5 个层次):

1. 性能对比(Fig. 2):TD3 vs TD3+HLG vs TD3+DySEL;

2. 支撑区间演化(Fig. 3):11 任务的 训练动态;

3. 固定支撑反哺实验(Fig. 4):把 DySEL 学到的支撑喂给 HL-Gauss,验证学到支撑的合理性;

4. 组件消融(Fig. 5):去掉宽度惩罚 / 去掉质量约束 / 完整 DySEL;

5. 超参敏感性与初始化消融(Fig. 6–7, 附录 B): 网格 + 初始支撑

  • 客观性 选择与最终报告使用相同 seeds,作者在附录 A 明确指出此为"乐观上界估计"并附完整敏感度曲线,披露较透明
  • 公平性:所有方法共享 batch size=256、双隐层 256 单元、ReLU、Adam、lr=3e-4、、buffer=1M、warm-up=10k 步等,控制变量较充分
  • 不足:benchmark 仅限 DM Control;作者未在 Atari 或其他领域验证;humanoid 类任务上的显著优势主要归因于 选择,但该超参本身仍依赖每任务网格搜索。

6. 主要结论与发现

  • Q1(性能):TD3+DySEL 在大多数任务上与 TD3+HLG 相当,并在 humanoid-run、humanoid-stand、humanoid-walk、cheetah-run、fish-swim、quadruped 等任务上明显领先。
  • Q2(关键超参) 是最重要的超参,控制宽度惩罚与交叉熵之间的权衡; 越大,初始支撑越窄;初始化支撑区间对最终性能影响有限。
  • Q3(支撑动态):两类行为——支撑稳定(如 finger-turn_hard、hopper-hop)或逐渐扩张(如 cheetah-run、humanoid、四足任务),具体形态取决于
  • Q4(学到支撑的价值):在支撑稳定的任务上,将 DySEL 最终学到的支撑喂给 vanilla HL-Gauss 也能提升表现;在需要扩张的任务上则仍劣于 DySEL 本身。
  • Q5(组件必要性):宽度惩罚与质量约束缺一不可——去掉宽度惩罚则支撑发散到无穷大(cross-entropy 通过扩大 而被虚假最小化);去掉质量约束则在需要扩张的任务(如 cheetah-run)上支撑过窄。

7. 优点与亮点

  • 理论贡献明确:严格证明 HL-Gauss 是 MSE Bellman 误差的上界,并指出支撑宽度直接决定上界松紧度。
  • 新视角:将"支撑学习"从纯最小化转化为带约束的 min-max 优化,理论洞见比 Chen et al. (2025) 更深。
  • 实用性强:支撑自动调整,免去手工指定 ,且唯一需调的超参 网格较小(6 个值)。
  • 消融充分:覆盖组件、超参、初始化三个维度;披露"乐观上界"估计方法并附完整敏感度曲线,透明度高
  • 实现完整:附录给出 JAX 参考实现(Listing 1–2),方便复现。

8. 不足与局限

1. 理论局限:上界基于 min-max Lagrangian 鞍点优化,双学习率敏感;激进的对偶更新可能导致支撑网络早期震荡,作者建议未来用 PID-controlled Lagrangian(Stooke et al., 2020)取代朴素对偶上升。

2. 支撑近似对称:当前 项隐含对称结构,学到的支撑几乎总是对称的,无法表达真实回报的非对称分布。

3. 仍固定:高斯核宽度仍由 决定,未与支撑独立学习,难以配合动态折扣因子 (François-Lavet et al., 2015)等进阶设定。

4. 评测基准单一:仅在 DM Control 上评估,未在 Atari、稀疏奖励、真实机器人等场景验证;泛化性存疑。

5. 超参选择偏差 在与最终报告相同的 seeds 上做网格搜索,附录虽披露敏感性但仍可能高估性能。

6. 算力信息缺失:未报告 GPU 型号、数量与训练时长,复现成本难以估算。

7. 应用场景限制:该方法聚焦分类评论家分支,与 IQN / FQF 等分位数方法相比,保留了对 bin 结构的依赖,对极端尾部回报的建模能力仍受直方图离散化限制。


(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记