无需 Bellman 完备性的拟合占据比评估
Fitted Occupancy-Ratio Evaluation without Bellman Completeness
📝 TLDR
离线强化学习中,现有的占用率比率估计方法通常需要Bellman完备性假设。本文提出FORE方法,通过伴随Bellman递归将折扣占用率比率表征为不动点,每次迭代在单步转移数据上求解单层密度比目标,并以KL散度投影到对数比率类。关键条件仅需折扣占用率比率本身的可实现性,在种群层获得KL收缩性,并得到有限样本遗憾界。该方法支持奖励重加权、占用率加权FQE及双稳健估计,证明比率可实现性足以替代完备性假设。
🧭 速览
离线策略评估中,现有占用率比率估计依赖Bellman完备性等强假设,限制了在函数逼近下的实际适用性。
FORE基于伴随Bellman递归,在单步转移数据上以KL散度将比率类投影到对数比空间,逐次逼近真实折扣占用率比率。
证明种群递归在KL散度下由伴随Bellman算子收缩,有限样本遗憾界由对数比逼近误差与假设类复杂度共同控制。
折扣占用率比率可实现性可作为离线策略评估的充分条件,无需Bellman完备性,并支持奖励重加权、加权FQE与双稳健估计。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
本文提出拟合占据比评估(FORE),通过伴随 Bellman 递归刻画折扣占据比为不动点,在每次迭代中求解单层密度比目标并以 KL 散度投影。核心突破在于只需占据比自身的可实现性,无需任何 Bellman 完备性假设——伴随 Bellman 算子在 KL 散度下的 -收缩性与 KL 投影天然相容,使得种群递归向真实比值指数收敛。实验表明该方法在值类不 Bellman 完备时仍能稳定工作。
研究背景与动机
离线强化学习的一个核心问题是离策略评估:我们需要用离线收集的行为数据评估一个目标策略的价值,却面临两个分布之间的偏移——行为策略产生的样本分布与目标策略的折扣占据分布不一致。占据比(occupancy ratio)(目标策略的折扣占据测度与离线数据分布的密度比)正是校正这一偏移的关键工具:通过 对样本进行重加权,可以无偏地估计目标策略的价值。
然而,现有估计占据比的方法大多建立在较强制条件之上。[[原-对偶方法]]和[[极小极大优化]]框架(如 DualDICE、Minimax Weight Learning)需要在评论家函数类上施加占据平衡矩,要求评论家类能够"检测"候选权重对应的伴随 Bellman 残差——这本质上是评论家完备性假设。[[拟合 Q 评估]](FQE)类方法则需要值函数可实现性加上 Bellman 完备性或投影算子稳定性:当值类在离线数据分布下投影时,由于目标策略占据分布与数据分布不匹配,投影 Bellman 递归可能发散而非收敛。这些完备性要求在实践中往往难以满足,限制了方法的适用范围。
本文的切入点在于重新审视占据比估计的本质:也许问题不在于值函数,而在于我们使用何种投影几何。FORE 放弃了传统的 投影,转而采用 KL 散度投影——这是一个关键的选择,因为伴随 Bellman 算子在 KL 散度下天然具有 -收缩性,且 KL 投影与该收缩几何完美相容。
方法
FORE 的核心思想是将折扣占据比表征为伴随 Bellman 算子的不动点。折扣占据测度满足 ,取 Radon–Nikodym 导数后得到 Bellman 方程:
这意味着真实占据比是算子 的不动点。FORE 的关键洞察是:该算子在 KL 散度下是严格收缩的。对任意 :
这一性质由 KL 散度的联合凸性与马尔可夫核的数据处理不等式直接导出。
基于这一收缩性,FORE 通过拟合不动点迭代来估计占据比。每次迭代包含两步:先用当前比值 计算伴随 Bellman 映像 ,再将该映像投影到对数比函数类 上(用 参数化):
投影后的比值 作为下一轮迭代的起点。由于 KL 投影恰好保留了收缩几何中最"近"的点,整个种群递归在相对熵意义下向真实比值收缩:若 (占据比可实现),则
该方法的近似条件仅是折扣占据比自身的可实现性,无需值函数可实现性、Bellman 完备性或评论家完备性——这是与现有方法最根本的区别。
在实现层面,每次迭代只需在一步转移数据上求解单层密度比目标。将 KL 投影损失展开后得到:
其中 是对数配分函数,。这是一个标准的监督学习目标,可以用指数族凸优化方法求解。
实验与结果
论文在两个合成环境中验证了 FORE 的有效性。
第一个是 Baird 风格有限 [[马尔可夫 reward 过程|MRP]]:状态空间含 6 个对称上层状态和 1 个下层状态,折扣因子 。值类为线性类 ,其中特征 。该设置中折扣占据比在两类状态上分别为常值 和 ,可被一维对数线性类精确表示,但值类不是 Bellman 完备的—— 会产生类外的二次分量。实验结果显示:线性 FQE 的投影乘子高达 (发散),而 FORE 的比递归乘子仅为 (强收缩),FORE-加权 FQE 的乘子为 (稳定收敛)。
第二个是线性高斯策略评估:状态-动作空间 ,离线数据服从高斯分布 ,目标策略转移为线性高斯。值类是三维仿射类 ,同样不满足 Bellman 完备性(因为 包含 和 等二次项)。样本量扫描实验(,各 300 次重复)和折扣因子扫描实验( 从 到 ,,各 500 次重复)表明,FORE 在各种条件下均能稳定收敛,其有限样本误差随样本量增加按 速率下降,符合理论预言。
讨论与可借鉴点
FORE 的核心贡献在于确立了占据比可实现性作为离线策略评估的充分条件——这是比现有完备性假设更弱、更自然的近似条件。伴随 Bellman 算子的 KL 收缩性与 KL 投影的相容性是一个漂亮的几何结构,它揭示了为何选择 KL 散度而非 范数对于这个问题至关重要。
不过,该方法也存在局限。首先,论文仅在合成环境(离散 MRP 和线性高斯)中验证,高维非线性真实任务的性能尚待考察。其次,极高折扣因子区域()的数值稳定性可能存在问题,因为 项会导致误差放大。第三,FORE 产生的占据比可直接用于奖励重加权、双重鲁棒估计和占据加权 FQE,但三种用途之间的权衡尚未系统研究。
对后续研究而言,FORE 的思路可以启发其他领域:在需要估计某个算子不动点的问题中,选择与算子收缩性相匹配的投影几何可能是关键。此外,"单层密度比目标"的设计也值得借鉴——它将复杂的双层优化问题转化为标准监督学习,避免了原-对偶方法常见的鞍点求解困难。
摘要
占据比能够修正离线强化学习中的分布偏移,是离策略评估的核心。现有原-对偶与极小极大方法通常通过在评论家函数类上施加占据平衡矩来估计这些比值。我们提出拟合占据比评估(FORE),这是一种拟合不动点方法,通过伴随 Bellman 递归来刻画折扣占据比。在每次迭代中,FORE 在一步转移数据上求解单层密度比目标,从而在 Kullback--Leibler (KL) 散度下将伴随 Bellman 映像投影到对数比函数类之上。与拟合 Q 评估的分析(通常要求值函数可实现性以及 Bellman 完备性或投影算子稳定性)不同,我们的核心近似条件仅是折扣占据比自身的可实现性。在此条件下,由于伴随 Bellman 算子具有 KL 收缩性质,KL 投影的总体递推在相对熵下向真实比值收缩。对于经验递推,我们建立了有限样本遗憾界,证明了在 KL 散度意义下的收敛,其误差包含对数比近似误差以及由比值假设类复杂度控制的统计误差。拟合得到的比值支持通过奖励重加权进行直接的价值估计、占据加权的拟合 Q 评估,以及结合拟合比值与拟合 Q 函数的双重鲁棒估计。综上,这些结果将折扣占据比的可实现性确定为离线策略评估的充分条件,且无需任何完备性假设。
Abstract
Occupancy ratios correct distribution shift in offline reinforcement learning and are central to off-policy evaluation. Existing primal-dual and minimax methods typically estimate these ratios by enforcing occupancy-balance moments over a critic class. We propose fitted occupancy-ratio evaluation (FORE), a fitted fixed-point method that characterizes the discounted occupancy ratio through an adjoint Bellman recursion. At each iteration, FORE solves a single-level density-ratio objective on one-step-transition data, thereby projecting the adjoint Bellman image onto a log-ratio class in Kullback--Leibler (KL) divergence. Unlike analyses of fitted Q-evaluation, which typically require value-function realizability together with Bellman completeness or projected-operator stability, our central approximation condition is just realizability of the discounted occupancy ratio itself. Under this condition, the population KL-projected recursion contracts in relative entropy toward the true ratio by virtue of the adjoint Bellman operator being a KL-contraction. For the empirical recursion, we establish finite-sample regret bounds that yield convergence in KL up to log-ratio approximation error and a statistical error governed by the complexity of the ratio hypothesis class. The fitted ratio supports direct value estimation by reward reweighting, occupancy-weighted fitted Q-evaluation, and doubly robust estimation that combines the fitted ratio with a fitted Q-function. Together, these results identify discounted occupancy-ratio realizability as a sufficient condition for offline policy evaluation without any completeness assumptions.
论文详细总结(自动生成)
论文总结:Fitted Occupancy-Ratio Evaluation without Bellman Completeness
1. 核心问题与研究动机
核心问题:离线策略评估(Off-Policy Evaluation, OPE)需要校正离线数据分布与目标策略折扣占据分布之间的分布偏移。当前基于密度比(occupancy ratio)的方法主要依赖原-对偶(primal-dual)或极小极大(minimax)框架,通过在评论家(critic)函数类上施加占据平衡矩条件来估计比值。然而这类方法的理论保证通常要求附加的完备性假设,包括:
- 值函数可实现性 + Bellman 完备性 / 投影算子稳定性:对于 Fitted Q-Evaluation(FQE)类方法,Bellman 算子本身在目标策略占据测度下收缩,但投影在离线数据分布下进行,二者测度不匹配导致投影 Bellman 递归可能发散。
- 评论家完备性 / 对偶可实现性:对于 DualDICE、GenDICE、Minimax Weight Learning(MWL)等方法,需要评论家类能够"检测"候选权重对应的伴随 Bellman 残差。
- 固有的 Bellman 误差控制:需要 Bellman 映像在函数类内保持稳定。
研究目标:寻找一种估计折扣占据比 的方法,其核心近似条件仅需折扣占据比自身的可实现性,无需任何完备性假设。
2. 方法论:FORE 算法
2.1 核心思想
FORE 将折扣占据比刻画为伴随 Bellman 算子的不动点,然后通过 KL 投影的拟合迭代进行估计。其关键洞察在于:伴随 Bellman 算子在 KL 散度下是 -收缩的,且 KL 投影与该收缩几何相容,因此投影后的种群递归继承同样的收缩性。
2.2 关键技术细节
占据比的 Bellman 方程:折扣占据测度满足 ,取 Radon–Nikodym 导数得:
KL 收缩性(引理 3.1):对任意 ,
由 KL 的联合凸性与马尔可夫核的数据处理不等式可得。
KL 投影的简化(引理 3.2):假设条件 C1 成立, 在 上的 KL 投影等价于求解:
其中 ,。该损失仅依赖初始状态一阶矩、一步转移矩以及对数配分函数,可用标准监督学习求解。
算法流程(Algorithm 1):
1. 对每个离线转移 ,从 采样 ,构造 。
2. 初始化 。
3. 对 ,求解经验 ERM:
其中 是上述 KL 投影损失的经验版本(用样本均值替换期望,经验对数配分函数 )。
4. 更新 。
种群层保证(定理 4.1):在条件 C1–C4 下,存在常数 ,使得对每个 :
其中 。若 ,则 ,投影误差消失,得到严格收缩 。
有限样本保证(定理 4.2):在经验归一化下,使用广义 KL 散度 度量误差,高概率成立:
其中临界半径 由对数比类 与诱导乘子类 的局部 Rademacher 复杂度控制。具体地:
- 线性函数类:
- 非参数类(Holder/Sobolev 球):
2.3 三种策略评估应用
1. 直接奖励重加权:
2. 双重鲁棒估计(定理 5.2):,值误差被 控制。
3. 占据加权 FQE(定理 5.3):用拟合比 作为 FQE 投影权重,将投影从离线数据分布改为(估计的)目标占据分布,从而在值类不满足 Bellman 完备性时也获得稳定收敛。
3. 实验设计
3.1 数据集 / 场景
- Baird 风格有限 MRP(6.1 节):状态空间为 6 个对称上层状态 + 1 个下层状态,折扣因子 ,值特征 。折扣占据比在两类上分别为常值 和 ,由一维归一化对数线性类精确表示。
- 线性高斯策略评估(6.2 节):,离线数据 ,目标策略下的转移为线性高斯。比类含真实比但不闭合于伴随 Bellman 更新。值类是三维仿射类 ,其中 ,但类不是 Bellman 完备的(因为 包含类外的二次项 )。
3.2 对比方法(benchmark)
- DualDICE(Nachum et al., 2019a):极小极大密度比估计。
- Minimax Weight Learning (MWL)(Uehara et al., 2020):使用 RFF-RBF 评论家(128 特征 + 截距)。
- Minimax Q-Learning (MQL):带 RFF-RBF 评论家的极小极大 Q 学习。
- 线性 FQE:标准 Bellman 回归作为基线。
- FORE 加权 FQE:使用 FORE 比作为投影权重的 FQE。
- 表格 FQE:作为 Bellman 完备基准(仅 Baird 例)。
所有方法使用相同维度的函数类,以确保比较公平。RFF-RBF 的带宽、岭惩罚、密度收缩系数由独立离线数据种群计算一次性确定,跨样本量和重复保持固定。
4. 资源与算力
论文未明确说明算力使用情况,包括 GPU 型号、数量、训练时长等。未发现相关描述。从实验规模(线性高斯设置下最大 转移、300-500 次重复)推断,计算量较小,可能在标准 CPU 或单块 GPU 上即可完成。
5. 实验数量与充分性
- 种群递归实验(Baird 风格 + 线性高斯):分别展示了线性 FQE、FORE、FORE-加权 FQE、表格 FQE 的种群迭代收敛行为,明确各方法的投影乘子。
- 有限样本实验(线性高斯):
- 样本量扫描:,每个样本量下 300 次独立重复。
- 折扣扫描:,固定 ,每个折扣下 500 次重复。
- 实验充分性评估:
- 优点:实验设计专门隔离了"值类可实现但 Bellman 不完备"这一关键场景;通过比较种群乘子( vs vs )清晰展示了 FORE 的稳定化作用;样本量与折扣因子扫描覆盖了多种条件。
- 局限:仅两个合成实验(一个离散、一个线性高斯),缺乏高维、非线性、真实任务的验证;重复次数(300-500)适中但对极端折扣区域()误差极大,数值稳定性可能受影响;未对 FORE 内部的多个实现细节(如 KL 类选择、批大小等)进行消融。
6. 主要结论与发现
1. 方法论结论:折扣占据比可作为伴随 Bellman 算子的不动点被刻画;通过 KL 投影(而非 投影)的拟合迭代,种群层严格 -收缩,无需 Bellman 完备性或评论家完备性。
2. 理论结论:种群误差上界为 ;有限样本误差增加统计项 。确定性近似项对值误差的贡献为 ,相比 FQE 的固有 Bellman 误差传播更优。
3. 应用结论:同一拟合比可同时用于直接奖励重加权、双重鲁棒估计和占据加权 FQE,且后者可在值类不 Bellman 完备时仍稳定收敛。
4. 实验发现:
- 在 Baird 例中,线性 FQE 投影乘子为 (发散),FORE 比递归乘子为 (强收缩),FORE-加权 FQE 乘子为 (稳定)。
- 在线性高斯例中,线性 FQE 乘子 (发散),FORE 比递归乘子 ,FORE-加权 FQE 乘子 。
- 有限样本下,FORE 在 时 MQL 与 FORE-加权 FQE 的值 RMSE 分别为 和 ,远优于线性 FQE 的 。
- 直接奖励重加权中,MWL 在样本量实验中表现略优于 FORE(RMSE vs ),但 FORE 的密度比 误差最小。
7. 优点
- 理论突破:将 Bellman 完备性条件替换为更弱的占据比可实现性,且投影误差仅为 (二次于最佳对数比近似),而非 Bellman 完备性所需的"所有 Bellman 映像在类内"全局条件。
- 几何匹配:KL 投影与伴随 Bellman 算子的 KL 收缩性天然相容,避免了标准 FQE 中 Bellman 算子(目标策略测度下收缩)与投影算子(离线数据测度下)的测度失配问题。
- 统一视角:单一方法同时支撑奖励重加权、加权 FQE 和双重鲁棒估计三种应用,无需单独的评论家类。
- 实现简单:每次迭代为单层监督学习(带 log-partition 的凸优化),可用梯度提升树或神经网络实现,无需鞍点优化。
- 统一统计框架:通过临界半径 同时刻画线性和非参数类的速率,无需在每次迭代时拆分数据。
- 实验清晰:种群乘子的对比直接展示了 FORE 的稳定性来源。
8. 不足与局限
- 覆盖性假设:仍要求 且 (条件 C1),即初始和一步分布的密度比有界;离线数据必须覆盖目标相关区域。
- 正性与对数可积:目标占据比 必须在 支撑上严格正且 (条件 C3, C5),否则 KL 散度可能无穷。
- 类复杂性:理论保证要求对数比类有界且有受控的局部 Rademacher 复杂度,深层神经网络的精细化控制仍是开放问题。
- 实验覆盖有限:
- 仅两个合成实验(离散 Baird + 线性高斯),缺乏 Atari、MuJoCo 等标准 RL 基准。
- 未在高维、复杂非线性设定下验证。
- 未对算法超参数(如对数比类的选择、迭代次数 的影响、批大小)做系统消融。
- 算力透明度:未报告计算资源使用情况,无法评估实际部署成本。
- 极端折扣不稳定:当 时值误差爆炸(线性 FQE 在 时 RMSE 达 量级),FORE 也呈线性增长,验证了理论中 因子,但实际可用折扣范围受限。
- 附录中的回退变体需完备性:附录 F 描述的 backward-regression 变体虽然更直接,但需要伴随 Bellman 完备性,限制了其应用范围。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




