扩散引导的不确定性感知延迟策略优化
Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization
📝 TLDR
现实强化学习常因反馈延迟导致性能下降,现有方法通过增广状态或预测真实状态缓解,但忽略了随机MDP下延迟状态与真实状态的内在差异。本文从理论上证明该差异会损害最优策略,并提出DUPO方法,利用扩散模型显式建模延迟状态与当前状态的关系,以差异估计加权延迟策略。连续机器人控制实验表明,DUPO在多种随机延迟下表现优于现有方法,在长延迟与随机延迟场景中尤为有效。该工作为延迟环境下的策略优化提供了不确定性感知的新思路。
🧭 速览
现实强化学习中反馈延迟会严重降低策略性能,而现有增广状态或状态预测方法忽略了随机MDP下延迟与真实状态间的固有差异。
提出DUPO,利用扩散模型显式建模延迟状态与当前状态关系,并以差异估计对延迟策略进行加权优化。
在多种连续机器人控制任务的随机延迟场景中,DUPO一致优于现有方法,在长延迟与随机延迟下尤为有效。
DUPO从理论上揭示了延迟与真实状态的内在差异,为延迟环境下的策略优化提供了不确定性感知新框架。
📊 论文图表(共 20 张)
展开查看 20 张图
TL;DR
这篇论文针对强化学习中反馈延迟导致性能下降的问题,从理论上证明了在随机环境下延迟状态与真实状态之间的差异会不可消除地放大,并据此提出 DUPO 方法——利用扩散模型建模延迟状态的后验分布,通过不确定性估计来加权延迟策略。在 MuJoCo 机器人控制任务上的实验表明,该方法在各种随机延迟场景下均优于现有基线,尤其在长延迟条件下的优势更为显著。
研究背景与动机
在实际部署强化学习系统时,延迟是一个普遍存在的问题。无论是机器人控制中的通信延迟、传感器流水线的处理延迟,还是神经网络推理带来的计算开销,都会导致智能体无法即时获取当前环境的真实状态。当延迟存在时,智能体接收到的信息不再是马尔可夫决策过程中要求的即时观测 ,而是一个由历史状态和动作组成的延迟消息 ,其中延迟长度 在现实场景中往往服从某一随机分布。
现有方法主要从两条路径尝试缓解延迟带来的性能损失。无记忆方法仅依赖最新观测,虽然计算高效,但忽略了延迟引入的非马尔可夫性,在大延迟下性能急剧恶化。状态增广方法将延迟观测与执行的动作序列拼接形成增广状态,理论上可以恢复马尔可夫性,但状态空间会随延迟长度指数膨胀,遭遇严重的维数灾难。模型与信念方法则尝试从历史信息中估计当前状态的统计量或分布,但这些方法通常假设延迟是确定性的或假设状态转移具有单模态特性。
论文的核心洞察在于:上述所有方法都忽视了一个根本性问题——在随机马尔可夫决策过程中,延迟状态与真实状态之间存在不可消除的内在差异。这种差异并非源于估计器的缺陷,而是由随机环境本身的性质决定的。状态转移的随机性使得历史信息对当前状态的推断天然存在歧义,且这种歧义会随着延迟长度的增加而不断放大。论文从信息论角度严格证明了这一点。
方法
论文首先给出了两个关键的理论结果。定理1证明了状态估计误差存在不可消除的下界:在温和的正则性条件下,对任意从延迟消息 到当前状态 的估计器 ,其均方误差至少为 ,其中 表征环境的内禀噪声水平。这意味着即使拥有完美的估计器,也无法完全消除延迟带来的不确定性。
定理2进一步建立了估计误差与策略性能之间的联系。当最优Q函数关于动作是强凹的且贪心策略映射的逆Lipschitz常数有限时,基于点估计的策略与最优策略之间的性能差距下界为 ,即随延迟长度线性增长。这从优化角度揭示了点估计方法的根本局限。
基于上述理论分析,论文提出 DUPO 方法,其核心思想是显式建模延迟状态的后验分布而非仅输出单点估计。具体而言,采用条件扩散模型来学习 。该模型通过标准的去噪扩散过程建模:从真实状态 出发,经过 步加噪得到接近各向同性高斯的噪声样本;反向过程则由参数化的噪声预测网络 驱动,逐步去噪恢复出潜在的无延迟状态。训练目标为标准的噪声预测损失:
扩散模型的优势在于其能够表达多模态的后验分布。在随机MDP中,从相同的延迟消息出发,可能对应多种合理的未来状态轨迹。通过从 中多次采样,可以获得一组多样化的潜在状态样本 ,而非单一的点估计。
获得多模态样本后,DUPO 利用它们来量化价值函数对状态估计的敏感程度,从而评估延迟策略的可靠性。对任意动作 ,定义评论家不确定性估计为:
这一方差项衡量了当使用不同后验样本时Q值的分歧程度。直观地说,如果某个动作的价值在不同状态假设下差异很大,说明该动作对状态估计非常敏感,在延迟信息模糊时应该更加保守。基于此,将不确定性转化为可靠性权重:
最终的不确定性加权策略 通过该权重对原始策略 进行重新归一化得到。这种设计使得策略在延迟信息模糊时自动向更保守的动作倾斜。
将上述机制整合到[[软策略迭代|SAC]]框架中:评论家在标准的无延迟转移元组上训练以保证Q值估计的准确性,演员则在延迟消息上通过加权目标进行更新,利用扩散模型提供的不确定性信号来调节策略的探索-利用权衡。
实验与结果
论文在 MuJoCo-v4 连续控制环境中验证 DUPO 的有效性。实验的核心设置是将确定性环境转化为随机马尔可夫决策过程:对执行的动作施加 的高斯噪声,同时引入随机观测延迟 ,其中 分别设置为 5、10、25 以覆盖短、中、长三种延迟量级。
基线方法包括 DC/AC(基于多步离策略估计)、State Augmentation(状态增广)以及 State Prediction(辅助状态预测)。所有方法在相同条件下训练 100 万步,使用 4 个随机种子取平均。
实验结果呈现出清晰的分层结构。在短延迟()条件下,各方法差距相对较小,State Prediction 等点估计方法仍具竞争力。但随着延迟增大,差距迅速拉开。在最具挑战性的长随机延迟()条件下,DUPO 的优势尤为显著:在 HalfCheetah-v4 上达到约 15.96 倍于 DC/AC 的归一化回报,在 Hopper-v4 上达到约 10.34 倍,在 Walker2d-v4 上也保持约 2.59 倍的优势。这一结果验证了论文的核心假设——不确定性感知机制在长延迟场景中发挥关键作用。
消融实验进一步揭示了方法各组件的贡献。延迟分布消融表明,虽然高斯延迟下的收敛速度略快于均匀或泊松延迟,但最终鲁棒性差异不大,说明方法对延迟分布具有较好的适应性。后验建模消融则证实了多模态建模的必要性:扩散多模态采样显著优于基于 MC Dropout 或单模态高斯的后验估计,特别是在状态空间复杂、转移随机性强的任务中。
讨论与可借鉴点
这项工作的一个重要贡献在于为延迟环境下的[[强化学习]]提供了理论分析与工程方法相结合的范式。定理1和定理2从信息论和优化的双重角度证明了点估计方法的固有局限,这种「理论先行、方法随之」的研究思路值得借鉴——它帮助我们理解问题的本质困难所在,而非仅仅在工程层面打补丁。
不确定性加权机制的设计也颇有启发性。论文没有简单地追求更精确的状态预测,而是承认估计的不确定性并据此调整策略行为。这种[[不确定性量化|不确定性感知]]的思路在许多现实世界的决策问题中都有应用价值,比如自动驾驶、金融交易等领域,决策系统同样需要在信息不完整的条件下做出鲁棒选择。
当然,论文也存在一些局限性。首先,仅在仿真环境中验证,虽然这在新方法探索阶段是常见做法,但真实机器人或自动驾驶场景中存在的传感器噪声、非平稳干扰等因素可能带来新的挑战。其次,扩散模型的反向采样过程计算开销较大,可能限制其在需要低延迟响应的实时控制系统中的应用。此外,论文仅考虑了观测延迟,而动作执行延迟、混合延迟或延迟分布随时间变化等更复杂的场景尚未涉及。
对于后续研究而言,一个有价值的探索方向是将 DUPO 的不确定性加权机制与在线学习算法结合,使其能够在与环境交互的过程中动态更新对延迟不确定性的认知。另一个方向是探索更轻量的后验建模方法,比如用流模型或能量模型替代扩散模型,以降低推理计算开销。
摘要
强化学习在现实世界环境中常因延迟反馈而遭受严重的性能下降。现有方法通常通过构建增广状态或预测真实状态来缓解由观测延迟引起的性能下降。然而,这些方法常常忽视了由随机马尔可夫决策过程引起的延迟状态与真实状态之间的固有差异。我们从理论上证明了这种差异的存在,并表明它会导致最优策略的退化。为应对这一挑战,我们提出了扩散引导的不确定性感知延迟策略优化(DUPO)。我们的方法使用扩散模型显式建模延迟状态消息与当前状态之间的关系,并利用所得到的差异估计来对延迟策略进行加权。在具有多种随机延迟的连续机器人控制任务上的大量实验表明,DUPO 始终优于现有方法,并在长时和随机延迟场景下依然保持有效。
Abstract
Reinforcement learning in real world environments often suffers from severe performance degradation due to delayed feedback. Existing approaches typically mitigate performance degradation caused by observation delays by constructing augmented states or predicting the true states. However, these methods often overlook the inherent discrepancy between delayed state and true states induced by stochastic MDP. We theoretically prove the existence of such a discrepancy and show that it leads to the degradation of the optimal policy. To address this challenge, we propose Diffusion Guided Uncertainty Aware Delayed Policy Optimization (DUPO). Our method explicitly models the relationship between delayed state message and the current state using a diffusion model, and leverages the resulting discrepancy estimates to weight delayed policies. Extensive experiments on continuous robotic control tasks with multiple stochastic delays demonstrate that DUPO consistently outperforms existing methods and remains effective even under long and random delay scenarios.
论文详细总结(自动生成)
论文总结:DUPO(扩散引导的不确定性感知延迟策略优化)
1. 核心问题与研究动机
现实世界中的强化学习系统普遍存在反馈延迟问题,包括通信延迟、传感器流水线延迟以及模型推理开销等。当观测延迟存在时,智能体不再能即时获得当前状态 ,而只能获取延迟的状态消息
其中延迟 服从某一随机分布。
现有处理延迟 RL 的方法主要分为三类:
- 无记忆方法:仅依赖最新观测,忽略延迟引入的非马尔可夫性,大延迟下性能急剧下降;
- 状态增广方法:将延迟观测与执行的动作序列拼接形成增广状态,恢复马尔可夫性,但状态空间随延迟指数膨胀,遭遇维数灾难;
- 模型/信念方法:从历史中估计当前状态的统计量或分布。
这些方法的共同缺陷是:忽略了随机 MDP 下延迟状态与真实状态之间不可消除的内在差异。论文指出,这种差异会随着延迟长度增加而放大,且单点状态预测方法无法捕捉这种不断变化的差异。
2. 方法论
2.1 理论分析
定理 1(不可消除且随延迟放大的状态差异):在温和正则性条件下,对任意可测估计器 ,
其中 为内禀噪声水平, 表征不确定性放大因子。
定理 2(点估计方法的延迟放大次优性):若 关于 为 -强凹,贪心动作映射 局部逆 Lipschitz 常数为 ,则
即点估计策略的性能差距随延迟线性增长。
2.2 基于扩散模型的状态后验建模
采用条件扩散模型学习后验分布 :
- 前向加噪过程:;
- 反向去噪由参数化的噪声预测网络 驱动;
- 训练目标为标准噪声预测损失:
通过从 中多次采样,可获得多模态的潜在无延迟状态样本 ,而非单点估计。
2.3 不确定性加权延迟 SAC
对任意动作 ,利用扩散样本估计评论家不确定性:
转化为可靠性权重(逆方差缩放):
进而得到不确定性加权策略:
直观上,价值对潜在状态越敏感的动作在延迟信息模糊时获得的概率质量越小,策略更保守。
将上述机制嵌入 SAC:
- 评论家在无延迟转移元组 上训练(标准做法);
- 演员在延迟消息 上通过加权目标 更新。
3. 实验设计
- Benchmark:MuJoCo-v4 连续控制任务,包括 Ant-v4、HalfCheetah-v4、Hopper-v4、Walker2d-v4、Swimmer-v4。
- 延迟设置:将确定性 MuJoCo 转化为随机 MDP——对环境执行的动作加入 高斯噪声;观测延迟 ,。
- 对比基线:
- DC/AC(Bouteiller et al., 2020):基于 SAC 的多步离策略估计 + 部分轨迹重采样;
- State Augmentation(Wang et al., 2024):延迟观测拼接动作历史;
- State Prediction(Wang et al., 2024):辅助模型预测无延迟状态。
- 训练协议:1M 全局环境步数,每组配置 4 个随机种子。
4. 资源与算力
论文正文与附录中未明确说明所用 GPU 型号、数量或训练时长。从补充材料中的关键超参数(如 batch_size=32、buffer_size=1{,}200{,}000、step_per_epoch=5000、max_epoch=200)可推断每个任务约 1M 步训练规模,但硬件配置未披露。
5. 实验数量与充分性
- 主实验:3 个 × 5 个环境 × 4 个种子 = 60 组运行,结果以 DC/AC 为基线归一化报告。
- 消融实验:
- 延迟分布消融:均匀 / 截断高斯 / 截断泊松三种延迟先验;
- 后验采样机制消融:扩散(DUPO)vs. MC Dropout(MD-PO)vs. 单模态高斯(G-PO);
- 超参数敏感性:在 Hopper-v4 上扫描 与采样数 。
- 学习曲线:覆盖 下的完整训练曲线。
总体而言,实验在任务多样性、延迟长度、种子数量以及消融维度上较为充分;但仅在仿真机器人任务上验证,缺乏真实机器人或更复杂场景。
6. 主要结论与发现
- DUPO 在大多数(环境,延迟)组合下取得最优或接近最优的归一化回报,优势随延迟增大而愈发显著;
- 在 的长随机延迟下,DUPO 在 HalfCheetah-v4(~15.96×)、Hopper-v4(~10.34×)、Walker2d-v4(~2.59×)等任务上明显优于 State Prediction 与 State Augmentation;
- 点估计基线在短延迟、简单动力学(如 Swimmer-v4,)下仍有竞争力,但随延迟增大增益迅速消失;
- 延迟分布形状主要影响收敛速度而非最终鲁棒性,高斯延迟下学习最快;
- 准确捕捉后验多模态至关重要:扩散多模态采样显著优于 MC Dropout 与单模态高斯采样。
7. 优点
- 理论动机扎实:两个定理从 Bayes 风险下界与性能差分解两个角度严谨地揭示了点估计方法的固有局限;
- 方法原则性强:用扩散模型显式建模 的多模态后验,比单点预测或单峰高斯更贴合随机延迟下的真实不确定性结构;
- 不确定性加权机制简洁有效:逆方差加权与 SAC 的结合既有理论依据又便于实现;
- 实验较为全面:覆盖多种任务、多种延迟量级、多种延迟先验,并辅以消融与超参数敏感性研究;
- 训练稳定性好:学习曲线显示 DUPO 收敛更快、方差更小、平台期更长。
8. 不足与局限
- 算力信息缺失:未报告 GPU 类型、数量与墙钟训练时间,难以评估实际计算开销;
- 扩散模型成本较高:每次策略更新需多次反向扩散采样,估计不确定性会带来额外计算开销,可能限制其在实时控制中的部署;
- 仅在仿真验证:所有实验均在 MuJoCo 仿真中完成,未涉及真实机器人、自动驾驶等真实延迟场景;
- 延迟类型单一:仅考虑观测延迟,未处理动作执行延迟、混合延迟或非平稳延迟分布;
- 环境噪声人为注入:通过在动作上叠加固定 的高斯噪声构造随机 MDP,未覆盖更复杂的环境随机性形式;
- 基线覆盖有限:未与近期变分延迟策略优化(VDPO)、辅助短延迟方法等最新基线直接比较;
- 理论假设较强:定理 2 依赖 的强凹性与 的局部逆 Lipschitz 性质,在深度近似下未必严格成立;
- 可复现性待补:论文承诺代码将在接收后公开,目前尚不可获取。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。



















