arXiv 2606.29867v1 · 发布 2026-06-29

RoAd-RL:面向鲁棒对抗强化学习的统一库与基准

RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning

AUTHORS Adithya Mohan, Daniel Kriegl, Torsten Schön
EVIDENCE 面向深度对抗强化学习的统一基准测试框架
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 21:36:26 UTC

📝 TLDR

深度强化学习在对抗扰动下性能严重下降,但研究受限于实现碎片化与评估协议不统一。RoAd-RL提出统一的开源基准框架,封装策略、攻击、防御与鲁棒性指标的标准化抽象,并与Stable-Baselines3和Gymnasium无缝集成。在LunarLander和Highway-v0上对DQN、PPO、SAC共192组攻防配置进行评测,结果显示部分常用防御反而比攻击更具危害性,而时序平滑防御表现稳定。该工作为对抗强化学习研究建立了标准化、可复现的评测基准。

🧭 速览

动机

深度强化学习易受对抗扰动影响,但对抗RL研究面临实现碎片化、评估协议不统一与可复现性差等挑战。

方法

RoAd-RL提供统一开源基准框架,封装策略、攻击、防御与鲁棒性指标的标准化抽象,集成Stable-Baselines3与Gymnasium并支持可复现评测流水线。

结果

在LunarLander与Highway-v0上以192组攻防配置测试DQN、PPO、SAC,发现部分常用防御效果劣于攻击本身,而时序平滑防御表现稳健。

结论

RoAd-RL建立对抗强化学习的标准化评测基准并公开发布,推动该领域的可复现研究。

📊 论文图表(共 3 张)

展开查看 3 张图

TL;DR

RoAd-RL 针对深度强化学习在对抗扰动下性能急剧下降的问题,推出一个统一的开源评测基准框架,通过标准化抽象封装策略、攻击、防御与鲁棒性指标,并与 Stable-Baselines3 和 Gymnasium 无缝集成。在 LunarLander 和 Highway-v0 环境中对 DQN、PPO、SAC 共 192 组攻防配置的系统性评测揭示了一个反直觉现象:部分常用防御方法(如 OutlierClip、AdversarialDetector)的危害性甚至超过它们试图抵御的攻击本身,而时序平滑方法则表现出持续稳健的防御效果。

研究背景与动机

深度强化学习在机器人控制、自动驾驶、智能交通等安全关键领域展现出令人瞩目的能力,但其策略网络与监督学习模型一样容易受到对抗扰动的影响。这种脆弱性意味着即使是对观测信号施加人类难以察觉的微小扰动,也可能导致智能体做出灾难性的错误决策。在监督学习领域,RobustBench、Foolbox、CleverHans 等框架早已建立起对抗鲁棒性研究的标准化基准,但对抗强化学习(Adversarial RL)领域却长期处于各自为战的状态。

这种碎片化带来的问题是多方面的。首先,不同研究团队往往使用各自定制的攻击与防御实现,导致同一防御方法在不同实现下的效果差异难以区分,横向比较几乎不可能。其次,评估协议的不一致性——包括扰动预算的选择、随机种子的设置、报告指标的差异——使得论文结果的可复现性大打折扣。更深层的问题是,由于缺乏统一的基准,研究者难以判断某项防御方法的改进是否具有普遍意义,还是仅仅在特定实验设置下的偶然表现。

RoAd-RL 的核心动机正是填补这一空白。该工作试图将对抗强化学习研究的评估流程系统化、标准化,就像 RobustBench 为图像分类领域所做的那样。通过建立一个可复现的评测基准,研究社区能够更高效地比较不同防御策略,发现跨方法的共性规律,并识别那些在特定设置下看似有效但实际有害的做法。

方法

RoAd-RL 的设计哲学围绕四个核心抽象展开:Policy(策略)、Attack(攻击)、Defense(防御)和 Metric(指标)。这种模块化架构确保了框架的灵活性和可扩展性——新方法只需通过子类化对应的抽象基类即可接入,无需修改框架核心代码。

在策略层面,RoAd-RL 统一了不同强化学习算法的策略调用接口,提供 act(obs) → action 的标准入口,同时可选 forwardloss 接口以支持需要访问策略内部梯度的攻击方法。当前实现以 Stable-Baselines3 作为后端,支持 DQN、PPO、SAC 等主流算法。

攻击与防御的组合遵循一条清晰的数据流水线:观测信号依次经过攻击模块和防御模块的处理,最终送入策略网络产生动作。用数学语言描述为 ,其中 表示扰动预算。

在已实现的攻击方法中,RoAd-RL 聚焦于观测空间的梯度攻击。FGSM(Fast Gradient Sign Method)采用单步扰动策略,计算扰动的公式为 。PGD(Projected Gradient Descent)则将攻击迭代 步,每步步长 ,并在投影到 球内后可选进行随机初始化。JSMA(Jacobian-based Saliency Map Attack)基于显著性排序,每次迭代仅扰动最关键的特征维度,默认设置为每次修改 top-2 个维度。对于离散动作空间采用 约束,连续动作空间则使用 约束。

防御方法全部为推理时纯观测级处理,不访问策略内部。七种已实现的防御包括:NormalizeClip 将观测投影到 区间;Temporal Smoothing 使用窗口大小 的滑动均值进行时序平滑;Gaussian Noise 注入方差为 的随机噪声;Feature Squeezing 将观测量化为 bit;Median Smoothing 采用窗口 的逐特征中值滤波;Outlier Clip 基于中位数绝对偏差()裁剪异常观测;Adversarial Detector 则通过滚动缓冲统计检测可疑观测并进行替换。

鲁棒性评测的核心指标是归一化 AUC-,即回报- 曲线的面积与干净基线对应面积之比。AUC 值为 1.0 表示达到无攻击时的性能,AUC 小于 1.0 代表性能下降,而 AUC 大于 1.0 则意味着扰动或防御意外带来了性能提升。这一设计使得不同配置下的结果可以直接比较。

可复现性通过确定性种子管理实现。回合种子通过公式 计算,其中 为实验种子, 为回合索引。所有实验结果以结构化 CSV/JSON 格式输出,并提供命令行接口方便无代码运行。

实验与结果

实验在两种截然不同的环境中展开:LunarLander-v2 及其连续版本提供 8 维观测的紧凑控制任务,其动力学对扰动高度敏感;highway-v0 则是一个 25 维运动学观测的结构化驾驶决策任务,语义化特征使其呈现出不同的鲁棒性特征。

评测覆盖三种智能体(DQN、PPO、SAC)、三种攻击方法(FGSM、PGD、JSMA)、七种防御方法以及五种扰动预算(),每个配置使用 3 个随机种子、每个种子- 对应 40 个回合,总计达到 115,200 个回合的评测规模。

结果揭示了环境间鲁棒性的巨大差异。LunarLander 对对抗扰动表现出极高的敏感性,最严重情况下 AUC 可降至 0.59,这意味着即使施加很小的扰动,智能体的平均回报也会急剧下降。相比之下,Highway-v0 在未防御状态下基本保持鲁棒,多数配置的 AUC 接近 1.0。这种差异提示我们,环境的观测结构和任务特性对智能体的鲁棒性有着根本性影响。

不同算法在同一环境下的脆弱性表现也截然不同。在 LunarLander 上,SAC 对 PGD 攻击最为脆弱,未防御时 AUC 仅为 0.590;DQN 则对 FGSM 的抵抗力更弱;而 PPO 的表现接近随机基线,部分配置的 AUC 甚至超过 1.0,这一现象可能源于扰动带来的隐式正则化效应。

最引人注目的发现是某些防御方法的有害性。OutlierClip 和 AdversarialDetector 在 LunarLander 上将 AUC 推至负值,意味着这些防御造成的性能损失超过了攻击本身。更令人警惕的是,即使在没有受到任何攻击的情况下,这些防御对 Highway-v0 上的 SAC 智能体也造成了严重的性能损失。这说明防御方法的评估不能仅在受攻击场景下进行,无攻击基线同样是重要的参考点。

Feature Squeezing 在 8 维 LunarLander 观测上的表现同样令人失望,AUC 从未防御的 0.793 降至 0.547,说明量化压缩可能更适合高维图像观测场景而非低维连续控制任务。JSMA 在 8 维空间内每次仅扰动 2 个特征的能力,使其攻击覆盖面严重不足,整体效果弱于 FGSM 和 PGD。

在这片充满陷阱的评测结果中,Temporal Smoothing 展现出一枝独秀的稳健性。在最具挑战性的配置(Lunar SAC + PGD)下,时序平滑将 AUC 从 0.590 提升至 0.752,相对恢复约 27%,证明通过时序信息聚合来平滑对抗扰动是一种有效且普适的防御思路。

讨论与可借鉴点

RoAd-RL 的贡献不仅在于提供了一个评测工具,更在于揭示了对抗强化学习研究中几个被忽视的重要问题。首先,防御的有效性高度依赖具体的环境和算法组合,不存在放之四海而皆准的通用防御策略,这提醒我们在评估防御方法时必须覆盖多样化的配置。其次,无攻击基线应当成为防御评估的标准配置——一个在无攻击场景下也会严重损害性能的防御,即使在某些攻击配置下表现尚可,其适用性也必须打上大大的问号。

然而,当前框架也存在明显的局限。在威胁模型方面,RoAd-RL 仅覆盖白盒观测空间的梯度攻击,未涉及黑盒攻击、奖励投毒、环境操纵、策略投毒等更广义的对抗场景。在防御覆盖方面,七种推理时防御并未包括对抗训练这一被广泛研究的防御范式,也缺少认证鲁棒性(certified robustness)的评估。在环境选择方面,LunarLander 和 Highway-v0 都是相对简单的低维观测环境,图像观测环境(如 Atari)、多智能体环境、物理世界的传感器噪声等场景的迁移性仍有待验证。

对于希望开展对抗强化学习研究的研究者,RoAd-RL 提供了几点重要借鉴:在设计防御方法时,必须同时报告无攻击基线性能和多环境多算法的评估结果,避免在特定配置下过拟合;在选择评测指标时,归一化 AUC- 提供了一种可跨配置比较的统一度量,但其解释性在出现负值或大于 1 的情况时需要更细粒度的分析;在研究选题上,时序平滑策略的持续稳健表现为这一方向的后续研究提供了有价值的线索,而 OutlierClip 等防御的有害性则提示我们需要更审慎地对待那些看似直观的防御思路。

RoAd-RL 的开源发布(通过 pip 可直接安装 road-rl 包)降低了对抗强化学习评测的门槛,使得更多研究者能够以统一的标准开展可复现的比较研究。这种标准化对于推动该领域从碎片化的个案研究走向系统化的知识积累具有重要意义。

摘要

深度强化学习(DRL)在机器人和自主系统中取得了显著成功,但仍然容易受到对抗性扰动的影响,从而严重降低性能。对抗强化学习的研究常常受到分散的实现、不一致的评估协议以及较差的复现性等因素的制约。为应对这些挑战,我们提出了 \textbf{RoAd-RL},一个开源的基准测试框架,提供了针对策略、攻击、防御和鲁棒性度量的统一抽象,并具有可复现的评估流水线,能够与 Stable-Baselines3 和 Gymnasium 无缝集成。我们在 LunarLander 和 Highway-v0 环境中对 DQN、PPO 和 SAC 智能体进行了 192 种攻防配置下的评估。结果表明,不同环境中的鲁棒性存在显著差异,并显示一些常用的防御方法可能比它们试图缓解的攻击本身更具危害性,而时间平滑方法始终表现出强劲的性能。RoAd-RL 为对抗强化学习研究建立了一个标准化的基准,并在 https://pypi.org/project/road-rl 公开提供。

速览

TLDR:深度强化学习虽在机器人与自动驾驶领域取得显著成功,却易受对抗扰动严重干扰。当前对抗强化学习研究面临实现碎片化、评估协议不一致和复现困难等挑战。本文提出开源基准框架RoAd-RL,抽象统一策略、攻击、防御与鲁棒性指标,并与Stable-Baselines3和Gymnasium无缝集成。在LunarLander和Highway-v0上对DQN、PPO、SAC开展192组攻防配置实验,结果表明部分常用防御反而比攻击更有害,时序平滑则持续表现稳健。RoAd-RL为对抗强化学习建立了可复现的标准化基准。 \

Motivation:深度强化学习策略易受对抗扰动影响,但现有研究实现碎片化、评估不一致、复现困难,亟需统一基准。 \

Method:RoAd-RL提供策略、攻击、防御与鲁棒性指标的统一切面,集成Stable-Baselines3与Gymnasium,支持可复现评估流水线。 \

Result:在LunarLander与Highway-v0上以192种攻防配置评测DQN、PPO、SAC,发现部分防御效果反不如攻击,时序平滑稳健有效。 \

Conclusion:RoAd-RL为对抗强化学习建立标准化开源基准,推动该领域开展系统化、可复现的比较研究。


Abstract

Deep Reinforcement Learning (DRL) has achieved significant success in robotics and autonomous systems, yet remains vulnerable to adversarial perturbations that can severely degrade performance. Research in adversarial reinforcement learning is often limited by fragmented implementations, inconsistent evaluation protocols, and poor reproducibility. To address these challenges, we present \textbf{RoAd-RL}, an open-source benchmarking framework that provides unified abstractions for policies, attacks, defenses, and robustness metrics, together with reproducible evaluation pipelines and seamless integration with Stable-Baselines3 and Gymnasium. We evaluate DQN, PPO, and SAC agents in LunarLander and Highway-v0 under 192 attack-defense configurations. Results reveal substantial variations in robustness across environments and show that some commonly used defenses can be more detrimental than the attacks they aim to mitigate, while temporal smoothing consistently achieves strong performance. RoAd-RL establishes a standardized benchmark for adversarial reinforcement learning research and is publicly available at https://pypi.org/project/road-rl.


论文详细总结(自动生成)

RoAd-RL 论文总结

1. 核心问题与研究动机

  • 背景:深度强化学习(DRL)在机器人、自动驾驶、智能交通等安全关键领域取得了显著成功,但其策略网络与监督学习模型类似,容易受到对抗性扰动(如对观测的微小扰动)影响,导致性能显著下降甚至产生不安全行为。
  • 痛点:对抗强化学习(Adversarial RL)研究长期面临以下挑战:
  • 不同论文使用各自定制的攻击/防御实现,难以横向比较;
  • 评估协议(扰动预算、随机种子、报告指标)不统一;
  • 可复现性差,论文结果难以复现。
  • 与监督学习的对比:在监督学习领域,RobustBench、Foolbox、CleverHans 等框架已极大推动了对抗鲁棒性研究的标准化,而对抗 RL 领域尚缺少一个被广泛采用的基准框架。
  • 本文目标:提出一个开源、统一、可扩展的对抗 RL 评测框架 RoAd-RL,封装策略、攻击、防御、指标四个核心抽象,并建立标准化的攻防基准。

2. 方法论

2.1 整体框架

RoAd-RL 将对抗鲁棒性评测划分为三个阶段:

1. 策略训练(Policy Training):在选定环境中训练 DRL 策略 ,当前以 Stable-Baselines3(SB3)作为后端。

2. 攻防组合(Attack-Defense Composition):观测经过"攻击 → 防御 → 策略"的流水线处理,即

3. 鲁棒性评测(Robustness Evaluation):在多个扰动预算 、随机种子、回合上聚合标准化的鲁棒性指标。

2.2 四大核心抽象

抽象接口说明
Policyact(obs) → action,可选 forward(obs)/loss(obs)统一不同 RL 算法的策略调用,支持可微分策略用于梯度攻击
Attackapply(obs, policy, ctx) → obs输入观测、策略与上下文(预算、步数、种子),输出扰动后观测
Defenseapply(obs, ctx) → obs推理时纯观测级防御,不访问策略内部
Metriccompute(episodes) → MetricResult标准化报告鲁棒性指标

所有组件均继承自抽象基类,新方法可通过子类化快速接入,无需修改框架核心代码。

2.3 已实现的攻击(作用于观测空间)

  • FGSM(Fast Gradient Sign Method):单步扰动
  • PGD(Projected Gradient Descent):默认 步、步长 ,可选随机初始化
  • JSMA(Jacobian-based Saliency Map Attack):基于 Jacobian 显著性排序,每次迭代仅扰动 top-(默认)个最关键维度

对离散动作策略使用 约束,连续动作策略使用 约束。

2.4 已实现的防御(均为推理时)

  • NormalizeClip:将观测投影到
  • Temporal Smoothing:滑动窗口大小 的均值平滑
  • Gaussian Noise:注入 (随机平滑)
  • Feature Squeezing:量化为 bit
  • Median Smoothing:窗口 的逐特征中值
  • Outlier Clip(MAD):基于中位数绝对偏差()裁剪异常观测
  • Adversarial Detector:基于滚动缓冲统计检测并替换可疑观测

2.5 评测指标

  • 回报类:均值回报、中位数回报、归一化性能下降
  • 风险类:CVaR、最差分位回报
  • 安全类:回合终止率、环境特定安全违规
  • 鲁棒性类:AUC-、扰动敏感度

2.6 可复现性设计

  • 确定性种子管理,回合种子通过

其中 为实验种子, 为回合索引。

  • 实验结果以结构化 CSV/JSON 输出;提供命令行接口(CLI)以方便无代码运行。

3. 实验设计

3.1 评测环境

  • LunarLander-v2 / LunarLanderContinuous-v2:8 维观测,紧凑控制任务,动力学敏感。
  • highway-v0:25 维运动学观测的结构化驾驶决策任务,语义化特征。

3.2 评测智能体

  • DQN(基于价值)
  • PPO(on-policy 策略梯度)
  • SAC(off-policy actor-critic)

3.3 攻防配置

  • 攻击 × 防御 × 智能体 × 环境 = 3 × 7 × 6 = 192 组配置
  • 扰动预算
  • 每个配置使用 3 个随机种子、每个种子- 对应 40 个回合

3.4 评测指标

  • 主指标为归一化 AUC-:在回报- 曲线下面积除以干净(无攻击)基线对应面积。
  • 1.0 表示达到干净基线;
  • 小于 1.0 表示性能下降;
  • 大于 1.0 表示扰动/防御使回报高于基线。

4. 资源与算力

  • 论文中未明确给出所使用 GPU 型号、数量、训练时长或总计算开销。
  • 仅说明训练在 Stable-Baselines3 默认超参数下完成,并提供了训练回合数(4,087–4,227 等)和最佳回报(200 回合滑动窗口)。
  • 评测总回合数为 个回合,但每回合的耗时与环境、攻击迭代步数相关,原文未给出 wall-clock 时间。

5. 实验数量与充分性

  • 实验规模:共 192 组攻防配置,合计 115,200 回合评测,覆盖 2 类环境、3 种算法、3 种攻击、7 种防御、5 个扰动预算、3 个随机种子。
  • 充分性评价
  • ✅ 在已选定的攻防-环境组合中实现了全因子扫描,统计量具有可比性;
  • ✅ 使用多个随机种子评估方差;
  • ⚠️ 仅覆盖 2 类环境,LunarLander 与 Highway-v0 之外的迁移性未知;
  • ⚠️ 仅评估观测空间的梯度攻击(白盒),未覆盖黑盒攻击、奖励投毒、环境操纵、策略投毒等威胁模型;
  • ⚠️ 防御仅限推理时方法,未涵盖对抗训练;
  • ⚠️ 未提供统计显著性检验(如置信区间、假设检验)。

6. 主要结论与发现

1. 环境差异显著

  • LunarLander 对对抗扰动高度敏感(AUC 可降至 0.59);
  • Highway-v0 在未防御时基本鲁棒(多数 AUC≈1.0)。

2. 算法差异显著

  • SAC 在 LunarLander 上对 PGD 最脆弱(未防御 AUC=0.590);
  • DQN 在 LunarLander 上受 FGSM 影响大于 PGD;
  • PPO 表现接近随机基线,AUC>1 多由噪声带来的隐式正则导致。

3. 时序平滑(Temporal Smoothing)最稳健:在最难设置(Lunar SAC + PGD)下,将 AUC 从 0.590 提升至 0.752,相对恢复约 27%。

4. 部分防御反而比攻击更具危害

  • OutlierClip 与 AdversarialDetector 在 LunarLander 上使 AUC 跌至负值;
  • 即使未受攻击,这些防御对 Highway SAC 也造成严重性能损失。

5. 特征压缩(Feature Squeezing)在低维控制任务中有害:在 8 维 LunarLander 上使 DQN AUC 从 0.793 降至 0.547,可能更适合高维图像观测。

6. JSMA 受限:在 8 维空间内每次仅扰动 2 个特征,覆盖面不足,攻击效果弱于 FGSM/PGD。

7. 防御有效性高度依赖环境与算法,不存在通用有效的对抗 RL 防御。

7. 优点与亮点

  • 模块化与可扩展性强:通过 Policy / Attack / Defense / Metric 四大抽象解耦,新方法可通过子类化快速接入。
  • 生态兼容性好:原生支持 Stable-Baselines3 与 Gymnasium,并提供 pip 安装与 CLI,降低使用门槛。
  • 可复现性机制完善:确定性种子管理、结构化日志、CSV/JSON 输出、标准化评测流程。
  • 全因子基准:192 组配置 + 5 个扰动预算 + 3 个种子 + 115,200 回合的系统性扫描。
  • 揭示反直觉现象:明确指出"防御可能比攻击更糟"这一重要且常被忽视的现象。
  • 开源发布:以 pip 包形式公开发布(road-rl),并与表格 I 中 RobustBench、Foolbox 等通用框架以及 RL-Adv、StateAdvDRL 等 RL 鲁棒性库对比,体现差异化定位。

8. 不足与局限

  • 威胁模型覆盖不足
  • 仅白盒观测空间梯度攻击(FGSM/PGD/JSMA);
  • 未涵盖黑盒攻击、奖励投毒、环境操纵、策略投毒、时序一致性攻击(如 Sun 等人的方法)等更广义的对抗场景。
  • 防御覆盖不足:仅 7 种推理时防御,未包含对抗训练、认证鲁棒性(certified robustness)、鲁棒 RL 训练算法等。
  • 环境有限:仅 LunarLander 与 Highway-v0 两类环境,未涉及图像观测环境(如 Atari)、多智能体环境、或对抗训练/迁移性评测。
  • 训练与算力信息缺失:未报告 GPU 型号、训练时长、单回合推理耗时,难以评估实际部署成本与可扩展性。
  • 统计推断有限:未提供置信区间、显著性检验或方差分析,结论的稳健性依赖读者自行评估。
  • PPO 基线偏弱:LunarLander 上的 PPO 基线接近随机水平,导致部分 AUC>1 难以解释为"鲁棒性提升",应避免对 PPO 的防御效果做过强结论。
  • AUC- 解释性:当防御导致回报低于干净基线时,AUC- 出现负值或大于 1 的解释可能产生歧义,需要更细粒度分析。
  • 应用局限:当前框架主要面向白盒观测扰动场景,对真实物理世界扰动(如传感器噪声、传感器欺骗攻击)的迁移性需要进一步研究。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记