通过平滑安全结构化策略组合实现安全在线学习
Safe Online Learning via Smooth Safety-Structured Policy Composition
📝 TLDR
安全在线强化学习要求策略在满足安全约束的同时保持优化过程的平滑性。现有方法或依赖动作干预实现严格安全,却会引入系统交互与学习的不连续;或采用软约束维持平滑,但安全保障有限。本文提出AutoSafe,将结构化安全监控与干预直接嵌入动作生成过程,依据风险评估在性能驱动与安全保守行为间平滑切换,实现连续在线交互与学习。实验在连续控制基准上兼顾强安全保障与学习平滑性,并在真实倒立摆系统上得到有效验证,兼具理论价值与实用意义。
🧭 速览
现有方法在严格安全干预与软约束之间存在权衡:前者破坏交互与学习的连续性,后者难以提供可靠的安全保障,亟需兼容二者的方案。
AutoSafe将结构化安全监控与干预嵌入策略动作生成过程,根据风险评估在性能策略与安全策略间平滑过渡,保持学习的连续性。
在连续控制基准上实现强安全保障的同时不牺牲学习平滑性,并在真实倒立摆系统上完成物理实验验证。
AutoSafe为安全在线强化学习提供了兼顾安全保证与学习平滑性的实用架构,可推广至真实物理系统的在线部署。
📊 论文图表(共 23 张)
展开查看 23 张图
TL;DR
安全在线强化学习长期面临一个两难困境:严格的安全干预能提供硬保障,但会破坏学习过程的连续性;软约束方法虽然保持学习平滑,却无法提供可靠的安全承诺。本文提出 AutoSafe,通过将安全监控与干预直接嵌入动作生成阶段,设计了一种可微分的凸策略组合机制,使策略能够在性能驱动与安全保护行为之间实现基于风险的平滑过渡。在连续控制基准任务和物理倒立摆系统上的实验表明,AutoSafe 在不牺牲学习平滑性的前提下实现了零安全违规,同时保持与最先进方法持平甚至更高的策略回报。
研究背景与动机
安全强化学习(Safe RL)旨在让智能体在优化累积回报的同时严格遵守安全约束,这一问题在机器人控制、自动驾驶等物理系统部署场景中具有根本性的重要意义。然而,现有方法形成了鲜明的阵营分化:一类是以 Simplex、控制障碍函数(CBF)等为代表的安全滤波器方法,通过在动作空间中执行事后干预或投影来保证安全性,这种硬干预虽然能提供可证明的安全边界,但干预发生在学习过程的末端,造成动作输出的不连续,并且阻断梯度回传,导致 actor-critic 框架下的学习动力学遭到破坏,表现为 critic loss 飙升甚至训练发散。另一类则是 Lagrangian 方法、Lyapunov 形状化 reward 等软约束方法,它们将安全目标编码为损失函数或奖励塑形项,维持了学习过程的平滑性,但安全保障依赖于期望收敛或长尾概率,无法在训练和部署期间提供硬约束保证。
这两种范式的根本矛盾在于安全的时机性与学习的连续性之间的张力。硬干预本质上是"事后补救",在系统已经接近或越过安全边界时才发挥作用;而软约束则是"提前预防",但缺乏强制力。本文的核心观察是:这种两难并非不可避免。如果将安全机制从学习管道的外层(后处理动作)移至内层(嵌入动作生成过程本身),就有可能在学习的每一步都让性能与安全因素共同参与决策,从而实现真正平滑且可证明安全的在线学习。
方法
AutoSafe 的核心设计哲学是将安全监控与干预重构为策略架构本身的结构性归纳偏置,而非外挂的安全过滤器。具体而言,论文提出一种可微分的凸策略组合,将学习驱动的策略 与认证安全策略 通过状态依赖的混合权重 进行融合:
这里 是学习策略采样的动作, 是安全先验提供的锚点动作,混合权重 由当前状态的风险评估决定。选择凸组合而非硬选择有深层原因:动作空间通常是凸集,凸组合的输出必然落在可行动作空间内,不会像简单的动作裁剪那样引入非线性突变;同时这条从学习动作到安全动作的"插值线段"在几何上提供了平滑过渡的几何基础。
对于高斯策略 ,合成策略的分布特性揭示了一种一阶稳定性机制:
随着 增大,均值向安全动作偏移(纠正意图),而探索方差以二次速率衰减。这一结构意味着当智能体接近安全边界时,干预不仅推举行动向安全方向靠拢,还同步收缩探索范围,防止偶然的极端动作导致违规。当 时,执行策略在安全边界附近退化为确定性,彻底消除随机性带来的越界风险。
理论分析从状态机会约束出发,导出了最小可行干预权重的闭式表达式。直觉上,若名义安全裕度的风险调整值 (其中 是风险分位数),则无需干预;否则 取决于名义安全赤字与可用安全改进的比值。为避免在线估计方差带来的不稳定性,论文采用一种指数型可学习锐度函数:
其中 是归一化安全裕度(1 表示安全内部、0 表示危险边界), 是由共享 actor 主干的小型预测头产生的锐度参数。关键在于,锐度参数 与 actor 参数 联合优化,使得 在不同任务与目标冲突强度下自适应调整:安全内部时 收敛到较小值(信任学习策略),边界附近时 增大(收紧干预)。
算法层面,AutoSafe 基于 Soft Actor-Critic(SAC)框架构建,critic 的学习目标完全不变,仅在动作采样阶段将 替换为合成动作 。安全策略实例化为经典的 Simplex 架构,通过半定规划求解 Lyapunov 矩阵与状态反馈增益,在定义的椭球安全集内保证名义策略的安全执行能力。整个系统的参数 共享同一个观察编码通道和梯度流,使得干预机制对 actor 完全透明,梯度可以顺畅穿过组合层回传到学习策略。
实验与结果
实验覆盖了五个不同维度和复杂度的任务:CartPole 平衡、血糖调节、3D 四旋翼目标到达、四足机器人起伏地形导航,以及真实的物理倒立摆-小车系统。对比基线涵盖三类代表方法:安全滤波器类的 SimplexRL 和 CBF(硬干预)、策略融合类的 AdaLam 和 Residual RL(软安全先验)、约束优化类的 Lagrangian 和 Lyapunov 塑形(软约束),并以 vanilla SAC 作为无安全参考。所有实验统一使用相同的 SAC 超参数和随机种子,每个配置运行 5 次取平均以控制方差。
核心结果在 Table 1 中呈现:AutoSafe 在所有四个仿真任务上均实现了零累积安全违规,同时保持与最优软约束基线持平甚至更高的累积回报。特别值得注意的是,在四旋翼和四足机器人等高维连续控制任务中,这种优势更为显著。硬干预基线(SimplexRL、CBF)虽然也实现了零违规,但付出了明显的性能代价——这是因为突然的动作替换破坏了 critic 的价值估计一致性,导致学习效率大幅下降。
论文的 Fig. 4 深入刻画了干预类型对学习动力学的影响。实验设置了三档目标冲突等级(CartPole 目标位置偏移量),结果显示硬干预方法在冲突加强时 critic loss 急剧攀升,return 曲线趋于平坦甚至下降;而 AutoSafe 的 critic loss 保持平稳,return 持续收敛。这一对比有力证明了"嵌入动作生成"这一设计选择的优越性:干预不再是外部的硬约束,而是融入了策略自身的概率结构,梯度可以正常流动。
关于可学习锐度参数的消融实验(Fig. 5、12、13)验证了联合优化的必要性。与固定锐度、线性启发式相比,可学习的 能在训练过程中自动调节干预强度——目标冲突越大,学到的 越大、 越高,避免了手工调度的不确定性。更令人启发的是 Fig. 7 真实 CartPole 实验中 的演化曲线:随训练推进平均 单调下降,表明策略逐渐信任自身而非依赖安全先验,显示出学习的"去安全依赖"趋势。
物理部署方面,AutoSafe 直接运行在 Raspberry Pi 边缘设备上,50 Hz 控制频率下实现实时推理。Table 5 的计算时间对比表明,AutoSafe 的推理开销接近 vanilla SAC,在四足机器人高频控制(200 Hz)场景下显著快于需要在线求解二次规划的 CBF 方法。
讨论与可借鉴点
AutoSafe 的核心贡献在于证明了安全与学习的平滑性并非不可调和的目标,而是可以通过将安全机制重构为策略架构的内在组成部分来实现兼容。这一"嵌入而非外挂"的思路对整个安全强化学习领域具有方法论层面的启发价值:它将安全从"事后检查"转变为"预防性参与",从离散的开关转变为连续的插值,从阻断梯度转变为允许梯度穿透。
当前方法的局限主要体现在几个方面。首先,安全性依赖于基于模型的安全先验(Simplex 架构需要动力学线性化假设),模型失配或过度保守会限制可达性能和探索能力,这在非线性强耦合系统中尤为突出。其次,论文演示的任务约束相对局部和结构化,对于时变外部扰动、移动障碍、非静态环境等更复杂的现实场景,需要显式重构或在线更新安全可恢复区域,论文虽给出了初步的移动障碍实验,但自适应机制仍未得到充分讨论。最后,物理验证局限于单关节的倒立摆系统,在高维机械臂、足式机器人等平台上的真实世界部署经验尚属空白。
从工程实践角度,AutoSafe 的可学习锐度设计提供了一种优雅的任务自适应方案,避免了手工调节干预阈值的繁琐。安全滤波器与策略组合的解耦设计也增强了系统的模块性——任何能输出安全动作的机制(如 CBF、RCBF、VIP)原则上都可以作为安全先验并入这一框架。这种灵活性为实际部署提供了便利:工程师可以根据计算资源选择不同复杂度的安全滤波器,而不必修改上层学习算法。
摘要
安全在线强化学习要求策略在遵守安全约束的同时保持平滑的优化动态。现有方法通常依赖以下两种途径之一:一是通过动作干预实现严格的安全执行,但这会在系统交互和学习中引入不连续性;二是采用软性安全约束的公式化方法,虽能保持学习的平滑性,但安全保证有限。我们提出了 AutoSafe,一种安全感知策略架构,将结构化安全监控与干预直接集成到动作生成过程中。该设计实现了性能驱动行为与安全保护行为之间平滑的、依赖于风险的过渡,从而产生连续的在线交互与学习动态。在一系列连续控制基准任务上的实证结果表明,AutoSafe 在不牺牲学习平滑性的前提下实现了强有力的安全执行。我们进一步在物理倒立摆-小车系统上对 AutoSafe 进行了验证,凸显了其在真实世界中实现安全在线学习的实际有效性。
速览
TLDR:安全在线强化学习要求策略在满足安全约束的同时维持优化的平滑性。现有方法多依赖动作干预的硬安全保证,但会引入系统交互和学习过程的不连续;而软安全约束方法虽保持平滑却难以提供充分安全保障。本文提出AutoSafe,将结构化安全监控与干预直接嵌入动作生成过程,使策略能在性能驱动与安全保护行为之间实现基于风险的平滑切换。实验在多个连续控制基准和真实倒立摆系统上验证了方法的安全性与学习平滑性。 \
Motivation:现有硬干预方法引入不连续性,软约束方法则安全保障有限,难以兼顾二者。 \
Method:AutoSafe将结构化安全监控与干预嵌入动作生成,实现性能与安全行为的平滑切换。 \
Result:在连续控制基准和真实倒立摆系统中均实现强安全保障且不损失学习平滑性。 \
Conclusion:为现实机器人任务中的安全在线学习提供兼顾安全性与平滑性的有效方案。
Context:该工作属于安全强化学习领域,在硬约束与软约束方法之间探索折中方案,典型应用于需在线交互的连续控制场景。
Abstract
Safe online reinforcement learning requires policies to respect safety constraints while maintaining smooth optimization dynamics. Existing approaches typically rely on either strict safety enforcement via action interventions, which introduce discontinuities in system interaction and learning, or soft safety constraint formulations, which preserve smooth learning but provide limited safety assurance. We propose AutoSafe, a safety-aware policy architecture that integrates structured safety monitoring and intervention directly into the action generation process. This design enables smooth, risk-dependent transitions between performance-driven and safety-preserving behaviors, resulting in continuous online interaction and learning dynamics. Empirical results across a suite of continuous-control benchmarks demonstrate strong safety enforcement without sacrificing learning smoothness. We further validate AutoSafe on a physical cart-pole system, highlighting its practical effectiveness for safe online learning in the real world.
论文详细总结(自动生成)
论文总结:Safe Online Learning via Smooth Safety-Structured Policy Composition
一、核心问题与研究动机
安全在线强化学习(Safe Online RL)要求策略在严格遵守安全约束的同时,保持稳定、平滑的学习动力学。然而,现有方法普遍面临两类取舍:
- 基于安全滤波器(Safety Filter)的硬干预方法(如 Simplex、CBF):通过在状态越过安全边界后进行动作替换或投影,提供较强的安全保证,但干预往往发生在最后时刻,造成动作不连续,并阻断梯度回传,破坏 actor-critic 框架下的稳定学习。
- 基于软约束或安全先验的方法(如 Lagrangian、Lyapunov shaping、Residual RL):保持学习平滑性,但安全保障依赖期望收敛或长尾概率,无法在训练和部署期间提供硬约束。
论文试图解决的核心矛盾:如何在提供硬安全保障的同时,避免硬干预对在线学习动力学的破坏?
二、方法论:AutoSafe 的核心思想与关键技术
2.1 整体思路
AutoSafe 将安全监控与干预直接嵌入到动作生成过程,作为策略架构的"结构性归纳偏置"。其核心是一种可微分的凸策略组合,将学习驱动的策略 与认证安全策略 通过状态相关的混合权重 融合:
其中 ,。
利用动作空间的凸性,凸组合的输出仍处于可行动作空间内,因此该组合在几何上是一条从学习动作到安全锚点的"插值线段",既不会任意裁剪动作,又能保证安全性。
2.2 分布整形与方差衰减(Distributional Shaping)
对于高斯策略 ,合成策略仍是高斯:
该结构揭示了一个一阶稳定性机制:随着 增大,均值向安全动作偏移(纠正意图)的同时,探索方差以二次速率衰减(防止偶然越界)。当 ,方差趋近于零,执行策略在安全边界附近退化为确定性。
2.3 风险校准的可学习干预
理论上,最小可行干预权重由状态机会约束导出:
其中 是名义安全裕度的均值与标准差, 为风险分位数, 是安全先验处的相对安全裕度。直观含义:若风险调整后的名义裕度 ,则无需干预;否则 取决于名义安全赤字与可用安全改进的比值。
为避免在线估计 带来的不稳定性,AutoSafe 采用一个指数型启发式实现:
其中 为归一化安全裕度(1 表示安全内部、0 表示边界), 为可学习锐度参数,由一个共享 actor 主干的小型预测头产生:
参数 与 actor 参数 联合优化,使 在不同任务与目标冲突下自适应调整:在安全内部小、在边界附近大,并保留可微性使梯度可穿过干预机制回传到 actor。
2.4 算法层面
- 训练基础:Soft Actor-Critic(SAC),critic 与学习目标均不修改;仅在动作采样阶段将 替换为合成动作 。
- 安全滤波器实例化:采用经典的 Simplex 架构——基于 Lyapunov 矩阵 与状态反馈增益 通过半定规划(SDP / LMI)求解得到,保证在椭球集 内交由学习策略控制。
- 总体参数 共享同一个观察通道与梯度流。
三、实验设计与 Benchmark
3.1 任务与环境
论文在 4 个连续控制仿真任务 + 1 个真实世界任务 上评估:
| 任务 | 状态/动作维度 | 控制频率 | 安全约束 | ||||
|---|---|---|---|---|---|---|---|
| CartPole Balancing | 50 Hz | $\ | x\ | ,\ | \theta\ | $ 边界 | |
| Glucose Regulation | – | 血糖上下界 | |||||
| 3D Quadrotor Goal Reaching | 50 Hz | 位置包络 | |||||
| Quadruped Navigation(起伏地形) | 200 Hz | 高度上下界 | |||||
| 真实 CartPole | – | 50 Hz | 同仿真 |
物理实验部署在 Raspberry Pi 上,执行策略在边缘侧推理;参数周期性从远端工作站更新。
3.2 对比方法
包含三类基线:
1. 安全滤波器类(硬干预):
- SimplexRL(基于 Simplex 的安全动作替换)
- CBF(基于控制障碍函数的二次规划投影)
2. 带安全先验的策略融合类:
- AdaLam(自适应权重混合)
- Residual(残差策略)
3. 约束 RL 类(软约束):
- Lyapunov-based reward shaping
- Lagrangian / Constrained Policy Optimization
并以 vanilla SAC 作为无安全约束参考。所有方法均使用相同 SAC 训练超参,每个任务运行 5 个随机种子。
3.3 评估指标
- Performance Return(回报):越高越好。
- Safety Violations(累积安全违规次数):越低越好。
- 额外分析:critic loss 与 actor loss 的稳定性曲线、平均 演化、安全干预频次、计算墙钟时间(Inference 与 Optimization ms/step)。
四、资源与算力
论文未明确披露 GPU 型号、集群规模或总墙钟训练时长。可推断的内容包括:
- 物理实验中明确给出 Raspberry Pi 嵌入式部署,控制频率 50 Hz,强调推理轻量、不依赖在线优化。
- 仿真实验包含四足机器人在 200 Hz 控制频率下的训练,间接说明使用具备 GPU 的工作站/服务器,但 GPU/CPU 型号、节点数、训练总时长未在正文或附录中给出。
- 训练步数在任务间有差异(例如 CartPole ,Quadrotor ,Quadruped ),但换算到 GPU-hours 或 FLOPs 的成本信息缺失。
五、实验数量与充分性
实验量较为充分,至少包含以下层次:
1. 主结果对照:四任务 × 5 随机种子 × 8 方法(含 SAC 与 7 个安全基线 + AutoSafe)。
2. 硬干预对学习动力学的对照实验(Fig. 4):在 CartPole 上设置 3 个目标冲突等级( m),比较 smooth vs. hard intervention 的 return 与 critic loss。
3. 可学习锐度 的迁移与消融(Fig. 5、12、13):固定/线性/指数 heuristic vs. learnable;额外对 AdaLam 的 调度做同等消融。
4. 预防性干预可视化(Fig. 6):展示 与 的时间曲线。
5. 真实世界实验(Fig. 7):三轮实物 CartPole 学习。
6. 约束变化场景(D.5):CartPole 与 Quadrotor 在移动障碍/时变约束下的扩展实验。
7. 敏感度分析(Table 4):。
8. 计算时间对比(Table 5):Inference/Optimization ms/step。
总体而言,实验覆盖较广且方法对比公平:所有方法均使用相同 SAC 主干、相同学习超参和种子;公平性较好。不足之处在于:真实世界实验仅有 CartPole 一例、且仅 3 轮,在高维机器人上缺少物理部署验证;超参数(如 AdaLam 的 初值)和 CBF 的 QP 调参可能影响部分基线的真实表现,作者也坦承这一点。
六、主要结论与发现
1. AutoSafe 在四任务上同时实现零硬安全违规和与最先进软约束方法持平或更高的回报(Table 1),在 Quadrotor 与 Quadruped 等高维任务中表现尤为突出。
2. 可微凸组合显著缓解硬干预带来的 critic loss 上升(Fig. 4、11):硬干预方法在目标冲突加强时 critic loss 飙升、学习停滞甚至发散;AutoSafe 的 critic loss 保持稳定。
3. AutoSafe 能学到自然的安全行为:随训练推进,平均 单调下降(Fig. 4b、7b),表明策略逐渐信任自身而非安全先验。
4. 可学习锐度 跨任务自动适配(Fig. 5、12):目标冲突越大、收敛 越大、 越小,避免手工调度。
5. 预防性干预优于即时干预: 在安全裕度降至某阈值前已开始上升,实现边界前的主动平滑过渡(Fig. 6)。
6. 计算开销接近 vanilla SAC(Table 5),推理时在 CBF、Quadruped 等设置上明显快于 CBF。
7. 通过重新解释离线可恢复区域,可在移动障碍约束(CartPole、Quadrotor,Fig. 15、16)下零违规部署。
七、优点
- 架构层面的优雅性:把安全监控与干预整合为可微策略组合的归纳偏置,使安全机制对 actor 梯度透明,既保留硬安全保障又保留软约束的平滑性。
- 理论推导完整:附录 A 给出基于状态机会约束的闭式 及其在仿射近似与有界误差下的鲁棒性分析(Prop. A.8–A.10),并证明边界附近协方差趋于零。
- 可学习锐度 是有意义的工程贡献,避免了依赖任务的人工调度。
- 与安全滤波器协同:AutoSafe 框架是 safety-filter-agnostic 的,本文以 Simplex 作为代表,但任何能输出动作的安全滤波器皆可并入。
- 物理验证:直接部署到 Raspberry Pi,凸显在线、可高频部署的实用性。
- 实验设计层次分明,涵盖基线、消融、敏感度、计算时间、可视化轨迹和真实部署。
八、不足与局限
1. 依赖基于模型的安全先验:与多数可证明安全学习方法类似,需要动力学线性化与 LMI 求解以获得 与 。模型失配或过于保守会限制探索能力与可达性能,论文明确指出此局限。
2. 约束空间相对结构化:目前演示的任务具有相对局部、结构化的状态约束(边界、Lyapunov 椭球)。在含时变外部扰动、移动障碍、未知障碍等更复杂场景下,需显式重构或在线更新安全可恢复区域,论文虽给出初步示例(D.5、Fig. 15、16),但对在线自适应机制的讨论仍较初步。
3. 真实世界验证局限于 CartPole:仅三轮实验,没有覆盖四足/四旋翼等更高维度物理系统。
4. 可复现性与算力披露不足:未声明 GPU/CPU 型号、训练时长;基线方法(特别是 CBF)调参对结果的影响未做系统 ablation,可能引入不公平性。
5. 安全裕度标准化与 选取仍需要任务相关知识,未给出自动化原则;论文虽然提供了 灵敏度表,但缺少选取指南。
6. 理论假设较强:闭式 的推导需要安全裕度在插值方向上仿射、子高斯尾界等假设;在强非线性或非仿射条件下只是近似,作者虽在 Prop. A.9 给出鲁棒性界,但实际生效条件仍依赖经验。
7. critic 仍由环境交互数据驱动,硬安全的极限保证来自底层 Simplex/Lyapunov 设计;当存在模型误匹配时,AutoSafe 并不能自动修复安全证书,仅能在已有安全先验之上做更平滑的组合。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。






















