arXiv 2607.07252v1 · 发布 2026-07-08

基于模型预测控制思想的安全强化学习

Safe Reinforcement Learning using Ideas from Model Predictive Control

AUTHORS Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender
EVIDENCE 结合深度强化学习与MPC实现安全策略学习
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-11 21:33:33 UTC

📝 TLDR

强化学习在物理系统应用中存在安全探索难题,违反机械约束可能造成不可逆损伤。本文提出融合深度强化学习与模型预测控制的通用安全框架,基于系统动力学模型离线计算可行状态-动作空间,在训练与部署阶段通过安全滤波器将RL动作投影至经验证的可行集合。该方法在非线性单自由度实验平台上完成了物理硬件实测验证,成功实现安全探索与稳定策略收敛。

🧭 速览

动机

物理系统在RL训练中违反机械约束会引发不可逆损伤,亟需在探索阶段提供严格的安全保障机制。

方法

利用系统动力学模型离线构建MPC可行状态-动作空间,通过安全滤波器实时将RL动作投影到该经验证集合。

结果

在非线性单自由度实验平台上完成物理硬件验证,RL代理实现安全探索与策略稳定收敛。

结论

融合DRL与MPC可兼顾自适应高性能与形式化安全保证,为物理系统安全RL提供通用可行方案。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

这篇论文解决了强化学习在物理系统中“安全探索”的核心难题:RL 智能体在训练时会产生违反机械约束的危险动作,导致硬件损伤。作者提出将深度强化学习与模型预测控制的思想融合——利用系统动力学模型离线计算出一个“安全可行域”,在线部署时用一个轻量级投影滤波器把 RL 的任意动作实时投影回这个安全集合。在 Quanser Aero 2 的单自由度非线性平台上完成物理硬件验证,成功实现了安全探索与策略收敛。

研究背景与动机

在复杂的信息物理系统(Cyber-Physical Systems, CPS)和机器人控制中,[[强化学习]] 通过与环境直接交互来合成控制策略,展现出传统控制方法难以企及的适应性。然而,这种“边学边试”的范式与现实物理系统的安全需求之间存在一道难以逾越的鸿沟。

[[强化学习]] 的训练过程依赖随机探索机制。以连续动作空间的 PPO(近端策略优化)算法为例,智能体通常通过在策略输出的动作上叠加高斯噪声来探索环境。这种“盲目”探索在虚拟仿真中是无害的——大不了重置环境。但在真实物理硬件上,机械极限一旦被突破,可能造成连杆断裂、执行器烧毁甚至不可逆的结构性损伤。这意味着训练必须在严格的安全边界内进行,违反约束的代价不是重来一次 episode,而是真金白银的硬件报废。

更棘手的是,仅仅保证当前状态满足约束是不够的。由于系统存在惯性,智能体可能在某个时刻虽然处于安全区域,但以极高的速度逼近机械极限——此时即便立即施加最大的反向控制力,也来不及在物理限制内刹住车。这种状态被称为“不可挽回点”(Point of No Return)。从这一点出发,无论接下来如何控制,都必然会在未来某个时刻突破约束。因此,安全的探索空间必须考虑系统未来的演化轨迹,而非仅着眼于单步约束满足。

[[模型预测控制]](Model Predictive Control, MPC)正是处理这类带约束轨迹优化问题的利器。MPC 在每个控制周期内求解有限时域的最优控制问题,并将第一个控制动作应用于系统,同时考虑系统的动力学模型和状态/动作约束。然而,MPC 的计算负担相当可观——对于非线性系统,实时求解一个有限时域优化问题往往需要毫秒级的计算资源,这对于高频控制回路是个严峻挑战。

这篇论文的切入点是:能否将 MPC 的安全保障能力“借用”过来,但把它昂贵的计算负担从实时控制回路转移到离线阶段? 具体而言,利用系统动力学模型离线计算出“安全可行状态-动作空间”,在线阶段用一个极轻量的确定性投影滤波器将 RL 智能体的动作投影到这个预先验证过的安全集合上。这样既能继承 MPC 的形式化安全保证,又能满足 RL 在线决策的实时性要求。

方法

可行状态-动作空间的数学刻画

论文首先形式化地定义了“安全”的概念。对于任意状态 ,所有能够保证系统在约束范围内运行的控制输入构成了该状态下的可行动作集合:

其中 是单步动作约束集合(如执行器的电压/力矩限幅)。 中的每个动作 必须满足:存在 内的一个无穷动作序列,使得系统从 出发沿这条序列演化时,永远不会离开安全状态集合

基于此,可行状态空间定义为:

即至少存在一个可行动作的状态集合。全局可行状态-动作空间则为两者的笛卡尔积:

这个 就是离线计算的核心产物——它包含了所有“即使考虑系统未来演化轨迹也仍然安全”的状态-动作组合。

MPC 作为安全性预言机

如何判断一个具体的 对是否属于 ?论文采用 MPC 作为“可行性预言机”。给定状态-动作对 ,MPC 求解器在有限预测时域 内尝试构造一条满足所有约束的安全轨迹:

若优化存在可行解,则 ,否则不在安全集合内。

关键的设计选择是让预测时域 远大于“以最大反向控制力使系统完全制动”所需的时间。这样做规避了构造控制不变集(control invariant set)的复杂数学,直接以足够长的预测范围作为长期安全性的实用保证——如果未来 步内都不违反约束,那么可以合理地认为系统具有足够的安全裕度。

利用凸性降低离线计算复杂度

如果对状态空间进行密集网格划分,对每个格点调用 MPC 预言机,计算量将随维度指数爆炸。论文观察到,大多数实际物理系统的动力学是控制仿射的(control-affine),即:

在这种形式下,安全约束对动作空间 线性,而系统动力学对控制输入也是线性的。因此,对于给定的状态 在动作空间中形成一个连续的凸区间 ,而非离散的点集。

这意味着不需要对动作空间进行穷举搜索,只需用二分搜索定位区间边界即可。计算复杂度从 降到 ,其中 是状态格点数, 是动作方向数。对于一维动作空间,复杂度进一步降为线性。

安全投影滤波器

离线阶段完成后, 被存储为一个查表函数或高效插值结构。在线运行时,RL 智能体输出原始动作 ,[[安全滤波器]](Safety Filter)执行确定性投影:

当智能体动作落在可行区间内时,保持不变;当动作越界时,将其投影到最近的安全边界上(欧氏距离最小化)。

为了让智能体逐步“学会”安全动作分布、减少对滤波器的长期依赖,论文还引入了奖励整形机制:对投影幅度 施加惩罚项,引导策略收敛到安全动作分布的中心区域。此外,为防止策略在安全边界附近振荡产生“砰-砰控制”(bang-bang control),论文对滑动窗口内归一化动作的标准差施加动作平滑惩罚。

系统架构与实现

整个框架的软件实现采用模块化设计:Simulink 中的系统动力学模型编译为 DLL,通过 Farama Gymnasium 接口封装为标准强化学习环境,再通过 Quanser Python API 与物理硬件通信。这套架构使得仿真环境与物理硬件共用同一套动力学模型描述,实现零样本 Sim-to-Real 迁移。

实验与结果

实验平台与任务

论文使用 Quanser Aero 2 双旋翼气动实验台,配置为单自由度俯仰角控制场景。系统的非线性动力学方程为:

其中 是俯仰角, 是角速度, 是控制电压。安全约束为 (约 rad)。

该系统具有显著的非线性重力项——重力力矩 随俯仰角非线性变化,使得“不可挽回点”随状态剧烈变化:高俯仰角区域对应的可行电压范围与低角度区域截然不同,验证了离线计算可行域的必要性。

训练结果

采用 PPO 算法在仿真环境中训练。离线 MPC 可行域计算成功刻画了状态空间的结构:高速接近机械极限时,可行电压范围急剧收缩,仅剩能提供最大制动推力的区间。

训练过程中,安全滤波器持续发挥作用,RL 智能体在受保护的环境下探索状态空间边界。论文报告,与作者先前未加滤波器的 PPO 基线相比,约束违反率显著降低。PPO 智能体在安全保护下稳定收敛到可行域内部的策略,避免了无约束探索中常见的“灾难性高速失败”——即飞轮转速失控后高速撞向机械限位的情况。

Sim-to-Real 验证

将训练好的策略直接部署到物理硬件上进行实测。理论框架的[[递归可行性]]保证(一旦状态落在 内,未来始终保持在该集合内)在物理实验中遭遇了真实世界的挑战:偶发的间歇性约束违反仍然出现。主要原因包括:仿真模型与物理系统的参数偏差、离散采样引入的积分误差、控制指令与执行器响应之间的通信延迟,以及数值求解的容差积累。

这些违反虽然不频繁,但揭示了纯确定性安全滤波在面对模型不确定性时的脆弱性——这为后续的鲁棒性扩展研究埋下了伏笔。

讨论与可借鉴点

核心贡献与启发

这篇论文最值得借鉴的思路是将安全约束的验证与策略的执行解耦。传统观点认为,安全性与学习能力是一对矛盾——要安全就不能自由探索,要高性能就必须承担风险。但论文通过“离线验证、在线投影”的范式证明,两者可以实现优雅的分工:MPC 提供形式化的安全知识,RL 提供自适应的策略优化,各自在擅长的环节发挥作用。

对于控制系统工程师而言,这套框架的可操作性强。离线阶段可以在研发实验室的高性能计算平台上完成,不受实时性约束;在线阶段的投影滤波器计算量极低,可以轻松嵌入现有的控制回路。对于机器人或工业自动化领域,这种“即插即用”的安全模块化设计有着直接的工程价值。

局限性

尽管论文展示了有说服力的硬件验证结果,其局限性也不容忽视。首先,离线可行域的计算面临维度灾难。网格搜索对高维状态空间(如多自由度机械臂的关节位置-速度组合)是不可扩展的。论文提出用高斯过程(GP)回归替代网格化可行域表示,但本文并未实现,这一方向的可扩展性有待验证。

其次,Sim-to-Real 鸿沟削弱了安全保证的严格性。论文自己也承认,理论上递归可行性的保证在物理硬件上被打破。离线阶段未采用鲁棒 MPC 框架来处理模型不确定性——如果系统在运行过程中发生参数漂移(如负载变化、摩擦老化),固定的安全滤波器可能不再保守。

第三,实验规模偏小。仅在单一 1-DOF 系统上验证,缺乏对不同非线性特性、不同动作空间维度系统的迁移性测试。与其他安全 RL 方法(如 [[安全强化学习]] 领域的 CBF 即控制障碍函数方法、基于 Lyapunov 函数的方法、可达集方法)缺乏统一的定量对比,限制了论文结论的可推广性。

未来方向

从这篇论文出发,至少有三个值得深耕的方向:一是鲁棒安全滤波器,在离线 MPC 阶段考虑模型不确定性,构造能在参数扰动下保持安全的可行域;二是高维系统的可扩展表示,探索函数近似(如神经网络、Gaussian Process)来压缩存储可行域,而非显式网格化;三是安全性的在线学习更新,当系统动力学随时间演化时,如何增量地更新安全滤波器而非完全重新计算。

对于从事机器人控制和强化学习交叉研究的研究者而言,这篇论文提供了一个务实的工程框架——它没有追求理论上的绝对完美,而是在保证“足够安全”的前提下释放了 RL 的学习能力。这种工程理性,或许正是安全 RL 从实验室走向工业应用的关键一步。

摘要

强化学习(RL)能够直接从数据中合成控制策略,因此在复杂信息物理系统(CPS)和机器人领域极具吸引力。然而,一个持续存在的挑战在于如何在主动学习阶段确保严格、硬性的安全约束。在实际物理系统中,违反机械极限可能造成不可逆的损害,因此探索过程必须严格限制在安全运行区域内。我们提出了一个通用框架,将深度强化学习(DRL)的自适应高性能特性与模型预测控制(MPC)的形式化安全保障相结合。利用系统动力学的数学模型,离线 MPC 计算定义了一个可行的状态-动作空间,表示能够保证约束满足的所有安全系统状态与控制输入组合。在训练和部署过程中,RL 智能体的瞬时动作通过一个安全滤波器投影到这一经全局验证的可行集合上。我们在一个非线性的 1 自由度实验室测试平台上系统地评估了该通用方法,在实际物理硬件上成功实现了探索和稳定的策略收敛。

Abstract

Reinforcement learning (RL) enables the synthesis of control policies directly from data, making it highly appealing for complex cyber-physical systems (CPSs) and robotics. A persistent challenge, however, is ensuring strict, hard safety constraints during the active learning phase. In real-world physical systems, violating mechanical limits can cause irreversible damage, necessitating that exploration remains strictly within safe operational regions. We propose a generalized framework that combines the adaptive, high-performance nature of deep reinforcement learning (DRL) with the formal safety guarantees of model predictive control (MPC). Using a mathematical model of the system dynamics, offline MPC computations define a feasible state-action space, representing all safe combinations of system states and control inputs that guarantee constraint satisfaction. During training and deployment, the RL agent's instantaneous actions are projected onto this globally verified feasible set via a safety filter. We systematically evaluate our generalized approach on a non-linear 1-DoF laboratory testbed, demonstrating successful exploration and stable policy convergence on physical hardware.


论文详细总结(自动生成)

论文总结:基于模型预测控制思想的安全强化学习

1. 核心问题与整体含义

  • 研究背景:深度强化学习(DRL)通过与环境的主动交互学习最优控制策略,在复杂非线性信息物理系统(CPS)和机器人控制中具有重要潜力。然而,标准 RL 的训练范式依赖对状态-动作空间的无约束探索,这与实际物理系统的安全要求存在根本矛盾。
  • 核心矛盾("安全探索悖论"):RL 智能体通过随机探索机制(如在连续动作空间添加高斯噪声)寻找最优策略,但这种探索不可避免地会提出违反机械极限、热边界或执行器约束的动作,可能导致硬件损坏、停机或不可逆损伤。
  • 更深的挑战:仅保证单步约束满足()是不够的。由于系统惯性,智能体必须避免进入"不可挽回点"(Point of No Return)——即从该状态出发,即使施加 内的最大控制力也无法阻止未来违反约束的状态。
  • 研究目标:提出一个通用框架,将 DRL 的自适应学习能力与 MPC 的形式化安全保障相结合,实现在物理硬件上训练与部署全过程的严格安全约束满足。

2. 方法论

2.1 核心思想

将 MPC 的计算负担从实时控制回路转移到离线阶段:离线计算定义一个"可行状态-动作空间" ;在线阶段通过一个轻量级的确定性投影滤波器,将 RL 智能体提出的任何不安全动作实时投影回该安全集合。

2.2 形式化定义

  • 可行动作集合:对任意状态 ,其可行动作集合定义为

使得存在 内的无穷序列动作保持系统始终处于 之外。

  • 可行状态空间
  • 全局可行状态-动作空间

2.3 MPC 作为可行性预言机

对于给定的状态-动作对 ,MPC 预言机通过有限时域 的优化求解来近似无穷时域安全性:

预言机函数定义为:

为规避显式构造控制不变终端集的复杂性,论文选择 显著超过"以最大反向控制力使系统完全制动"所需的最大时间,以此作为长期安全性的实用保证。

2.4 利用系统凸性降低离线计算复杂度

  • 对于控制仿射(control-affine)动力学系统,控制输入以线性方式进入系统方程(例如直流电机电压输入),安全约束在动作空间上为线性不等式,因此 形成连续凸区间。
  • 无需对连续动作空间进行密集网格评估,仅需用二分搜索确定最小安全动作 与最大安全动作 ,使得
  • 这一性质使得离线映射的计算量从指数级降为线性级。

2.5 安全投影滤波器

在线阶段,对 RL 智能体提出的原始动作 ,确定性投影滤波器 定义为:

  • 通过欧氏距离投影到最近的安全边界。
  • 奖励整形机制:对投影幅度 进行惩罚,鼓励智能体逐渐习得安全动作分布。
  • 防止"砰-砰控制":对滑动窗口内归一化动作的标准差施加动作惩罚。

3. 实验设计

3.1 测试平台

  • Quanser Aero 2:可重构双旋翼气动实验台,配置为 1 自由度俯仰角控制(机械锁定偏航轴)。
  • 两个水平对置风扇提供单一电压输入 ,系统具有显著非线性重力项。

3.2 系统动力学

非线性动力学方程:

  • 参数 为俯仰角, 为俯仰角速度。
  • 为转动惯量, 为摩擦系数, 为电压增益, 为质心到枢轴距离。
  • 机械约束:

3.3 算法与对比

  • DRL 算法:近端策略优化(PPO)。
  • 对比基线:与作者先前工作中未加安全滤波器的 PPO 进行比较(参考文献 [13]),展示约束违反率的显著下降。
  • 评估指标:成功完成训练的能力、约束违反率、策略收敛稳定性。

3.4 软件架构

  • Simulink 数学模型被编译为 DLL,并通过 Farama Gymnasium 接口封装。
  • 通过 Quanser Python API 实现零样本迁移到物理硬件。

4. 资源与算力

  • 论文未明确说明所使用 GPU 型号、数量、训练时长或计算资源。
  • 仅指出使用 Python 端的 Stable Baselines3 库以及 Simulink/DLL 编译环境。
  • 离线阶段 MPC 网格搜索的计算开销未给出量化数据。

5. 实验数量与充分性

  • 实验规模有限:论文报告的核心实验集中在单一测试平台(Quanser Aero 2)的 1 自由度配置上。
  • 缺乏系统消融:未对以下关键因素进行充分的消融研究:
  • 预测时域 的选择对安全性与计算量的影响;
  • 不同网格分辨率对离线映射精度的影响;
  • 状态-动作空间维度扩展(高维)下的可扩展性;
  • 不同 RL 算法(如 SAC、TD3)的兼容性。
  • 对比基线单薄:主要与作者自身先前工作对比,缺乏与 CBFs、Lyapunov-based safe RL、可达集方法等其他安全 RL 范式的直接定量比较。
  • 公平性:由于缺乏统一基准,定量结论的可推广性受限。

6. 主要结论与发现

  • 离线 MPC 计算成功刻画了 Quanser Aero 2 系统的可行状态空间,揭示出在高速度接近机械极限时,可行电压范围急剧收缩至仅能提供最大反向推力的值。
  • PPO 智能体在安全滤波器保护下成功探索状态空间边界,并稳定收敛。
  • 与未保护基线相比,约束违反率显著降低。
  • 安全投影滤波器可高频运行,有效避免了无约束 DRL 探索中的灾难性高速度失败。
  • 理论保证与实测差异:理论框架保证递归可行性,但物理硬件上出现偶发的间歇性机械约束违反,主要源于"Sim-to-Real"差异、离散采样误差、通信延迟和数值求解容差。

7. 优点与亮点

  • 离线/在线分离架构:将昂贵的 MPC 求解从实时控制回路剥离,保留其形式化安全保障,同时不牺牲控制频率。
  • 凸性利用:巧妙利用控制仿射系统的凸性,将连续动作空间的可行性评估从密集网格搜索降至二分搜索,大幅提升离线映射效率。
  • 递归安全性定义:明确定义"不可挽回点"边界 ,避免单步约束满足的不足。
  • 物理硬件验证:在真实非线性 CPS 上完成端到端验证,而非仅停留在仿真层面。
  • 奖励整形引导:通过投影惩罚项引导智能体内部化安全边界,减少对滤波器的长期依赖。
  • 模块化软件架构:Simulink→DLL→Gymnasium 的封装方案支持零样本迁移,便于工业部署。

8. 不足与局限

  • Sim-to-Real 鸿沟:理论上的绝对安全保证高度依赖系统动力学模型的精度,而真实物理系统的偏差直接导致偶发违反。
  • 维度灾难:网格搜索随状态-动作空间维度 呈指数级增长,对高维系统(如多自由度机械臂)不可行。
  • 缺乏鲁棒性形式化:离线阶段未采用鲁棒 MPC 框架系统处理模型不确定性。
  • 实验规模有限:仅在单一 1-DOF 系统验证,缺乏对不同动力学特性、不同非线性程度的系统迁移性测试。
  • 缺乏量化指标:约束违反率、训练曲线、性能对比等的具体数值未在文本中详细给出(仅在图中可视化)。
  • 离散化误差:连续动力学在采样间隔内可能违反约束的问题未充分讨论与缓解。
  • 未来工作依赖假设:作者提出用高斯过程(GP)替代网格搜索以缓解维度灾难,但本文未实现该方案。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记