基于深度强化学习的大气再入航天器姿态控制
Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry
📝 TLDR
航天器再入大气层时姿态控制面临非线性动力学、参数不确定与故障等挑战,传统PID增益调度方法在自适应性与鲁棒性上存在不足。本文将再入姿态控制形式化为连续无策略深度强化学习问题,并在训练中引入动力学随机化以覆盖预定义运行包线内的任务变化,进而提出融合传统控制的混合控制器方案。实验表明混合控制器对攻角跟踪精度更高,在质量、惯量张量与襟翼执行器带宽等扰动下鲁棒性优于纯传统控制基线,展现了深度强化学习在再入姿态控制中的工程应用潜力。
🧭 速览
航天器再入段姿态控制需应对非线性动力学与参数不确定性,传统PID增益调度方法在自适应性和鲁棒性方面存在局限。
采用连续无策略深度强化学习构建姿态控制器,训练时利用动力学随机化在预定义包线内增强泛化,并融合传统控制形成混合控制器。
纯RL控制器与传统控制性能相当;混合控制器攻角跟踪更优,且在质量、惯量张量与襟翼带宽变化下鲁棒性显著优于传统基线。
动力学随机化结合混合控制策略可有效提升RL在再入姿态控制任务中的泛化能力与工程实用性。
📊 论文图表(共 40 张)
展开查看 40 张图
TL;DR
这篇论文探索了深度强化学习在航天器大气再入姿态控制中的应用,提出将传统增益调度 PID 与 RL 策略相结合的混合控制器架构,并通过动力学随机化训练策略在预定义运行包络内实现鲁棒泛化。实验表明,采用 MR.Q 算法的加性混合控制器在攻角跟踪精度和参数扰动鲁棒性上均显著优于纯 PID 基线,为深度 RL 在安全关键姿态控制系统中的工程落地提供了可行路径。
研究背景与动机
航天器再入大气层是高超声速飞行中最为复杂的阶段之一。以高升阻比升力体飞行器为例,再入过程跨越从海拔 93 km 到 10 km 的广阔空域,速度从 7378 m/s 骤降至 150 m/s,马赫数变化范围横跨 0.5 到 26.8,气动压力在 50 到 5825 Pa 之间波动。这一过程中,飞行器必须精确跟踪攻角以满足结构与热防护的约束,同时抑制侧滑角并控制滚转姿态。执行器由尾部两片襟翼和偏航推力器组成,传统上采用工业标准的增益调度 PID 控制器——在 21 个线性快照模型上通过极点配置离线设计增益参数,再根据当前飞行状态插值获取控制增益。
然而,这种经典方案面临深层困境。一方面,再入气动环境的高度非线性与强耦合特性使得基于线性化模型的增益调度难以在全包络内保持一致性能。另一方面,飞行器质量、惯性张量会因燃料消耗而持续变化,襟翼执行器带宽也会因老化或故障而退化,传统的固定增益 PID 难以自适应这些不确定性。与此同时,深度强化学习在机器人控制、游戏博弈等领域展现了处理非线性系统的强大能力,其通过与环境交互直接优化控制策略的方式,理论上能够捕获传统方法难以建模的复杂动力学。
但深度 RL 进入安全关键姿态控制系统存在两道门槛:其一是 RL 策略的「黑箱」特性使得安全验证极为困难;其二是[[离策略强化学习]]算法在训练分布之外的泛化能力往往不足,当遇到与训练样本差异较大的工况时性能可能急剧下降。本文的核心切入点正在于此——如何在保留 RL 自适应学习优势的同时,通过合理的架构设计与训练策略确保策略在运行包络内的安全泛化。
方法
作者首先将再入姿态控制形式化为一个上下文相关的[[离策略强化学习]]问题。上下文空间编码了飞行器动力学的关键不确定参数:质量在 1312 到 1968 kg 之间变化,三个主惯量轴的比例因子在 0.9 到 1.1 之间浮动,惯性主轴可能发生最多 ±10° 的旋转,襟翼执行器带宽则在 12 到 30 rad/s 之间波动。控制目标是最大化策略在所有可能上下文上的期望累计回报。
在控制架构设计上,论文探索了三种从纯 RL 到纯传统的连续体。最极端的是纯 RL 方案,直接输出襟翼和推力器的命令增量,完全脱离传统控制器。居中的是加性混合控制器,其输出作为残差叠加到 PID 基线命令上,RL 的作用相当于对传统控制律施加「修正」,这种设计使得性能下界天然就是 PID 基线。最保守的是增益调度混合控制器,RL 不直接输出执行器命令,而是输出 12 个 PID 增益的比例因子,实现对传统控制器的「元调节」。
观测空间的设计体现了对姿态控制本质的深刻理解。除气动角、角速率、指令值、上一时刻襟翼命令等基本信息外,混合模式下还额外加入了 PID 基线命令。更关键的是,为缓解部分可观测性(角速率测量存在噪声、执行器存在延迟),研究者参照 PID 误差反馈的物理直觉,在观测中显式加入了比例-积分-微分误差项,使网络能够「看到」与传统控制器类似的误差信号。
奖励函数采用基于 Bryson 法则的设计思路,核心是确保姿态跟踪精度:
其中 是三个控制通道归一化误差的平方和, 控制指数衰减的锐度。奖励设置 0.001 的下界是为了避免 RL 在早期探索阶段因轨迹过早终止而学到「放弃控制」的捷径。控制代价项采用平方形式惩罚执行器使用量,推力器权重(1.0)远高于襟翼权重(0.05),这反映了偏航推力器的能量成本更高的工程现实。
在算法选择上,论文对比了 SAC、TD3、TD7 和 MR.Q 四种[[离策略强化学习]]算法。MR.Q 基于 TD3 框架,引入多步回报(horizon=3)以缓解[[离策略强化学习]]中的高估偏差,并利用基于模型的表征学习辅助价值函数估计。消融实验证实,多步回报和模型表征是该算法在姿态控制任务上超越 TD3 的关键因素,移除 state encoder 末层的 ELU 激活函数(仅保留 LayerNorm)也带来了性能提升。
泛化能力的培养依赖于动力学随机化策略。与传统在固定标称参数下训练不同,动力学随机化在每个训练 episode 开始时从预定义分布中连续均匀采样不确定性参数,迫使策略在多样化的动力学配置中学习适应性。这一策略与任务调度方法(Round-Robin、针对难度的 SMT、针对覆盖度的 AMT-B/M)进行了对比,后者在该实验中因训练不稳定而完全失败,作者将其归因于任务级 replay buffer 与难任务带宽采样的组合效应。
实验与结果
实验采用自研的 6-DOF 刚体飞行动力学仿真器,包含国际标准大气模型、表格化高保真气动系数、多速率子系统模拟(快慢回路分别以 140 Hz 和 14 Hz 运行)以及计算延迟建模。控制器以 14 Hz 运行,每回合约 700 步。
统计评估采用 rliable 库推荐的鲁棒指标:区间中位数(IQM)代替算术均值以抗离群值,95% Bootstrap 置信区间量化不确定性,概率改进指标衡量「算法 A 优于算法 B」的可信度。每个主实验配置使用 10 个随机种子,每个种子评估 10 个回合。
算法对比结果清晰地表明 MR.Q 的优势。在标称条件下,MR.Q 的 Only RL 和 Additive Hybrid 架构均达到最高累计回报,显著超越 SAC 和 TD3。TD7 虽然接近 MR.Q,但未显示出显著优势。架构层面,标称条件下 Only RL 或 Additive Hybrid 取得最优回报,但 Gain-Scheduling Hybrid 展现了更好的跨种子稳定性——其最差性能也有保障,不会像纯 RL 那样在某些种子下完全失败。
泛化能力是论文最核心的验证维度。研究者设计了系统性的包络外测试:惯性张量主轴旋转扩展到 ±30°(训练时仅 ±10°),主惯量缩放范围扩展到 [0.7, 1.3],襟翼带宽测试低至 5 rad/s 的严重降级场景。结果显示,动力学随机化训练的策略取得了显著更高的成功率:Only RL 达到 98-100%,Additive Hybrid 达到 93-94%,而 PID 基线在极端配置下仅为 79%。值得注意的是,未使用动力学随机化的 RL 策略在某些包络外场景(尤其是惯性主轴旋转)下表现甚至弱于 PID,这正是动力学随机化发挥作用的关键证据。
应用层面的量化指标进一步印证了 RL 的优势。Additive Hybrid 在 90/95/98 分位上显著降低了攻角跟踪误差和滚转角误差,尽管代价是襟翼命令增量和推力器使用量的增加。在飞行器质量或惯性张量发生大幅变化时,混合控制器的跟踪精度始终保持稳定,而 PID 基线的误差会随参数偏离标称值而快速上升。
讨论与可借鉴点
这项工作为深度强化学习在安全关键控制系统中的应用提供了几个重要启示。首先是架构设计的工程哲学:混合控制器通过保留传统 PID 作为安全兜底,既利用了 RL 的自适应学习能力,又在理论上保证了性能下界不低于传统方案。监督器在检测到异常时关闭 RL 切换回 PID 的安全模式,为工程部署提供了清晰的容错路径。
其次是动力学随机化作为泛化促进手段的有效性。在姿态控制这类物理规律主导的领域,参数不确定性是有界的、分布可定义的,这使得动力学随机化比纯数据增强策略更具物理可解释性。训练阶段引入的参数变化直接对应了运行阶段可能遭遇的物理不确定性,这种对应关系增强了工程师对策略行为的信任。
然而,论文也存在若干局限。部分关键消融实验(多步回报 horizon 的最优值探索、激活正则项的贡献)仅使用 1 个随机种子,统计鲁棒性不足。PID 基线作为精心调优的工业实现,与 RL 策略在训练算力和在线适应能力上并不对等——RL 策略理论上可以通过持续学习适应未知扰动,而 PID 基线的增益调度是静态的。更重要的是,Additive Hybrid 在降低跟踪误差的同时显著增加了执行器使用量(尤其是推力器的 98 分位达到 88-93 N),推进剂预算对任务可行性的影响未被充分讨论。
对于后续研究而言,动力学随机化的设计空间值得进一步探索——当前的连续均匀采样是否最优?能否根据飞行阶段动态调整参数分布以实现更高效的探索?此外,文中规划的在线异常检测与 FPGA 部署尚未实现,如何在计算资源受限的飞行计算机上高效运行深度 RL 策略仍是开放的工程挑战。
摘要
深度强化学习通过比传统姿态控制方法更有效地处理非线性动力学、不确定性和故障情况,有潜力以更自适应、更精确、更鲁棒的方式解决姿态控制问题。我们探索了强化学习(RL)在航天器再入姿态控制中的应用。一种工业标准的带有增益调度的比例-积分-微分控制器,作为无模型RL以及结合这两种方法的混合控制器的强基线。我们在RL框架中对该应用进行了形式化处理,以应用连续的、离策略RL。最先进的RL在该领域取得了与传统控制方法相当的性能。然而,其分布外泛化能力尚不充分。因此,我们采用动力学随机化方法,在训练过程中引入具有挑战性的任务变化,并强制在预定义的操作包络内实现泛化。最后,我们使用针对应用的特定指标对所获得的最佳基于RL的控制器进行了评估,以证明相对于传统控制器在操作包络内的优越性能,即混合控制器能够更好地跟踪攻角,并且在质量、惯性张量和襟翼执行器带宽变化的情况下具有更强的鲁棒性。
Abstract
Deep reinforcement learning has the potential to solve attitude control problems more adaptively, precisely, and robustly by handling nonlinear dynamics, uncertainties, and failure cases more effectively than traditional attitude control approaches. We explore reinforcement learning (RL) for attitude control in spacecraft re-entry. An industry-standard proportional-integral-derivative controller with gain scheduling serves as a strong baseline for model-free RL and hybrid controllers that combine these two approaches. We formalize the application in the RL framework to apply continuous, off-policy RL. State-of-the-art RL achieves comparable performance to traditional control approaches in this domain. However, its out-of-distribution generalization is not sufficient. Hence, we use dynamics randomization to introduce challenging task variations during training and enforce generalization in a predefined operational envelope. Finally, we assess the best obtained RL-based controllers with application-specific metrics to show superior performance in comparison to traditional controllers in the operational envelope, that is, hybrid controllers are able to track the angle of attack better and are more robust under variations of mass, inertia tensor, and flap actuator bandwidth.
论文详细总结(自动生成)
论文总结:基于深度强化学习的大气再入航天器姿态控制
一、核心问题与研究背景
- 应用场景:高升阻比升力体飞行器在大气层内(海拔 93 km → 10 km,速度 7378 m/s → 150 m/s)的高超声速再入段姿态控制,核心目标是跟踪攻角 (结构与热完整性约束)、抑制侧滑角 、跟踪滚转角 ,执行器为尾部两片襟翼 、 与偏航推力器 。
- 传统方案:工业标准增益调度 PID(基于 Ma 与动压 在 21 个线性快照模型上做极点配置),属于确定性、可形式化验证的控制律。
- 痛点:PID 增益调度的自适应性与鲁棒性有限,难以应对非线性气动(、)、质量/惯量不确定性、执行器故障等场景;而深度 RL 的"黑箱性"与分布外泛化不足又阻碍其进入安全关键姿控系统。
- 本文定位:将再入姿态控制形式化为连续离策略 RL 问题,提出 PID + RL 混合架构,并通过动力学随机化在预定义运行包络内强制泛化,论证深度 RL 在该任务上的工程可用性。
二、方法论
2.1 RL 问题形式化(上下文 MDP)
- 上下文空间 编码动力学参数:质量 、主惯量比例因子 、主轴旋转 、襟翼执行器带宽 ,标称条件 。
- 目标:在上下文集合 上最大化 。
2.2 三种控制架构
| 架构 | 输出 | 备注 |
|---|---|---|
| Only RL | 纯策略直接输出执行器增量 | |
| Additive Hybrid | 加性残差(residual RL) | 输出叠加到 PID 基线命令 |
| Gain-Scheduling Hybrid | 12 个 PID 增益因子 | 监督器可在异常时切回 PID |
2.3 观测空间
气动角 与角速率;指令值 ;上一时刻襟翼命令;混合模式下加入 PID 基线命令;为缓解部分可观测性,按"类 PID 误差反馈"结构额外加入比例-积分-微分误差 。所有量归一化到 。
2.4 奖励函数(Bryson 法则 + 严格正 attitude 奖励)
下界 抑制早期终止倾向;折扣因子 下无控制代价理想总回报约为 100。
2.5 算法与训练策略
- 算法筛选:SAC、TD3、TD7、MR.Q(基于 TD3 的多步回报 + 模型表征学习 + LAP)。
- 关键消融结论:MR.Q 的多步回报()与基于模型的表征是其在姿控任务上超越 TD3/TD7 的主因,激活正则项 贡献不大;其改进:移除 state encoder 末层 ELU(仅保留 LayerNorm)。
- 泛化策略:动力学随机化(DR,连续均匀采样) vs. 任务调度(Round-Robin、SMT、AMT-B、AMT-M)。
三、实验设计
- 仿真平台:自研高保真 6-DOF 刚体飞行动力学(含国际标准大气、高保真表格化气动系数、多速率子系统、计算延迟),步长 ,控制频率 14 Hz,每回合约 700 步。
- 基准(Baseline):增益调度 PID(极点配置,21 个线性快照 + 线性插值)。
- 对比方法:
- 算法层面:SAC、TD3、TD7、MR.Q;
- 架构层面:Only RL、Additive Hybrid、Gain-Scheduling Hybrid;
- 训练策略层面:DR、RR、SMT、AMT-B、AMT-M;
- 无控制对照(No Ctrl.)。
- 评估指标:
- RL 指标:IQM 累计回报、95% Bootstrap 置信区间、Probability of Improvement(rliable)。
- 应用指标: 分布分位数(90/95/98)、成功率(100 个测试上下文上完成轨迹的百分比)、控制代价分位数。
- 包络外测试:主惯量缩放 + 主轴旋转 ;初始姿态 ;襟翼带宽 。
四、资源与算力
- 单次训练:MR.Q、TD7 约 48 h / 1 千万步;TD3 约 24 h;SAC 约 30 h。
- 总训练时长(仅学习曲线部分):(墙钟时间,可并行)。
- GPU 型号与数量未在文中明确披露;实现基于 JAX 0.7.0 + Flax 0.11.1,RL 代码开源(
mlaux1/rl-bloxv0.5.7),仿真与实验代码未公开。 - 使用
rliable库进行统计对比。
五、实验数量与充分性
- 充分性较高:
- 每个主实验 10 个随机种子 + 每 seed 10 个评估回合,使用 IQM/置信区间/概率改进等鲁棒统计。
- DR 阶段使用 100 个统一采样测试上下文 + 30 个上下文用于 checkpoint 选择。
- 对 MR.Q 进行激活正则项消融、模型表征消融(去掉 dynamics/reward/terminal loss)、多步回报 horizon 消融(),定位关键组件。
- 奖励函数敏感度分析(襟翼权重 、推力器权重 ),覆盖跟踪性能、控制代价、样本效率权衡。
- 提供完整轨迹、控制命令、误差分布、控制命令分布的可视化(附录 J)。
- 公平性局限:
- 部分消融仅 1 个 seed(作者承认统计鲁棒性不足);
- DR vs 任务调度对比的训练被限制在 5M 步(4M 步后观察到不稳定),SMT 全部 seed 成功率为 0%,结论带有训练预算限制;
- PID 基线调优为 21 个快照离线设计,未与 RL 进行同等算力的在线调参比较。
六、主要结论与发现
1. 算法层面:MR.Q 无需任务特定调参即超越 PID 基线与 SAC/TD3/TD7;性能优势主要来自多步回报与基于模型的表征学习。
2. 架构层面:
- 标称条件下,Only RL 或 Additive Hybrid 取得最高回报;
- Gain-Scheduling Hybrid 训练跨 seed 与跨时步稳定性最好,性能下界不低于 PID;
- Additive Hybrid 是文中主推候选:保留 PID 安全兜底,可显式约束 RL 权限。
3. 泛化层面:
- 标称训练下,RL 对惯量张量 z 轴旋转与初始姿态变化鲁棒性弱于 PID,但对襟翼执行器降级鲁棒性更强;
- 动力学随机化(DR)显著提升成功率:Only RL 98–100%,Additive Hybrid 93–94%,远高于 PID 基线的 79%;
- 任务调度未带来收益:SMT 完全失败(0% 成功率),AMT-B/M、RR 与 DR 无显著差异,作者将其归因于"任务级 replay buffer + 难任务带宽训练"的训练不稳定性。
4. 领域特定指标:Additive Hybrid 在 90/95/98 分位显著降低 与 ,代价是更高的襟翼增量与推力器使用量。
七、优点
- 研究链条完整:算法选型 → 架构对比 → 标称评估 → 包络外泛化 → DR + 任务调度 → 领域指标评估 → 消融分析 → 部署考量(OOD 检测 + FPGA)。
- 工程导向:提出"监督器在异常时关闭 RL 切回 PID"的安全模式,并指出加性混合控制器性能下界即 PID 基线。
- 评测严谨:采用 rliable 推荐统计方法(IQM + bootstrap CI + 概率改进),避免均值被离群值污染。
- 奖励设计简洁且可解释:基于 Bryson 法则的代价 + 严格正下界,避免稀疏奖励与早期终止退化。
- 开源实现:核心 RL 库开源,便于复现与后续研究。
八、不足与局限
- 硬件细节缺失:未明确 GPU 型号/数量与具体并行策略,影响可复现性;仿真代码未公开。
- 训练预算不一致:DR vs 任务调度对比被截断在 5M 步(受不稳定影响),结论可能受预算影响。
- 部分消融统计薄弱:、激活正则等关键消融仅 1 个 seed,结论可信度有限。
- 基线对比不完全公平:PID 基线为离线精心调优的工业实现,未给予 RL 同等的环境/算力预算进行调参。
- SMT 完全失败(0% 成功率):作者将其归因为实现细节(每任务 replay buffer + 难任务带宽),但未深入分析或提出改进方案。
- OOD 检测与 FPGA 部署仅为规划:实际部署所需的监督器逻辑与硬件加速尚未实现。
- 奖励敏感度与控制代价权衡:Additive Hybrid 显著降低误差,但襟翼与推力器使用量大幅增加(推力器 95 分位从 ~71 N 升至 ~50–60 N 但 98 分位升至 ~88–93 N),文中未讨论能量/推进剂预算对总任务可行性的影响。
- 任务局限:仅仿真训练,未做硬件在环(HIL)或飞行测试;气动模型虽为工业级,但表格化系数仍依赖风洞数据,未评估模型误差对策略的影响。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。







































