arXiv 2607.05939v1 · 发布 2026-07-07

基于竞争性多智能体强化学习的携网无人机拦截敏捷目标方法

Intercepting an Agile Target with Net-Carrying Drones using Competitive Multi-Agent Reinforcement Learning

AUTHORS Timothée Gavin, Murat Bronz
EVIDENCE 多智能体近端策略优化(MAPPO)用于竞争性无人机拦截
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-08 21:41:42 UTC

📝 TLDR

针对多架敏捷无人机携带捕获网拦截另一架敏捷无人机的追逃任务,本文提出基于多智能体近端策略优化与优先虚拟自博弈的训练框架,在高保真仿真器中以集体推力与机体角速度底层指令驱动双方敏捷飞行。实验表明该方法在捕获率、捕获时间和坠毁率上均优于启发式基线,且涌现出追捕者间的协作战术。

🧭 速览

动机

现有追逃策略多依赖高层指令且缺乏对抗鲁棒性,难以应对敏捷目标,并易因对手策略变化而过拟合。

方法

采用MAPPO结合优先虚拟自博弈联合训练追捕者与逃逸者,在高保真仿真器中以集体推力与机体角速度底层指令控制双方实现敏捷飞行。

结果

在捕获率、捕获时间和坠毁率上均优于启发式基线;消融实验显示PFSP显著提升对不同对手的适应性,底层控制指令是学习高性能策略的关键。

结论

该框架能生成对多种对手策略均鲁棒的追捕策略,并在追捕者之间自发涌现协作战术。

📊 论文图表(共 15 张)

展开查看 15 张图

TL;DR

本文研究了由多架携带捕获网的无人机编队拦截单架敏捷逃逸无人机的对抗性追逃问题。研究者将任务建模为竞争性多智能体强化学习问题,采用多智能体近端策略优化(MAPPO)结合优先虚拟自博弈(PFSP)的训练框架,在高保真仿真器中以总推力与机体角速度(CTBR)底层指令驱动双方执行真实的敏捷飞行。实验表明,该方法在捕获率、捕获时间和坠毁率三项指标上均显著优于启发式基线,并涌现出追击者间的协同拦截战术。

研究背景与动机

随着无人机入侵受限空域的事件日益频发,如何使用多架拦截无人机携带捕获网来消除威胁成为一个重要的实际需求。传统的拦截方法——例如比例导航(PN)——通常依赖精确的系统模型或对目标行为的可预测性假设,难以应对现代四旋翼无人机进行的大角度、高动态逃逸机动。这种敏捷机动在真实威胁场景中极为常见,固定翼入侵者或失控无人机都可能展现出剧烈的姿态变化和快速的轨迹转折。

深度强化学习在无人机竞速领域已经展现出超越人类水平的控制能力,为这一问题提供了新的思路。然而,竞速任务中的目标通常是静态的或沿着预定轨迹运动的,与追逃任务中主动逃逸的对抗性目标有本质区别。更重要的是,现有RL方法在多追击者拦截任务中存在两个关键的不足。首先,许多研究采用高层控制指令(如速度指令)和简化的四旋翼动力学模型,这限制了智能体所能执行行为的敏捷程度——当对手进行高机动逃逸时,缓慢的响应会直接导致拦截失败。其次,这些方法通常只在确定性、相对简单的逃逸策略上训练,缺乏对同样具备学习能力且高度敏捷的对手的对抗训练,导致策略容易过拟合于训练中见过的对手行为,面对新的逃逸策略时泛化能力很差。

本文的核心动机正是解决这两个问题:让追击者和逃逸者都能在底层控制指令下执行真正的敏捷飞行,同时设计合理的训练机制,使学到的策略能够应对多样化的对手策略,而非仅仅记住训练时的特定对手行为。

方法

研究者将"多追击者(携网)—单逃逸者"的敏捷空中追逃问题建模为竞争性多智能体强化学习任务,采用MAPPO作为基础训练算法,并引入优先虚拟自博弈(PFSP)来解决对手策略过拟合问题。

在问题建模层面,场景设定为一个无障碍矩形竞技场,架追击者各自携带半径为的圆形捕获网,网的中心与机体坐标系对齐,与1架机动能力相同的逃逸者进行对抗。捕获条件定义为逃逸者中心进入任意追击者的捕获网范围。研究者还特意在竞技场边界设置了缓冲区,仅对逃逸者施加边界惩罚,迫使其在中心区域执行敏捷机动,而不是依赖靠近边界来躲避追击——这种设计确保了逃逸者必须真正"跑起来"而非"躲起来"。

在控制层面,研究者选择了CTBR(总推力与机体角速度)作为底层动作输出。这种控制方式直接输出无人机所需的推力大小和三轴角速度指令,由1000Hz的底层姿态控制器进行跟踪,而策略网络以100Hz的频率输出新指令。相比于高层速度指令,CTBR允许智能体直接控制无人机的瞬时角加速度,从而实现更快速、更敏捷的姿态调整和轨迹变化,这对捕获敏捷目标至关重要。

观测空间的设计同样经过仔细考量。每个智能体的观测包含三个部分:自身状态(在体坐标系下表示的速度和旋转矩阵)、其他智能体的相对位置与速度信息、以及环境信息(高度和边界距离)。这种设计确保了智能体既能感知自身的运动状态,又能获取周围智能体的动态信息,为协同决策提供了基础。

训练框架采用了集中训练、分散执行(CTDE)范式。Actor网络采用两层MLP结构,包含256个ReLU单元每层,输出多元高斯分布的均值与标准差,经tanh函数压缩到有界连续动作空间。同一团队的追击者共享一个策略网络,但各自独立执行。Critic网络结构对称,输出线性值函数。关键在于,集中式Critic在训练时可以访问全局信息,包括所有智能体的精确位置、速度、旋转矩阵,以及对手当前时刻的动作——这一设计直接针对了多智能体学习中因对手策略变化而导致的非平稳性问题。

奖励函数的设计体现了对多种退化策略的防范。追击者获得的奖励包含捕获奖励、步进奖励(每存活一步的微小正奖励以鼓励快速行动)、距离奖励(驱使追击者靠近逃逸者),以及碰撞惩罚。值得注意的是,追击者与逃逸者机体之间的碰撞采用软惩罚以保留学习信号,而追击者之间的碰撞则直接终止回合以加速分散策略学习。任何一方因坠毁或出界终止时,对方不会获得额外奖励,这防止了智能体学习"迫使对手自毁"的投机策略。逃逸者额外受到边界惩罚的约束,避免其依赖场地边缘进行被动防守。

优先虚拟自博弈(PFSP)的引入是本方法的核心创新之一。传统的自博弈方法通常只与最新训练的策略进行对练,容易导致对当前对手的过拟合和灾难性遗忘。PFSP通过维护一个不断增长的策略池来解决这一问题:每当局势策略对池中所有历史策略的性能超过某个阈值时,将其冻结并加入策略池。在后续训练中,每个回合从对手池中按照性能加权分布采样策略进行对练。性能指标的定义同时考虑了捕获是否成功以及捕获所花费的时间,能够更准确地反映对抗强度。采样概率采用的形式,使得表现较差的对手策略有更高的被选中概率,从而确保训练始终具有足够的挑战性。

实验与结果

实验在立方米的矩形竞技场中进行,逃逸者被约束在中央立方米的区域以内,任务设定为3架追击者对阵1架逃逸者,每回合最长10秒。研究者对比了多种基线方法,包括针对敏捷四旋翼改进的比例导航(FRPN)、人工势场法(APF),以及不同训练范式的RL方法(noSP仅训练确定性对手、SP标准自博弈、PFSP-vel速度指令版本)。

实验结果清晰地表明了研究方法的优越性。在面对所有5种逃逸者策略时,采用PFSP-CTBR的追击者均取得了最高的捕获率(76.9%至93.3%)和最短的捕获时间(2.82至4.10秒),同时坠毁率显著低于所有启发式基线。相比之下,FRPN等启发式方法在面对敏捷学习逃逸者时表现急剧下降,FRPN追击者的坠毁率最高达到71%,APF则出现了"纯追踪、永远追不上"的失败模式——这充分说明了高层控制指令和简单策略在面对敏捷对抗时的局限性。

消融实验揭示了两个关键发现。首先,关于控制层级的对比非常显著:使用速度指令的PFSP-vel在面对PFSP-CTBR逃逸者时几乎完全失效,捕获率仅为17.7%。这直观地说明,CTBR底层控制通过允许直接的角速度指令,能够支持更敏捷的机动响应,对抗成功至关重要。其次,关于自博弈方式的对比同样重要:noSP虽然对训练中见过的特定对手表现良好,但泛化能力差,在未见对手上坠毁率飙升;SP有所改善但仍受限于对最新对手的过拟合;PFSP通过性能优先采样历史策略,在所有对手上保持稳定表现,展现出更强的鲁棒性。

研究者还进行了定性分析,观察到了追击者之间协同战术的涌现。学到的策略展现出"先快速尝试—失败后立刻由其他追击者接力"的多阶段拦截模式,有时还会利用数量优势将逃逸者向内驱赶以封堵逃逸路线。虽然"包围"策略的出现频率不高(研究者推测这可能与训练早期对手较弱、场地受限有关),但快速连续尝试的协同模式已经证明了多智能体协调学习的可行性。

讨论与可借鉴点

本研究在方法层面展示了将竞争性多智能体强化学习推进到CTBR底层控制层面的可行性,显著扩展了此前工作所涉及的敏捷性边界。PFSP的性能指标设计值得特别关注——同时考虑捕获时间与坠毁情况的指标定义,比简单的胜负二元指标更能反映真实的对抗强度,从而引导出更鲁棒的策略学习。

然而,研究也存在一些值得讨论的局限性。首先,实验完全在仿真环境中进行,未进行sim-to-real迁移验证。真实世界中的传感器噪声、未建模动力学和外部扰动都可能影响策略的实际表现。其次,研究仅评估了3v1这一种队伍规模,未讨论追击者数量变化对策略可扩展性和训练稳定性的影响。第三,协同策略的涌现虽然有趣,但其出现频率和稳定性仍有提升空间,研究者自己也承认需要更大场地和更复杂的对手来进一步验证。

对于后续研究而言,本文的算力配置值得关注:使用单张RTX 4090 GPU和AMD Ryzen 9处理器,在JAX框架下以1024个并行环境训练,仅用约5.5小时就完成了双方合计100亿环境步的训练,仿真吞吐达到步/秒。这一工程实现为类似规模的MARL研究提供了可复现的算力参考。更重要的是,本文所采用的PFSP训练范式——维护策略池并按性能加权采样——是一种通用的对抗训练技术,可以迁移到其他竞争性MARL任务中,用于提升策略的泛化能力和鲁棒性。

摘要

本文提出了一种由一组携带捕获网的敏捷无人机组成的编队拦截敏捷无人机的解决方案。我们将该问题建模为竞争性多智能体强化学习(MARL)任务。为了解决智能体因过拟合当前对手策略而出现的非平稳性和灾难性遗忘问题,我们使用结合优先虚拟自博弈(PFSP)的多智能体近端策略优化(MAPPO)来训练追击者与逃逸者。我们在高保真模拟器中采用底层控制指令——总推力与机体角速率(CTBR)对智能体进行训练,以实现追击者和逃逸者的敏捷飞行。我们从捕获率、捕获时间与坠毁率等方面,将所学策略的性能与启发式基线方法进行对比,结果表明我们的方案优于基线方法。消融研究表明,PFSP 能够生成可适应不同对手策略的更鲁棒策略,而底层控制指令对于在追逃任务中学习高性能策略至关重要。最后,对所学行为的定性分析揭示了追击者之间合作战术的涌现。

Abstract

This article presents a solution to intercept an agile drone by a team of agile drone carrying catching nets. We formulate the problem as a competitive Multi-Agent Reinforcement Learning (MARL) task. To address the problem of nonstationarity and catastrophic forgetting of agents overfitting to the current opponent strategy, we train the pursuers and the evader using Multi-Agent Proximal Policy Optimization (MAPPO) with Prioritized Fictitious Self Play (PFSP). We train the agents in a high-fidelity simulator using low-level control commands, collective thrust and body rates (CTBR), to achieve agile flights for both the pursuers and the evader. We compare the performance of the trained policies in terms of catch rate, time to catch and crash rates, against heuristic baselines and show that our solution outperforms them. Ablation studies show that PFSP lead to more robust policies that can adapt to different opponent strategies, and that a low-level control commands are crucial for learning performing strategies in the pursuit-evasion task. Finally, a qualitative analysis of the learned behaviours highlights the emergence of cooperative tactics among the pursuers.


论文详细总结(自动生成)

论文总结:基于竞争性多智能体强化学习的携网无人机拦截敏捷目标

1. 核心问题与研究动机

随着无人机入侵受限空域事件增多,使用多架拦截无人机携带捕获网来消除威胁成为重要应用方向。然而传统的拦截方法(如比例导航 PN)依赖精确模型或可预测的目标行为,难以应对现代四旋翼无人机进行的大角度、高动态的逃逸机动。深度强化学习在无人机竞速中已展现出超越人类水平的能力,但竞速任务中目标通常是静态或可预测的,而拦截任务要求智能体应对主动逃逸的对抗性目标。

现有 RL 方法在多追击者拦截任务中存在两个主要不足:(1) 多采用高层控制指令(如速度指令)和简化的四旋翼动力学模型,限制了所学习行为的敏捷性;(2) 缺乏对同样具备学习能力且高度敏捷的逃逸者的对抗训练,导致策略对未见过的对手泛化能力差、容易过拟合。

本文将"多追击者(携网)—单逃逸者"的敏捷空中追逃问题建模为竞争性多智能体强化学习任务,旨在训练双方均使用底层控制指令以实现真正的敏捷飞行,并提出新的训练机制以提升对多样化对手的鲁棒性。

2. 方法论

2.1 整体框架

采用 MAPPO(多智能体近端策略优化) 训练双方策略,并结合 PFSP(优先虚拟自博弈) 缓解非平稳性和灾难性遗忘问题。训练在 JAX 框架下实现高保真四旋翼仿真器中,采用 CTBR(collective thrust and body rates,总推力+机体角速度) 底层控制指令,仿真器内嵌 INDI 控制器支持高层命令(用于基线方法)。

2.2 问题建模

  • 场景:在无障碍矩形竞技场中, 架追击者(携带半径为 的圆形捕获网,网心与机体坐标系对齐)与 1 架逃逸者(机动能力相同)。
  • 捕获条件:逃逸者中心进入任意追击者捕获网范围。
  • 缓冲区设计:在竞技场边界设有缓冲带,仅对逃逸者施加惩罚,迫使其在中心区域执行敏捷机动,避免其依赖边界逃逸。

2.3 观测与动作空间

对智能体 ,其观测为:

其中 (体坐标系下速度与旋转矩阵),(其他智能体的相对位置与速度),(高度与 条射线方向的边界距离)。

每个智能体输出底层动作 ,由 1000 Hz 的底层姿态控制器跟踪;策略网络以 100 Hz 输出。

2.4 集中训练、分散执行(CTDE)

  • Actor 网络:两层 MLP(256 ReLU 单元/层),输出多元高斯分布的均值与标准差,经 tanh 压缩为有界连续动作。同一团队共享一个策略网络,各追击者独立执行。
  • Critic 网络:结构对称,输出线性值函数。集中式 Critic 在训练时可访问全局信息——所有智能体的精确位置、速度、旋转矩阵以及对手当前时刻的动作,以缓解对手策略变化导致的非平稳性。

2.5 奖励函数

追击者 和逃逸者 的奖励分别为:

各项含义如下:

  • :捕获奖励
  • :坠毁或出界惩罚
  • :追击者与逃逸者机体软碰撞惩罚
  • :追击者之间硬碰撞惩罚(终止回合)
  • :追击者距离惩罚
  • :逃逸者靠近边界的指数增长惩罚
  • :惩罚动态不可行的角速度指令

关键设计:追击者—逃逸者碰撞采用软惩罚以保留学习信号;追击者之间碰撞终止回合以加速分散策略学习;任一方因坠毁/出界终止时对方不获得奖励,避免学习"迫使对手自毁"的退化策略。

2.6 优先虚拟自博弈(PFSP)训练流程

为避免对当前对手过拟合,双方各自维护一个不断增长的策略池,每个回合从对手池中按性能加权分布采样冻结的对手策略。性能指标定义为:

其中 为回合结束时刻, 为最大回合长度。采样概率为:

当当前策略对全池对手的性能超过阈值时,将其冻结并加入策略池。每回合中 50% 概率对最新对手训练、50% 概率按 PFSP 分布采样,从而在持续挑战最强者与保持历史多样性之间取得平衡。

3. 实验设计

3.1 场景与指标

  • 竞技场,逃逸者被约束在中央 区域。
  • 任务:3v1 追逃场景。
  • 回合限制:10 秒。
  • 指标:捕获率、逃脱率、坠毁率(追击者/逃逸者/双双)、捕获时间(采用右删失处理以避免偏差)。
  • 统计:每对策略组合跑 10,000 回合。

3.2 对比方法

追击者基线

  • FRPN(Fast-Response Proportional Navigation):用于敏捷四旋翼的比例导航变体,使用加速度指令,无团队避碰。
  • APF(Artificial Potential Field):吸引—排斥势场,常速度指令。
  • FRPN + APF:FRPN 叠加 APF 排斥力。
  • noSP:MAPPO 训练对手为确定性 APF 逃逸者。
  • SP:MAPPO + 标准自博弈(仅对最新对手训练)。
  • PFSP-vel:PFSP 但输出速度指令(由 INDI 控制器转换为 CTBR)。
  • PFSP-CTBR(本文方法):PFSP + CTBR 底层指令。

逃逸者基线:APF、noSP、SP、PFSP-vel、PFSP(本文方法)。

3.3 关键消融

  • 控制层级影响:对比 PFSP-vel vs PFSP-CTBR。
  • 自博弈方式影响:对比 noSP vs SP vs PFSP。
  • 策略组合正交化测试:5 种追击者 × 5 种逃逸者共 25 种组合,组成完整方阵表格(Table II)。

4. 资源与算力

文中明确给出算力配置:

  • GPU:1 × NVIDIA RTX 4090(24 GB VRAM)
  • CPU:AMD Ryzen 9 7950X3D(16 核,4.2 GHz)
  • 内存:128 GB RAM
  • 仿真吞吐:约 环境步/秒
  • 训练规模:每方训练 50 亿环境步(双方合计 100 亿步)
  • 训练时长:约 5 小时 30 分钟
  • 并行环境数:1024 个并行环境
  • 实现栈:仿真器、训练循环全部用 Python + JAX 实现,借助 JIT 编译在加速硬件上并行执行

5. 实验数量与充分性

  • 实验规模:5 × 5 完整策略对阵 × 10,000 回合 = 总计 250,000 回合用于最终评估。
  • 多维度评估:捕获率、逃脱率、三类坠毁率、右删失捕获时间(含标准差)。
  • 消融完备:从训练范式(noSP / SP / PFSP)与控制层级(vel / CTBR)两个维度正交消融,并辅以启发式方法。
  • 定性分析:除定量表格外,给出多张俯视/侧视图展示协同拦截、连续尝试失败—再尝试等涌现行为。

整体设计较为充分;但作者明确指出:学习基线仅做了与本文框架一致的消融对比(因为现有 RL 方法多训练于确定性逃逸者,与本文的可学习逃逸者设置不直接可比),其他 RL 方法的全面基准对比被留作未来工作。

6. 主要结论与发现

1. PFSP-CTBR 全面占优:在 3v1 场景下,对所有 5 种逃逸者策略,PFSP-CTBR 追击者均取得最高捕获率(76.9%–93.3%)与最低捕获时间(2.82–4.10 s),且坠毁率显著低于启发式基线。

2. 启发式基线失效:FRPN、APF 及其组合面对敏捷学习逃逸者时坠毁率急剧上升(FRPN 追击者坠毁率最高达 71%),APF 出现"纯追踪、永远追不上"的失败模式。

3. 底层控制指令至关重要:PFSP-vel 面对 PFSP-CTBR 逃逸者几乎完全失效(捕获率 17.7%);CTBR 控制支持更敏捷的机动,从而获得更高、更安全的捕获率与逃脱率。

4. 自博弈范式显著影响泛化:noSP 对训练中遇到的特定对手表现良好,但泛化差(坠毁率在未见对手上飙升);SP 有所改善但仍受限于"对最新对手过拟合";PFSP 通过按性能优先采样历史策略,在所有对手上保持稳定表现。

5. 涌现协同行为:追击者学会"先快速尝试—失败后立刻由其他追击者接力"的多阶段拦截策略;会利用数量优势将逃逸者向内边界驱赶以封堵逃逸路线;会从多方向协同包围;但学到的"包围"策略频率不高,更多依赖敏捷性执行快速连续尝试。

7. 优点

  • 方法新意:将竞争式 MARL 推进到 CTBR 底层控制层面,且双方均为可学习策略,相比既有工作显著扩展了任务难度。
  • 训练范式设计合理:PFSP 的性能指标 同时考虑捕获时间与坠毁情况(而非简单胜负),能更准确反映对抗强度。
  • 奖励设计细致:软/硬碰撞区分、逃逸者边界惩罚、动态可行性惩罚、双方对对手失败不获奖励的设定共同避免多种退化策略。
  • 算力效率高:纯 JAX + JIT + 单卡 RTX 4090 + 5.5 小时完成 100 亿步训练,吞吐达 步/秒,工程实现具有较强可复现性。
  • 评估充分:正交化对阵 + 多指标 + 大样本量(10,000 回合/组合)+ 定量与定性结合。
  • CTDE 缓解非平稳性:集中式 Critic 显式接收对手动作信息,直接对应非平稳性根源。

8. 不足与局限

  • 强假设条件:无障碍竞技场、逃逸者被强制约束在中央较小体积、不考虑目标检测与状态估计——这些都限制了真实部署的相关性,作者也在文中明确承认。
  • 真实平台未验证:所有结果仅在仿真中取得,未做 sim-to-real 迁移,传感器噪声、未建模动态与扰动的影响未知。
  • 与既有 RL 方法对比不充分:出于公平性考虑,未将其他 RL 追逃方法接入自博弈框架做完整基准,仅在自身方法内做消融,无法判断本文方法在更广泛 RL 追逃文献中的相对位置。
  • 覆盖场景有限:仅评估 3v1 一种队伍规模,未讨论追击者数量对策略可扩展性、训练稳定性与协同行为的影响。
  • 协同策略局限性:学到的"包围"策略出现频率较低,作者推测可能与训练早期对手较弱、场地受限有关,需更大竞技场进一步验证。
  • 可解释性不足:定性结论主要依赖可视化轨迹与速度图,缺乏对协同信号、包围拓扑形成过程的定量分析。
  • 坠毁率仍非零:在最难逃逸者面前 PFSP-CTBR 追击者仍有一定坠毁率(最高约 8.2%),安全性在真实对抗任务中可能仍不足。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记