arXiv 2606.30893v1 · 发布 2026-06-29

基于采样的协调感知多目标多机器人强化学习

Sampling-Based Coordination-Informed Multi-Objective Multi-Robot Reinforcement Learning

AUTHORS Antonio Marino, Esteban Restrepo, Soon-jo Chung, Paolo Robuffo Giordano, Claudio Pacchierotti
EVIDENCE 多智能体强化学习中的协调多目标优化
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-04 02:29:29 UTC

📝 TLDR

多机器人系统需同时优化竞争性目标并保持协调行为。现有MARL方法依赖固定或集中式协调,灵活性差且违反分布式约束。本文提出CIMORL框架,结合分布式权重预测、特权专家训练与Pareto最优理论保证,并引入CIMORL-TS与CIMORL-MPPI两种采样变体。实验在协作与对抗场景中取得21.2%超体积提升,并在Crazyflie无人机上完成资源分配与多攻防验证。

🧭 速览

动机

现有MARL依赖固定或集中式协调,难以在多目标竞争下兼顾分布式部署与协同适应性。

方法

提出CIMORL框架,融合分布式权重预测、特权专家训练与Pareto最优理论保证,并设计CIMORL-TS与CIMORL-MPPI两种采样变体。

结果

在协作与对抗场景中超体积指标提升21.2%,策略稳定性优于现有方法。

结论

通过Crazyflie无人机在资源分配与多攻防任务中验证了框架的鲁棒性与去中心化部署可行性。

📊 论文图表(共 13 张)

展开查看 13 张图

TL;DR

多机器人系统在协同优化多个相互冲突目标的同时必须保持分布式协调能力,现有方法因依赖固定权重或集中式协调而难以兼顾适应性与去中心化约束。CIMORL(Coordination-Informed Multi-Objective Reinforcement Learning)框架通过让每个智能体自主预测目标偏好权重、借助特权专家在训练阶段提供高质量监督,实现了完全去中心化的部署执行。实验表明该方法在超体积指标上相较当前最优基线提升 21.2%,并在 Crazyflie 无人机平台上完成了真实场景验证,证明了从仿真到真实世界的有效迁移能力。

研究背景与动机

多机器人系统的决策面临本质性的多目标优化挑战。在复杂环境中,智能体必须同时权衡任务完成效率、能耗消耗、通信带宽占用以及碰撞规避等多个相互竞争的目标。以资源分配任务为例,智能体需要在尽快送达资源、避免碰撞、维持通信网络连通性之间做出动态取舍;而在对抗性场景中,攻击方与防守方更是形成零和博弈与协同合作的混合格局。

现有 [[多智能体强化学习]] 方法在处理这类问题时存在显著瓶颈。固定权重方案要求预先指定各目标的相对重要性,无法适应环境动态变化;集中式协调虽然便于全局优化,但违背了分布式系统的物理部署约束与通信限制,尤其在部分可观测条件下难以保证实时性。更关键的是,[[多目标优化]] 与 [[Pareto 最优性]] 之间的理论联系在现有方法中往往被忽视——许多方法只能保证找到某个可行解,而非真正逼近 Pareto 前沿。

论文以 [[Dec-POMDP]](去中心化部分可观测马尔可夫决策过程)为建模基础,聚焦一个核心问题:如何在保证理论 Pareto 最优性的前提下,实现完全去中心化的多目标多机器人决策?这一问题的挑战在于,去中心化执行要求每个智能体仅依赖局部观测与邻居通信,但 Pareto 最优性理论通常需要全局信息来保证。

方法

CIMORL 框架的核心思想是将多目标优化问题分解为三个相互耦合的子机制:分布式权重预测、特权专家训练与理论保证的 Pareto 最优性。

分布式权重预测机制是该框架最关键的设计创新。传统做法是让所有智能体同步一个全局权重向量,但这需要全局通信且缺乏灵活性。CIMORL 采用 Graph Neural ODE 风格的二阶意见动力学模型,让每个智能体基于局部观测与邻居通信自主预测其对各目标的偏好权重。具体而言,权重演化由以下微分方程控制:

其中 为主权重状态, 为辅助协调状态, 表示观测驱动的偏好嵌入, 为基于相似性的注意力矩阵。这一设计的直觉来源于社会网络中的意见动力学:智能体通过与邻居的持续交互逐渐形成共识,同时保留各自的个性化偏好。关键理论结果(引理 1)表明,当所有智能体权重同步时,团队策略可达 Pareto 前沿;而引理 2 进一步放宽条件,允许智能体形成不相交的联盟,仅在联盟内部同步权重。

特权专家训练策略解决了去中心化执行与训练效率之间的矛盾。训练阶段借助全局信息,使用基于采样的规划器作为特权专家。具体实现上,论文提出了两种变体:CIMORL-TS 采用多目标神经树搜索(MONTS),通过扩展的 Tchebycheff 标量化选择最优子节点;CIMORL-MPPI 则采用多目标模型预测路径积分控制,利用重要性采样得到近最优高斯动作分布。两种方法均使用增强型加权 Tchebycheff 标量化作为优化目标:

其中 的线性项确保严格 Pareto 最优性。策略网络通过加权专家损失与 PPO 优势的混合目标进行训练,权重系数从 1 衰减到 0,实现从专家引导到自主探索的平滑过渡。

部署阶段完全去中心化是另一关键特性。执行时每个智能体仅需运行本地策略网络与本地权重动力学模块,完全不依赖中央协调器。定理 1 证明,在连通通信图假设下,分布式系统可收敛到由图拓扑与观测决定的稳定聚类平衡;定理 2 通过收缩理论进一步证明,在小增益条件下闭环系统具有鲁棒稳定性。

实验与结果

论文在两类场景中验证了 CIMORL 的有效性:多资源分配(5 智能体、3 资源、4 目标点)与多团队攻防(20 智能体分 4 队)。评测指标涵盖 [[超体积]]、稀疏性与期望标量化回报等。

主要实验结果揭示了以下关键发现。首先,在多资源分配任务上,CIMORL-TS 与 CIMORL-MPPI 较 MOMAPPO-TS 提升 21.2% 超体积,较基础 MOMAPPO 提升约 38%,且策略稳定性显著优于基线方法。其次,消融实验验证了权重同步与联盟聚类机制的重要性——取消共识机制后性能大幅下降,强制全局共识则限制了联盟的自适应形成。第三,在真实 Crazyflie 无人机平台上出现了明显的 sim-to-real 迁移差距:MOMAPPO 出现快速碰撞失败(刚性脆弱性),CIMORL 基线虽能避免碰撞但产生空间震荡,唯有 CIMORL-MPPI 同时实现避碰与资源分配,断连率仅 0.2%。这一差异可归因于 MPPI 的高斯动作分布提供了更平滑的策略表示,而树搜索方法受限于 50ms 实时预算仅能运行 50 次模拟。

从扩展性角度看,权重聚类机制使智能体自发形成联盟,分散多目标优化负载,在 5/10/20 智能体的规模下均保持均衡性能。

讨论与可借鉴点

CIMORL 框架为 [[多智能体强化学习]] 中的多目标协调问题提供了理论严谨且工程可行的解决思路,具有以下可借鉴的设计原则:特权信息仅限训练阶段使用、权重预测与策略执行解耦、联盟结构自适应形成而非预先指定。

然而,该工作仍存在若干局限。权重动力学的收敛速度与数值稳定性之间存在权衡,提升收缩率的同时保持稳定性是开放问题;定理 2 的观测转移确定性假设较强,将随机性完全归因于控制策略;对抗场景采用风险敏感正则化代替严格 minimax,对手建模的理论分析尚不完整。此外,真实部署中通信延迟与观测噪声的鲁棒性未经验证,TS 方法在计算资源受限场景下的适用性也受到质疑。

对于后续研究,一个有价值的探索方向是将特权专家从基于采样的规划器扩展至其他形式,例如基于模型的强化学习或模仿学习,以适应不同计算约束下的训练需求。另一个开放问题是如何在保证 Pareto 最优性的同时处理动态联盟——当前框架假设联盟结构在执行过程中相对稳定,但真实场景可能需要在线调整联盟成员。

摘要

多机器人系统必须在保持协调行为的同时协同优化相互冲突的目标。现有的多智能体强化学习方法通常依赖于固定或集中式的协调机制,这限制了系统的适应性并违背了分布式约束。本研究提出了协调感知多目标强化学习(Coordination-Informed Multi-Objective Reinforcement Learning,CIMORL)框架,该框架融合了分布式权重预测机制、特权专家训练策略以及对 Pareto 最优解的理论保证。我们提出了基础 CIMORL 方法及其两种基于采样的变体——CIMORL-TS(树搜索)与 CIMORL-MPPI(模型预测路径积分),它们在训练阶段利用特权全局信息,从而支持完全去中心化的部署执行。在协作与对抗场景下的实验验证表明,相较于当前最先进的基线方法,所提方法在超体积指标上实现了 的提升,并展现出更优的策略稳定性。基于 Crazyflie 无人机的真实世界实验进一步验证了该框架在部分可观测条件下资源分配任务以及多攻击者多防御者场景中的鲁棒性。

Abstract

Multi-robot systems must simultaneously optimize competing objectives while maintaining coordinated behavior. Existing multi-agent reinforcement learning approaches often rely on fixed or centralized coordination, which limits adaptability and violates distributed constraints. This work introduces the Coordination-Informed Multi-Objective Reinforcement Learning (CIMORL) framework, integrating a distributed weight prediction mechanism, a privileged expert training strategy, and theoretical guarantees for Pareto-optimal solutions. We present the base CIMORL method alongside two sampling-based variants, CIMORL-TS (Tree Search) and CIMORL-MPPI (MPPI), which leverage privileged global information during training to enable fully decentralized deployment. Experimental validation in cooperative and adversarial scenarios demonstrates a hypervolume improvement and superior policy stability compared to state-of-the-art baselines. Real-world experiments with Crazyflie drones further validate the framework's robustness in resource allocation and multi-attacker multi-defend scenarios under partial observability.


论文详细总结(自动生成)

论文总结:基于采样的协调感知多目标多机器人强化学习(CIMORL)

1. 核心问题与研究动机

多机器人系统在复杂环境中需要同时优化多个相互冲突的目标(如任务完成时间、能耗、通信带宽、碰撞避免等),同时保持分布式协调行为。然而现有方法存在以下核心矛盾:

  • 固定权重方案缺乏对动态环境的适应性;
  • 集中式协调违背分布式执行的物理与通信约束;
  • 可扩展性差难以部署于真实大规模多机器人系统;
  • 多目标多智能体强化学习(MOMARL)中权重同步与 Pareto 最优性之间缺乏理论联系。

为此,论文以 Dec-POMDP 框架为建模基础,提出在部分可观测条件下实现真正的去中心化多目标决策。


2. 方法论

2.1 核心思想

CIMORL(Coordination-Informed Multi-Objective RL)将多目标优化问题分解为三个子机制:

1. 分布式权重预测:每个智能体基于局部观测与邻居通信,通过 Graph Neural ODE 风格的二阶意见动力学自主预测其对各目标的偏好权重;

2. 特权专家训练:训练阶段借助全局信息,使用基于采样的规划器(MCTS / MPPI)提供高质量监督信号;

3. 理论 Pareto 最优性保证:通过权重同步证明系统可达团队级 Pareto 前沿。

2.2 关键公式

增强型加权 Tchebycheff 标量化(中心化形式):

分布式 Tchebycheff 形式(去中心化部署):

其中 的线性项保证严格 Pareto 最优性。

2.3 权重意见动力学(式 (7))

二阶分布式系统由主权重状态 与辅助协调状态 构成:

其中 为观测驱动的偏好嵌入, 分别为基于相似性的注意力矩阵与通信图加权的注意力矩阵。

2.4 关键理论结果

  • 引理 1(Lemma 1):当智能体能实现任意目标组合时,团队 Pareto 最优性当且仅当所有智能体权重同步;
  • 引理 2(Lemma 2):当智能体形成不相交的目标子集联盟 时,仅需在每个联盟内同步权重;
  • 定理 1(Theorem 1):分布式系统 (7) 在连通通信图下收敛到由图拓扑与观测决定的稳定聚类平衡;
  • 定理 2(Theorem 2):在小增益条件 下,闭环多智能体系统是收缩的。

2.5 采样变体

变体专家算法核心思想收敛率
CIMORL-TSMONTS(Multi-Objective Neural Tree Search)扩展 NTE,通过 Tchebycheff 标量化选择最优子节点
CIMORL-MPPIMOMPPI(Multi-Objective MPPI)通过重要性采样得到近最优高斯动作分布

策略损失函数采用专家监督损失与 PPO 优势的加权和:

其中 从 1 衰减到 0。


3. 实验设计

3.1 仿真场景

1. 多资源分配(Multi-Resource Assignment):5 个智能体、3 种资源、4 个目标地点;冲突目标为送达、避碰、连通性维护;

2. 多团队攻防(Multi-Team Attackers-Defenders):20 个智能体分 4 队,含 4 个攻击目标与 1 个防御目标。

3.2 对比基线

  • MOMAPPO(多策略外环方法)
  • MO-MIX(离散动作 CTDE 混合架构)
  • MOMAPPO-TS:在 MOMAPPO 基础上叠加 Tree Search 特权数据
  • 消融变体
  • CIMORL w/o Sync:取消共识机制
  • CIMORL w/o Clust:强制单一全局共识,无联盟

3.3 评估指标

  • 超体积(Hypervolume)
  • 稀疏性(Sparsity)
  • 多样性(Diversity)
  • 期望标量化回报 ESR(Expected Scalarized Return)

3.4 真实世界实验

使用 Crazyflie 2.1 四旋翼无人机,执行资源分配与 3 队攻防对抗实验;轮换不同策略于红/绿/蓝队验证在线适应能力。


4. 资源与算力

论文附录 IX-D 明确说明:

  • CPU:Intel Core i7-9750H @ 2.60 GHz
  • GPU:单卡 NVIDIA RTX 2080Ti
  • 内存:32 GB RAM
  • 系统:Ubuntu 22.04
  • 智能体控制频率:20 Hz(双积分模型 + PD 稳定控制)
  • 搜索超参数:CIMORL-TS / CIMORL-MPPI 均使用 2000 次模拟、搜索深度 25
  • 真实部署时间预算:50 ms(MPPI 使用 1000 仿真、horizon 10;TS 因串行瓶颈只能用 50 仿真)

训练步数、批量大小等超参数在 Table IV 中给出。论文未明确报告 wall-clock 训练时长


5. 实验数量与充分性

  • 团队规模:5 / 10 / 20 智能体三档消融;
  • 随机种子:图 6 与图 9 的归一化基于 10 个随机种子;
  • 场景数:2 个仿真场景(协作 + 对抗)+ 1 类真实 Crazyflie 实验;
  • 真实世界实验:3 个攻防配置 × 3 队策略轮换;
  • 消融:2 个核心消融(w/o Syncw/o Clust)+ 1 个特权基线(MOMAPPO-TS);
  • 公平性:所有算法共享相同网络架构与维度([32,32] MLP + tanh);搜索方法采用相同仿真预算与规划深度。

总体而言,实验设计较为充分,兼顾了仿真扩展性与真实迁移性,并加入了理论消融验证;但权重预测网络本身的鲁棒性消融(如通信延迟、噪声)仍显不足。


6. 主要结论与发现

1. 超体积提升:CIMORL-TS 与 CIMORL-MPPI 在多资源分配任务上比 MOMAPPO-TS 提升 21.2%,比 MOMAPPO 提升约 38%;

2. 小增益闭环稳定性:理论与实验均验证了权重动力学与观测动力学的可协调性;

3. 真实部署差异

  • MOMAPPO 出现快速碰撞失败(rigid brittleness);
  • CIMORL 基线避免碰撞但出现空间震荡(oscillatory hesitation);
  • CIMORL-MPPI 是唯一在真实实验中同时实现避碰与资源分配的算法(断连率仅 0.2%);

4. 从自博弈到异构部署的泛化:MPPI 凭借特权专家监督显著提升在线适应能力,TS 因采样预算受限表现下降;

5. 权重聚类机制有效使智能体形成联盟,分散多目标负载,随队规模扩展保持均衡。


7. 优点

  • 理论深度:将多目标优化、图神经网络意见动力学、收缩理论有机结合,给出 Lemma 1/2 与 Theorem 1/2 的严格证明;
  • 工程完整度:覆盖训练、特权专家、去中心化部署、真机迁移全链路;
  • 采样式专家灵活性:TS 与 MPPI 互补(深搜索 vs 广并行),适配不同硬件约束;
  • 真实验证充分:Crazyflie 平台上对策略轮换进行多组对照实验;
  • 可扩展的分布式架构:权重预测仅依赖邻居通信,符合去中心化部署需求。

8. 不足与局限

  • 权重动力学收敛慢:当前收敛到平衡态所需时间较长,提升收缩率同时保持数值稳定性仍是开放问题;
  • 观测动力学假设过强:Theorem 2 假设观测转移是确定性的,将所有随机性归因于控制策略(Assumption 3);
  • 目标数量受限:目前最多处理 4 个目标,未在更复杂的目标空间中验证;
  • 缺乏通信延迟与噪声鲁棒性分析:作者明确将其留作未来工作;
  • TS 在真机上的计算瓶颈:受限于 50 ms 时间预算,仅能运行 50 次模拟,导致决策质量下降;
  • 对抗场景的对手建模简化:采用风险敏感正则化代替严格的 minimax,理论分析尚不完整;
  • 环境复杂度:未在含静态/动态障碍的拥挤场景中验证路径规划能力;
  • 训练时长未披露:算力效率与可复现性难以精确评估。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记