arXiv 2607.09587v1 · 发布 2026-07-10

CoDiMAD:基于扩散模型的无通信多机器人协调特权蒸馏

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

AUTHORS Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang
EVIDENCE 基于扩散模型的特权蒸馏方法实现无通信多机器人协调
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-13 21:47:30 UTC

📝 TLDR

用MAPPO训练特权oracle,构建离线观测-动作数据集,再以条件扩散模型近似oracle的多模态条件分布。实验在三项协作任务上一致优于本地MARL与确定性蒸馏基线,为通信受限下的多机器人协同提供新思路。

🧭 速览

动机

部分可观测且无通信条件下,同一局部观测可能对应多个需不同合作动作的全局构型,确定性特权蒸馏将多模态分布坍缩为均值,产生无效或犹豫动作。

方法

用MAPPO训练全局信息特权oracle;构建(局部观测,oracle动作)离线数据集;以条件去噪扩散概率模型作为学生策略近似oracle条件动作分布。

结果

在三项协作任务上,CoDiMAD一致优于直接本地MARL与确定性蒸馏基线,采样出对应一致协作模式的果断动作。

结论

CoDiMAD验证扩散模型可恢复oracle多模态条件分布,为通信受限场景的去中心化多机器人协作提供可扩展方案。

📊 论文图表(共 4 张)

展开查看 4 张图

TL;DR

多机器人协作在无通信场景下面临部分可观测性带来的根本挑战:相同的局部观测可能对应多个需要截然不同协作动作的全局状态,导致条件动作分布天然呈多模态。现有确定性蒸馏方法将多模态坍缩为均值预测,往往产生低质量的"折中"动作。CoDiMAD 提出一种三阶段特权蒸馏框架,用条件去噪扩散模型而非点估计来表达学生策略,使其能够从一致的协调模态中采样出果断动作,在三个协作任务上成功率提升显著,同时碰撞率降低一到两个数量级。

研究背景与动机

去中心化多机器人协调在通信受限环境中具有广泛的应用前景。水下航行器受限于声学通信的高延迟与丢包率,水面无人艇在远距离时面临射频链路间歇中断,环境监测、搜救与协同操作等任务都要求机器人仅依赖自身传感器观测做出决策。这种设定构成了 [[部分可观测]] 环境下 [[去中心化多智能体系统]] 的典型挑战:每个智能体只能获得局部视野,却需要与队友实现有效协调。

当前主流方法大致分为两类。一类是 [[CTDE-MARL]](即中心化训练去中心化执行),典型代表是 MAPPO,其中心化 Critic 在训练时提供全局信息辅助,但执行时 Actor 仍只能看到局部观测。这种设计导致探索效率低下,协调策略往往次优。另一类是 [[特权策略蒸馏]],已被成功应用于单机器人视觉导航和腿足运动等任务:通过训练一个具备全局信息的 oracle 策略,再将其知识迁移到受传感器约束的学生策略。

然而,将特权蒸馏扩展到多机器人场景时遇到了本质困难。在单机器人任务中,给定局部观测往往能唯一推断出最优动作;但在多机器人系统中,相同的局部观测可能对应于多个本质不同的全局构型。例如,两个机器人观测到彼此相距较远时,无法判断队友是在向左还是向右移动——两种全局状态都需要完全不同的协作动作来避免碰撞。这使得条件动作分布天然呈现 [[多模态分布]] 特征。

现有的回归式 [[行为克隆]] 方法(如 MSE 损失)在多模态条件下会收敛到条件均值,这个均值点可能落在两个有效模态之间的低密度区域。以一个简单的双模高斯混合为例,当两个模态的均值充分分离时,条件均值恰好位于两模之间,而该点的概率密度随分离距离的平方呈指数衰减。这意味着确定性预测必然产生低质量的"折中"动作,在机器人协作场景中可能导致碰撞或任务失败。

方法

CoDiMAD 的核心洞察是:学生策略应该以 [[条件密度估计]] 而非点估计的方式表达,从而能够直接采样 oracle 条件分布的各个模态。基于这一洞察,论文提出了三阶段流水线:

第一阶段:训练特权 Oracle。使用 MAPPO 在双流输入下训练 oracle 策略 ,使其同时访问局部传感器信息和全局鸟瞰图(BEV)。局部流包含 LiDAR 占用栅格和自身速度场等共享通道;全局流则包含自车和队友位置热力图、任务状态等特权信息。这种双流设计让 oracle 能够准确区分看似相似但本质不同的全局构型。

第二阶段:构建离线数据集。冻结训练好的 oracle,让其在学生视角下执行 rollout,只保留成功且无碰撞的回合。数据集中的每条记录包含学生获得的局部观测 和 oracle 对应的动作 。数据筛选机制确保监督信号的质量——失败或存在碰撞的轨迹不参与蒸馏过程。

第三阶段:扩散式行为克隆。这是 CoDiMAD 的核心创新。与传统回归式蒸馏不同,学生策略被参数化为 [[条件去噪扩散概率模型]](Conditional DDPM),通过学习去噪网络 来近似 oracle 条件动作分布。

前向扩散过程将原始动作逐步添加噪声:

训练目标是让去噪网络从带噪动作中预测注入的噪声,并采用逐时刻重加权以强调高噪声区段对条件先验的学习:

其中 是由 CNN 和 GRU 编码器从局部观测提取的条件嵌入。推理时使用 [[DDIM]] 加速采样,将 200 步去噪压缩至 20 步,接近实时控制的时间预算。

这种设计在理论上具有清晰的意义:扩散模型在无限数据和模型容量下等价于估计条件分数函数 ,其采样过程能够完整还原 oracle 的多模态条件分布,而非坍缩为均值。

实验与结果

实验在三个协作任务上进行:Cooperative Coverage(协作探索最大化栅格覆盖率)、Pursuit-Evasion(追击者围捕快速逃逸者)以及 Box Pushing(协作推动重物至目标区域)。每个任务包含随机障碍物和 200 步回合限制。

主要对比基线包括:MAPPO-Oracle(不可部署的特权上限)、MAPPO-Local(端到端局部 MARL)、BC-RNN(共享相同 RNN 编码器但使用确定性 MLP + MSE 蒸馏)。消融变体 CoDiMAD w/o RNN 用来检验时序历史编码的贡献。

实验结果揭示了多模态问题在实际协作中的严重程度。在 Box Pushing 任务上,BC-RNN 的成功率仅为 6.5%,而 CoDiMAD 达到 72.2%——这表明当协作需要精确的协调动作时,模态平均失败会导致几乎完全失效。在 Pursuit-Evasion 任务中,CoDiMAD 的捕获率达到 90.6%,接近 oracle 的 99.1%,而 MAPPO-Local 仅有 14.2%,直接验证了特权蒸馏对探索瓶颈的缓解效果。

碰撞率的变化更为直观:与 BC-RNN 相比,CoDiMAD 在 Coverage 任务中将每回合碰撞数降低约 19 倍,Pursuit-Evasion 任务中降低 4.3 倍。这一差异在理论上可由模态平均失败解释——当确定性策略输出位于两模之间时,机器人之间的相对运动轨迹恰好穿过高碰撞风险的中间区域。

定性分析进一步验证了扩散模型的多模态恢复能力。通过在 Pursuite-Evasion 任务中对 200 个最近邻样本可视化 oracle 分布,同一嵌入下 CoDiMAD 的多次采样能够覆盖两个清晰的协调模态,而 BC-RNN 的单点预测恰好落在两模之间。轨迹多样性的可视化也显示,CoDiMAD 在同一起始状态下能产生风格迥异的协调方案,每个方案内部保持一致性。

讨论与可借鉴点

CoDiMAD 的贡献在于首次系统地将扩散生成模型引入 [[多智能体强化学习]] 的特权蒸馏范式,清晰刻画了"条件分布 vs 条件均值"在多机器人协调中的实际影响。理论分析给出了命题与推论,将模态平均失败的形式化表达与实验观测的碰撞激增对应起来,形成了从问题分析到方法设计再到实验验证的完整闭环。

然而,这项工作也存在明显的局限性。首先,实验仅在 同构机器人设定下验证,随 agent 数量增加协调空间的复杂度会急剧上升,异构多智能体的适应性尚未探索。其次,离线蒸馏固有的分布漂移风险意味着学生在遇到 oracle 训练分布之外的状态时可能失效,论文提到可引入扩散兼容的在线微调方法(如 IDQL)作为后续方向。此外,仿真到真实环境的迁移仍是一项开放挑战,水下和水面的传感器噪声、动力学建模差异都可能破坏蒸馏策略的有效性。

对于后续研究而言,CoDiMAD 的三阶段解耦设计提供了一个可复用的框架:数据生成与策略学习分离后,可以方便地替换 oracle 训练算法或学生策略类。扩散模型的引入为需要捕捉多模态协调策略的场景提供了新思路,特别是在通信拓扑动态变化、角色分工不确定等导致条件动作分布具有本质多样性的任务中。这种"分布而非均值"的建模哲学,或许会成为多智能体协作研究中的重要范式转变。

摘要

在部分可观测条件下的去中心化多机器人协调仍然具有挑战性,尤其是在无通信环境中,智能体必须仅依据局部传感器观测来执行动作。特权策略蒸馏提供了一种有前景的方法,通过将知识从具有全局信息的预言机传递给受传感器约束的学生策略。然而,在多智能体系统中,相同的局部观测可能对应于多种需要本质不同协作动作的全局构型,使得条件动作分布天然具有多模态性。标准确定性蒸馏将这些模态坍缩为其均值,往往产生无效或犹豫的动作。为解决此问题,我们提出了CoDiMAD,一个三阶段框架:使用MAPPO训练特权预言机,构建局部观测-预言机动作对的离线数据集,并将预言机蒸馏为以条件去噪扩散概率模型参数化的去中心化学生策略。通过扩散逆过程近似条件预言机-动作分布,CoDiMAD从一致的协调模态中采样出果断动作,而非对这些模态进行平均。理论分析刻画了确定性蒸馏的模态平均失败以及基于扩散的蒸馏的分布恢复性质。在三个协作任务上的实验表明,CoDiMAD始终优于直接局部多智能体强化学习和确定性蒸馏基线方法。源代码将在论文录用后公开。

Abstract

Decentralized multi-robot coordination under partial observability remains challenging, especially in communication-free settings where agents must act solely from local sensor observations. Privileged policy distillation provides a promising approach by transferring knowledge from a globally informed oracle to sensor-constrained students. However, in multi-agent systems, the same local observation may correspond to multiple global configurations requiring qualitatively different cooperative actions, making the conditional action distribution inherently multi-modal. Standard deterministic distillation collapses these modes to their mean, often yielding invalid or hesitant actions. To address this issue, we propose CoDiMAD, a three-stage framework that trains a privileged oracle with MAPPO, constructs an offline dataset of local-observation-oracle-action pairs, and distills the oracle into decentralized students parameterized as conditional denoising diffusion probabilistic models. By approximating the conditional oracle-action distribution through the diffusion reverse process, CoDiMAD samples decisive actions from coherent coordination modes rather than averaging across them. Theoretical analysis characterizes the mode-averaging failure of deterministic distillation and the distributional recovery property of diffusion-based distillation. Experiments on three cooperative tasks show that CoDiMAD consistently outperforms direct local MARL and deterministic distillation baselines. The source code will be made publicly available upon acceptance.


论文详细总结(自动生成)

CoDiMAD 论文总结:基于扩散模型的无通信多机器人协调特权蒸馏

1. 核心问题与研究动机

  • 应用背景:去中心化多机器人协作在水下航行器(声学延迟/丢包严重)、水面无人艇(射频链路间歇、距离受限)等通信受限场景中需求迫切;环境监测、搜救、协同操作等典型任务均要求机器人仅依赖自身传感器局部观测完成决策。
  • 核心难点:部分可观测性(Partial Observability, PO)下,同一局部观测可能对应多个本质不同的全局构型,每个构型需要不同的协作动作,导致条件动作分布天然呈现多模态
  • 现有方案瓶颈
  • CTDE-MARL(如 MAPPO):中心化 Critic 仅作为训练辅助,actor 仍从局部观测端到端训练,探索效率低、协调策略次优。
  • 特权策略蒸馏(单机器人视觉驾驶、腿足运动等已成功):用具备全局信息的 oracle 策略监督具备传感器约束的学生策略,但扩展到多机器人时由于多模态问题出现模态平均(mode-averaging)失败
  • 回归式行为克隆(BC + MSE):在多模态条件下收敛至条件均值,可能落在多个有效模式之间的低密度区域,产生犹豫或无效动作甚至碰撞。
  • 本文洞察:应以条件密度估计而非点估计的方式表达学生策略,从而直接采样 oracle 条件分布的众模态。

2. 方法论

2.1 整体框架(三阶段流水线)

1. Stage 1:用 MAPPO 训练 特权 oracle 策略 ,访问双流输入(局部 + 全局 BEV 地图)。

2. Stage 2:冻结 oracle,对学生视角的局部观测执行 rollout,构建离线数据集

3. Stage 3:以条件 DDPM 为策略类对学生做行为克隆蒸馏,并在推理时采用 DDIM 将 200 步去噪压缩至 20 步。

2.2 信息不对称与观测表征

  • 32×32 BEV 多通道网格地图;同构机器人共享策略参数。
  • Oracle 双流:局部共享通道(LiDAR 占用、自身速度场)+ 全局特权通道(自/队友位置热力图、任务态)。
  • 学生单流(4 通道):前两通道与 oracle 共享,后两通道将任务态与队友位置裁剪到传感半径内。

2.3 扩散式行为克隆的关键公式

  • 前向扩散过程(余弦噪声表,):
  • 训练损失(带逐时刻重加权以强调高噪声区段对条件先验的依赖):

其中条件嵌入 来自 CNN+GRU 编码器; 由三层残差 MLP(隐层 128)构成,去噪步嵌入与条件嵌入逐层相加。

  • DDIM 推理,10× 加速):

其中 由 Tweedie 公式 给出。

  • 数据筛选:仅保留成功且无碰撞的回合;动作按维度做 z-score 归一化,统计量作为模型 buffer 保存供反归一化。

2.4 理论分析

  • 命题 1(部分可观测引起的多模态):若局部观测 对应的全局状态后验可分为 个配置类 ,类均值彼此充分分离,则 oracle 条件动作分布近似为多模高斯混合

其中

  • 推论 1(回归式蒸馏的模态平均失败):在双模特例 下,MSE 最优确定性预测为条件均值

其离最近模态的距离为 ),分布在该点的密度满足上界

即在 的良好分离下,密度随 指数衰减,落于两模之间低密度区。

  • 注 1(扩散作为条件密度模型):扩散去噪目标在无穷数据与容量极限下等价于估计条件分数 ,采样过程可还原完整的 避开模态平均坍缩

3. 实验设计

3.1 任务与场景

  • 仿真环境:200×200 连续竞技场, 同构机器人,随机障碍物,200 步回合。
  • 三个基准任务:
  • Cooperative Coverage:协作探索最大化栅格覆盖率,含碰撞惩罚与完成奖励。
  • Pursuit-Evasion:3 个追击者围捕 1 个最大速度 2 倍于追击者的逃逸者(APF 控制)。
  • Box Pushing:协作推动重物至随机目标区,奖励包含位移与多人同时接触,惩罚碰撞。

3.2 对比方法

  • MAPPO-Oracle:特权上界(不可部署),提供性能天花板。
  • MAPPO-Local:基于局部观测的 MARL 基线,刻画端到端探索瓶颈。
  • BC-RNN:与 CoDiMAD 共享 RNN 编码器但用 MLP + MSE 做确定性蒸馏,隔离扩散生成的作用。
  • CoDiMAD w/o RNN:去掉 GRU,隔离时序历史编码的贡献。

3.3 评估指标

  • 任务成功率(Coverage Rate / Capture Rate / Success Rate)与单位回合碰撞数(含机器人间与障碍物)。

4. 资源与算力

  • 硬件:单块 NVIDIA RTX 4090 GPU;PyTorch 实现。
  • 训练规模:oracle 5M 环境步;学生 50 个 epoch,batch size 128。
  • 超参数:噪声预测网络为 3 个残差 MLP block(隐层 128);观测编码器 GRU 隐层 128;优化器 AdamW,学习率 ;EMA 衰减率 0.99。
  • 扩散设置:余弦噪声表 ;训练 ,推理
  • 未明确信息:未给出 wall-clock 训练时长;未说明是否多卡并行或进行超参搜索。

5. 实验数量与充分性

  • 任务 × 方法 × 种子:3 任务 × 5 个方法变体 × 3 随机种子,每个种子评估 200 个回合,主结果表格含标准差。
  • 分析实验
  • 条件动作分布可视化(Pursuit-Evasion):取 200 个最近邻样本可视化 oracle 分布;同一嵌入下采样 200 次的 CoDiMAD 动作覆盖两个模态;BC-RNN 单点输出落于两模之间。
  • 轨迹多样性分析:同一起始状态执行 5 次 rollout,可视化 Coverage 与 Pursuit-Evasion 任务中多机器人轨迹的模态选择。
  • 消融:去掉 RNN 的 CoDiMAD w/o RNN 用来检验时序贡献。
  • 评价:实验覆盖了性能指标、碰撞安全性、模态恢复可视化、轨迹多样性、消融等维度,结论之间互相支撑(如碰撞下降 19× 与模态平均理论一致),整体较为充分。但仍局限于单一仿真器与 3-agent 设定,存在评估维度扩展空间。

6. 主要结论

  • 逼近 oracle 上界:Coverage(95.7% vs 97.6%,保留 ~98%)、Pursuit-Evasion(90.6% vs 99.1%)接近 oracle;Box Pushing(72.2% vs 98.2%)差距最大,反映紧致接触协作对微偏角敏感。
  • 优于回归式蒸馏 BC-RNN:Coverage 覆盖率提升 14.8 个百分点,碰撞下降约 19×;Pursuit-Evasion 碰撞下降 4.3×;Box Pushing 成功率从 6.5% 跃升至 72.2%,与"任务越复杂、模态越严重,差距越大"一致。
  • 优于直接局部 MARL:尤其在 Pursuit-Evasion(14.2% → 90.6%)、Box Pushing(18.0% → 72.2%)上数量级式提升,验证特权蒸馏对探索瓶颈的缓解。
  • 时序价值:去掉 RNN 后各项任务性能稳定下降,Pursuit-Evasion 捕获率从 90.6% → 80.4%,碰撞数 0.80 → 1.41,证实 GRU 在消歧上的作用。
  • 模态可视化:CoDiMAD 在同嵌入下能恢复双模动作分布,BC-RNN 输出恰位于两模之间,定性证实理论分析。

7. 优点

  • 首次将扩散式生成策略系统引入多机器人特权蒸馏,把"条件分布 vs 条件均值"的差距明确化、可视化。
  • 理论闭环:给出命题 1、推论 1、注 1 形式化刻画多模态成因、回归平均失败与扩散恢复能力,公式清晰且与实验对应。
  • 三阶段解耦设计使数据生成与策略学习解耦,便于复用 oracle 与替换策略类。
  • 工程实用性:用 DDIM 把单步推理去噪步数压缩 10×,接近实时闭环控制预算。
  • 评估完整:主表 + 多模态可视化 + 轨迹多样性 + 消融,多角度交叉验证。
  • 数据筛选与归一化(仅保留无碰撞成功回合、维度归一化)提升了监督质量与训练稳定性。

8. 不足与局限

  • 同构 agent,且使用共享网络参数,可扩展性与异构协同未验证;作者也明确指出随 agent 数增加协调空间复杂度上升。
  • 离线蒸馏固有的分布漂移风险:学生可能在 oracle 轨迹分布外状态失效,作者提出引入扩散兼容 RL 目标(如 IDQL)做在线微调,但本文未实施。
  • 仿真到真实的迁移尚未完成:作者声称将部署于物理海洋机器人,但实验未涵盖,sim-to-real gap(传感器噪声、动力学差异、通信模型)仍是开放问题。
  • 任务设定相对受限:二维速度控制、BEV 32×32 网格表示、固定数量 LiDAR 通道,未涉及高维视觉、不完全动力学模型或更复杂的运动学约束。
  • 碰撞指标较粗:报告"每回合总碰撞数"(含机器人间与障碍物),未区分类型;不同任务的失败模式缺乏细粒度诊断。
  • 算力描述有限:仅给出 GPU 型号与批大小/步数,缺少训练总时长、收敛曲线、推理延迟的具体数值,难以复现时序开销。
  • 超参敏感性未系统化:扩散步数 、DDIM 步数 、噪声表选择、EMA 衰减等未做 sweep,存在超参风险。
  • 基线覆盖不全:缺少近期多智能体扩散策略(如 MIMIC-D)以及非 MAPPO 的局部 MARL(如 QMIX、SAC 系列)在通信受限条件下的横向对比。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记