arXiv 2607.04972v1 · 发布 2026-07-06

面向未见环境、未知伙伴与可变规模的多机器人开放自适应协同

Multi-Robot Open Adaptive Teaming Across Unseen Environments, Partners, and Scales

AUTHORS Yang Li, Feng Xue, Fan Mo, Yunhao Liu, Jianhong Wang, Ying Wen, Qingrui Zhang, Shaoshuai Mou, Wei Pan
EVIDENCE 多机器人开放自适应组队,基于超图博弈的团队级合作协调
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-07 06:13:02 UTC

📝 TLDR

针对多机器人在真实部署中需同时适应未知环境、陌生伙伴和动态团队规模的挑战,现有方法在固定队友的封闭世界假设下孤立处理各问题。本文将这一场景形式化为开放自适应多机器人协作,提出超图博弈形式化建模团队级合作结构,并基于此设计HOLA算法,训练时渐进扩展伙伴与环境的覆盖范围。实验在多无人机与多四足机器人协同追捕任务上验证,HOLA在三维适应性上均超越基线,且学得策略可直接零样本迁移至Crazyflie与Zsibot L1真实硬件。

🧭 速览

动机

多机器人实际部署需同时应对未知环境、陌生伙伴与可变团队规模,而现有方法多在封闭世界假设下孤立解决这些问题。

方法

提出超图博弈形式化建模团队级合作结构,设计HOLA算法,通过渐进式开放训练动态扩展伙伴与环境的覆盖范围。

结果

在多无人机与四足机器人协同追捕任务中,HOLA在三维适应性上均优于基线,策略可直接零样本部署至Crazyflie与Zsibot L1真实平台。

结论

首次形式化开放自适应多机器人协作问题,验证了超图博弈建模与开放式训练对跨环境、跨伙伴、跨规模泛化的有效性。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

真实世界部署多机器人团队时,需要同时应对未知环境、陌生队友和动态变化的团队规模这三重挑战,但现有方法往往在固定队友的封闭假设下孤立处理某一维度。本文将这一场景形式化为开放自适应多机器人协同问题,提出基于超图形式博弈的建模框架,并设计 HOLA 算法在训练过程中渐进扩展伙伴与环境的多样性。在多无人机与多四足机器人协同追捕任务上的实验表明,HOLA 在三个适应性维度上全面超越基线方法,且学得策略无需微调即可直接部署到 Crazyflie 和 Zsibot L1 真实硬件平台。

研究背景与动机

多机器人系统在搜救、巡检、物流等真实应用场景中,往往无法事先获知任务环境的具体布局、团队成员的具体构成以及任务执行过程中可能发生的队友增减。以灾害救援为例,一架抵达现场的无人机可能需要与从未配合过的地面机器人实时协调,而这些机器人在型号、能力甚至通信协议上都可能存在差异。同时,任务进行中某些机器人可能因能源耗尽或设备故障而退出,新的支援力量也可能中途加入。这些情况要求多机器人系统具备在[[开放域学习]]框架下同时适应环境、伙伴和规模三维度的协同能力。

然而,现有方法在应对这一综合挑战时存在明显短板。基于中心化训练分散式执行的[[CTDE]]范式虽然能提升协作效率,但通常假设训练和测试阶段的队友构成固定。零样本协调方法虽然允许与未见队友配合,但往往只关注伙伴维度的泛化,忽视了环境和规模的变化。更为关键的是,这些方法大多在棋盘游戏或厨房模拟环境(如 Hanabi、Overcooked)中验证,与真实物理平台存在显著的[[sim-to-real 迁移]]鸿沟。真实世界的多机器人协同不仅涉及策略层面的配合,还必须处理传感器噪声、通信延迟、碰撞安全等物理约束,这对算法的鲁棒性提出了更高要求。

方法

论文的核心贡献在于提出一种超图形式博弈建模框架,用以捕获超越成对交互的团队级协作关系。作者将多机器人任务建模为 [[Dec-POMDP]],其优化目标为:

其中环境分布 、伙伴类型 和团队规模均在训练和测试阶段保持开放。与传统图神经网络仅建模二元边不同,作者定义开放超图形式博弈(OH-Game)由元组 构成:顶点集合 代表各机器人的策略网络,超边集合 描述超过两个智能体之间的协同效用,权重函数 反映子集协作的期望回报。超边大小的范围 则明确支持可变团队规模,使得同一框架下可以自然表达三人小队、五人编队等不同规模下的协调结构。

基于这一博弈论构造,作者进一步提出超偏好中心度来量化个体的合作能力:

该指标越高表示该机器人越受队友欢迎,成为各类规模团队中的"首选伙伴"。

在算法层面,HOLA 包含预训练和开放式学习两个阶段。预训练阶段采用最大熵多智能体训练初始化策略群体,培养基础的多样性。开放式学习阶段的核心是 Grapher 和 Oracle 两个模块:Grapher 负责将新学习者加入已有群体,按超边大小采样伙伴并计算协作权重;Oracle 则通过逆 Myerson 值推导伙伴采样分布,使得合作能力较弱的伙伴被优先采样训练,从而引导新智能体学习如何与各类队友有效配合。通过在优化目标 中同时对伙伴类型、环境配置和队内成员变化取期望,HOLA 实现了一体化处理三维适应性的目标,而非像现有方法那样孤立改进某一维度。

实验与结果

实验在多无人机(基于 Crazyflie 2.1)和多四足机器人(Zsibot L1)两个物理平台上验证协同追捕任务(3追2逃)。测试协议分为固定团队和开放团队两种:前者仅测试未见伙伴与随机环境组合,后者则进一步引入回合内团队规模动态变化。

在开放团队协议下,HOLA 的优势显著:多无人机场景中,面对训练时见过的环境捕获率达 73%,而面对完全未见的新环境反而提升至 85%,平均约 320 步完成任务;几乎所有基线方法在两种环境下的成功率都低于 50%,表现最好的 PBT 也不足 40%。多四足机器人场景中,HOLA 在见过和未见环境下分别为 57.2% 和 62.6%,比最近基线 MAPPO 高出 6-10 个百分点。消融实验进一步证实,移除 Oracle 模块后(变体 HOLA-R)在所有指标上均有明显下降,证明基于逆 Myerson 值的伙伴采样机制对学习高阶合作能力至关重要。

最令人印象深刻的是零样本 sim-to-real 迁移能力:学得的策略无需任何微调即可直接部署到真实硬件。在 FZMotion 运动捕捉系统辅助下,12 台 Crazyflie 无人机和 Zsibot L1 四足机器人均能实现稳定的实时协同,验证了 HOLA 在真实物理环境中与陌生队友协调的鲁棒性。

讨论与可借鉴点

论文将超图博弈与渐进式开放训练相结合,为[[多智能体系统]]的开放域泛化提供了新的技术路径。这种一体化处理环境、伙伴、规模三维度不确定性的思路,相比孤立优化某一指标更具系统性。超偏好中心度的设计也提供了可解释性,便于分析不同机器人在团队协作中的定位。

然而,论文也存在一些局限性。任务类型较为单一,所有实验均围绕追捕场景展开,尚未在异构任务(如运输+探测的组合场景)中验证。未见伙伴池仅包含 4 种类型,可能不足以代表真实部署中伙伴能力分布的复杂性。此外,论文未公开训练算力和样本量级,对复现工作构成障碍。未来可探索的方向包括:更大规模团队(10机以上)和更长时域任务下的性能验证、在通信受限或部分可观条件下的稳健性分析,以及与主动安全约束机制的深度整合。

摘要

在真实世界中部署机器人团队需要同时适应未见环境、未知伙伴以及变化的团队规模,然而现有方法通常在固定队友的封闭世界假设下孤立地应对这些挑战。我们将其形式化为开放自适应多机器人协同,并提出一种超图形式博弈建模方法,能够捕获超越成对交互的团队级协作关系,为回合内团队构成动态变化时的协调结构推断提供了原则性基础。与图神经网络架构不同,这是一种用于建模智能体间策略性交互与收益结构的博弈论构造。基于该建模方法,我们开发了超图开放式学习算法(HOLA),该算法在训练过程中逐步扩展伙伴与环境的多元性,而非针对固定配置进行优化。在多无人机与多四足机器人平台的协同追捕任务上的评估表明,HOLA在全部三个适应性维度上均优于所有基线方法。学习到的策略无需微调即可直接迁移至物理硬件,在Crazyflie和Zsibot L1平台上的成功部署验证了其在与未见队友协作的新颖环境中具备稳健的实时协调能力。

速览

TLDR:真实部署多机器人团队需同时适应未知环境、陌生队友与可变规模,但现有方法多在固定队友的封闭世界假设下孤立处理各维度挑战。本文将这一需求形式化为开放式自适应多机器人组队,提出超图博弈建模团队级合作结构,并设计HOLA算法通过训练中渐进扩展伙伴与环境多样性提升泛化能力。在多无人机与多四足机器人协同追捕任务上,HOLA在三维度适应性全面超越基线,学得策略无需微调即可迁移至Crazyflie与Zsibot L1真实硬件平台。 \

Motivation:现实部署要求机器人团队同时应对未知环境、陌生队友与可变规模,但现有方法在固定队友的封闭世界假设下孤立处理各维度挑战。 \

Method:提出超图博弈形式化建模团队级合作结构,并设计HOLA算法,通过训练中渐进扩展伙伴与环境多样性实现开放式自适应。 \

Result:在多无人机与多四足机器人协同追捕任务上,HOLA在环境、伙伴、规模三维度适应性上均超越所有基线方法。 \

Conclusion:学得策略可零微调直接迁移至Crazyflie与Zsibot L1真实平台,验证了未知环境中与陌生队友协同的鲁棒协调能力。

Context:本文处于多机器人协作与元强化学习交叉脉络,针对既有方法难以同时兼顾环境、伙伴与规模开放性的局限,将超图博弈与课程式开放训练结合,推进了开放式多智能体学习的工程边界。


Abstract

Deploying robot teams in the real world requires simultaneous adaptation to unseen environments, unknown partners, and varying team sizes, yet existing approaches often address these challenges in isolation under the closed-world assumption of fixed teammates. We formalize this as open adaptive multi-robot teaming and propose a hypergraphic-form game formulation that captures team-level cooperative relationships beyond pairwise interactions, providing a principled foundation for coordination structure inference when team composition changes dynamically within episodes. Unlike graph neural network architectures, this is a game-theoretic construct for modeling strategic interactions and payoff structures among agents. Building on this formulation, we develop the Hypergraphic Open-ended Learning Algorithm (HOLA), which progressively expands partner and environment diversity during training rather than optimizing for fixed configurations. Evaluated on cooperative pursuit with multi-drone and multi-quadruped platforms, HOLA outperforms all baselines across all three adaptability dimensions. Learned policies transfer directly to physical hardware without fine-tuning, with successful deployments on Crazyflie and Zsibot L1 platforms confirming robust real-world coordination in novel environments with unseen teammates.


论文详细总结(自动生成)

论文总结:面向未见环境、未知伙伴与可变规模的多机器人开放自适应协同

1. 核心问题与研究动机

论文聚焦于多机器人在真实世界中部署时所面临的三重适应挑战

  • 未见环境:任务场景(如灾害区域、动态仓库、巡逻网络)中的地形与障碍物无法事先获知。
  • 未知伙伴:机器人必须与从未交互过的队友(即训练过程中未出现过的伙伴)实时协作,例如一架搜救无人机可能突然需要与陌生的地面单元协调。
  • 可变团队规模:机器人在同一个 episode 内可能有队友加入、离开或失联,需要回合内(within-episode)而非仅回合间(across-episode)的动态组队。

现有方法(CTDE、ad hoc teamwork、零样本协调 ZSC 等)多在封闭世界假设下孤立处理某一维度,难以同时满足三维适应要求,并且大多仅在游戏式基准(Hanabi、Overcooked、StarCraft)上验证,未充分迁移到物理多机器人平台。

因此作者将这一同时跨越环境、伙伴、团队规模的挑战形式化为 Open Adaptive Multi-Robot Teaming(开放自适应多机器人组队) 问题。

2. 方法论

2.1 形式化建模

论文将每个机器人决策建模为局部 POMDP,多机器人任务整体建模为 Dec-POMDP,定义为:

其中:

  • 为可学习机器人集合, 为不可控伙伴集合, 为伙伴类型空间, 为环境空间, 为机器人动力学与安全约束集。
  • 联合 agent-action 空间 联合 agent-type 空间 显式刻画可变团队规模。
  • 奖励分解为任务奖励与约束惩罚:

2.2 超图形式博弈(Open Hypergraphic-Form Game, OH-Game)

核心构造是元组

  • :顶点集合,每个顶点 代表由神经网络参数 参数化的智能体策略
  • :超边集合,每条超边 连接恰好 个顶点,描述超过两个智能体之间的协同效用。
  • :超边权重,反映子集协作的期望回报。
  • :超边可能大小的范围,明确支持可变规模。

为从中提取个体合作能力,作者进一步定义 Open Preference Hypergraph (OPG),将每个顶点的偏好超边 设定为:

并定义超偏好中心度(hyper-preference centrality)

其中 为节点 在大小为 的偏好网络中的中心度。 表示该智能体是所有团队规模下最受欢迎的伙伴。

2.3 HOLA 算法流程

HOLA 包含预训练阶段开放式学习阶段。预训练阶段用最大熵多智能体训练(MEP)初始化策略群,培养策略多样性:

开放式学习阶段每个生成 内包含两个模块:

Grapher 模块:将新学习者 加入已有群体,按超边大小 采样 个伙伴形成超边,并计算权重:

Oracle 模块:通过内部 Solver 计算逆 Myerson 值采样分布:

采样分布据此取反比例:

使得合作能力较弱的伙伴被采样概率更高,从而训练新智能体成为近似最佳偏好伙伴

优化目标 同时对伙伴、 环境与队内成员变化三类不确定性取期望,从而一体化处理三维适应性。

> 关键辨析:作者特别强调此处超图是博弈论构造而非图神经网络架构,用于建模策略性交互与收益结构。

3. 实验设计

3.1 测试任务与平台

  • 测试任务:多机器人协同追捕(cooperative pursuit),3 追 2 逃,2:1 速度比()。
  • 仿真平台:Crazyflie 2.1 多无人机系统(飞行空间 ,含 5 障碍物,)。
  • 物理平台
  • 多无人机:12 台 FZMotion 运动捕捉相机,120 Hz;Lenovo ThinkPad T590 + Jetson Orin Nano;Crazyradio PA;基于 CrazySwam 控制栈,速度控制 10 Hz。
  • 多四足机器人:Zsibot/GEMBODY L1 地面四足(场地 );50 台动捕相机;ROS2 + Chrony 分布式通讯,端到端时延

3.2 协议

  • Open Team Protocol:同时启用未见伙伴、随机障碍配置、回合内可变团队规模。
  • Fixed Team Protocol:3v2 固定团队,仅测试未见伙伴 + 随机环境。

3.3 对比基线

类型方法
CTDEMAPPO [14]、DACOOP-A [2]
自博弈Self-Play [48,49]
群体训练PBT [15,49]、FCP [50]、MEP [45]
异质伙伴池Greedy、VICSEK [46]、D3QN-G (两个不同种子)
消融HOLA-R(去掉 Solver,改用逆均值奖励)

3.4 评估指标

捕获成功率(SR / SUC)、平均回合长度(AEL / AST)、碰撞率(COL);均在 50 回合 × 3 个随机种子下统计。

4. 资源与算力

论文未明确报告所使用的 GPU 型号、数量、训练时长或总计算量(FLOPs)。仅从系统描述可推断:

  • 在线推理部署在 Lenovo ThinkPad T590 + Jetson Orin Nano 边缘平台上,运行速率约 10 Hz。
  • 训练所需算力未公开。

这一不足对复现工作量评估构成障碍。

5. 实验数量与充分性

总体实验覆盖:

  • 仿真:固定团队未见伙伴协调(图 5)、未见环境(Table II)、开放团队下多无人机追捕(图 6 上)、开放团队下多四足追捕(图 6 下)、 Solver 消融(HOLA vs HOLA-R)、不同伙伴能力谱评估(Table I)。
  • 真实硬件:Crazyflie 多无人机与 Zsibot L1 多四足两个平台的零样本部署。
  • 每个数据点至少 50 episode × 3 随机种子,并报告均值与标准差。

充分性判断:覆盖了 3D 适应性的每一个维度,设置了内部消融和外部真实部署,并展示了"见过"与"未见"环境的对比;评估比较客观。不足在于仅有一个任务族(追捕),并且未见伙伴池只有 4 种风格,整体多样性有限;可扩展性实验(更大团队、更长时间跨度)缺失。

6. 主要结论

1. 固定团队下:HOLA 在异构未见伙伴池中成功率 82%、碰撞率 13.67%,显著优于 FCP(次优 72%);在未见环境中 SUC = 44.00%(最高),COL = 54.67%(并列最低)。

2. 开放团队下

  • 多无人机:HOLA 见环境 73%、未见环境 85% 捕获率,320 步完成,几乎所有基线 < 50%(PBT < 40%)。
  • 多四足:HOLA 见环境 57.2%、未见环境 62.6% 捕获率,比最近基线 MAPPO 高 6–10 个百分点。

3. 零样本 sim-to-real:学得策略无需微调直接部署于 Crazyflie 多机与 Zsibot L1 四足机器人,验证了真实环境下的协同可行性。

4. 消融:移除 Solver 后 HOLA-R 全指标下降,验证超图博弈对高阶合作依赖建模的必要性。

5. 效率:HOLA 回合同步优化捕获效率与碰撞率,而非以牺牲安全换取攻击性。

7. 优点

  • 理论创新:首次将超图形式博弈引入开放自适应多机器人组队,突破了图神经网络将协同仅建模为成对关系的局限,并给出基于 Myerson-Shapley 值的伙伴采样分布推导。
  • 一体化框架:将环境、伙伴、规模三类不确定性统一进单一优化目标 ,避免了现有方法孤立改进某一维度。
  • 零样本真实部署:论文含 Crazyflie 与 L1 两种形态平台的真实实验,远多于仅停留在 Hanabi/StarCraft 模拟的同类工作。
  • 可解释性:超偏好中心度 提供了衡量个体合作能力的可计算标量,便于分析。
  • 渐进式开放训练:通过不断扩展训练伙伴与环境集合而非针对固定配置优化,提升零样本泛化。

8. 不足与局限

  • 算力信息缺失:未报告 GPU 类型/数量、训练时长及样本量级,复现成本难估。
  • 任务单一:所有仿真与实物实验均围绕追捕类任务,尚未在运输、编队、探索等更具异构性的多机器人任务族上验证。
  • 伙伴池偏窄:未见伙伴池仅 4 种(Greedy、VICSEK、D3QN-G ×2),可能不足以代表真实的伙伴分布。
  • 规模与时长有限:可变团队规模实验仅做了小幅波动,大规模团队与长视野任务(self-play 在 100v100 等设定)尚未涉及——作者自承。
  • 安全约束可改进:在高密度交互情境下仍有较高碰撞率(如四足平台 HOLA 约 33–40%),与捕获成功率权衡仍待优化。
  • 固定团队开放场景代理设置:未充分评估大规模训练对真实环境的过拟合风险,且未见伙伴池中各算法的能力谱在仿真内复现。
  • 基准公平性:部分基线(PBT、FCP)的计算与种群预算与 HOLA 是否完全对齐未明确披露,可能放大 HOLA 的相对优势。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记