基于分层混合物理信息深度强化学习的异构多机器人系统高精度编队控制
High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning
📝 TLDR
异构多机器人系统队形控制面临两难:经典方法依赖精确模型且难应对不确定性,端到端强化学习样本效率低、收敛差。本文提出层次混合物理约束深度强化学习(HHy-PIDRL)框架,上层用SAC算法为Ackermann转向领航者设计自主导航策略,下层融合物理前馈、PD控制器与自适应DRL残差控制器构成HM-DRL混合编队策略,并以分层奖励训练全向跟随者。实验显示两层策略成功率均达100%,消融实验验证了各模块有效。
🧭 速览
经典控制依赖精确模型、难以应对模型不确定性与外部扰动;端到端强化学习样本效率低、收敛性差,无法满足异构多机器人高精度编队需求。
两层HHy-PIDRL框架:上层基于SAC为Ackermann领航者设计自主导航策略;下层融合物理前馈、PD与自适应DRL残差控制器构成HM-DRL混合编队策略,以分层奖励训练全向跟随者。
领航者自主导航策略与HM-DRL编队策略的成功率均达100%,消融实验验证了各模块的必要性与方法可信度。
HHy-PIDRL将物理先验与深度强化学习优势结合,有效克服模型依赖与样本效率瓶颈,为异构多机器人提供高精度、高响应编队控制方案。
📊 论文图表(共 12 张)
展开查看 12 张图
TL;DR
本文针对异构多机器人系统中阿克曼转向领航者与全向跟随者的高精度编队控制问题,提出了一种名为 HHy-PIDRL 的分层混合物理信息深度强化学习框架。该框架通过在上层使用 SAC 算法训练领航者自主导航策略,在下层融合物理前馈、PD 控制器与自适应 DRL 残差控制器形成 HM-DRL 混合编队策略,并设计了针对性的分层奖励函数来训练全向跟随者。实验结果表明,两层策略均达到 100% 的成功率,消融实验证实了各模块的有效性贡献。
研究背景与动机
异构多机器人系统通过整合不同类型机器人的独特优势,在工业物流、协同探测、智能交通等领域展现出比同构系统更高的任务效率和容错能力。编队控制作为这类系统的核心基础性问题,要求多个机器人不仅要到达指定位置,还要在空间中保持特定的相对几何关系。然而,当领航者采用具有非完整性约束的阿克曼转向车辆时,其动力学特性会在高速高曲率机动过程中产生高度非线性的向心力和欧拉加速度,这些运动特性会沿编队传播,导致跟随者面临高度非平稳的控制挑战。
传统的编队控制方法主要依赖精确的数学模型。PD 控制和 PID 控制通过反馈误差来调节控制量,实现简单但难以处理模型不确定性和外部扰动;模型预测控制虽然能够显式考虑系统约束,但计算负担随预测时域和系统规模急剧增长,且同样对模型精度要求苛刻。这些经典方法的共同局限在于:当系统模型与真实物理过程存在偏差时,控制性能会显著下降。
端到端的深度强化学习方法为这一困境提供了新的解决思路——智能体通过与环境交互自主学习控制策略,理论上能够适应模型不确定性。然而,作为“黑盒”方法,纯 RL 策略存在样本效率低、训练过程不稳定、收敛困难等问题。更重要的是,这种做法完全抛弃了人类对物理系统的已有认知,将宝贵的物理先验知识置于一旁,导致智能体需要从零开始探索一个巨大的控制空间。
本文的切入点正是融合两者的优势:既要让物理先验知识引导学习过程、缩小探索范围、提升训练效率,又要借助强化学习的自适应能力来处理模型不确定性。在此基础上,作者提出了分层混合物理信息深度强化学习框架,针对异构多机器人系统的特点设计层次化的控制架构。
方法
HHy-PIDRL 框架的核心思想是将整个编队控制系统划分为两个层次,上层负责领航者的自主导航,下层负责跟随者的编队跟踪。这种分层设计不仅简化了马尔可夫决策过程的构建难度,还使得各层可以根据自身特点选择最合适的控制策略。
在上层,领航者的运动学模型采用标准的阿克曼转向车辆描述。其状态更新由线速度 和前轮转向角 决定,角速度为 ,其中 为车辆轴距。基于 Soft Actor-Critic 算法,作者为领航者设计了自主导航策略网络,状态空间包含位置、航向角、当前速度、目标点相对坐标、欧氏距离和航向偏差等 8 个维度;动作空间输出归一化的加速度和转向指令。奖励函数采用复合设计,距离奖励使用指数衰减项 引导智能体向目标点移动,同时加入对齐奖励、速度奖励、转向惩罚和时间惩罚以鼓励平滑高效的行驶轨迹。训练过程持续 50,000 个回合后,智能体在约 46,500 回合时达到稳定性能,平均到达终点仅需约 50 步。
下层的 HM-DRL 编队控制策略是本文方法的核心创新点。不同于直接让神经网络输出完整控制量,该策略将控制速度分解为三个子模块的叠加:物理前馈控制器提供对系统动力学的前瞻性补偿,PD 控制器提供基于当前误差的反馈调节,DRL 残差控制器则专门负责消除前两者无法完全补偿的残余误差。
物理前馈控制器的设计体现了对系统物理特性的深刻理解。对于全向移动机器人,要精确跟随阿克曼领航者的运动轨迹,需要补偿四个方面的物理效应:线速度补偿使跟随者随领航者平移;切向速度补偿 用于抵消领航者自转带来的相对运动;向心加速度补偿 处理曲线运动中的离心效应;欧拉加速度补偿则处理领航者加减速带来的惯性影响。这四项补偿构成了完整的前馈控制量 ,它使得在理想情况下跟随者能够准确预测并跟踪领航者的运动轨迹。
PD 反馈控制器采用经典的比例-微分结构 ,其中 、,用于修正前馈控制的建模误差和外部扰动带来的偏差。
自适应 DRL 残差控制器是该框架中唯一需要学习的部分,其状态空间设计充分利用了局部和全局信息。20 维的状态向量包含跟随者自身的误差状态(位置误差、速度误差)、领航者动态信息(线速度、角速度、加速度的各分量)、邻居机器人相对信息(相对位置和相对速度)、自身历史误差(过去两步的位置误差模值)以及全局编队状态(编队平均位置误差和间距误差)。引入全局信息的巧妙之处在于,它让分布式部署的跟随者能够获得编队的整体态势感知能力,同时历史误差序列使智能体具备了趋势预测的本能——当误差正在减小还是增大时,控制器可以做出更有前瞻性的决策。
残差控制器的奖励函数采用分层设计,包含位置奖励、间距奖励、保持奖励、进度奖励、接近奖励和终止奖励六个组成部分。其中保持奖励的设计尤为精巧:当位置误差小于阈值 时,奖励为 ;否则为零。这一设计针对性地解决了 DRL 在误差较小时面临梯度消失的难题——当智能体已经接近目标时,传统的指数衰减距离奖励会变得非常小,导致学习信号微弱、难以进一步精调,而保持奖励在误差进入小范围后转为关注误差的平方,使梯度信号更加显著。训练采用 SAC 算法配合优先经验回放机制,按 TD 误差大小对样本进行优先级采样,进一步提升了学习效率。
实验与结果
实验在 的二维平面仿真区域内进行,系统配置为 1 个阿克曼领航者加 3 个全向跟随者。领航者的最大速度设为 ,最大转向角为 ;跟随者的最大速度为 。测试涵盖了三角编队、竖直线编队、矩形编队、水平线编队和周边编队五种不同的队形配置。
实验结果表明,上层领航者自主导航策略在 20 个测试回合中全部成功到达目标点。下层 HM-DRL 编队控制策略在三角编队测试中达到 100% 成功率,平均位置误差约为 ,平均间距误差约为 。这些数字说明系统不仅能够使机器人到达期望位置,还能稳定维持编队的内部几何结构。
消融实验的结果清晰地揭示了各模块的贡献。在仅使用自适应 RL 控制器的条件下,位置误差高达 ,成功率仅为 90%——这说明纯学习方法在没有物理引导时难以处理复杂的非线性动力学。加入物理前馈后,位置误差降至 ,成功率提升至 100%,表明前馈控制提供了强有力的物理先验,大幅缩小了学习所需的探索空间。PD 控制与 RL 残差的组合达到 的位置误差和 95% 的成功率,效果介于前两者之间。三者结合的完整 HM-DRL 策略以 的误差和 100% 的成功率达到最优,验证了各模块的互补性:前馈负责大势、PD 稳定当前、残差消除细节。
值得注意的是,该框架展现了良好的可扩展性。同一个跟随者控制策略网络能够适应多种编队形态,只需修改期望队形的定义参数。这在实际应用中意味着可以根据任务需求灵活切换编队构型,而无需重新训练控制策略。
讨论与可借鉴点
从方法论角度审视,本文提出的物理前馈与 DRL 残差叠加架构具有广泛的适用价值。这种“物理引导 + 学习修正”的范式既保留了经典控制在稳态条件下的精确性,又赋予了系统处理模型不确定性的自适应能力。其关键在于前馈控制器的设计质量——对系统动力学理解越深刻,前馈部分能覆盖的成分就越多,残差学习所需填补的空白就越小。
分层奖励函数的设计同样值得借鉴,特别是保持奖励对梯度消失问题的针对性解决。在实际机器人控制任务中,高精度往往意味着稳态误差已经很小,而此时传统奖励函数的梯度信号趋于消失。类似的“小误差区域梯度增强”设计思路可以推广到其他对控制精度有高要求的 DRL 应用中。
然而,本文也存在一些局限性需要正视。首先,实验仅在仿真环境中进行,缺乏真实机器人平台的验证——仿真与现实的差距(sim-to-real gap)仍然是制约强化学习方法落地的重要因素。其次,测试集规模相对有限,20 个回合的统计结果可能难以充分反映方法的鲁棒性。再者,论文未涉及对外部扰动、传感器噪声、通信延迟等因素的鲁棒性测试,而这些在实际部署中往往不可避免。最后,系统规模停留在 1 领航加 3 跟随的规模,对于更大规模、更多类型的异构编队,其可扩展性仍有待验证。
总体而言,这项工作在异构多机器人编队控制领域提出了一套完整且可操作性强的解决方案,其核心设计理念——将物理先验深度嵌入深度强化学习框架——对于相关领域的研究具有重要的参考价值。
摘要
现有的经典控制方法通常需要精确的模型,并且难以应对模型不确定性和外部扰动,而端到端强化学习(RL)方法则存在样本效率低、收敛性差的问题。为克服这些挑战,本文提出了一种分层混合物理信息深度强化学习(HHy-PIDRL)框架,旨在实现异构多机器人系统(HMRS)的高精度、高响应编队控制。该框架包含两个层次。具体而言,首先,上层基于 Soft Actor-Critic(SAC)深度强化学习(DRL)算法,为阿克曼转向领导者设计自主导航策略网络。其次,下层模块融合了高保真物理前馈控制器、经典比例-微分(PD)控制器以及自适应 DRL 残差控制器,提出了一种有效的基于混合模型与 DRL(HM-DRL)的编队控制策略网络。第三,针对全向跟随者的训练设计了一种独特的分层奖励函数,能够有效引导智能体获得精细且稳定的控制策略。实验结果表明,上层自主导航策略网络以及基于 HM-DRL 的编队控制策略网络的成功率均达到 100%。同时,本文还开展了消融实验,以验证所提方法的有效性与可信度。
Abstract
Existing classical control methods commonly require precise models and struggle to cope with model uncertainties and external disturbances, while end-to-end reinforcement learning (RL) approaches suffer from low sample efficiency and poor convergence. To overcome these challenges, this paper proposes a hierarchical hybrid physics-informed deep reinforcement learning (HHy-PIDRL) framework, aiming to realize high-precision, highly responsive formation control for heterogeneous multi-robot systems (HMRSs). The proposed framework contains two layers. Specifically, first, the upper layer designs an autonomous navigation policy network for Ackermann-steering leader based on the Soft Actor-Critic (SAC) deep reinforcement learning (DRL) algorithm. Second, the lower module integrates a high-fidelity physical feed-forward controller, a classical proportional-derivative (PD) controller, and an adaptive DRL residual controller to propose an effective hybrid model and DRL (HM-DRL)-based formation control policy network. Third, a unique hierarchical reward function is designed for training Omnidirectional followers, which effectively guides agents toward a refined, stable control policy. Experimental results demonstrate that, the success rate of both the upper-layer autonomous navigation policy network and the HM-DRL based formation control policy networks reach 100%. Meanwhile, ablation experiments are conducted to verify the validity and credibility of the proposed method.
论文详细总结(自动生成)
论文总结:基于分层混合物理信息深度强化学习的异构多机器人系统高精度编队控制
1. 核心问题与研究动机
异构多机器人系统(HMRS)通过发挥不同机器人的独特优势,在复杂任务中具备更高的效率、鲁棒性与经济性。编队控制是 HMRS 的核心基础问题之一,但其面临显著挑战:
- 领航者动力学复杂:当领航者为具有非完整性约束的阿克曼转向(Ackermann-steering)车辆时,其在高速高曲率机动下产生的高度非线性、耦合的非完整动力学(向心力与欧拉力)会沿编队传播,形成高度非平稳的控制问题。
- 经典控制方法的局限:PD 控制、MPC 等方法依赖精确系统模型,难以应对未建模动态和外部扰动。
- 端到端 DRL 的缺陷:作为"黑盒"方法,存在样本效率低、未能利用系统物理知识、训练不稳定、鲁棒性差等问题。
研究目标:设计一个兼顾物理先验稳定性与 DRL 自适应性的混合控制框架,实现 HMRS(阿克曼领航者 + 全向跟随者)的高精度、高响应编队跟踪控制。
2. 方法论
2.1 整体框架:HHy-PIDRL(分层混合物理信息深度强化学习)
框架分为两层:
- 上层:基于 SAC 算法的阿克曼领航者自主导航策略网络。
- 下层:基于 HM-DRL(混合模型 + DRL)的多全向跟随者编队跟踪策略网络。
2.2 运动学模型
领航者(阿克曼模型):
其中 ,。
跟随者(全向模型,欧拉离散):
2.3 上层:SAC 自主导航策略
状态空间(8 维):,含归一化处理。
动作空间(2 维):(归一化加速度与转向指令)。
复合奖励函数:
其中距离奖励采用指数衰减 ,到达终点稀疏奖励 。
2.4 下层:HM-DRL 编队控制律
核心思想:将控制速度分解为三个子模块的叠加:
#### 2.4.1 物理前馈控制器
包含四项补偿:
- 线速度补偿:跟随领航者平移速度。
- 切向速度补偿:,抵消领航者自转影响。
- 向心加速度补偿:。
- 欧拉加速度补偿:。
#### 2.4.2 PD 反馈控制器
文中取 ,。
#### 2.4.3 自适应 RL 残差控制器
补偿前两个控制器未能消除的残余误差。
状态空间(20 维):
- 自身误差:位置误差与速度误差。
- 领航者动态:线速度、角速度、加速度分量。
- 邻居相对信息:相对位置与速度。
- 历史误差:前两步位置误差模值。
- 全局形成误差:编队平均位置误差与间距误差。
动作空间:(与缩放因子 相乘得到 )。
分层奖励函数:
关键设计:
- 距离奖励:(,)。
- 间距奖励:。
- 保持奖励(高保持奖励):,其中 ,,;该设计针对性地解决误差小时梯度消失问题。
- 进度奖励:。
- 软碰撞惩罚:对领航者和其他跟随者设定安全距离阈值 、。
网络训练:采用 SAC + 优先经验回放(PER)缓冲区,按 TD 误差大小进行优先级采样。
3. 实验设计
3.1 仿真场景
- 仿真环境:二维平面区域 。
- 异构平台:1 个阿克曼领航者 + 3 个全向跟随者。
- 物理参数:领航者最大速度 ,最大转向角 ;跟随者最大速度 。
- 编队模式:三角编队(主)、竖直线编队(验证可扩展性)、矩形/水平线/周边等。
3.2 评估指标
- 平均位置误差:。
- 平均间距误差:衡量编队内部结构稳定性。
- 成功率:所有三个条件同时满足才记为成功。
3.3 对比方法
- 与现有 PD/PI 控制、MPC、分布式 DRL 文献([8]-[15])进行间接定性比较。
- 消融实验:设置 4 种情况对比——
1. 仅自适应 RL 控制器。
2. 物理前馈 + 自适应 RL 残差。
3. PD + 自适应 RL 残差。
4. 物理前馈 + PD + 自适应 RL 残差(完整 HM-DRL)。
3.4 网络结构
所有网络均为标准 MLP,含两个 256 神经元隐藏层 + ReLU 激活。
4. 资源与算力
- 硬件:Intel Xeon Platinum 8352S 处理器 + NVIDIA GeForce RTX 4090 GPU(单卡)。
- 软件/平台:未明确说明使用的强化学习框架(如是否基于 PyTorch/TensorFlow、ROS/Gazebo 等仿真平台)。
- 训练时长:未明确给出 wall-clock 训练时间。
- 训练回合数:领航者训练 50,000 episode;跟随者训练 10,000 episode;每回合最多 300 步。
5. 实验数量与充分性
| 实验类型 | 数量/规模 |
|---|---|
| 领航者训练 episode | 50,000 |
| 跟随者训练 episode | 10,000 |
| 领航者独立测试 | 20 episode |
| 跟随者测试(三角编队) | 20 episode |
| 编队模式验证 | 三角 + 竖直线 + 矩形 + 水平线 + 周边(5 种) |
| 消融实验 | 4 种控制器组合 × 三角与竖直线两种队形 |
充分性评价:
- 优点:包含训练曲线、可视化轨迹、消融对比、多种队形泛化测试,整体设计较为系统。
- 不足:
- 仅在单一仿真环境下完成,缺乏 真实机器人实验 验证。
- 对比基线仅为消融组合,未与独立的 PD-only、纯 DRL、经典 MPC 等同类方法在同一指标体系下做直接数值对比。
- 缺乏对 外部扰动、噪声、传感器误差 等鲁棒性测试场景。
- 异构规模仅 1 个领航 + 3 个跟随,缺乏更大规模(多领航、多类型跟随者)的可扩展性验证。
- 20 episode 测试集较小,统计置信度有限。
6. 主要结论与发现
1. 成功率:领航者自主导航策略与 HM-DRL 编队控制策略的成功率均达到 100%(测试集 20 episode)。
2. 编队精度:三角编队测试中平均位置误差 ,平均间距误差 。
3. 效率:领航者训练至约 46,500 episode 时,平均到达步数稳定在 50 步左右(约 5 秒)。
4. 消融结论(三角编队):
- 仅 RL 控制器:位置误差 ,成功率 。
- 前馈 + RL:位置误差 ,成功率 。
- PD + RL:位置误差 ,成功率 。
- 完整 HM-DRL(前三者结合):位置误差 ,成功率 —— 各组件对性能均有贡献。
5. 可扩展性:同一策略网络可在多种编队形态(三角、竖直线、矩形、水平线、周边)下复用,仅需修改期望队形定义。
7. 优点
- 物理 + DRL 深度融合:物理前馈控制器显式补偿线速度、切向、向心与欧拉加速度,将先验物理知识内嵌进控制律,显著降低 DRL 探索空间,提升学习效率与稳定性。
- 分层架构合理:上层自主导航 + 下层编队跟踪职责清晰,简化了 MDP 设计难度。
- 状态空间设计新颖:引入全局编队平均误差与个体历史误差序列,使分布式智能体具备全局视角与趋势感知能力。
- 保持奖励设计巧妙:通过 的指数形式针对性解决小误差梯度消失问题,鼓励"逼近→保持"两阶段精细化学习。
- 完整的消融实验验证了每一组件的必要性。
- 优先级经验回放(PER):加速训练收敛。
- 真实物理模型:使用真实阿克曼运动学与全向轮模型,相比简化质点模型更贴近实际。
8. 不足与局限
- 缺乏真实机器人实验:所有验证均在 20m×20m 仿真环境中完成,未在真实硬件平台上验证,Sim2Real 差距未知。
- 缺乏同类方法数值对比:未与 PD-only、MPC、纯 DRL 等方法在同一指标体系下做直接对比,仅有定性引用与自我消融。
- 鲁棒性测试缺失:未涉及传感器噪声、外部扰动(如风、负载变化)、通信延迟等真实场景挑战。
- 场景规模有限:仅在 4 机器人小规模系统上验证,未测试大规模(如 10+ 跟随者、多领航)异构编队的可扩展性。
- 队形切换能力未验证:仅展示了对固定队形的跟踪,没有研究队形动态切换、避障重配置等复杂情形。
- 训练细节不透明:未给出 wall-clock 训练时间、未说明 PER 优先级超参 、 的具体取值、未提供 SAC 网络初始化、收敛判定标准等。
- 样本效率改善仅定性论述:虽然强调"显著改善",但缺乏与端到端 DRL 训练样本量的定量对比数据。
- 无通信假设的代价:假设机器人间无通信——但这与"全局编队平均误差"状态输入存在逻辑不一致(若无通信,全局平均误差如何获得?),需要在实际部署中讨论该状态的估计方式(如通过传感器观测或领航者广播)。
- 期刊成熟度:论文为 arXiv 预印本(编号 2607.03512v1),未经同行评审。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。











