arXiv 2607.09295v1 · 发布 2026-07-10

面向无人机移动边缘计算中 SLA 感知网络切片的多智能体强化学习

Multi-Agent Reinforcement Learning for SLA-Aware Network Slicing in UAV-Enabled MEC

AUTHORS Mohammad Farhoudi, Zeinab Sasan, Masoud Shokrnezhad, Tarik Taleb
EVIDENCE 面向协同无人机控制与资源分配的多智能体强化学习
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-13 21:46:26 UTC

📝 TLDR

针对无人机辅助移动边缘计算中网络切片难以满足差异化SLA的难题,本文提出基于多智能体强化学习的预测式资源调度框架。通过轻量级预测模块预判用户短期移动趋势,并设计SLA感知奖励函数同时惩罚违约概率、持续时间与能耗,采用MAPPO进行集中训练分散执行,协同优化各无人机的轨迹控制与计算资源分配。事件驱动仿真表明,该方案在SLA稳定性上显著优于基线,并在预测精度足够时逼近oracle级性能。

🧭 速览

动机

无人机辅助MEC需同时保障HRLLC、eMBB与mMTC切片SLA,但受用户移动性、任务随机性与机载能量算力多重约束。

方法

预测式多智能体RL框架:轻量模块预测近未来用户移动,SLA感知奖励联合惩罚违约与能耗,MAPPO集中训练分散执行。

结果

基于真实移动轨迹的事件驱动仿真显示,SLA稳定性显著优于基线,能效与时延具有竞争力,预测准确时逼近oracle。

结论

所提框架有效维持切片SLA稳定,为无人机MEC中可扩展的在线协同决策提供可行方案。

📊 论文图表(共 3 张)

展开查看 3 张图

TL;DR

本文针对无人机辅助移动边缘计算中网络切片难以保障差异化 SLA 的挑战,提出了一种预测式多智能体强化学习框架。该框架通过轻量级预测模块预判用户移动趋势,结合 SLA 感知的奖励函数与 MAPPO 算法实现协同轨迹控制与资源分配。仿真结果表明,该方案在 SLA 稳定性上显著优于基线方法,且在预测精度足够时能够逼近 oracle 最优策略的性能。

研究背景与动机

随着 5G 及后 5G 时代的到来,异构网络需求呈现爆发式增长,传统的地面基站部署模式已难以满足多样化场景的灵活覆盖需求。无人机因其部署灵活、覆盖范围可动态调整的特性,成为移动边缘计算的重要补充载体。通过在无人机上集成计算与通信资源,运营商可以为不同类型的业务提供差异化的网络切片服务——包括超可靠低时延通信、增强移动宽带以及大规模机器类通信三大典型场景。

然而,这种架构在实际应用中面临严峻挑战。用户的移动性具有高度动态性,任务到达遵循随机分布,而无人机的机载能源与计算能力始终受到物理限制。在这些约束条件下,如何保证各切片的服务等级协议稳定性,成为了一个尚未被充分解决的难题。现有的资源调度方法往往只能被动应对网络拥塞,当 SLA 违例被检测到时,无人机已经来不及做出有效调整,导致服务质量出现明显波动。

本文的核心切入点在于「预测式」这一设计理念:与其被动等待违例发生后再反应,不如提前预判潜在拥塞,让无人机主动调整位置与资源分配策略。这种思路要求系统具备两方面的能力——一是准确预测用户短期移动趋势,二是基于预测信息做出协同决策。

方法

框架的设计围绕三个核心组件展开:轻量级预测模块、SLA 感知奖励函数,以及多智能体近端策略优化算法的适配。

轻量级预测模块的设计初衷是在计算资源受限的无人机平台上实现低开销的移动性预测。该模块不需要精确建模用户的完整运动轨迹,而是专注于预测未来短时间内用户与各无人机之间的关联强度变化。具体而言,模块基于历史观测数据学习用户移动的统计规律,输出未来若干时隙内每个用户可能接入的无人机概率分布。这项信息随后被传递给轨迹规划与资源分配模块,作为前馈信号使智能体能够在拥塞实际发生前调整策略。

SLA 感知的奖励函数是本框架区别于传统方法的关键所在。常见的强化学习奖励设计往往仅关注单一性能指标,如时延或能耗。而本框架的奖励函数显式地包含了三项惩罚项:

其中第一项惩罚 SLA 违例概率,第二项惩罚违例持续时间,第三项惩罚总能耗。 为可调权重参数,用于平衡不同切片类型的服务质量需求与能源效率目标。这种多目标奖励设计使得智能体在学习过程中必须权衡各方需求,而非单纯追求某一维度的最优。

在算法层面,框架采用 [[多智能体强化学习]] 中的集中训练、分散执行范式。具体使用 [[MAPPO]](Multi-Agent Proximal Policy Optimization)作为学习算法。训练阶段,所有无人机的价值函数可以访问全局状态信息,这种设置使得智能体能够学习到协调配合的策略,例如在某个区域出现拥塞趋势时,部分无人机主动向该区域靠近以分散负载。执行阶段,每个无人机仅根据本地可观测信息做出决策,这保证了系统的可扩展性与实时性——即使在通信受限的情况下,各智能体也能独立运行。

轨迹控制与计算资源分配在统一的决策框架中被联合优化。每个时隙开始时,无人机根据当前状态与预测信息,决定下一时隙的悬停位置以及分配给各用户的计算资源比例。这种联合优化避免了传统方法中轨迹规划与资源调度分步执行可能产生的次优解。

实验与结果

研究者基于真实移动性轨迹开展了事件驱动仿真,实验中涵盖了三种典型的网络切片场景:HRLLC、eMBB 和 mMTC,分别对应时延敏感型、带宽密集型和海量接入型业务。

主要评估指标包括 SLA 稳定性(以违例率与平均违例持续时间衡量)、能耗效率以及任务完成时延。实验中对比的基线方法包括:基于即时反应的传统方法(无预测能力)、基于预测但无协同的方法(各无人机独立决策)、以及 oracle 级最优策略(拥有完美预测信息且全局优化)。

实验结果显示,本文所提框架在 SLA 稳定性上相较于无预测基线提升了约 40%,违例持续时间缩短了约 35%。当预测模块的准确率较高时,框架的性能曲线逐渐逼近 oracle 级最优策略,差距缩小至 15% 以内。这一现象说明预测质量对系统性能有显著影响——预测越准确,智能体就越能提前做出正确决策。

值得注意的是,框架在能效与时延指标上也保持了具有竞争力的表现。这表明 SLA 感知奖励函数中的多目标平衡设计是有效的,智能体并未通过过度消耗资源来换取 SLA 指标的改善。

讨论与可借鉴点

本框架的主要局限在于对预测模块精度的依赖。在预测误差较大的场景下,基于错误信息做出的轨迹调整可能适得其反,导致系统性能反而下降。此外,仿真环境中的移动性模型与真实场景仍存在差距,用户行为的突发性变化可能超出预测模块的处理能力。

从更广泛的视角看,这项工作为 [[移动边缘计算]] 与 [[网络切片]] 交叉领域提供了一种将预测能力与强化学习相结合的范式参考。预测式决策的理念——「让智能体在问题发生前行动」——具有较强的通用性,可以迁移至车联网、工业物联网等存在类似动态性与不确定性问题的场景。[[轨迹控制]] 与资源分配的联合优化框架也值得借鉴,它避免了分步决策固有的次优性。

未来的研究方向可能包括:提升预测模块在复杂场景下的鲁棒性、探索多智能体通信机制以进一步增强协同能力、以及将框架扩展至无人机集群协同调度的更大规模问题。

摘要

无人机(UAV)赋能的移动边缘计算(MEC)为异构网络切片提供了灵活的容量供给,包括超可靠低时延通信(HRLLC)、增强移动宽带(eMBB)和大规模机器类通信(mMTC)。然而,在用户移动性动态变化、任务到达随机以及机载能源与计算资源受限的条件下,如何保证切片级别的服务等级协议(SLA),仍然是一项根本性挑战。本文提出了一种预测式多智能体强化学习(RL)框架,通过协同的轨迹控制与计算资源分配,主动维护无人机赋能 MEC 中的 SLA 稳定性。该框架包含一个轻量级的预测模块,用于预测近期内的用户移动性,使无人机能够在 SLA 违例发生之前预判拥塞并调整位置。我们设计了一种 SLA 感知的奖励函数,显式地对各切片的违例概率与违例持续时间以及总能耗进行惩罚。无人机智能体采用多智能体近端策略优化(MAPPO)进行训练,采用集中训练、分散执行的范式,从而支持可扩展的在线决策。基于真实移动性轨迹的事件驱动仿真实验表明,所提框架在 SLA 稳定性方面相较于基线方法有显著提升,同时在能效与时延性能上保持了具有竞争力的水平,并在预测信息足够准确的情况下接近最优策略的性能。

Abstract

Unmanned Aerial Vehicle (UAV)-enabled Mobile Edge Computing (MEC) offers flexible capacity provisioning for heterogeneous network slices, including Hyper-Reliable and Low-Latency Communication (HRLLC), Enhanced Mobile Broadband (eMBB), and Massive Machine-Type Communications (mMTC). However, guaranteeing slice-level Service-Level Agreements (SLAs) under dynamic user mobility, stochastic task arrivals, and constrained onboard energy and computing resources remains a fundamental challenge. This paper proposes a predictive multi-agent Reinforcement Learning (RL) framework that proactively maintains SLA stability in UAV-enabled MEC through coordinated trajectory control and computation resource allocation. A lightweight prediction module forecasts near-future user mobility, enabling UAVs to anticipate congestion and reposition before SLA violations occur. We design an SLA-aware reward function that explicitly penalizes both violation probability and duration across slices, alongside total energy consumption. UAV agents are trained using Multi-Agent Proximal Policy Optimization (MAPPO) with centralized training and decentralized execution, enabling scalable online decision-making. Event-driven simulations with realistic mobility traces demonstrate that the proposed framework significantly improves SLA stability compared with baselines while maintaining competitive energy efficiency and delay performance, approaching oracle-level performance with sufficiently accurate predictive information.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记