arXiv 2606.31347v1 · 发布 2026-06-30

大规模电动汽车车队的智能充电:独立多智能体强化学习方法

Smart charging of large fleets of Electric Vehicles: Independent Multi-Agent Reinforcement Learning approaches

AUTHORS Xavier Rate, Eloann Le Guern, Raphaël Féraud, Fatma Salem, Melissa Chiknoun, Eymeric Giabicani, Mehdi Feki, Patrick Maillé, Guy Camilleri, Anne Blavette, Hamid Benhamed
EVIDENCE 比较独立多智能体强化学习方法用于去中心化电动汽车充电协调
SCORE 0.8
CATEGORIES TASK mas
GENERATED 2026-07-04 02:30:00 UTC

📝 TLDR

电动汽车大规模接入电网引发峰值负荷升高、线路过载与可再生能源消纳等难题,亟需去中心化隐式协调机制。本文针对大规模EV车队智能充电问题,比较上下文组合多臂老虎机与策略梯度两种独立多智能体强化学习方法,基于真实光伏出力驱动的动态电价仿真,在不同拥堵水平与异构混合策略下评估。结果显示两类方法在不同场景各有优势,为去中心化EV充电调度提供可行方案。

🧭 速览

动机

大规模电动车接入电网带来峰谷差加大、线路过载与新能源消纳压力,需要隐式协调以兼顾用户成本与电网安全。

方法

采用独立多智能体强化学习,对比上下文组合多臂老虎机与策略梯度算法,智能体仅依据电价、荷电状态和时间约束等局部信息自主决策。

结果

在不同拥堵水平和异构混合策略下,两类方法均能实现去中心化协调充电,并在成本与过载风险间取得各有侧重的平衡。

结论

独立多智能体强化学习为大规模EV车队去中心化充电调度提供了有效方案,不同算法适配于不同电网场景。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

这篇论文在电动汽车大规模接入电网的背景下,对比了两类去中心化充电调度方法:上下文组合多臂老虎机(以 Linear Thompson Sampling 为代表)和策略梯度算法(PPO/A2C/SPO)。基于四年真实光伏出力数据驱动动态电价,在不同拥堵水平下的大量仿真表明,上下文多臂老虎机收敛快速且整体稳健,而策略梯度方法在高拥堵场景下展现出更强的协调能力,但收敛极慢。

研究背景与动机

随着全球电动汽车保有量快速增长,电网正面临前所未有的挑战。当数以百万计的车主选择在下班后同时插上充电枪,峰值负荷的叠加效应可能远超配电变压器的承载能力,导致电压跌落甚至线路过载。更棘手的是,可再生能源的间歇性与电动汽车充电需求的随机性之间存在时间错配——光伏出力高峰通常在正午,而大多数电动汽车的停泊时段集中在夜间,这意味着大量清洁电力因缺乏储能而被迫弃置。

传统的集中式优化方法虽然能在数学上求得最优解,但要求调度中心实时掌握每辆电动汽车的精确信息:何时到达、停留多久、当前电量还剩多少。这些信息不仅涉及用户隐私,在大规模部署时还会带来沉重的通信与计算负担。更何况,天气变化影响光伏出力、用户行为决定出行模式,环境本身充满不确定性,基于确定性模型的最优规划往往在现实中难以奏效。

基于以上考量,这篇论文将目标锁定在一个更具实际意义的方向:完全去中心化的隐式协调。也就是说,每辆电动汽车只需要知道本地的电价信号、当前荷电状态和时间窗口约束,就能独立做出充电决策。当大量这样的个体决策在电价信号的引导下自发趋于协调时,电网层面的峰值负荷降低、可再生能源消纳提升、线路过载减少等目标就能隐式实现,而无需任何中心化的调度指挥。

方法

将这个问题形式化,首先要明确系统的基本结构。假设有 辆电动汽车同时接入一个配电变压器,其同时充电的上限为 (即变压器容量)。当 时,就产生了拥堵——此时并非所有车辆都能在它们期望的时段完成充电。整个时间轴被离散化为以 15 分钟为单位的时隙,每辆电动汽车的到达时间、离开时间和所需充电量都是随机变量,反映了用户行为的真实不确定性。

电价的设定直接与光伏出力挂钩:

这个公式的含义是:光伏出力越大,电价越低。当太阳能发电达到峰值时,电价趋近于零,从而激励电动汽车在这个时段充电,将原本会被弃置的清洁电力利用起来。每辆电动汽车的充电计划被建模为一个布尔向量 ,满足在可用的时间窗口内恰好选择 个时隙完成充电。

在这样的设定下,每辆电动汽车的个体奖励由两部分决定:实际使用的电价和该时段是否发生拥堵。这形成了一个典型的多智能体强化学习问题,但由于各车辆之间没有直接通信,且拥堵状况由所有车辆的随机策略共同决定,这实际上需要采用无模型的强化学习方法。

论文采用了独立多智能体强化学习框架,每个电动汽车拥有独立策略,将其他所有车辆视为环境的一部分。这种做法避免了集中式 Critic 的可扩展性瓶颈,但也意味着每个智能体必须在部分可观测的非平稳环境中学习。

具体来说,论文对比了两大类方法。第一类是上下文组合多臂老虎机,代表算法是 Linear Thompson Sampling(LinTS)。这个方法做了一个关键简化:假设奖励仅依赖于当前状态与动作,而不存在跨时步的状态转移依赖。在这种简化下,充电调度被建模为一个组合老虎机问题——每天从 个时隙中选出恰好 个来充电。LinTS 的核心思想是对每个时隙维护一个线性模型参数的后验分布,在每个决策时刻从该分布中采样,然后贪心地选择期望收益最高的 个时隙。更新时则根据实际获得的奖励,利用贝叶斯更新公式调整线性模型的参数估计。

第二类是策略梯度算法,包括 PPO、A2C 和 SPO。这些方法将问题视为完整的马尔可夫决策过程,奖励依赖于状态转移,因此能够学习到时序上的依赖关系。PPO 使用截断的重要性比率来稳定策略更新,配合价值函数的价值损失和 GAE(广义优势估计)来计算优势函数。A2C 则是 PPO 的简化版本,去掉了截断机制。SPO 则用软二次正则替代硬截断,保证梯度全程非零,避免了 PPO 在早期训练中可能遇到的梯度消失问题。

这两种范式的根本差异在于:LinTS 将问题视为一系列独立的决策,对环境动态做了平稳性假设;策略梯度方法则显式建模状态转移,能够学习更复杂的协调策略,但代价是收敛更困难。

实验与结果

实验基于一个自行开发的多智能体仿真平台,使用 Elia 平台 2021 至 2024 年共四年的比利时光伏出力数据,生成了 4000 天的动态电价序列。电动汽车的参数设定反映了真实场景:22 kW 充电功率、92 kWh 电池容量、到达时间服从正态分布、停车时长服从截断指数分布。实验采用了两种信息假设——完美实时电价和日前预测电价(后者在现实中更可行但存在误差),以及两种拥堵水平——变压器容量为需求的 70%(低拥堵)和 30%(高拥堵)。

在同构部署(所有车辆运行同一算法)的实验中,结果呈现出清晰的模式。LinTS 和非上下文的 Bernoulli TS 在数百个 episode 内即可收敛到较优水平,而策略梯度算法即使在 3000 个 episode(约 8 年的模拟时间)后仍未完全收敛。在低拥堵条件下,上下文信息为 LinTS 带来了边际优势,使其略优于无上下文的基线,两者的收益水平都接近理论最优的 Greedy 方法。

然而,在高拥堵条件下,策略梯度方法展现出独特的协调优势。从约 500 个 episode 开始,PPO/SPO/A2C 的平均收益开始超越 LinTS。更值得注意的是,在衡量用户体验的关键指标——SOC 失败率(即未能按时完成充电的比例)上,策略梯度方法具有压倒性优势。这说明虽然 LinTS 收敛快,但它学到的是一个相对静态的策略,难以根据实时的拥堵动态调整;而策略梯度方法虽然收敛慢,却能学习到更精细的协调机制。

当引入日前预测电价而非完美实时信息时,两类方法的鲁棒性差异更加明显。LinTS 和传统的 Thompson Sampling 性能出现了明显下降,因为它们依赖于对环境平稳性的假设,而预测误差打破了这一假设。相比之下,PPO/A2C/SPO 的表现几乎不受影响,这得益于它们对状态转移的显式建模,使其能够将价格预测的不确定性纳入决策考量。

异构混合部署的实验结果最为出人意料。当 10 辆运行 PPO 的车辆与 10 辆运行 LinTS 的车辆共存时,高拥堵场景下出现了有趣的动态:LinTS 因假设环境平稳而在初期占据优势,但 PPO 通过学习动态"污染"了环境,使得 LinTS 的策略逐渐失效。论文指出,PPO 大约需要 1.5 年的模拟时间才能反超 LinTS,这暴露了策略梯度方法在现实部署中的根本困境——太慢了。

讨论与可借鉴点

这篇论文的实验设计值得称道之处在于,它没有止步于单一算法的性能评估,而是系统地考察了异构多智能体这一更接近现实部署的场景。大多数研究假设所有车辆运行同一算法,但在真实世界中,不同车厂可能采用不同的调度策略,用户也可能选择不同的充电应用。这种异构性不仅影响系统性能,还会引发策略间的相互干扰,论文对此的揭示具有重要的警示意义。

然而,论文的局限性也同样明显。首先,"大规模"在这里仅指 20 辆电动汽车、单一变压器的规模,与真正的大规模电网调度相去甚远。论文没有考虑配电网拓扑、线路潮流、节点电压等物理约束,拥堵模型也只是简单的超额随机断开,缺乏公平性或优先级机制。其次,策略梯度方法的收敛速度问题在实践中几乎是无解的——即使模拟 8 年仍未完全收敛,这意味着任何基于纯在线学习的部署方案都面临严峻挑战。论文提出了滑动窗口方案的思路,但由于季节性变化的周期特性,窗口至少需要一年才能捕捉到足够的电价波动规律,这大大限制了方法的适应性。

对于后续研究而言,这篇论文提供了一个清晰的方向:LinTS 的收敛速度与策略梯度方法的协调能力之间存在互补性,如何设计能够兼顾两者的混合架构是一个值得探索的方向。此外,将电网物理约束纳入优化模型、设计考虑公平性的拥堵管理机制、以及在更接近真实的网络拓扑上进行验证,都是具有实际价值的研究课题。

摘要

通过电动汽车实现交通电气化给电网管理带来了新的挑战,例如峰值需求增加、电压波动、线路过载以及可变可再生能源的并网。为了在实现电动汽车高效并网的同时降低用户成本并避免网络过载,需要电动汽车之间进行隐式协调。本研究比较了两种用于优化此类分散式电动汽车充电的独立多智能体强化学习方法:上下文组合多臂老虎机算法和策略梯度算法。我们使用一个真实的仿真环境,其中自主智能体基于局部环境信息(包括电价信号、荷电状态和时间约束)做出决策,并在不同的拥塞水平以及由实际光伏发电数据推导出的动态电价下,结合混合策略配置与异构智能体组对其性能进行了评估。

Abstract

The electrification of transportation through electric vehicles introduces new challenges for power grid management, such as increased peak demand, voltage fluctuations, line overloads, and the integration of variable renewable energy sources. To enable efficient integration of EVs while minimizing costs for users and avoiding network overloads, implicit coordination between EVs is required. This work compares two independent multi-agent reinforcement learning approaches for optimizing such decentralized EV charging: contextual combinatorial bandits and policy gradient algorithms. Using a realistic simulation environment with autonomous agents making decisions based on local environmental information (including price signals, state-of-charge, and temporal constraints), we evaluate their performance across varying congestion levels, and mixed-strategy configurations with heterogeneous agent groups under dynamic electricity pricing derived from real photovoltaic production data.


论文详细总结(自动生成)

大规模电动汽车车队智能充电:独立多智能体强化学习方法

1. 核心问题与研究动机

随着电动汽车(EV)大规模普及(2024 年全球销量约 1700 万辆,预计 2030 年占新车销量 40%),电网面临严峻挑战:

  • 峰值负荷与线路过载:无序充电导致电压跌落、线路过载和电网不稳定。
  • 可再生能源消纳困难:在光伏出力高峰期(如加州 CAISO 春、秋季太阳能弃电超 900 GWh),因缺乏储能而被迫削减清洁电力。
  • 可扩展性:集中式优化(如 MILP)需获取所有 EV 的到达/离开时间、荷电状态(SOC)等完整信息,受限于通信、隐私与计算成本。
  • 不确定性:天气影响新能源出力与负荷,用户行为决定 EV 可用时段。

研究目标:在大规模 EV 场景下实现完全去中心化的隐式协调,使每辆 EV 仅依据局部信息(电价、SOC、时间约束)自主决策,既降低用户充电成本,又缓解电网拥堵、最大化可再生能源消纳。

2. 方法论

2.1 问题形式化

  • 系统模型 辆 EV 接入单一变压器,同时充电上限为 时产生拥堵。
  • 时间结构:每天 离散为 个时隙;每辆 EV 的到达时间 、离开时间 、所需充电时隙数 均为随机变量。
  • 电价模型:与光伏出力反相关:

光伏出力最大时电价为 0,无出力时为 1,从而激励 EV 利用新能源。

  • 可行充电计划集
  • 个体奖励

其中 表示该时隙发生拥堵, 为 Hadamard 积。

  • 优化目标:最大化平均日收益

同时最小化充电未完成的 SOC 失败事件

  • 核心特征:由于其他 EV 调度未知,且拥堵由随机策略共同决定,该问题必须采用无模型强化学习而非基于模型的规划。

2.2 独立多智能体强化学习方法

采用独立多智能体强化学习(Independent MARL):每个 EV 拥有独立策略,将其他 EV 视为环境的一部分,避免集中式 Critic 带来的可扩展性瓶颈。

#### (1) 上下文组合多臂老虎机:Linear Thompson Sampling (LinTS)

简化 RL 框架——奖励仅依赖状态与动作,无序贯依赖。将充电选择建模为组合老虎机问题:每天从 个时隙中选 个,拥堵发生则重选。算法 1 流程:

  • 对每个时隙采样参数
  • 计算期望奖励似然
  • 选择使收益最大的 个时隙(计算复杂度 );
  • 一天结束观察实际电价,按

更新线性模型。

#### (2) 策略梯度算法:PPO / A2C / SPO

完整 MDP 框架,奖励依赖状态转移:

  • PPO(算法 2):使用截断重要性比率

截断损失

配合价值函数 MSE 损失 ,采用 GAE 计算优势

  • A2C:去除截断机制,不进行多轮 buffer 回放。
  • SPO:将硬截断替换为软二次正则

保证全程非零梯度。

3. 实验设计

3.1 仿真环境

  • 基于 Gymnasium 自研多智能体平台(开源)。
  • 支持可配置容量 、异构策略混合、真实历史光伏数据、自定义 EV 到达/离开分布、拥堵管理(超额随机断开)。

3.2 EV 参数

参数取值
充电功率22 kW
电池容量92 kWh
到达时间 截断至 [6, 12]
停车时长 小时
初始 SOC均匀 [10%, 70%]
目标 SOC80%

3.3 数据与价格

  • 数据源:Elia 平台 2021–2024 年(4 年)比利时光伏出力数据。
  • 价格生成:4000 天(采样均匀于 4 年区间),15 分钟粒度,按 1–99 分位归一化。
  • 信息假设:① 完美实时电价;② 日前预测电价(含不确定性)。
  • 数据集划分:3000 天训练 / 1000 天测试。

3.4 对比方法

方法类型是否使用上下文
Greedy启发式(已知价格下理论最优)
Bernoulli TS非上下文老虎机
Linear TS (LinTS)上下文组合老虎机
Neural TS神经网络老虎机
PPO策略梯度
A2C策略梯度
SPO策略梯度

3.5 评估协议

  • 训练 3000 episode,测试 1000 episode,每次实验重复 5 次取均值。
  • 两个场景:① 同构部署(20 辆 EV 同算法);② 异构部署(10 PPO + 10 LinTS)。
  • 两个电网容量场景:70%(低拥堵)与 30%(高拥堵)。
  • 评估指标:平均日收益 + SOC 失败率(对数尺度)。

4. 资源与算力

论文未明确披露所用 GPU 型号、数量或训练时长。仅说明 PPO 使用 Stable-Baselines3 实现,25 个 epoch、batch=512、clip=0.3、lr=;LinTS 方差参数 ;NeuralTS 单隐藏层 64 神经元、lr=。这一信息披露缺失是论文的一个明显短板。

5. 实验数量与充分性

  • 同构实验:覆盖 7 种算法 × 2 种价格信息 × 多档容量(20%、30%、50%、70%、100%)= 数十组实验。
  • 异构实验:1 种混合配置(10 PPO + 10 LinTS)× 2 容量水平 × 2 信息模式。
  • 重复性:每组 5 次重复取均值。
  • 评估维度:包含学习曲线、最终收益、SOC 失败率、收敛速度。
  • 充分性评价:实验设计较系统,涵盖收敛性、最终性能与异构鲁棒性;但异构混合仅测试 PPO+LinTS 一种组合,未涉及多算法三组以上混合,对"异构"维度的覆盖仍有限。整体较为公平(统一环境、同一价格生成、相同 5 次重复)。

6. 主要结论与发现

1. 收敛速度:LinTS 与 Bernoulli TS 在数百 episode 内即可收敛;PPO/A2C/SPO 在 3000 episode 后仍未完全收敛;NeuralTS 收敛极慢。

2. 低拥堵(70% 容量):LinTS 略优于 TS(因利用上下文信息),二者接近最优 Greedy;策略梯度算法尚未追上。

3. 高拥堵(30% 容量):PPO/SPO/A2C 在 500 episode 后略胜 LinTS,A2C/PPO/SPO 在 SOC 失败率上明显占优,表明策略梯度算法协调能力更强。

4. 价格信息鲁棒性:使用日前预测电价时,LinTS/TS 性能下降,而 PPO/SPO/A2C 性能几乎不变(因为它们对环境动态更鲁棒)。

5. 异构混合(10 PPO + 10 LinTS):在高容量下 LinTS 收敛快且更优;但在低容量高拥堵下,LinTS 因假设环境平稳,PPO 通过学习动态"污染"了其解,导致 LinTS 性能退化;PPO 需约 1.5 年(500+ 天) 才能反超 LinTS。

6. 总评:LinTS 收敛快、整体表现稳健;策略梯度算法在高拥堵场景协调更优但收敛过慢,限制在线部署。

7. 优点

  • 方法对比维度全面:在同一实验框架下系统比较老虎机族与策略梯度族(PPO/A2C/SPO)共 7 种方法,并设置非上下文基线突出上下文贡献。
  • 真实数据驱动电价:使用 Elia 4 年真实光伏数据,比纯合成电价更具现实意义;同时考虑完美实时与日前预测两种信息假设。
  • 异构鲁棒性评估:突破以往"单一算法"评估范式,考察算法混合部署这一真实场景。
  • 开源代码:提供 GitLab 仓库,便于复现与扩展。
  • 指标互补:同时报告平均收益与 SOC 失败率,并标注对数尺度,反映算法在极端场景下的表现。

8. 不足与局限

  • 算力与超参披露不足:未说明硬件资源、训练时间、超参搜索过程,限制了结果的可复现性。
  • "大规模"程度有限:仅 20 辆 EV,单一变压器,未涉及配电网级拓扑、线路损耗、电压约束。
  • 无网络模型简化:电网被简化为"总负荷求和 + 随机断开",忽略线路潮流、节点电压、相间不平衡等真实物理约束。
  • 拥堵机制简化:仅采用"超额随机断开",未考虑公平性、优先级或调度排序。
  • 异构实验单一:仅测试 PPO+LinTS 一种混合配置,未涉及 3 组及以上算法混合、不同比例敏感度分析。
  • 策略梯度收敛过慢:即使 3000 episode(≈8 年)仍未完全收敛,1.5 年才能反超 LinTS,限制在线部署可行性。
  • 滑动窗口方案未被充分验证:作者提出对 LinTS 加滑动窗口以应对非平稳,但因季节性需求窗口至少需 1 年,限制适应性;未来工作建议采用对抗性线性老虎机,但本文未实施验证。
  • 未评估用户行为不确定性鲁棒性:到达时间、停车时长等随机性已建模,但未做敏感性分析。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记