面向自主订单拣选车动态电池管理的深度强化学习方法
Deep Reinforcement Learning for Dynamic Battery Management of Autonomous Order Pickers
📝 TLDR
仓库自主移动机器人(AMR)的电池充电管理直接影响订单处理时效与吞吐。传统固定规则启发式在动态环境下难以兼顾多机器人协调,易造成资源低效。本文提出基于PPO的深度强化学习框架,联合优化充电站选择与充电时长,并显式考虑排队等待时间。实验表明该方法在订单完成率上较最强基线提升达6%,同时显著缩短总充电耗时,并在不同仓库配置与到达率下保持鲁棒。
🧭 速览
仓库AMR充电管理中,固定规则启发式在订单随机到达的动态环境下表现次优,且难以协调多机器人共享有限充电资源。
基于PPO的深度强化学习框架,联合学习充电站选择与最优充电时长决策,并将预期排队等待时间显式纳入状态与奖励设计。
相比最强基线,订单完成率最高提升6%,总充电时间显著减少,且在不同仓库布局与随机到达率下保持稳定鲁棒。
PPO框架在动态充电决策上优于现有DRL与传统启发式,所学习策略具有可解释性,为仓储运营提供实践洞察。
📊 论文图表(共 3 张)
展开查看 3 张图
TL;DR
本文针对仓储自主移动机器人(AMR)在随机订单到达场景下的动态充电决策问题,提出了一种基于近端策略优化(PPO)的深度强化学习框架。该方法联合优化充电站选择与充电时长,并通过平均奖励机制与差分广义优势估计(GAE)适应持续性任务特性。实验表明,所提方法在订单完成率上较最强基线提升达6%,同时显著降低充电站等待时间,且在多种仓库配置与动态到达率下保持鲁棒。
研究背景与动机
现代大型履约中心高度依赖自主移动机器人完成存取、搬运与拣选任务。以Amazon为例,其已部署超过百万台机器人协同作业。然而,AMR的连续运行受限于有限的电池容量——商用磷酸铁锂电池完整充电平均需要2.7小时——这意味着在高密度仓储环境中,机器人必须周期性地前往固定充电站补能,由此引发了一系列复杂的运营挑战。
从系统层面看,多个机器人同时需要充电时会形成排队瓶颈;从单个机器人层面看,需要在取单、充电、回仓库三种状态之间做出权衡决策;从环境层面看,订单按泊松过程随机到达,进一步放大了不确定性。传统方法通常采用固定阈值的规则启发式策略——例如仅当电量低于某阈值时才触发充电——这类短视策略无法应对随机到达与充电站拥堵的动态变化,也无法考虑多机器人之间的协调配合。
正是针对这些局限性,研究者开始探索基于学习的方法,试图让AMR自主学习"何时去充、选哪个充电站、充多久"以及"何时回仓库"的协同决策。
方法
论文将每个AMR建模为[[多智能体强化学习]]中的独立智能体,将整个问题形式化为[[马尔可夫决策过程]](MDP)。状态空间包含本机器人的电量、载货量、到订单与各充电站的距离等自身状态,以及其他机器人的状态与所有充电站的队列长度信息。动作空间则离散化为个选项,其中为充电站数量,其余动作包括启动拣货、停止充电、前往仓库等。为了避免智能体做出非法动作(如在已有订单时去充电),研究者引入了动作掩码机制,将非法动作的 logits 置为极小负值后经 softmax 输出概率,从而在策略层面约束有效决策空间。
在奖励设计上,研究者采用了简洁而有效的三部分结构:启动拣货给予正奖励以解决稀疏的订单完成信号,每步给予负奖励作为时间成本。这种看似简单的设计实际上避免了过度复杂的奖励工程——作者通过实验发现,显式考虑充电时长、队列长度等因素反而会降低样本效率与策略性能。
针对仓储任务的无终止持续特性,研究者做出了一个关键设计决策:用平均奖励替代传统的折扣回报。在标准[[深度强化学习]]框架中,折扣因子会过度削弱远期收益的重要性,但在这里每个订单同等重要。因此定义长期平均奖励为:
同时维护指数滑动平均基线 作为长期平均估计。在此基础上,引入差分 TD 误差:
以及对应的[[广义优势估计]](GAE)形式,用于估计优势函数并构建回报目标。
网络架构采用共享 Actor + 独立 Critic 的设计方案。所有智能体共享一个 Actor 网络,输入为局部观测拼接 one-hot 身份编码,使策略能够根据"我是哪个机器人"做出差异化决策;每个智能体则维护独立的 Critic 网络用于估计状态价值。这种[[独立近端策略优化]](IPPO)架构实现了完全去中心化执行,无需联合 Critic 或中心化训练器,在部分可观测的多智能体环境中表现出良好的可扩展性。
实验与结果
实验在两种规模的仿真环境中进行:环境E-I为4区块配置、2个充电站,订单到达率分别为0.50和0.60;环境E-II为6区块配置、同样2个充电站,到达率提升至0.75和0.90。每个训练 episode 模拟4小时仿真时间,共训练10000个 episode;测试阶段采用8小时仿真并取10次独立运行的平均值。
基线方法涵盖多个层次:最新学术工作方面采用 Bischoff 等人的 Masked PPO 框架(被适配到多区块动态订单场景);经典方法方面包含 DQN 与集中训练分散执行(CTDE)的 PPO;此外还有多种固定阈值启发式策略,如 Fixed_100_15 表示电量上限100、下限15时触发充电,以及根据订单队列动态调整阈值的 HighLow 策略。
实验结果呈现了清晰的层次结构。IPPO 在所有四种配置下均超越所有基线,最强基线(Fixed_100_15)的订单完成率约为70%,而 IPPO 达到76%,绝对提升6个百分点。更细致的效率指标进一步验证了策略的优越性:IPPO 拥有最低的充电站等待时间占比以及最低的单订单充电耗时。值得注意的是,DQN 表现最弱,而 CTDE PPO 弱于 IPPO,这表明在部分可观测环境中联合 Critic 并不优于独立 Critic 的设计。
可解释性分析揭示了学习策略的多个非平凡特征。充电启动时机大约在电量降至24%至28%时,策略展现出协同避让行为——当检测到邻近机器人电量较低时,会提前充电以避免资源竞争;反之则推迟充电。停止充电策略在较小规模环境中呈现空间不对称性(远处机器人提前终止以节省返回时间),在较大规模环境中则倾向于充至满电。SHAP 特征重要性分析确认了电量状态、载货量与距离因素的主导作用。
鲁棒性验证涵盖了训练/测试时长不匹配、动态订单到达率(模拟真实B2C电商的2小时时隙波动模式)以及仓库 depot 位置变化等场景,IPPO 在所有情况下均保持对最佳基线的优势,仅出现轻微性能下降。
讨论与可借鉴点
论文为仓储自动化领域的动态资源调度提供了一个值得参考的解决范式。其核心贡献在于验证了"平均奖励 + 独立 Critic"的框架设计在持续性多智能体任务中的有效性——这一发现在同类研究中具有较强的参考价值。可解释性分析的完整呈现也值得肯定:通过 SHAP 值与决策时刻特征统计的双视角解读,不仅验证了策略的合理性,还提炼出四条具有实践价值的运营规则:引导 AMR 使用最近充电站、优先在远端布置充电站、根据邻近机器人电量动态调整充电终止时机、待载货耗尽后再返回仓库。
然而论文也存在若干局限。首先,算力信息完全缺失——未披露 GPU 型号、训练时长或硬件规模,这使得研究结果的可复现性受到一定影响,也难以评估实际部署成本。其次,缺乏消融实验来量化平均奖励、动作掩码、独立 Critic 等各设计模块的独立贡献。再次,仓库规模仅测试了4区块与6区块两种配置,在更大规模或不同拓扑结构下的泛化性有待验证。最后,实验仅涉及仿真环境,真实仓库中的传感器噪声、通信延迟等因素可能带来额外的性能衰减。
对于后续研究而言,一个有价值的探索方向是将该框架拓展到充电站位置可动态调整、或充电速率可异质化(如快充/慢充)的场景。此外,论文强调的"协同避让"行为暗示了多智能体通信的价值,如何在不过度增加通信开销的前提下实现这一能力,值得深入研究。
摘要
仓库中自主移动机器人(AMR)的电池充电是一项关键的运营挑战,对订单处理时间和吞吐量均有重大影响。本研究针对随机订单到达场景下的动态AMR充电问题展开研究,要求机器人学习最优充电决策。传统固定规则启发式方法在动态环境中往往表现次优,且无法考虑多AMR协同,导致严重的资源低效。为克服上述局限,我们提出一种基于近端策略优化(PPO)的深度强化学习(DRL)框架,专为具有固定充电站的多区块仓库而设计。该模型动态学习两项关键决策:充电站选择与最优充电时长,并显式地考虑充电站的预期排队等待时间。通过大量数值实验,我们将所提模型与最先进的深度强化学习方法及传统启发式方法进行了对比。结果表明,所提PPO框架相较于最强基线方法可将订单完成率提升高达6%,同时显著缩短用于充电操作的总时间。此外,我们在多种仓库配置和随机到达率条件下验证了模型的鲁棒性。最后,我们对学习到的深度强化学习策略进行了深入解读,揭示了其相对于标准基线的优越性,并提供了具有实际价值的运营洞察。
Abstract
Battery charging of Autonomous Mobile Robots (AMRs) in warehouses is a critical operational challenge that heavily impacts both order processing times and throughput. In this study, we address the dynamic AMR charging problem under stochastic order arrivals, where robots must learn optimal charging decisions. Traditional fixed-rule heuristics often prove suboptimal in dynamic environments and fail to account for multi-AMR coordination, leading to severe resource inefficiencies. To overcome these limitations, we propose a Proximal Policy Optimization (PPO)-based Deep Reinforcement Learning (DRL) framework designed for multi-block warehouses with fixed charging stations. Our model dynamically learns two key decisions: charging station selection and optimal charging duration, explicitly accounting for anticipated queuing times at the stations. Extensive numerical experiments benchmark the proposed model against state-of-the-art DRL and traditional heuristic approaches. Results demonstrate that our PPO framework increases order-completion rates by up to 6\% compared to the strongest baseline, while significantly reducing the total time dedicated to recharging operations. Furthermore, we validate the model's robustness across diverse warehouse configurations and stochastic arrival rates. Finally, we interpret the learned DRL policy, offering valuable operational insights into its superiority over standard benchmarks.
论文详细总结(自动生成)
论文总结:面向自主订单拣选车动态电池管理的深度强化学习
1. 核心问题与研究背景
现代大型履约中心(如 Amazon 已部署百万级机器人)依赖自主移动机器人(AMR)完成存取、搬运与拣选任务。AMR 的连续运行受限于有限的电池容量,必须周期性地前往固定(通常为感应式)充电站补能。商用磷酸铁锂电池完整充电平均需 2.7 小时,新型 KUKA KMP 1500P 从 20% 充至 80% 约需 1 小时,因此在多机器人共享有限充电站的高密度仓储环境中:
- 资源冲突:多个机器人同时充电会引发排队与瓶颈;
- 决策耦合:机器人需同时权衡取单、去充电站、回 depot 三类目标;
- 动态性:订单按 Poisson 过程随机到达,进一步放大不确定性。
传统基于固定阈值的规则启发式(如电量低于某阈值才充电)属于短视策略,无法应对随机到达与充电站拥堵。研究目标:在多区块、固定充电站、随机订单到达的仓储环境下,让 AMR 自主学习"何时去充、选哪个充电站、充多久"以及"何时回 depot"的协同决策,最大化订单完成率并降低无效充电/等待时间。
2. 方法论
2.1 问题建模为 MDP
将每个 AMR 建模为智能体 ,MDP 元组 :
- 状态 :自身状态(归一化电量、载货、到订单/各充电站/depot 的归一化欧氏距离、当前服务模式 )+ 其他 agent 的状态(电量、载货、距离、服务模式)+ 所有充电站的队列长度 。
- 动作 :离散动作空间 ,包含
go pick、go to CS_m(共 个)、stop charging、go to depot、wait in queue、keep charging、travelling。通过动作掩码 屏蔽非法动作,将有效空间约束为非平凡决策。 - 奖励 :
- 启动拣货 (用于解决稀疏订单完成信号);
- 每步机会成本 (最小化总耗时);
- 作者经验发现,过度复杂的奖励(显式考虑充电时长、队列等)反而降低样本效率与策略性能。
2.2 算法:独立 PPO(IPPO)+ 平均奖励 + 差分 GAE
关键设计一:平均奖励(Average Reward)替代折扣回报。由于仓储任务是无终止的持续任务,每个订单同等重要,折扣因子会过度削弱远期收益。作者最大化长期平均奖励:
并维护指数滑动平均基线 作为长期平均估计。
关键设计二:差分 TD 误差与 Differential GAE
回报目标 。
关键设计三:共享 Actor + 独立 Critic。所有 个智能体共享一个 actor 网络 (输入为局部观测拼接 one-hot 身份编码 ),每个智能体维护独立 critic 。这种 IPPO(Independent PPO)实现完全去中心化执行,无需联合 critic。
2.3 网络结构与 PPO 目标
共享 Actor: Action logits,隐藏层后接 ReLU + LayerNorm。非法动作 logits 置为 后 softmax。
独立 Critic:,同样三层 ReLU + LayerNorm。
Actor 损失(PPO 截断目标 + 熵正则):
其中 。熵系数 线性衰减:
Critic 损失:采用 Huber Loss (阈值 ),对大幅初始预测误差具有鲁棒性。
训练流程(Algorithm 1):每个 episode 包含 5 个阶段:Rollout 收集 → 优势计算 → Critic 更新( epochs)→ Actor 更新( epochs)→ 基线更新。所有样本扁平化后按 mini-batch 512 随机打乱,梯度 L2 范数裁剪至 0.5。
3. 实验设计
3.1 仿真环境
- 环境 E-I:4 个区块,每区 4 个过道、每过道两侧各 8 个货位; 个固定充电站;订单 Poisson 到达率 。
- 环境 E-II:6 个区块,同样过道/货位配置; 个充电站;。
- 每个智能体载货上限 ,电池 ,最小阈值 或 ,放电率 ,充电率 ,速度 。
- 训练:每个 episode 模拟 4 小时(14400 秒),共 10000 episodes;测试:8 小时仿真。
- 代码开源:https://github.com/taniya-0/dynamic-battery-drl/
3.2 基线方法
- Bischoff et al. (2026) 的 Masked PPO 框架(被改造为多区块动态订单场景):动作为离散充电电量档位( 或 ),并包含中断策略。
- DQN:经典 MARL 基线。
- CTDE PPO:集中训练分散执行的 PPO(带联合 critic)。
- FixedThreshold 启发式:固定电量上下阈值的充电策略,例如
Fixed_100_15表示上限 100、下限 15。 - HighLow 启发式:动态调整电量上限,取决于待拣货订单队列长度(剩余订单比例)。
3.3 评估指标
- 订单完成率(按 agent 和总体);
- 充电站等待时间占比;
- 每完成订单的充电耗时;
- SHAP 值与策略特征统计:用于可解释性分析。
3.4 超参数调优
使用 Optuna + TPE 采样器(贝叶斯优化)调参。关键最终值:
| 超参数 | 值 |
|---|---|
| Actor 学习率 | |
| Critic 学习率 | |
| 2 | |
| 3 | |
| 截断 | 0.208 |
| GAE | 0.98 |
| 0.0117 | |
| 0.164 |
4. 资源与算力
论文未明确披露所用 GPU 型号、数量或训练壁钟时间。训练规模信息如下:
- 每个 episode 模拟 4 小时仿真时间,共 10000 episodes;
- 测试为 8 小时仿真 × 10 episodes;
- mini-batch 大小 512;
- 全局 episode 时长 步;
- 仅有定性描述:"训练在 … 进行"。
未提供能耗、显存占用、并行数等具体硬件指标,算力透明度不足。
5. 实验数量与充分性
实验规模
- 4 种环境配置:E-I()、E-I()、E-II()、E-II();
- 8 组主对比:IPPO vs. Bischoff、DQN、CTDE PPO、Fixed(4 档)、HighLow;
- 敏感性分析:
- 训练/测试时长(4h vs 8h 训练,4/8/12/24h 测试);
- 动态到达率(基于真实 B2C 电商订单数据,按 2 小时时隙波动 12 段);
- depot 位置敏感性(移至中央验证空间不均衡假设);
- 可解释性分析:SHAP beeswarm 图 + 10 个测试 episode 的逐动作特征均值表(Table 10、11)。
公平性评价
- 优:所有方法在相同仿真器、相同订单流、相同训练步数下评估;Bischoff 基线被专门适配到多区块动态订单场景,并采用其原文最优配置;
- 优:多次运行取均值(10 测试 episode);
- 优:包含统计显著性暗示(10 episodes × 8h × 8 算法);
- 不足:未报告方差/置信区间,缺少消融实验(如共享 actor、独立 critic、动作掩码、奖励设计各自的贡献);
- 不足:仅 2 个仓库尺寸(4 与 6 区块),泛化性边界有待考察。
6. 主要结论与发现
1. 订单完成率提升:IPPO 在 4 种配置下均超过所有基线,相对于最强基线(如 Fixed_100_15)的总体完成率提升达 6%(E-I, : 76% vs 70%)。
2. 效率提升:IPPO 拥有最低的充电站等待时间占比与最低的单订单充电耗时。
3. DQN 与 CTDE PPO 表现:DQN 最弱;CTDE PPO 弱于 IPPO,表明在部分可观测环境中联合 critic 不优于 IPPO 的局部独立 critic。
4. 空间不均衡性:完成率随 agent 距离 depot 增加而下降(移至中央后趋同)。
5. 关键可解释发现(策略分析):
- 拣货:电量约 60%、载货约 6/10 时启动;偏好就近订单;
- 充电:电量降至 24%–28% 时启动,优先选最近充电站;会观察邻居电量——若相邻 agent 电量高,则自身也择机充电,反之避免同时抢占充电站;
- 停止充电:在 E-I 中呈空间不对称性(远处 agent 提前终止以节省时间);在 E-II 中倾向充至满电;
- 回 depot:在载货接近 0 时返回,最大化单次带货量。
6. 鲁棒性:训练/测试时长扩展、动态到达率下 IPPO 仍稳定优于最佳基线,仅有轻微下降。
7. 四条实践规则(论文给出):
- 引导 AMR 使用最近充电站,并合理布置以均衡覆盖;
- 充电站应优先布局在距 depot 较远的 agent 一侧;
- 当邻近或共用同一充电站的 agent 电量过低时,提前终止充电腾出资源;
- 待载货耗尽后再去 depot。
7. 优点
1. 完整的 MDP 建模:动作空间覆盖"启动/选择/终止充电 + 取单 + 回 depot"全链路决策,并通过动作掩码大幅压缩无效分支;
2. 创新的平均奖励框架:相比标准折扣 PPO,在持续任务中订单完成率从 <90% 跃升至 >95%,这是少有的实证对比(Figure 2);
3. 稳健的实现细节:Huber Loss、LayerNorm、梯度裁剪、per-agent 优势归一化、critic 多 epoch 等设计都经过深思熟虑;
4. 可解释性强:通过 SHAP + 决策时刻特征均值双视角解读学到的策略,揭示出"协同避让"等非平凡行为;
5. 基线全面:既包含最新 DRL 框架(Bischoff 2026)、DQN、CTDE PPO,也包含传统启发式,覆盖面广;
6. 动态订单到达率实验:引入真实 B2C 电商订单模式,比纯平稳到达更贴近实际;
7. 开源代码:提高可复现性。
8. 不足与局限
1. 算力披露缺失:未报告 GPU 型号、数量、训练壁钟时间,难以评估实际部署成本;
2. 缺乏消融实验:未单独剥离"平均奖励 vs 折扣回报"、"共享 actor vs 独立 actor"、"动作掩码"、"奖励塑形"等关键设计对最终性能的贡献;
3. 方差未量化:所有结果均未给出标准差或置信区间,难以判断统计显著性;
4. 场景受限:
- 仅 2 种仓库尺寸(4/6 区块)、固定拓扑;
- 假设碰撞规避由外部保证(collision-free),未集成路径规划;
- 订单遵循 FIFO,无批次拣选(Batching);
- 电池放电率为常数,未建模载荷相关的能耗(作者在结论中也已承认);
5. 充电站数固定:,未考虑充电站数量变化或移动充电方案;
6. IPPO 的部分可观测局限:理论上 IPPO 缺乏集中 critic 的全局协调能力,但在本任务中表现优于 CTDE PPO,作者未深入分析原因;
7. 敏感性分析覆盖面较窄:仅做了训练时长、动态到达率、depot 位置三种扰动,未对 、、 等关键环境参数进行系统扫描;
8. 应用限制:模型在仿真中验证,距离实际仓储部署尚需考虑通信延迟、硬件故障、安全约束等现实因素。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。


