基于确定性策略的扩展均值场控制Actor-Critic学习
Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies
📝 TLDR
提出基于确定性策略的Actor-Critic算法用于扩展均值场控制问题,扩展大规模多智能体建模。
🧭 速览
连续时间广义均值场控制中动力学与奖励依赖状态-动作联合分布,现有无模型强化学习方法存在关键局限。
采用确定性反馈策略避免随机核优化,推导测度依赖的McKean-Vlasov灵敏度公式及Wasserstein空间策略梯度,提出粒子近似与测度依赖网络结合的连续时间DDPG算法。
在随机Cucker-Smale共识控制与含交易拥挤的最优清算实验中,该算法展现出高效性、稳定性和鲁棒性。
该工作突破了广义均值场无模型强化学习的关键瓶颈,为分布依赖控制问题提供了系统化的解决方案。
📊 论文图表(共 4 张)
展开查看 4 张图
TL;DR
本文为连续时间扩展均值场控制问题提出了一种无模型强化学习框架,通过引入确定性反馈策略避免了对随机核的优化,并利用 Wasserstein 空间上的优势率函数推导出包含测度导数项的策略梯度公式,最终形成一套融合粒子逼近、测度依赖神经网络和时序差分学习的连续时间深度确定性策略梯度算法。在 Cucker-Smale 一致性控制和交易拥挤下的最优清算问题上的实验验证了该方法的有效性与稳定性。
研究背景与动机
大规模多智能体系统的控制在现实中无处不在——从无人机编队、金融市场中的交易行为,到人群疏散与交通流量优化。这类问题的核心困难在于:当智能体数量庞大时,精确建模每个智能体的状态与交互会产生指数级增长的计算成本。[[均值场博弈]]理论为此提供了一个优雅的解决思路:它将无限多个智能体的极限情形作为近似,通过单个智能体与"均值场"(即总体分布)的交互来刻画系统行为,使得原本难以处理的全局优化问题被转化为可计算的局部问题。
然而,经典均值场控制框架存在一个关键假设——动力学和奖励函数通常只依赖于状态分布本身,而不依赖于控制分布。但在许多实际场景中,这个假设过于简化。以金融市场为例,交易行为本身会影响价格变动,而拥挤的交易活动(大量智能体采取相似策略)会产生额外的市场冲击;再如多机器人协调场景,机器人之间的碰撞避免不仅与位置分布有关,还与彼此的运动策略分布密切相关。这些问题属于[[扩展均值场控制]](extended mean field control)的范畴,其中控制分布对系统动力学和收益函数都有显式影响。
扩展均值场控制的核心挑战在于双重复杂性:既要优化控制分布这一无穷维对象,又要在缺乏显式模型的情况下学习系统动态。已有的研究要么依赖于精确的系统模型,要么在处理控制分布时引入过强的假设,导致方法在实际应用中存在局限。本文的核心动机正是要突破这些局限,提出一套完全无模型、且能高效处理控制分布依赖的强化学习方法。
方法
该工作的方法论起点是对策略形式的选择。作者采用确定性反馈策略,即控制律直接表达为状态和时间的函数:,其中 是待学习的参数化策略。在这种策略下,智能体的状态-动作分布实际上是状态分布沿确定性映射的推前映射(push-forward)。这一选择看似自然,实则蕴含深意——它巧妙地绕开了对随机核(stochastic kernel)的直接优化,这是此前许多方法难以逾越的计算障碍。
在动力学层面,作者考虑参数化的 McKean-Vlasov 方程:
其中 和 分别表示状态分布和控制分布。这个方程将个体行为与总体分布耦合,是均值场理论的标准框架。关键的第一步是建立无模型的灵敏度公式——即系统状态如何对策略参数 求导。这个灵敏度分析在有限维最优控制中是个标准工具,但将其推广到分布依赖的动力学系统需要细致处理测度空间上的微分结构。作者利用 Wasserstein 空间的几何结构,获得了参数变化的分布响应。
基于灵敏度分析,作者推导出策略梯度公式。这里的核心创新是引入 Wasserstein 空间上的[[优势率函数]](advantage-rate function)。不同于标准强化学习中在离散状态空间定义的 advantage,优势率函数 捕捉的是在给定局部状态 、动作 和当前分布 下,采取该动作相对于"平均最优"动作的相对优势。这一概念的引入使得策略梯度可以表达为分布空间上的泛函导数:
为了进一步精确化梯度估计,作者引入了局部值函数 和 的概念。这些局部函数依赖于当前状态、动作以及联合状态-动作分布,从而能够提供更细粒度的梯度信息。关键的洞察是,策略梯度最终包含两类导数项:一是关于动作的常规梯度 (这在标准 Actor-Critic 框架中很常见),二是关于控制分布的测度导数项 (这来自分布对奖励和动力学的显式依赖)。测度导数的引入是一个理论上的突破,它允许算法直接利用控制分布的信息来调整策略。
这些分析最终汇聚为一条基于[[鞅]](martingale)的学习原理。直觉上,值函数与优势函数的时变满足一个特定的 martingale 性质,类比于强化学习中 TD 误差的零期望特性。这一原理不仅在理论上优美,还具有直接的算法含义:它为时序差分学习提供了坚实的理论基础,使得我们可以在连续时间设定下设计稳定的学习规则。
在算法实现层面,作者提出的连续时间深度确定性策略梯度算法包含几个关键技术模块。首先是粒子逼近(particle approximation):用有限样本模拟来近似连续分布,这在大规模多智能体系统中是标准的降维技巧。其次是测度依赖的神经网络——网络不仅输入当前状态,还输入当前状态分布和控制分布的某种低维统计量(如均值、方差等)。时序差分学习则用于在线更新值函数估计,而探索机制可以在动作空间或参数空间中注入噪声以确保充分采样。
实验与结果
作者在两类典型问题上验证了算法的有效性。
第一类是随机 Cucker-Smale 一致性控制问题,这是多智能体编队控制中的经典模型。经典 Cucker-Smale 模型描述了一群智能体如何通过局部通信协议达成速度一致。作者在这里加入了两层扩展:一是引入随机扰动模拟真实环境中的不确定性,二是使控制策略可以依赖于控制分布来调整通信强度——当多数智能体采取协作策略时,增强通信耦合;当策略分散时,降低耦合以避免过度敏感。实验结果表明,所提算法能够快速收敛到稳定的一致性状态,且在分布依赖奖励的设定下表现出对拥挤度变化的良好适应。
第二类实验关注带有交易拥挤的最优清算问题,这是量化金融中的核心问题之一。交易员的清算策略不仅影响自身的执行成本,还通过市场影响改变价格动态。特别地,当大量交易者同时采取相似的激进清算策略时,会造成显著的市场冲击。作者将这一问题建模为扩展均值场控制,其中交易员的收益同时依赖于自身持仓、当前价格以及总体清算策略的分布。实验结果显示,相比于忽略分布依赖的基准方法,该算法能够识别出"拥挤效应"——即当市场整体流动性不足时,适当降低清算速度反而能获得更好的风险调整收益。这一发现具有重要的实践意义。
消融实验进一步揭示了各模块的贡献。移除测度导数项(只保留常规策略梯度)会导致在分布敏感问题上的性能显著下降;缺少粒子逼近而直接使用参数化分布假设会引入过强的模型偏差;时序差分学习相比纯蒙特卡洛估计具有更低的方差和更快的收敛速度。
讨论与可借鉴点
这项工作的理论贡献在于为扩展均值场控制提供了一套完整的无模型学习框架,特别是测度导数项的引入填补了此前研究中的空白。它将连续时间[[Actor-Critic]]算法的设计建立在严格的 martingale 原理之上,为算法的收敛性分析奠定了基础。
然而,也有若干值得注意的局限。首先,测度导数的计算需要额外的函数逼近器,如何设计高效的估计器仍是个开放问题;其次,Wasserstein 空间上的灵敏度分析对分布的光滑性有假设,在分布具有奇异支撑(如有限支撑点集)时可能需要额外的正则化处理;最后,实验规模虽已远超小规模测试,但仍主要在相对规则的模拟环境中验证,在真正高维或异构的大规模系统中表现如何有待进一步探索。
对于 [[强化学习]] 和多智能体系统领域的研究者而言,这项工作提供了一个重要启示:分布依赖是连接微观个体决策与宏观系统涌现行为的桥梁。未来的研究方向可能包括:非确定性策略的扩展、分布式实现与通信效率的权衡、以及在更复杂市场或物理系统中的应用验证。
摘要
本文针对连续时间扩展均值场控制问题,提出了一种无模型强化学习框架,其中动力学与奖励均可依赖于状态与控制的联合分布。我们采用确定性反馈策略,在该策略下,状态-动作分布直接由状态律的推前映射所诱导产生。这避免了针对随机核的优化,并绕开了现有方法在扩展均值场设定中的若干关键局限。我们首先针对参数化McKean–Vlasov动力学建立了一个无模型的灵敏度公式,并据此推导出一个通过Wasserstein空间上的优势率函数表达的确定性策略梯度公式。随后,我们引入依赖于状态、动作以及状态-动作联合分布的局部值函数与优势率表示,从而对该公式加以精细化,得到的策略梯度既包含关于动作的导数项,也包含关于控制分布的测度导数项。这些刻画引出了一条基于鞅的学习原理,并启发了一种连续时间深度确定性策略梯度算法,该算法融合了粒子逼近、依赖于测度的神经网络、时序差分学习以及在动作空间或参数空间中的探索。在随机Cucker–Smale一致性控制以及带有交易拥挤的最优清算问题上的数值实验表明,所提方法在效率、稳定性与鲁棒性方面均表现良好,其中包括那些对控制分布具有显式依赖的问题。
Abstract
This paper develops a model-free reinforcement learning framework for continuous-time extended mean field control problems, where both the dynamics and reward may depend on the joint distribution of states and controls. We adopt deterministic feedback policies, un-der which the state–action distribution is induced directly as a push-forward of the state law. This avoids optimization over stochastic kernels and bypasses key limitations of existing ap-proaches in extended mean field settings. We first establish a model-free sensitivity formula for parameterized McKean–Vlasov dy-namics and use it to derive a deterministic policy gradient formula expressed through an advantage-rate function on the Wasserstein space. We then refine this formula by introduc-ing local value and advantage-rate representations that depend on the state, action, and joint state–action distribution, yielding a policy gradient that includes both action derivatives and measure-derivative terms with respect to the control distribution. These characterizations lead to a martingale-based learning principle and motivate a continuous-time deep deterministic policy-gradient algorithm combining particle approximations, measure-dependent neural net-works, temporal-difference learning, and exploration in either action or parameter space. Numerical experiments on stochastic Cucker–Smale consensus control and optimal liquida-tion with trade crowding demonstrate the efficiency, stability, and robustness of the proposed method, including problems with explicit dependence on the control distribution.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。



