机制转换跳跃扩散过程中零和随机微分博弈的熵正则化强化学习
Entropy Regularized Reinforcement Learning for Zero-Sum Stochastic Differential Games in a Regime-Switching Jump-Diffusion Process
📝 TLDR
传统随机微分博弈框架在面对参数误设与突发结构性环境变化时存在局限。本文提出分布控制方法,将均衡策略刻画为关于动作的条件概率分布,构建熵正则化零和博弈的强化学习框架。利用动态规划原理推导耦合的Hamilton-Jacobi-Bellman-Isaacs方程组,在线性二次情形下通过ODE系统获得半解析解,一般情形下设计Actor-Critic策略改进算法。通过投资博弈数值实验验证了温度参数与制度切换对最优策略和价值函数的影响。
🧭 速览
传统随机微分博弈框架难以应对参数误设和制度状态突发的结构性环境变化,亟需更具鲁棒性的均衡建模与求解方法。
提出熵正则化分布控制策略,由动态规划原理推导耦合HJBI方程组,并在线性二次情形下联立ODE求半解析解,在一般情形下设计Actor-Critic策略改进算法。
线性二次问题获得值函数与均衡策略的半解析解,一般情形算法可近似各制度下的值函数与均衡策略,数值实验揭示温度参数与制度切换对策略及价值的影响规律。
为含制度切换的跳扩散零和博弈提供了融合强化学习的均衡求解框架,提升了对参数不确定性与结构性突变的适应能力。
📊 论文图表(共 6 张)
展开查看 6 张图
TL;DR
这篇论文针对传统零和随机微分博弈在面对参数不确定性(如模型误设)和突发环境结构性变化时的脆弱性,提出了一种分布控制方法——将博弈中的最优策略从确定性的动作映射推广为以状态、机制和参数为条件的概率分布。结合[[熵正则化]]技术,构建了一套在[[机制转换跳跃扩散过程]]下的强化学习框架。对于线性二次特殊情形,论文通过求解耦合的[[Hamilton-Jacobi-Bellman-Isaacs方程]]组获得了值函数与均衡策略的半解析表达式;对于一般非线性情形,则设计了[[Actor-Critic]]策略改进算法。投资博弈的数值实验表明,温度参数和制度切换均对最优策略与均衡价值产生了显著且可量化的影响。
研究背景与动机
在现代金融工程与经济博弈论中,[[随机微分博弈]]是描述多个决策者(参与者)在不确定性环境下进行动态竞争与合作的核心理论框架。无论是期权定价、供应链管理,还是资产配置与风险管理,都可以建模为零和或非零和的随机微分博弈问题。然而,传统框架存在一个根本性的脆弱性:对系统动力学模型的参数假设过于刚性。在现实应用中,宏观经济政策突变、信用评级的骤然调整、或者市场流动性的突然枯竭,都可能导致模型参数发生不可预知的变化——这在学术上被称为参数误设(parameter misspecification)。当这种误设发生时,基于错误模型计算出的“最优”策略在实际执行中可能表现极差。
另一个挑战来自环境的结构性变化,即所谓的“制度切换”(regime switching)。例如,金融市场可能在低波动状态与高波动状态之间切换,或者实体经济可能在增长期与衰退期之间轮回。这种切换往往伴随跳跃现象——股价可能在极短时间内出现大幅跳空,汇率可能在政策宣布后瞬间重定价。经典的连续扩散过程(如几何布朗运动)无法捕捉这类现象,因此研究者引入[[跳跃扩散过程]]来更真实地建模资产价格的尖峰厚尾特征。同时,机制转换模型(Regime-Switching Model)则专门用于描述离散状态之间的结构性切换。当跳跃与机制转换结合在一起,就形成了机制转换跳跃扩散过程——这是论文所处理的核心系统动力学。
正是在这一背景下,论文提出一个关键问题:能否设计一种分布控制(distributional control)方法,使得均衡策略不再依赖于对参数的精确假设,而是以一种概率分布的形式自适应地覆盖各种可能的参数情形?这种思路本质上将鲁棒性内嵌于策略设计之中——即便参数在一定范围内波动甚至完全误设,基于分布的策略也能在整体上保持较好的表现。引入[[熵正则化]]则进一步确保了分布的光滑性:温度参数控制着策略在概率意义上偏离确定性子集的程度,为探索与利用之间的权衡提供了理论基础。
方法
论文方法论的核心创新在于将最优策略建模为概率分布。在经典随机控制中,给定状态 和机制 ,控制器的最优动作是一个确定性的数值或函数 。而在分布控制框架下,策略被重新定义为以状态、机制和参数 为条件的动作分布 。这意味着,对于同一个状态,智能体可能以不同的概率执行不同的动作——这本身就构成了对参数不确定性的自然表达:如果参数 是未知的或可变的,那么条件分布 的混合就代表了在所有可能参数情形下的“期望最优”行为。
在此基础上,论文构造了熵正则化零和随机微分博弈的目标泛函。设值为函数 表示博弈进行到时刻 、系统状态为 、当前机制为 时,参与者面临的均衡价值。熵正则化的引入为价值函数添加了一项关于策略分布的熵的惩罚:
其中 是温度参数, 是折扣因子, 是即时报酬函数,而 通常取为某个基准分布(可以理解为无参数误设时的先验策略)。当 时,熵惩罚项的权重趋于零,分布退化为确定性策略;当 时,策略趋向于完全随机。温度参数因此成为控制策略保守程度的关键旋钮——较小的 产生更集中、更激进的策略,而较大的 则产生更平滑、更保守的策略。
利用动态规划原理(DPP),论文推导了两人零和博弈下的耦合[[Hamilton-Jacobi-Bellman-Isaacs方程]]组。对于玩家一(最大化方)和玩家二(最小化方),价值函数需要分别满足各自的 HJB 方程,而均衡条件要求这两个方程在同一点处同时成立,从而形成耦合的 HJBI 方程组。在跳跃扩散和机制转换的情形下,方程不仅包含常规的微分算子(漂移项、扩散项的二阶偏导),还包含对跳跃幅度进行积分的项以及对离散机制状态进行求和的项。这种数学结构使得方程的求解变得极为困难。
论文最重要的理论贡献在于证明了在均衡状态下,最优策略可以通过价值函数的梯度来表达。对于玩家一:
其中 是动作-值函数(Q-function), 表示对动作的梯度。这一表达式的含义是:最优动作分布正比于基准分布与一个指数权重项的乘积,而该权重取决于在当前动作下对长期价值的边际影响。这种形式与[[最大熵强化学习]]中的策略表达式高度一致,但被推广到了博弈论和带有跳跃的连续时间情形。
在线性二次(LQ)特殊情形下,论文通过假设值函数具有二次形式,成功将偏微分方程组的求解降维为一套耦合常微分方程(ODE)系统的求解。设值函数为 ,其中 是与机制 相关的对称矩阵, 是标量偏移项。将这一形式代入 HJBI 方程后,利用二次函数的微分性质和期望的线性性质,可以得到一组矩阵Riccati型常微分方程。这组方程虽然在不同机制之间相互耦合(因为机制切换时 会被替换为 ),但其本质仍然是 ODE,从而可以借助数值线性代数的标准工具求解,理论上保证了解的存在性与唯一性。
对于一般非线性情形,论文转向强化学习方法,设计了一套[[Actor-Critic]]策略改进算法。该算法在每个机制下同时维护两个近似器:Critic 网络近似值函数 ,Actor 网络近似策略分布 。Critic 的更新遵循时间差分(TD)学习的思路,利用从环境中采样的轨迹数据最小化值函数预测误差;Actor 的更新则基于前述梯度表达式,利用策略梯度定理驱动参数向更高价值的方向移动。机制切换被视为环境的固有随机性——当观测到机制发生切换时,算法切换到对应机制的子网络继续学习,从而实现跨机制的迁移。
实验与结果
论文通过一个投资博弈的数值算例来验证所提方法的有效性。设定中有两个参与者(投资者),各自持有资本存量,在不确定的市场环境中进行竞争性投资决策。市场的瞬时回报率受到跳跃事件(对应突发利好或利空消息)的驱动,且市场在“繁荣”与“衰退”两种机制之间切换,切换强度本身也具有随机性。
实验首先考察了温度参数 的影响。结果显示,随着 的增大(即策略变得更加分散),均衡投资的波动性显著降低——这符合直觉,因为较大的 惩罚了策略分布偏离先验的程度,迫使玩家采取更保守的行动。有趣的是,价值函数的敏感度分析表明,存在一个最优的 区间,使得在最坏参数情形下的鲁棒价值达到最大:过小的 导致策略过于激进,在参数误设时损失惨重;过大的 则使策略过于平滑,错失了利用有利市场条件的机会。
其次,实验揭示了机制切换频率对均衡策略的深刻影响。当切换频繁时(即“制度动荡”程度较高),两个参与者的最优策略趋于收敛——无论参数如何,最优投资率都向某个中间值靠拢。这是因为频繁的切换意味着任何极端策略都可能在某个制度下遭受巨大损失,理性的玩家会选择在时间平均意义上更安全的折中方案。而当切换稀少时(即“制度稳定”),玩家可以根据当前制度调整策略,策略的异质性显著增强。
讨论与可借鉴点
这篇论文在理论上将分布控制、熵正则化、强化学习三大工具整合进了[[随机微分博弈]]的框架,在实践上为处理参数不确定性和环境结构变化的决策问题提供了一套可行的方法论。其最深刻的启发在于:策略不是点估计,而是分布。这种观念转变与贝叶斯强化学习中的后验策略分布、鲁棒控制中的最坏情形优化一脉相承,共同指向一个更符合现实的原则——在不确定性环境下,拥抱随机性本身就是一种理性。
然而,论文也存在若干局限。首先,Actor-Critic 算法在连续动作空间、高维状态空间下的收敛性缺乏理论保证,数值实验中仅测试了低维设定。其次,耦合 HJBI 方程的存在性与唯一性条件较为严格,要求系统动力学和报酬函数满足一定的正则性假设。第三,论文没有讨论机制切换的外生性假设与内生性假设的区别——在现实中,切换可能依赖于状态变量本身(如市场下跌触发政策切换),这将使数学分析更加复杂。
未来方向上,可以探索将这一框架推广到**非零和博弈]]或[[合作博弈]]设定,以及研究在深度神经网络作为函数近似器时的收敛性质。此外,跳跃与机制切换的组合在金融、能源和气候模型中均有广泛应用,将论文的框架与这些实际问题对接将是值得关注的研究路径。
摘要
为了应对传统随机微分博弈(SDG)框架中的参数误设和突发的结构性环境变化,本文引入了一种分布式控制方法,将最优策略表征为以连续状态、离散机制状态和参数为条件的、关于动作的概率分布。这在机制转换跳跃扩散过程中构建了一个熵正则化零和随机微分博弈(ERRL-ZSSDGs)的强化学习框架。利用动态规划原理(DPP),我们推导了相应的耦合 Hamilton-Jacobi-Bellman-Isaacs(HJBI)方程组,并由此通过值函数的梯度表达均衡策略。对于线性二次问题,通过求解耦合常微分方程(ODE)组,可获得值函数与均衡策略的半解析解。在更一般的设定下,我们开发了一种 Actor-Critic 策略改进算法,以近似不同机制下的值函数与均衡策略。该方法被应用于一个投资博弈,数值算例展示了温度参数与机制转换对最优策略及值的影响。
Abstract
To address parameter misspecification and sudden structural environmental changes in conventional stochastic differential game (SDG) frameworks, this paper introduces a distributional control approach that characterizes optimal strategies as probability distributions over actions, conditioned on the continuous state, the discrete regime state, and parameters. This forms a reinforcement learning framework for entropy-regularized zero-sum stochastic differential games (ERRL-ZSSDGs) in a regime-switching jump-diffusion process. Using the dynamic programming principle (DPP), we derive the associated coupled systems of Hamilton-Jacobi-Bellman-Isaacs (HJBI) equations, from which equilibrium strategies are expressed via gradients of the value function. For linear-quadratic problems, semi-analytical solutions for both value function and equilibrium strategies are obtained by solving a system of coupled ordinary differential equations (ODEs). In more general settings, an Actor-Critic policy improvement algorithm is developed to approximate the value functions and equilibrium policies across different regimes. The method is applied to an investment game, and numerical examples illustrate the effect of the temperature parameter and regime transitions on optimal policies and values.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





