arXiv 2607.17316v1 · 发布 2026-07-19

为 Boltzmann 合理性提供理论基础:熵正则化策略的公理化表征

Rationalizing Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies

AUTHORS Silviu Pitis
EVIDENCE 强化学习中熵正则化策略的公理化理论分析
SCORE 0.9
GENERATED 2026-07-21 22:04:10 UTC

📝 TLDR

在强化学习中,softmax策略虽被广泛使用却缺乏第一性原理推导,且其熵正则项与MDP的独立性公理相冲突。本文通过区分'机遇'与'选择'两类随机性,将VNM独立性限定于环境彩票,施加IIA与单调性后唯一确定Boltzmann策略、熵正则化与软Bellman方程。进一步将软/硬Bellman选择归结为是否让智能体珍视自身选择能力的设计决策,给出回报单调性与广义折扣收敛等RL推论,融合经济学与信息论两条思路。

🧭 速览

动机

softmax策略在RL中虽有鲁棒性等启发式辩护,但缺乏公理化推导,熵正则化与MDP独立性公理存在张力。

方法

区分环境'机遇'与智能体'选择'两类随机性,将VNM独立性限于环境彩票,在选择节点施加IIA与单调性公理。

结果

唯一推出Boltzmann策略、熵正则化表示与软Bellman方程,并获得回报单调性与广义折扣收敛性。

结论

软/硬Bellman的选择本质是设计决策,即是否让智能体珍视自身的选择能力。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

这篇论文为强化学习中广泛使用的 Boltzmann 策略(即 softmax)提供了首个完整的第一性原理推导。通过将 MDP 中的随机性区分为"机遇"(环境状态转移)与"选择"(智能体决策),论文证明:只要对选择节点施加无关选项独立性(IIA)和单调性这两条公理,就能唯一确定 Boltzmann 策略形式、熵正则化表示和软 Bellman 方程。这一结果表明,软/硬 Bellman 的选择本质上是一个设计决策——智能体是否重视自身的选择能力。

研究背景与动机

在强化学习的几乎所有主流算法中,softmax 策略 都是随机选择的默认模型。无论是软策略梯度方法、SAC 还是各种最大熵强化学习变体,都依赖这一形式。然而,现有的各种辩护——从鲁棒性角度、从探索角度、从"控制即推断"框架——都无法从第一性原理唯一推导出 softmax 形式本身。

更深的矛盾在于软 Bellman 方程中的熵正则项。软 Bellman 方程将价值函数定义为 ,这意味着 ,即熵奖励严格超过线性聚合值。这一形式违反了 VNM 独立性公理——而 VNM 独立性恰恰是支撑 MDP 奖励结构的基石。结果是:当我们向动作集合中添加一个新动作时,智能体的价值函数可能反而下降,这与直觉相悖,也与 MDP 的独立性假设相冲突。

这产生了一个根本张力:我们知道熵正则化在实践中效果拔群,但其在规范性层面是否合理?如果熵奖励与 MDP 的基础公理相矛盾,我们是否有理由继续使用它?

方法

论文的核心理论创新在于区分两类随机性:机遇(chance)与选择(choice)。在 MDP 中,环境的状态转移是机遇节点——结果由环境强制施加,不受智能体控制,因此 VNM 独立性对这类"环境彩票"仍然适用。而智能体做出决策的选择节点则不同——智能体拥有真正的"选项",其价值高于任何固定彩票。这一区分最初来自经济学中 Kreps 对 flexibility preference 的讨论,论文将其精准落地到强化学习的语境。

基于这一区分,论文对两类节点施加不同的公理体系。在基本前景(即由确定性策略组成、所有随机性来自环境转移的结构)上,保留 VNM 期望效用和动态一致性,推出广义 Bellman 关系。而在选择节点上,论文引入两条新公理:IIA 和单调性。

IIA 的含义是:两个动作的选择概率比值只取决于它们自身的价值差异,与其他动作无关。具体而言,策略 IIA 要求 仅依赖于 ;价值 IIA 则要求每个动作对菜单价值的贡献仅依赖于该动作与"去除该动作后的菜单"之间的价值差。单调性公理则要求:如果动作 的 Q 值严格高于动作 ,那么选择 的概率也应严格高于选择 的概率。

论文的主要定理证明:在一类有限 MDP 中(折扣因子满足 ,且动作数 ),上述公理同时成立,当且仅当存在某个温度参数 ,使得 softmax 策略、熵正则化表示和软 Bellman 方程同时成立。

证明分三步完成。第一步由策略 IIA 得到 ;利用 时的比值一致性迫使 满足乘性 Cauchy 方程 ;结合严格单调性即得 第二步由价值 IIA 建立函数方程,通过一系列精细的极值论证和对称性分析,最终推导出价值函数必须具有 的形式,其中 LSE 是对数求和指数函数。第三步将这一价值表示代入 Bellman 关系,闭合得到唯一的软 Bellman 不动点。

这一证明的关键洞见在于:从 IIA 和单调性出发,熵正则化不是被预设的加性结构,而是作为唯一可能解被推导出来。这与之前 Fudenberg 等人的静态推导形成对照——论文填补了"动态 MDP + Bellman 递归"这一空白。

实验与结果

作为一篇公理化理论论文,本文的核心"实验"是检验公理的边界条件。论文选取了 Tsallis 熵族 作为检验对象——这一族包含 Shannon 熵()和 sparsemax()等常见变体。

实验设计如下:对每个 Tsallis 参数 ,随机采样 Q 值(固定两个动作的 Q 值分别为 1 和 0,其余动作的 Q 值从均匀分布采样),计算在 Boltzmann 温度 的标准差作为 IIA 违反程度的度量。结果显示,仅在 Shannon 熵对应的 处,IIA 违反量为零——这与定理的预测完全一致。

论文还提供了两张对照表。第一张比较了 Boltzmann、-greedy、Thompson sampling、Mellowmax、Tsallis/sparsemax 等策略在策略 IIA、单调性、全支撑和附加扰动效用(APU)上的满足情况。第二张则跨学科梳理了六条独立推导路径:经济学中的 Luce axiom、随机效用模型、最大熵方法、合理不关注(plausible indifference)、扰动效用,以及计量经济学中的 Rust 方法。这些路径从不同领域独立出发,却殊途同归至 Boltzmann 结构,成为该形式结构性重要性的有力证据。

此外,论文还推导了几个 RL 特有的结论。回报单调性表明:实际(未正则化)的累积回报 关于温度 单调非降,这意味着更强的探索倾向不会损害真实性能。离散阈值则揭示了一个反直觉现象:当存在放大动作()且温度过低时,软 Bellman 算子会位于恒等映射之上,导致不存在有限不动点——此时熵正则化反而阻碍收敛。

讨论与可借鉴点

这篇论文最重要的贡献或许不是技术细节,而是提供了一个概念框架来思考为什么软 Bellman 是合理的。硬/软 Bellman 的选择并非事实问题,而是设计决策:你是希望智能体珍视自己的选择能力(因此愿意为保持选项付出熵代价),还是只关心最终 outcome?这将哲学问题转化为工程问题。

论文的局限同样值得注意。定理要求 ,这意味着在二元偏好(如 RLHF 中的 pairwise 比较)中,IIA 不再唯一确定指数形式——这解释了为什么在某些离散选择场景下其他策略形式也站得住脚。论文也没有给出温度参数 的确定方法,这部分留给了实践者根据任务特性来调整。

对于实践者而言,论文提供了一个可操作的 IIA 检验:加入或删除动作时, 是否保持不变? 如果答案是否定的(比如 LLM 生成中大量近义改写导致概率高度冗余),那么标准的 softmax 可能不是最佳选择,nested logit 等结构更合适。论文还指出了一个实用洞见:在 RLHF 中,KL 系数与奖励尺度的乘积 才是真正独立的量,同时调节两者存在冗余。

从更广阔的视角看,这篇论文是跨学科汇流的典范:经济学中从 Luce 到 McFadden 的选择理论、信息论中 Shore-Johnson 的最大熵公理、以及 RL 社区独立发展的软策略方法,三条路径在 Boltzmann 形式处交汇。这种汇流不是巧合,而是反映了该结构在规范性层面的坚实基础。

摘要

softmax 策略 是强化学习(RL)中随机选择的默认模型。RL 文献中已从鲁棒性、探索和优化等角度给出了多种解释,但均未能从第一性原理唯一推导出 softmax 形式。这留下了一个尚未解决的根本矛盾:软贝尔曼方程中的熵奖励项违反了支撑马尔可夫决策过程(MDP)奖励结构的独立性公理。我们通过区分两种随机性——机遇与选择——来化解这一矛盾。通过将冯·诺依曼–摩根斯坦(VNM)独立性限制于基本前景上的环境抽奖,我们证明:在选择节点上对策略和价值函数施加无关选项独立性(IIA)与单调性,可唯一确定 Boltzmann 策略、熵正则化表示以及软贝尔曼方程。因此,软贝尔曼方程与硬贝尔曼方程之间的选择归结为一个设计层面的决策:智能体是否重视其自身的选择能力。我们进一步推导了 RL 特有的若干结论,包括回报单调性以及在广义折扣下的收敛性,并综合了经济学与信息论中独立发展却殊途同归的研究路线,对何时适合在智能体设计中采用 IIA 给出了规范性评估。

Abstract

The softmax policy is the default model of stochastic choice in reinforcement learning (RL). Various justifications based on robustness, exploration, and optimization have been offered in the RL literature, but none uniquely derives the softmax form from first principles. This leaves a basic tension unresolved: the entropy bonus in the soft Bellman equation violates the Independence axiom that underwrites the Markov decision process (MDP) reward structure. We dissolve this tension by distinguishing two kinds of randomness: chance and choice. By restricting von Neumann-Morgenstern (VNM) Independence to environmental lotteries over base prospects, we show that imposing independence of irrelevant alternatives (IIA) and monotonicity on the policy and value functions at choice nodes uniquely determines the Boltzmann policy, the entropy-regularized representation, and the soft Bellman equation. The choice between the soft and hard Bellman equations thus reduces to a design decision: whether the agent values its own ability to choose. We develop RL-specific consequences, including return monotonicity and convergence under generalized discounting, and synthesize the independent lines from economics and information theory that arrive at the same structure, offering a normative assessment of when IIA is appropriate for agent design.


论文详细总结(自动生成)

论文总结:为 Boltzmann 合理性提供理论基础

1. 核心问题与研究动机

强化学习(RL)领域普遍采用 softmax(玻尔兹曼)策略 作为默认随机选择模型,但其使用长期缺乏来自第一性原理的公理化推导。现有辩护(如平移不变性、鲁棒性、控制即推断框架)均无法唯一导出 softmax 形式本身。

更深层的张力在于:软 Bellman 方程中的熵正则项 严格超过复合彩票约简(CLR)所给的线性聚合值 ,从而违反 VNM 独立性公理——而后者正是支撑 MDP 奖励结构的基石。这导致一个根本矛盾:当向选择集中加入新动作时,智能体价值可能下降。本文的核心问题是:能否在期望效用理论框架内,为 softmax 策略与熵奖励项提供一个规范性(normative)的公理化基础?

2. 方法论:核心思想与关键技术细节

2.1 核心建模创新:区分"机遇"与"选择"

论文将 MDP 中的随机性解耦为两类节点:

  • 机遇节点(chance node,环境状态转移):结果由环境强制施加,独立性原则适用(满足 CLR)。
  • 选择节点(choice node,决策点):智能体拥有真正"选项",其价值高于任何固定彩票(Kreps 1979)。

形式化:限制 VNM 独立性于"基本前景"(base prospects)。一个基本前景 由确定性策略 组成,其所有随机性来源于环境转移 。基本前景上的环境彩票仍受 VNM 公理约束;而选择节点上的随机化由新的 IIA 与单调性公理治理。

2.2 四条公理(Axiom 1–4)

  • 公理 1(VNM 期望效用)+ 公理 2(动态一致性 DC):在基本前景上推出广义 Bellman 关系 (其中 ,但仅对确定性后续策略确定)。
  • 公理 3(IIA)
  • (a) 策略 IIA: 仅依赖于
  • (b) 价值 IIA: 仅依赖于
  • 公理 4(单调性):(a) 策略单调性:;(b) 价值单调性:每个选项不劣于即不降低菜单价值。

2.3 主定理(Theorem 3.1:Boltzmann 表示定理)

在有限 MDP()下,上述公理同时成立,当且仅当存在 使:

2.4 三步证明的关键技术

  • Step 1(推导 softmax 策略):由策略 IIA 得 时比值一致性迫使 ,即 Cauchy 乘性方程;结合严格单调性得 )。
  • Step 2(推导熵表示):由价值 IIA 写 ;两动作情形给出函数方程 ;三动作情形给出更复杂的对称方程。定义 后,方程 (3) 成为 的自反方程。极值论证与 联合排除非常数解,最终得 ,从而 ,累加即得
  • Step 3(闭合 Bellman 方程):将 代入 Bellman 关系 ,得唯一解 ,由引理 3.3 保证为 -压缩。

2.5 等价公理化路径

  • 路径 1(边际一致性) 与价值 IIA + 单调性等价。
  • 路径 2(附加扰动效用 APU):Fudenberg–Iijima–Strzalecki (2015) 的 APU 形式配合公理 1, 2, 4 推出同一 Shannon 熵正则项

3. 实验设计与对照

本文为公理化理论性论文,未在传统数据集/基准上做实证。三类"检验性"内容:

  • 数值示例(Section 4.3):在 Tsallis 熵族 (含 Shannon 与 sparsemax )上采样 Q 值(,其余 500 次采样自 ),衡量在 的标准差作为 IIA 违反量。结果:仅 处违反量为零。
  • 对照表:表 1 比较 Boltzmann、-greedy、Thompson sampling、Mellowmax、Tsallis/sparsemax 在策略 IIA、单调性、全支撑与 APU 上的满足情况;表 2 跨学科梳理 Luce、Yellott、Shore–Johnson、McFadden、Fudenberg、Haarnoja、Rust、Auer 等独立推导路径。
  • 手动示例:用一个三动作 Thompson sampling 反例说明 IIA 失效: 菜单下 下的 3 变为 2。

未引用:未出现 ImageNet、Atari、MuJoCo、text 偏好数据集等通用基准,亦未训练神经网络策略。

4. 资源与算力

论文未报告任何 GPU 型号、数量、训练时长或计算资源。整个工作为公理化分析与小型数值实验(采样 500 次的统计计算),可在普通 CPU 上完成;理论上并不需要大规模算力。

5. 实验数量与充分性

  • 理论实验:3 条主要命题(Proposition 4.1 软 Bellman 不收敛反例、Proposition 4.2 horizon continuity 解析、Proposition 4.3 下真实回报单调性)+ 1 个 Tsallis 族数值图 + 2 张对照表 + 2 个手动构造的反例( 的单状态 MDP;Thompson sampling 三动作反例)。
  • 充分性评估:作为公理化论文,其"实验"旨在展示公理的边界条件与具体推论,不以统计性能比较为目标,故实验与定理相符,论证闭环。但本文并不试图在大规模 RL 任务上验证 Boltzmann 假设,因此对实践读者的直接实证支撑有限——可视为规范性论证而非实证贡献。

6. 主要结论与发现

1. Boltzmann 唯一性(Theorem 3.1):IIA 与单调性共同施加于策略与价值时,唯一确定 softmax 策略、Shannon 熵奖励与软 Bellman 方程,给出从公理到算法的完整路径。

2. 设计层面解读:硬/软 Bellman 选择的本质是设计决策——智能体是否重视"拥有选项"的能力。软 Bellman 等价于在 Bellman 关系中加入一项"选项溢价"

3. -离散下界(Proposition 4.1):当存在放大动作 过小时,软 Bellman 算子位于恒等映射之上,无有限不动点;显式构造给出阈值

4. horizon continuity 解析(Proposition 4.2):若对所有平稳策略 (horizon continuity + 张成条件蕴含),则软 Bellman 对任意 均有唯一不动点,软策略迭代收敛。

5. 回报单调性(Proposition 4.3):实际(未正则化)回报 关于 单调非降,对任意凸正则器亦成立(Milgrom–Segal 2002)。

6. 跨学科汇流:表 2 显示至少六条独立公理路径殊途同归至 Boltzmann 结构(选择理论、随机效用、最大熵、合理不关注、扰动效用、计量经济);这是该形式结构性重要性的证据。

7. IIA 失效的具体形式:以 LLM 11 候选响应中 10 个近义改写为例,IIA 会将 概率分给近义改写、仅 给语义独立候选,揭示"红蓝巴士"问题;建议改用 nested logit。

8. -奖励对偶,故 RLHF 中 KL 系数 与奖励尺度 仅通过 产生作用,独立调参存在冗余。

7. 论文优点

  • 公理到算法的完整路径:相较 Fudenberg 等人 (2015) 的静态 APU 推导,本文填补了"动态 MDP + Bellman 递归"的空白,Step 2 中由价值 IIA 推导出熵奖励而无须预设加性结构,是新颖的关键论证。
  • "机遇/选择"二分视角:把熵奖励自然解读为"选择能力的选项溢价"(Kreps 1979 的 flexibility preference 在 RL 语境中的精准落地),化解了 VNM 与熵正则化之间的表观冲突。
  • 跨学科综合:清晰联系经济学偏好公理化(Luce, McFadden, Yellott, Fudenberg)与信息论公理化(Shore–Johnson, Matejka–McKay),并将 econometric 软 Bellman 早期推导(Rust 1987)介绍至 RL 社区。
  • 工程诊断价值:给出可操作的 IIA 检验——"加入/删除动作时 是否不变",便于实践者评估 Boltzmann 假设是否合宜。
  • 新发现的概念 阈值、horizon continuity 的新作用、回报单调性、-奖励对偶冗余,均为新结果或明晰化以往分散的观察。

8. 不足与局限

  • 二元动作失效:定理要求 ;在二元偏好(如 RLHF pairwise 比较)中 IIA 不再唯一确定指数形式,软 Bellman 在此场景下不具公理强制力。
  • 不决定 :与 VNM 公理不决定效用单位同源——任何"理想温度"的论断在奖励尺度未固定时皆为空话。RLHF 中常见的同时调 即为冗余,但作者未能给出从偏好数据中识别 的具体可识别性证明。
  • 静态 IIA 而非动态 IIA:是否静态逐状态 IIA 蕴含轨迹级(动态)IIA 仍是公开问题;可能需要额外的递归性公理(Fudenberg–Strzalecki 2015)。
  • 缺乏实证验证:未在 Atari、MuJoCo、LLM RLHF 等实际任务上检验定理推论;Tsallis 数值图仅展示违反趋势而不涉及下游性能。
  • 连续动作空间的参考测度 :扩展到连续 时, 是额外建模输入(SAC 默认使用 Lebesgue 测度),IIA 的密度比形式条件需要明确
  • 离散抽样方差偏差风险:Tsallis 数值实验固定 ,未必代表一般场景;500 次采样规模有限,且未报告置信区间。
  • 道德/对齐视角缺失:未讨论当 policy 通过 nested logit 修复后,与 RLHF 中 Arrow 式标注者异质性偏好聚合(Maura-Rivero 等 2025)的兼容性。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记