arXiv 2606.29526v1 · 发布 2026-06-28

优化训练策略的幻象:以单调推理策略作为大语言模型强化学习的真正目标

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

AUTHORS Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng
EVIDENCE 解决大模型强化学习中的离策略问题并提出单调推理策略目标
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 21:33:56 UTC

📝 TLDR

大语言模型强化学习后训练因训练引擎与推理引擎概率不一致而产生训练-推理失配,固有的off-policyness易使训练不稳定甚至崩溃。现有方法聚焦缓解失配,却忽略训练侧策略更新未必带来推理侧部署策略改进这一目标错位问题。本文提出单调推理策略改进(MIPI)目标及其两阶段实现框架MIPU,构建参考候选更新并以推理侧差距代理筛选同步候选。两种模型规模高失配实验显示,MIPU在平均推理性能与训练稳定性上均取得提升,为LLM强化学习目标对齐提供了新方向。

🧭 速览

动机

既有研究只缓解训练-推理失配带来的off-policyness,却忽视训练策略更新未必改善推理部署策略这一根本目标错位。

方法

提出单调推理策略改进目标MIPI,并设计两阶段框架MIPU,通过构建采样参考的候选更新结合推理侧差距代理筛选同步候选。

结果

在两种模型规模的高失配实验设置下,MIPU显著提升平均推理性能并有效改善训练稳定性。

结论

揭示训练策略优化与推理策略改进间的目标错位,确立以推理端单调改进为核心的大模型强化学习新优化范式。

📊 论文图表(共 3 张)

展开查看 3 张图

TL;DR

大语言模型强化学习训练中,推理引擎和训练引擎的概率不一致是导致训练不稳定的重要原因。现有方法都聚焦于弥合这种失配,但忽略了一个更深层的问题:训练侧策略的改进并不能保证推理侧部署策略也得到改善。本文提出单调推理策略改进(MIPI)原则及其两阶段实现框架MIPU,通过构建参考采样器候选更新并用推理侧差距代理筛选同步候选,让真正的优化目标锁定在推理侧策略的提升上。在 FP8 量化这一高失配场景下,MIPU 使 Qwen3-4B 的平均推理性能从 64.42% 提升至 66.71%,同时显著改善了训练稳定性,避免了基线方法常见的性能崩溃。

研究背景与动机

大语言模型的强化学习后训练近年来备受关注,从 GPT 系列到 Qwen 系列,主流模型都在使用 [[强化学习]] 技术来提升模型的推理能力。然而,这套技术栈有一个根深蒂固的脆弱性:训练过程容易出现不稳定甚至崩溃。

问题的根源在于现代 LLM 训练采用的双引擎架构。推理引擎(比如 vLLM、SGLang)负责生成样本,追求部署效率;训练引擎(比如 Megatron、FSDP)负责计算对数概率和梯度更新,追求训练精度。两侧参数虽然会同步,但由于数值精度差异、解码策略不同、服务后端实现细节各异,它们对同一条轨迹给出的概率分布往往不一致——即 。这种 [[训练-推理失配]] 天然地引入了一种始终存在的离策略程度(off-policyness),毒害着训练过程。

先前的工作已经意识到这个问题并提出了多种应对方案:有的通过 [[重要性采样]] 修正梯度估计,有的过滤掉失配严重的 token,有的周期性衰减学习率,还有的采用 FP16 rollout 来缓解量化带来的失配。这些方法的核心假设是:只要训练侧策略改进了,推理侧策略也会跟着改善。

但这篇论文指出,这个假设从未被严格检验过。事实上,训练侧策略的改进并不能推出推理侧策略的改进。这意味着现有方法都在优化一个错误的目标——它们优化的实际上是训练引擎里的策略 ,而不是部署时真正使用的推理策略 。这就是论文所说的目标层级错位问题。

方法

为了解决这个问题,论文首先提出 MIPI 原则(Monotonic Inference Policy Improvement),将真正的优化目标明确定义为推理策略的单调改进:

然后,论文通过一个恒等分解将这个目标拆解成三项可操作的量:

这个分解的妙处在于:项 ③ 只依赖于上一轮的状态,可以在更新前就计算;项 ② 是传统 [[强化学习]] 方法试图最大化的目标;而项 ① 才是关键——它衡量的是参数同步后推理侧与训练侧的差距。

基于这个分解,论文提出了 MIPU 框架(Monotonic Inference Policy Update),采用两步走的设计来同时优化项 ② 和控制项 ①。

第一步:参考采样器的策略更新。目标是最大化 ,即项 ② 加项 ③。论文采用截断重要性权重修正来处理 off-policyness,具体形式借鉴了 TIS 方法的思路。核心思想是用上一轮推理策略 作为参考分布来采样,通过重要性权重来修正分布偏移。

第二步:推理差距感知的候选接受。训练完候选策略 并同步到推理引擎后得到 ,需要判断这次更新是否真正改进了推理侧策略。论文设计了一个推理差距代理指标 ,它基于反向形式的重要性权重来估计同步后的推理差距。如果这个指标显示风险过高(低于某个容差阈值 ),就回滚到上一个检查点;否则接受更新。

这种设计的精妙之处在于:两步各司其职——第一步确保训练方向的正确性,第二步提供安全阀来防止有害更新传导到推理侧。容差参数 可以动态调整(论文采用从 线性退火到 的策略),前期宽松以允许充分探索,后期收紧以确保稳定收敛。

实验与结果

论文在两种模型规模上验证了 MIPU 的有效性:Qwen3-1.7B 和 Qwen3-4B,训练数据分别来自 DAPO-Math-17k 和 DeepMath-103K 的筛选子集。为了制造高失配环境,论文采用 FP8 量化 rollout——这会放大训练与推理引擎之间的概率差异。

实验涵盖五个数学推理基准:MATH-500、AIME24、AMC23、Minerva 和 OlympiadBench。结果显示,Qwen3-4B 上 MIPU 的平均性能达到 66.71%,相比基线的 64.42% 有明显提升;Qwen3-1.7B 上则从 50.86% 提升到 53.97%。更关键的是训练稳定性的改善:基线、MIS 和 LR-decay 方法在达到峰值后都出现了明显的性能退化(collapse),而 MIPU 保持了平稳的训练轨迹直到结束。

消融实验揭示了第一步和第二步各自的贡献:单独使用第一步(TIS 版本)能改善候选更新方向但不能防止崩溃;单独使用第二步(仅 inference gap 过滤)能防止崩溃但难以提升性能。二者结合才能同时获得性能与稳定性的收益。

论文还通过随机回滚对照实验排除了"Step 2 只是稀疏化更新"这一解释。随机回滚虽然拒绝了更多更新(67.0% vs 53.5%),但仍会导致崩溃,说明 Step 2 的有效性源于它真正利用了 的方向信号,而非简单的"少更新"策略。

讨论与可借鉴点

这篇论文的核心贡献在于揭示了一个此前被忽视的目标层级问题:强化学习社区花了大量精力去弥合训练-推理失配,却没有人质疑过"弥合失配是否就等于改进了推理策略"。这个视角转换很有启发性。

从工程角度看,MIPU 的设计哲学值得借鉴:用两步走的框架将"优化方向"和"安全约束"解耦,第一步专注于让训练信号更准确,第二步充当风险控制器。这种分而治之的思路在系统工程中很常见,但在 RL 训练框架设计中还不多见。

论文的局限也很明显:实验只在 1.7B 和 4B 两个中等规模模型上验证,未涉及更大规模(10B+)的场景;仅测试了数学推理这一单一任务域;仅在 FP8 量化这一种高失配源上验证;每个基准只跑了单次随机种子,统计显著性较弱。此外,Step 2 的推理差距代理毕竟只是一个代理而非真正的单调保证,其在小模型上的震荡较大,实际使用时仍需要调参者根据经验设置容差阈值。

对于未来的研究方向,一个自然的拓展是在更大规模的模型上验证 MIPU 的可扩展性,以及在更多样的任务(如代码生成、对话对齐、多步 agent 任务)上测试其普适性。另一个值得探索的方向是设计自适应的容差调度策略,让系统自己判断何时该宽松、何时该收紧,减少人工调参的负担。

摘要

强化学习(RL)在大型语言模型(LLM)后训练中受到越来越多的关注,然而 RL 训练仍然较为脆弱,可能出现不稳定或崩溃的情况。一个重要的原因是训练与推理之间的不匹配:LLM 采用分离的推理引擎和训练引擎以兼顾生成效率与训练精度,但在实际中,即便模型参数已同步,训练端与推理端对同一条轨迹给出的概率仍然不一致。这天然地引入了一种始终存在并毒害训练的特殊离策略程度。先前的工作在弥合不匹配以稳定训练策略方面已做出诸多努力。本文指出,现有工作忽略了目标对齐问题:对训练引擎中的策略进行有效更新,并不一定能保证推理策略(即部署时使用的策略)获得改善。为此,我们为大语言模型强化学习提出了一种新的策略优化目标,称为单调推理策略改进(Monotonic Inference Policy Improvement, MIPI)。基于该原则,我们引入了单调推理策略更新(Monotonic Inference Policy Update, MIPU),一个两步式的大语言模型强化学习框架,它构建参考采样器的候选更新,并通过推理侧差距代理有选择地接受已同步的候选。在两种模型规模、高度不匹配条件下进行的实验表明,MIPU 提升了平均推理性能并改善了训练稳定性。

Abstract

Reinforcement learning (RL) has gained growing attention in large language model (LLM) post-training, yet RL training remains fragile and can suffer from instability or collapse. One vital cause is training-inference mismatch: LLM adopts separate inference and training engines for generation efficiency and training precision, which in practice exhibits inconsistent probabilities for the same trajectories on training and inference sides, even with synchronized model parameters. This naturally induces a special type of off-policyness ever existing and poisoning the training. Prior works have made various efforts in addressing the off-policyness to stabilize the training policies under the mismatch. In this paper, we point out the objective misalignment neglected by existing works that an effective update to the policy in the training engine not necessarily ensures the improvement of the inference policy, i.e., the one used in deployment. To this end, we propose a new policy optimization objective for LLM RL, named Monotonic Inference Policy Improvement (MIPI). Following this principle, we introduce Monotonic Inference Policy Update (MIPU), a two-step LLM RL framework that constructs sampler-referenced candidate updates and selectively accepts synchronized candidates using an inference-side gap proxy. Experiments conducted on two model scales under high mismatch show that MIPU improves average reasoning performance and training stability.


论文详细总结(自动生成)

论文总结:优化训练策略的幻象——以单调推理策略作为 LLM 强化学习的真正目标

1. 核心问题与研究动机

1.1 训练-推理失配(Training-Inference Mismatch)

现代大语言模型(LLM)强化学习流水线普遍采用双引擎架构

  • 推理引擎(如 vLLM、SGLang):负责 rollout 生成,强调部署效率;
  • 训练引擎(如 FSDP、Megatron):负责对数概率计算与梯度更新,强调训练精度。

即使两侧参数同步,由于数值精度、解码策略、服务后端实现等差异,训练策略 与推理策略 对同一轨迹给出的概率分布仍然不一致,即 。这一现象被称为训练-推理失配

1.2 现有工作的局限

现有方法(TIS、MIS、LR-decay、FP16 rollout 等)均聚焦于降低失配程度,但都隐含一个未被检验的假设:

训练侧策略的改进并不保证推理部署侧的改进。这是一种被忽视的目标层级错位(Objective Misalignment)问题。


2. 方法论

2.1 核心思想:MIPI 原则

论文提出 Monotonic Inference Policy Improvement (MIPI) 原则——以推理策略的单调改进作为真正的优化目标:

通过恒等分解将推理端改进拆分为三项:

2.2 MIPU:两步式实现框架

Step 1 — 参考采样器的策略更新(Sampler-Referenced Update)

目标优化 ② + ③,即 。采用截断重要性权重修正(Truncated Importance Sampling,TIS 风格):

其中:

  • 为当前更新比;
  • 为预更新失配修正。

Step 2 — 推理差距感知的候选接受(Inference-Gap-Aware Acceptance)

对候选训练策略 同步至推理引擎后得到 ,基于反向性能差恒等式估计同步后推理差距代理:

为容差阈值),则回滚至前一检查点;否则接受更新。

2.3 算法流程

```

for k = 0, 1, 2, ...:

保存检查点 (θk, Ωk, μk)

Step 1: 采样 G 个响应 → 计算奖励、组相对优势、失配权重

→ 最大化 J_S1(θ) → π{k+1}, μ{k+1}

Step 2: 在验证集上估计 T̂_post

若 T̂_post ≥ -c:接受更新

否则:回滚到 (θk, Ωk, μk)

```


3. 实验设计

3.1 训练数据集

  • Qwen3-1.7B:基于 DAPO-Math-17k 筛选 5759 题;
  • Qwen3-4B:基于 DeepMath-103K 筛选 1491 题;
  • 筛选标准:基础模型具有非平凡但非饱和的成功率,确保奖励信号具有有意义的方差。

3.2 评估基准(5 个数学推理 benchmark)

基准类型评估方式
MATH-500数学竞赛pass@1
AIME24数学竞赛avg@16
AMC23数学竞赛avg@16
Minerva定量推理pass@1
OlympiadBench奥林匹克级pass@1

3.3 对比方法

  • Baseline:标准 GRPO + dual clip;
  • MIS:基于失配权重 的 token 过滤;
  • LR-decay:按原论文规则周期性衰减学习率(Qwen3-4B:;Qwen3-1.7B:);
  • TIS(Step 1 单独版本,作为消融对比);
  • Step 2 单独版本
  • MIPU(完整版 Step 1+Step 2)
  • 随机回滚对照(70% 拒绝率,验证 Step 2 信号有效性)。

4. 资源与算力

  • GPU:8 张 H100(具体型号未明示集群配置);
  • RL 框架:ROLL(Wang et al., 2025);
  • 训练引擎:Megatron;推理引擎:vLLM;
  • 关键超参:学习率 ,训练 batch size 64,group size ,clip 范围 ,prompt 长度 512,response 长度 8192,温度训练 1.0 / 评估 0.7;
  • 未明确披露:训练总时长、单实验 GPU 小时数、模型 FLOPs 等;

> ⚠️ 论文未给出 wall-clock 训练时间与总算力消耗,仅提供了硬件型号信息。


5. 实验数量与充分性

5.1 实验规模

实验类型数量
主结果(两个模型 × 五个 benchmark)2 组主实验,每组 4 种方法
消融实验(Step 1、Step 2、Step 1+2、Baseline)4 组
训练动态可视化(score、Mismatch-K3、Inference Gap、Rollback Rate、Grad Norm、Clip Ratio)多曲线
信号分析(小模型 vs 大模型的差距幅度)1 组对照
随机回滚 vs Step 2 对照1 组
容差 敏感度分析(、动态)1 组
Step 1 三种实现对比(PPO-IS / Vanilla-IS / TIS)1 组消融

5.2 公平性与客观性评估

优点

  • 所有方法共享相同的 rollout、奖励函数、优化设置;
  • 采用统一评估协议,pass@1 / avg@16 报告;
  • 消融实验在 Qwen3-4B FP8 设置下完成,变量隔离清晰;
  • 与系统级方法(FP16 rollout)正交比较,未混淆层次。

局限

  • 实验规模仅限 1.7B / 4B 两个中等模型,缺乏更大规模(>10B)验证;
  • 仅测试数学推理单一任务域(GRPO+verifiable reward),未覆盖代码、对话、agent 等;
  • 仅在 FP8 量化这一特定高失配场景下验证,未覆盖其他失配源(如 attention 实现差异);
  • 每个 benchmark 仅 1 次随机种子结果,统计显著性较弱。

6. 主要结论与发现

1. 目标错位确实存在:训练侧 不能推出推理侧 ,尤其在 FP8 量化 rollout 下表现明显。

2. MIPU 在两个模型规模上均取得最佳平均性能

  • Qwen3-4B:平均 66.71%(vs Baseline 64.42%);
  • Qwen3-1.7B:平均 53.97%(vs Baseline 50.86%)。

3. 训练稳定性显著提升:Baseline / MIS / LR-decay 在达到峰值后出现明显性能退化(collapse),而 MIPU 保持平稳轨迹直至训练结束(Stable 列为 ✓)。

4. Step 1 与 Step 2 互补

  • Step 1(仅 TIS)改善候选更新方向;
  • Step 2(仅 inference gap 过滤)防止崩溃但难提升性能;
  • 二者结合才同时获得性能与稳定性。

5. Step 2 的有效性源于信号而非稀疏化:随机回滚(拒绝率 67.0% > Step 2 的 53.5%)仍会崩溃,说明 Step 2 真正利用的是 的方向信号,而不是简单的"少更新"。

6. 容差调度关键:动态容差(前 100 步由 线性退火至 )优于固定容差,过严()会导致学习停滞。


7. 优点与亮点

  • 视角新颖:从"目标层"而非"系统层"重新审视训练-推理失配,揭示了常被忽视的目标级错位问题;
  • 理论简洁:通过三项恒等分解将推理端单调改进拆解为可操作的训练目标与可估计的验证信号;
  • 工程友好:两步框架可灵活替换(Step 1 可选 PPO-IS / Vanilla-IS / TIS;Step 2 容差可调),便于后续优化;
  • 对比全面:同时比较了基线、MIS、LR-decay、TIS、随机回滚、Step 2 单独等多种 baseline;
  • 可解释性强:提供了训练分数、KL 散度、Inference Gap、Rollback Rate、Grad Norm、Clip Ratio 等多维动态曲线,便于诊断;
  • 正确定位 FP8 失配源:为低精度 RL 系统提供了一条与系统优化正交的改进路径。

8. 不足与局限

维度具体说明
模型规模仅 1.7B / 4B,未验证在 10B+ 模型上的可扩展性
任务多样性局限于数学推理,未涵盖代码生成、对话对齐、agentic RL 等场景
失配源单一实验仅在 FP8 量化 rollout 上验证,未测试 attention flash-attn、KV cache paged attention 等其他失配源
统计显著度每个 benchmark 似仅有单次随机种子结果,未报告标准差或多次种子均值
无形式保证论文自承 Step 2 提供的是"风险信号"而非"单调保证",仅能降低风险而无法严格确保改进
理论局限性反向形式的重要性权重 仍存在高方差风险,长度归一化仅为缓解而非根治
超参敏感容差 需针对模型规模调整,缺乏自适应方案
算力信息缺失未披露总 GPU 小时、训练时长、碳排放等,难以评估性价比
接受信号噪声 在小模型上震荡较大(图 4a),阈值设置仍是工程权衡
回滚机制代价高回滚率场景下产生额外同步与回滚开销,工程成本未量化

> 总体评价:该论文从优化目标视角提出了一个被忽视的重要问题,并通过一个简洁优雅的两阶段框架给出了可行的工程解。其在 FP8 量化这一高失配场景下验证了性能与稳定性的双重提升。然而,规模化验证(更大模型、更多任务、更多失配源)与统计严谨性(多种子、显著性检验)仍是后续工作必须补齐的方向。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记