arXiv 2606.30420v1 · 发布 2026-06-29

面向大语言模型推理的经验增强策略优化

Experience Augmented Policy Optimization for LLM Reasoning

AUTHORS Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li, Chiyu Ma, Shaohang Wei, Xiang Wang, Guoyin Wang, Jingren Zhou
EVIDENCE 针对LLM推理设计强化学习策略优化算法
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 21:37:20 UTC

📝 TLDR

RLVR训练LLM推理能力时存在采样成本高、累积经验利用效率低的问题,且已有经验复用方法因策略不匹配而失效。本文提出Experience-Augmented Policy Optimization(EAPO),将先验RL优化策略作为动作级经验先验,在rollout的关键决策点选择性注入经验,并结合修正的importance sampling保证经验增强下学习的稳定性与无偏性。在Qwen-2.5-math 7B与Qwen-3-8B五个基准测试中,EAPO持续优于现有RLVR方法。

🧭 速览

动机

现有RLVR方法从零开始on-policy训练,采样成本高、经验利用率低;用固定轨迹复用历史经验又会因策略不匹配而失效。

方法

EAPO将先验优化策略建模为动作级经验先验,在rollout关键决策点选择性注入,并采用修正的importance sampling以稳定无偏学习。

结果

在Qwen-2.5-math 7B与Qwen-3-8B上跨五个基准测试,EAPO持续优于当前最优RLVR方法。

结论

经验应以策略自适应方式表达而非复用为固定轨迹,EAPO为低成本高效RLVR训练LLM推理提供了新范式。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

基于可验证奖励的强化学习(RLVR)在提升大语言模型推理能力方面展现出强大潜力,但现有方法要么从零开始同策略优化导致采样成本高昂,要么简单复用历史轨迹却因策略不匹配而效果有限。本文提出的经验增强策略优化(EAPO)另辟蹊径,将已优化的策略 作为动作级经验先验,在 rollout 的关键决策点稀疏注入经验引导,同时通过平滑重要性采样保证学习的稳定性。实验表明,在 Qwen-2.5-Math 7B 和 Qwen-3-8B 上,EAPO 在五个数学与科学推理基准上持续优于现有 RLVR 方法,且仅需不到 4% 的 token 替换率即可实现显著性能提升。

研究背景与动机

让大语言模型学会像人类一样进行复杂推理,一直是人工智能领域的核心挑战之一。近年来,基于可验证奖励的强化学习(即 RLVR)范式异军突起,通过大规模 rollout 采样与可验证奖励信号,驱动模型自主探索更长的链式思考与自我纠错行为。从 OpenAI o1 到 DeepSeek-R1,从 GRPO 到 DAPO,这一技术路线在数学推理、代码生成等任务上取得了突破性进展。然而,在这股热潮背后,一个根本性的效率问题始终未得到充分重视:每次训练迭代都需要从零开始进行同策略优化,在近乎无限的可能性空间中漫无目的地搜索成功轨迹,采样成本动辄数以百万计,而那些在训练过程中累积的宝贵探索经验却往往被白白丢弃。

近期一些工作开始尝试复用历史经验,但它们的思路是将成功轨迹作为静态样本直接回放——这在传统的强化学习场景中或许是合理的,但在 RLVR 的语境下却遇到了一个棘手的难题:策略不匹配。训练过程中,模型的能力与行为分布始终处于动态演变之中,早期生成的低质量轨迹与当前策略的行为模式渐行渐远,将其强行复用不仅无法提供有效的学习信号,反而会引入偏差甚至导致性能退化。换言之,RLVR 中的经验复用问题远比传统 RL 更为微妙:我们需要的不是固定轨迹的简单回放,而是一种能够适应策略演化的动态经验表达方式。

EAPO 的核心洞察正在于此:经过 RL 优化后的策略 实际上隐式编码了关于"哪些动作更可能导向成功"的结构化决策知识,这种知识以动作级的概率分布形式存在,而非僵硬的轨迹片段。因此,经验不应该被理解为需要回放的固定输出,而应该被视为可以引导探索方向的动作级先验。

方法

EAPO 的设计围绕三个递进的核心问题展开:如何形式化经验、如何选择性注入经验、如何保证经验增强下的学习稳定性。

经验的形式化表达是第一步。传统方法将经验理解为特定的状态-动作序列(轨迹),而 EAPO 转而将先前经过 RL 优化的策略 本身视为经验载体。在 rollout 的每个解码步 ,我们可以计算当前策略 与经验策略 在所选 token 上的对数似然比:。这个差值衡量了当前决策与经验策略之间的分歧程度。当 时,意味着当前策略过度自信地选择了 强烈反对的 token——这正是一个典型的高风险关键决策点,值得经验介入引导。

经验引导的 resampling 在识别出关键决策点后,具体如何注入经验呢?EAPO 引入一个阈值 作为门控:当 时,以经验策略 替代当前策略进行采样;否则保持当前策略的探索。这个机制确保了经验只在真正需要的地方发挥作用,而非全面接管探索过程。值得注意的是,作者发现实际运行时仅有不到 4% 的 token 会被替换,这一稀疏性验证了"有效 RL 引导天然稀疏"的假设——大量探索仍由当前策略独立完成,经验仅在关键分歧点提供纠正。

为了加速这一过程并保持自回归因果依赖,作者还借鉴了 speculative decoding 的思想,以块大小 为单位进行处理:先用当前策略批量生成 个投机 token,再由经验策略并行评估其 值,一旦发现首个触发门控的位置便截断后续投机 token 并从经验策略重采样。

经验感知的策略优化 需要解决一个关键问题:部分 token 来自经验策略而非当前策略的 rollout 分布,这违反了标准重要性采样的假设,直接计算策略梯度会引入偏差。EAPO 采用响应级平滑重要性采样(sIS)来处理这一挑战。首先计算每条轨迹中经验注入 token 的比例 ,然后构造平滑分布 ,在这个分布上计算修正的重要性权重。当 时,sIS 退化为标准 on-policy ratio;随着 增大则平滑过渡到经验引导分布,从而在利用经验与保持学习无偏性之间取得平衡。

此外,EAPO 还包含两项重要设计:正向经验过滤确保只有最终预测正确的经验增强轨迹才参与梯度更新,避免错误经验注入导致偏差梯度;经验退火机制则规定经验引导仅在训练的前 步生效,此后切换为纯同策略 rollout,防止模型过度依赖经验策略而丧失独立探索能力。

实验与结果

作者基于 Qwen-2.5-Math-7B-Base 和 Qwen-3-8B-Base 两个基座模型展开实验,训练数据为 DAPO-Math-17K,评测则覆盖了域内数学推理(AIME'24、AIME'25、AMC)与域外科学推理(MMLU-Pro、GPQA)共五个基准。

实验结果清晰地表明了 EAPO 的优势。在 AIME'24 上,EAPO 将 Qwen-2.5-Math-7B 的 Pass@1 从基线 DAPO 的 47.0% 提升至 56.7%,相对提升达 20%;在更难的 AIME'25 上,提升幅度进一步扩大至 28%。值得注意的是,EAPO 不仅优于基础的 GRPO 和 DAPO,也显著超越了此前尝试复用经验的轨迹回放方法以及多教师蒸馏方法 OPD/MOPD,这些对比充分验证了"策略自适应经验复用"思路的优越性。

更深入的分析揭示了几个重要发现。首先,稀疏干预的效率远超预期:即使 时 resampled ratio 不足 4%(约每 1000 个 token 中仅约 40 个被替换),这些被替换 token 所在的响应准确率却持续超过 70%,说明经验引导精准地纠正了那些最可能导致失败的过度自信决策。其次,经验粒度的选择至关重要:token 级经验注入在 AIME'24 上显著优于 trajectory 级经验,尽管后者与 的 KL 散度更低,这表明细粒度的精准干预比粗糙地贴近经验分布更重要。最后,sIS 的稳定性作用不可忽视——移除平滑重要性采样后,EAPO 的性能出现明显下降,说明即使只有少量 token 被替换,正确的信用分配机制仍然是学习稳定性的关键保障。

讨论与可借鉴点

EAPO 的成功揭示了一个更普适的原则:在 RLVR 场景下,经验的有效复用不在于回放多少历史轨迹,而在于如何精准地在策略分歧点注入结构化先验知识。这一"稀疏引导"的策略为降低 RLVR 的采样成本开辟了新思路——与其让模型在庞大的搜索空间中盲目探索,不如让经验策略在关键时刻提供"纠偏",将宝贵的采样预算集中在真正需要探索的方向上。

然而,这项工作也存在若干局限值得注意。EAPO 的效果依赖于高质量先验策略 的存在,当先验策略本身能力有限或存在系统性偏差时,经验引导可能将模型引向局部最优。此外,超参数 的选择仍依赖经验性调优,缺乏训练过程中动态自适应调整的机制。在更广阔的应用场景上,当前实验仅限于可验证奖励的数学与科学推理任务,对于弱监督或噪声奖励场景(如开放域对话)尚未涉及。另一个潜在风险在于正向经验过滤机制——仅保留正确轨迹可能放大已有偏好,长期训练后可能压缩模型的多样性与探索能力。

尽管如此,EAPO 的核心思想——将经验从静态轨迹转化为策略自适应的动作级先验——为 RLVR 领域提供了一种可扩展、高效的训练范式。随着大规模模型训练对算力成本的要求日益严苛,这种"精准引导"而非"广撒网"的策略复用思路,有望成为未来 RLVR 算法设计的重要方向。

摘要

基于可验证奖励的强化学习(RLVR)是提升大语言模型(LLM)推理能力的一种强大范式。然而,现有的 RLVR 方法通常依赖从零开始的同策略优化,导致采样成本高昂且对累积经验的利用效率低下。随着训练过程中模型能力和策略行为的不断演变,近期通过固定推理轨迹来复用经验的尝试进一步受到策略不匹配的困扰。鉴于这些局限性,我们认为 RLVR 中的经验不应作为固定推理轨迹被复用,而应以策略自适应方式进行表达。在本工作中,我们提出了经验增强策略优化(EAPO),它将一个先前经过 RL 优化的策略用作动作级的经验先验,并在 rollout 过程中的关键决策点有选择性地注入经验。为了确保从经验增强的 rollout 中实现稳定且无偏的学习,EAPO 还引入了一种自适应的重要性采样方案。基于 Qwen-2.5-math 7B 和 Qwen-3-8B 在五个不同基准上的实验表明,EAPO 在推理性能上持续优于当前最先进的 RLVR 方法。

Abstract

Reinforcement Learning with Verifiable Rewards (RLVR) is a powerful paradigm for improving the reasoning capabilities of large language models (LLMs). However, existing RLVR methods typically rely on on-policy optimization from scratch, resulting in high sampling costs and inefficient utilization of accumulated experience. As model capabilities and policy behaviors evolve during training, recent attempts to reuse experience via fixed reasoning trajectories further suffer from policy mismatch. Motivated by these limitations, we argue that experience in RLVR should not be reused as fixed reasoning trajectories, but instead expressed in a policy-adaptive manner. In this work, we propose Experience-Augmented Policy Optimization (EAPO), which leverages a prior RL-optimized policy as an action-level experience prior and selectively injects experience at critical decision points during rollout. To ensure stable and unbiased learning from experience-augmented rollouts, EAPO further incorporates an adapted importance sampling scheme. Experiments on using Qwen-2.5-math 7b and Qwen-3-8B on five different benchmarks demonstrate that EAPO consistently improves reasoning performance over state-of-the-art RLVR methods.


论文详细总结(自动生成)

论文总结:面向大语言模型推理的经验增强策略优化(EAPO)

1. 核心问题与研究动机

  • 背景:基于可验证奖励的强化学习(RLVR)已成为提升大语言模型(LLM)推理能力的主流范式(如 GRPO、DAPO、OpenAI o1、DeepSeek-R1 等),通过大量 rollout 和可验证奖励信号促使模型产生更长的链式思考(CoT)与自反思行为。
  • 现有方法的两大瓶颈

1. 采样成本高、经验利用率低:现有 RLVR 方法均从零开始进行 on-policy 优化,在巨大搜索空间中探索成功轨迹,需要海量采样,但忽略了已优化模型 中蕴含的宝贵经验。

2. 固定轨迹复用存在策略不匹配(policy mismatch):近期工作(如 ExGRPO、RLEP)尝试把历史成功轨迹作为经验直接复用,但随着策略持续进化,早期静态轨迹与当前策略行为脱节,复用价值迅速衰减。

  • 核心观点:RLVR 中的经验不应以固定轨迹形式复用,而应以策略自适应的动作级先验形式表达——RL 优化后的策略 隐式编码了"哪些动作更可能通向成功"的结构化决策先验。

2. 方法论

2.1 总体框架

EAPO 包含三个核心组件:

1. 经验形式化(Experience Formalization):将 视为动作级决策先验;

2. 经验引导的 resampling(Experience-guided Resampling):在 rollout 的关键决策点稀疏注入经验;

3. 经验感知的策略优化(Experience-aware Optimization):保证经验增强 rollout 下的稳定无偏学习。

训练流程采用两阶段策略:第一阶段用 DAPO 训练得到 ;第二阶段从同一基座 初始化目标策略 ,再次用 DAPO 优化,但在 rollout 中引入 的引导( 仅用于 rollout 引导,不直接监督优化目标)。

2.2 关键决策点识别

在每个解码步 ,计算当前策略与 在所选 token 上的对数似然比(token-level discrepancy):

  • :两策略一致,当前决策与经验相符;
  • 更支持当前决策,决策被经验支撑;
  • :当前策略过度自信地选择了 强烈反对的 token——典型的"高风险关键决策点"。

2.3 经验引导的 Action Resampling

引入阈值 ,定义门控信号:

经验引导的采样分布定义为:

即仅在 处丢弃当前 token 并从 重采样,保持其他步的 on-policy 探索。

块级加速(Block-wise Verification):受 speculative decoding 启发,以块大小 处理,每次由 生成 个投机 token, 并行评估;若发现首个 的位置 ,则截断并从 重采样该 token,丢弃后续投机 token,保持因果一致性。

2.4 经验感知的策略优化

(1)Positive Experience Filtering:经验注入的轨迹 仅在最终预测正确时()才参与梯度更新,避免错误经验注入带来偏差梯度。

(2)Resampling-based Importance Sampling(sIS):由于部分 token 来自 而非 ,违反标准重要性采样假设。token 级修正会破坏自回归因果依赖,因此采用响应级平滑重要性采样:

时退化为标准 on-policy ratio,随 增大平滑插值至经验引导分布。

(3)Experience Annealing:仅在前 步进行经验引导 resampling,之后切换为纯 on-policy rollout,避免过度依赖 、保持后期独立探索能力。

最终 EAPO 在 DAPO 目标函数下最大化:

其中 ,采用 asymmetric clipping(无 KL 惩罚)。

3. 实验设计

3.1 数据集与训练设置

  • 训练集:DAPO-Math-17K
  • 优化器:AdamW,常学习率 ,权重衰减 ,全局 batch size 512
  • Rollout 组大小,其中 15 条为纯 on-policy,1 条为经验增强轨迹
  • 块大小Annealing 步数默认阈值

3.2 模型

  • Qwen-2.5-Math-7B-Base(最大生成长度 8192)
  • Qwen-3-8B-Base(最大生成长度 20480)

3.3 评测基准

域内数学推理

  • AIME'24、AIME'25、AMC(Pass@1 与 Pass@16,32 次平均)

域外科学推理(OOD 泛化)

  • MMLU-Pro、GPQA(8 次平均)

3.4 对比方法(三类)

1. Baseline RLVR:GRPO、DAPO

2. Token 级监督:On-Policy Distillation (OPD)、Multi-Teacher On-Policy Distillation (MOPD)

3. 轨迹级经验复用:Trajectory Replay

4. 消融变体:EAPO w/o sIS(无平滑重要性采样的 EAPO)

4. 资源与算力

  • 论文未明确披露所用 GPU 型号、数量及训练时长;
  • 仅指出"由于时间与计算成本限制,Trajectory Replay 与 EAPO w/o sIS 仅在 7B 模型上评估",8B 模型实验有所裁剪;
  • 默认超参数()的选择基于经验性消融而非系统性搜索。

5. 实验数量与充分性

  • 超参数敏感性实验(RQ1):阈值 多档扫描,分析对 AIME'24 性能、resampled ratio、resampled accuracy 三个维度的影响;
  • 组件消融(RQ2)
  • 经验粒度:token 级 vs. trajectory 级(仅正样本);
  • 经验过滤策略:仅正样本 vs. 正负样本;
  • 分析指标:AIME'24 性能 + 与 的 KL 散度;
  • 附录组件消融(Figure 4)
  • Annealing 步数 敏感性;
  • Resampling、Positive Filtering、sIS 三组件逐项叠加效果(单调递增);
  • 主实验(RQ3):两个基座 × 5 个基准 × 多指标(Pass@1 / Pass@16)× 32/8 次平均;
  • 实验充分性评价
  • 多数据集(域内 + 域外)、多基座、多基线对比均较完整;
  • 消融覆盖核心设计选择,且附录补充了 annealing 与组件级 ablation,论证较为充分;
  • 但 8B 模型上对比方法不全(Trajectory Replay、EAPO w/o sIS 缺失),且未在更多模型规模/任务类型上验证。

6. 主要结论与发现

  • 稀疏干预即可显著提升 时 resampled ratio 不足 4%(约 1000 token 中仅 ~40 token 被替换),但经验增强响应的准确率持续超过 70%,验证"有效 RL 引导天然稀疏"的核心假设。
  • 粒度比距离更重要:token 级经验在 AIME'24 上显著优于 trajectory 级经验,尽管后者与 的 KL 散度更低——说明细粒度干预比贴近经验分布更重要。
  • 正样本过滤关键:引入负样本会扩大与 的 KL 散度并显著降低 AIME'24 性能,验证 Positive Filtering 的必要性。
  • sIS 的稳定性作用:EAPO 始终优于 EAPO w/o sIS,说明在少量 token 被替换时仍需正确的 credit assignment。
  • 域外泛化:在 GPQA 与 MMLU-Pro 上 EAPO 同样取得最佳或极具竞争力的成绩,说明学到的是可迁移的推理行为而非数学过拟合。
  • 综合结论:策略自适应的经验复用(policy-adaptive experience reuse)为 RLVR 提供了可扩展、高效的训练方向。

7. 优点

  • 问题视角新颖:明确指出"固定轨迹复用 → 策略不匹配"的本质矛盾,提出以 为动作级先验的统一视角,区别于现有 OPD/MOPD 等 token 级蒸馏方法;
  • 设计精细且自洽
  • 通过 自动定位"过度自信且缺乏经验支撑"的决策点,无需人工标注;
  • 块级加速借鉴 speculative decoding,工程化考虑充分;
  • Positive Filtering + 平滑重要性采样 + Annealing 三个机制互补,分别解决"偏差梯度"、"因果依赖破坏"、"过度依赖经验"三个具体问题;
  • 实验设计完整:覆盖域内/域外基准、两类基座、多类对比方法,并提供组件级与超参数级消融;
  • 可解释性强:resampled ratio 与 resampled accuracy 的可视化清晰展示"低干预-高回报"的稀疏性结论;
  • 算法可复现:附录提供完整伪代码(Algorithm 1),包含 rollout 与优化两阶段流程。

8. 不足与局限

  • 依赖先验 的质量与多样性 本身由 DAPO 训练得到,其能力上限与偏差会直接限制 EAPO 效果,未在 质量不同时做鲁棒性测试;
  • 超参数固定化 等均为预设常量,缺乏训练过程中动态自适应机制(如根据 resampled accuracy 调整 );
  • 作用范围有限:仅在可验证奖励的数学/科学推理任务上验证,对弱监督或噪声奖励场景未涉及(如开放域对话、生成质量评估等);
  • 单经验源限制:当前仅使用单个 ,未探索多策略融合或动态演化的经验源;
  • 算力与可复现性信息缺失:未报告 GPU 型号/数量/总训练时长,难以评估实际计算成本;
  • 公平性细节不完整:8B 模型上未运行 Trajectory Replay 与 EAPO w/o sIS(理由为时间/算力限制),削弱了 8B 规模下 EAPO 优势的直接论证;
  • 域内/域外性能差距未深入分析:虽报告 OOD 提升,但未分析 EAPO 学到的能力具体如何迁移(如是否真正学到"反思-修正"等元能力);
  • Positive Filtering 的偏置风险:仅保留正确轨迹可能放大已有偏好、压缩多样性,长期训练可能影响探索能力。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记