arXiv 2607.14614v1 · 发布 2026-07-16

超越熵:基于对比策略优化的正确性感知的优势塑形

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

AUTHORS Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang
EVIDENCE 对比策略优化是一种带有理论与实证分析的新型强化学习算法
SCORE 0.9
GENERATED 2026-07-20 16:31:27 UTC

📝 TLDR

RLVR方法常用熵进行优势塑形,但熵难以区分有益不确定性与有害混淆,限制了优势信号的有效性。论文提出对比策略优化(CPO),利用参考引导分布与原始生成分布在token级的对比差异来构造正确性感知的优势塑形信号。理论与实证表明该对比差异可可靠指示token级正确性,并能解决零优势问题。在域内与域外基准上,CPO显著优于基于熵的RLVR方法,同时保持良好的泛化性能。

🧭 速览

动机

RLVR以熵作为优势塑形信号,但熵无法区分有益的不确定性与有害的混淆,难以作为可靠的正确性指示。

方法

提出CPO,利用参考引导分布与原始生成分布在token级上的对比差异来构建正确性感知的优势信号。

结果

在域内与域外基准上显著优于熵基RLVR方法,有效解决零优势问题,并保持强泛化能力。

结论

正确与错误响应分别天然支持探索与利用,二者平衡带来最佳性能,揭示了CPO的优势来源。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

可验证奖励强化学习(RLVR)长期依赖熵作为优势塑形信号,但熵无法区分"有益的探索性不确定"与"有害的迷惑性混淆",导致信号与正确性之间存在根本错位。论文提出对比策略优化(CPO),通过比较参考引导分布与普通生成分布在每个 token 上的概率差异——即"对比分歧"——来直接感知 token 级正确性。理论证明该分歧与 oracle 正确性概率严格单调相关,实验则表明其在数学推理域内外基准上大幅超越基于熵的 RLVR 方法,同时自然维持了策略的探索能力,并将 On-policy Distillation 纳入统一框架。

研究背景与动机

在 LLM 后训练中,RLVR 范式已成为数学推理、代码生成等可验证领域的关键技术。其基本设定是:模型对每个问题采样多条回复,根据奖励(通常只有 +1/-1)的组内相对优势更新策略。然而这种稀疏的轨迹级奖励面临两个根本瓶颈。其一是信用分配粒度不足:整条回答要么全对要么全错,模型无法得知具体是哪个 token 导致失败或成功。其二是零优势问题:当一组采样全部正确或全部错误时,组内所有回复的优势归零,大量训练信号被浪费。

近期工作普遍引入熵作为补充的优势塑形信号。基本思路是:高熵意味着模型对当前 token 的置信度低(存在探索空间),应给予正向激励;低熵则意味着模型已经很确定,应压制该方向的更新。然而论文指出,熵只刻画不确定性本身,无法区分两类截然不同的不确定性:一是"有益的探索"——模型在正确解法上寻找替代路径;二是"有害的混淆"——模型被错误解法中的细节所迷惑。二者产生的熵信号完全等价,但它们对学习的影响正好相反。这导致现有熵基方法的设计彼此矛盾:有的奖励高熵,有的惩罚高熵,本质上是在用错误的信息指导学习。

作者的核心洞察来自一个教育学类比:学生想知道自己解题是否正确,不能只盯着自己的卷面发呆,而要对照参考答案。当参考答案让某个步骤的概率下降时,说明该步骤倾向于错误;反之则倾向于正确。这种"自我对照"的思想正是 CPO 的出发点——用参考引导分布与生成分布之间的对比分歧来感知 token 级的正确性。

方法

CPO 的核心是定义 token 级的对比分歧。给定输入 、已生成前缀 、候选 token 以及参考答案 ,分歧定义为:

其中 是普通的生成分布, 是参考引导的后验分布——将问题 和参考答案 同时输入模型,让模型按"参考答案所暗示的思路"重新生成在当前位置选 的概率。这个差值度量的是:引入参考答案之后,模型对当前 token 的置信度如何变化。如果 ,说明参考答案的出现反而让模型更不愿意选这个 token,这意味着该 token 倾向于错误;反之 则表示该 token 倾向于正确。

为了给这个直觉提供形式化保证,论文引入 oracle 正确性概率 ——给定前缀条件下选择 后最终答案正确的条件概率。利用 Bayes 准则,可以将理想正确性条件下的 token 分布重写为:

其中 是前缀级正确性边际概率。由此推导出的核心定理表明:

该对数比值对 严格单调递增。这意味着: 当且仅当 ,即该 token 倾向于错误;反之则倾向于正确。由于参考答案 编码了 ground truth,参考引导分布近似等于理想正确性条件分布,因此 可作为正确性的可靠代理。

有了 token 级的正确性信号,下一步是将其融入策略优化。基础形式是在轨迹级 advantage 上叠加 ,但这可能造成 token 级信号与轨迹级信号方向冲突。为此论文设计了带裁剪的分段塑形规则,确保 token 级信号最多削弱一半的轨迹级优势,从而保留轨迹级的整体方向性。

最终 CPO 的目标函数与 GRPO 结构相同,只是将原始 advantage 替换为塑形后的 ,并附加一个双向前向传播的计算开销(约增加 20% 的训练时间)。值得注意的是,On-policy Distillation 恰好是 CPO 的特例——当 由外部教师模型实例化时,reverse KL 形式 与上述分歧定义完全一致。这使得 CPO 将看似独立的两类方法——RLVR 与蒸馏——统一在同一个正确性驱动的框架下。

实验与结果

实验在 Qwen2.5-Math-7B 和 Qwen3-Base-4B 两个基础模型上进行训练(MATH 数据集 7.5k 题),评测覆盖领域内(MATH-500、AIME2024、AIME2025、AMC2023)和领域外(GPQA、MMLU-Pro、KnowLogic)共七个基准。

核心结果是 CPO 在两个模型上平均超越 GRPO 达 7.7% 和 8.5%,在最具挑战性的 AIME2025 上提升尤为显著(7B 模型上 43.3 vs 30.0)。更值得关注的是泛化表现:熵基方法在域外常出现退化,而 CPO 不仅没有退化,甚至略有提升(如 Qwen3-Base-4B 在 GPQA 上 78.3 vs 基础模型的 76.8)。这说明基于正确性的信号比基于不确定性的信号更能学到真正可迁移的能力。

针对零优势问题的专项实验表明,当训练数据全部来自零优势 prompt 时,CPO 仍能持续学习并提升,而对比方法 RL-ZVP 平均落后 3.2 个百分点。这验证了通过 token 级正确性注入信号的必要性。

消融实验揭示了一个深层规律:正确响应与错误响应在 CPO 中扮演着截然不同的角色——正确响应倾向于高熵(维持探索多样性),错误响应倾向于低熵(聚焦错误位置纠正)。这种天然分工使得 取得最佳综合表现。对 token 级分歧的词云分析进一步表明,CPO 聚焦于执行性 token(如代码关键字、符号运算),而熵基方法更多关注话语标记,两者指向了不同的学习目标。

讨论与可借鉴点

CPO 的核心贡献在于提出了一个简单而有力的假设:参考引导分布与生成分布之间的对比分歧,能够可靠地反映 token 级的正确性。这个假设在数学上得到了严格证明,在实验上也获得了充分验证。它将 RLVR 中的优势塑形从"熵驱动的探索利用平衡"转变为"正确性驱动的信用分配",后者与奖励信号的本质目标(正确性)更为对齐。

从实践角度看,CPO 的额外开销主要是参考引导的一次额外前向传播,这使得训练成本增加约 20%。论文选择使用参考答案(ground truth)作为 的实例化,但理论上任何比当前策略更"正确性知情"的分布都可以——外部教师、另一个模型的 critique,甚至 Critic 的反馈均可。这一开放性为后续工作留下了广阔的探索空间。

值得思考的是方法论层面的启示。CPO 成功地将"对照参考答案"这一人类学习中的基本策略引入策略优化,暗示了多视角对比在信用分配中的潜力——通过引入额外的分布(参考的、教师的、对抗的)来获得更细粒度的学习信号,这可能是突破稀疏奖励困境的一条有前景的路径。

摘要

可验证奖励强化学习(RLVR)通常使用熵来进行优势塑形。然而,熵无法区分有益的不确定性与有害的混淆,从而限制了其作为正确性信号的有效性。我们提出了对比策略优化(CPO),该方法利用参考引导生成分布与普通生成分布之间的 token 级对比分歧来进行正确性感知的优势塑形。理论分析和实验结果均表明,这种分歧能够可靠地指示 token 级别的正确性。我们进一步表明,在策略蒸馏是 CPO 的一个特例,其中后验分布由外部教师模型实例化。CPO 还能解决零优势问题。在领域内和领域外基准上的实验表明,CPO 在保持强大泛化能力的同时,大幅优于基于熵的 RLVR 方法。进一步分析显示,正确和错误的回答分别自然地支持探索与利用,平衡二者可获得最佳性能。

速览

TLDR:针对可验证奖励强化学习(RLVR)中常用熵进行优势塑形、但无法区分有用不确定性与有害混淆的局限,本文提出对比策略优化(CPO):利用参考引导分布与普通生成分布之间的逐token对比分歧,实现正确性感知的优势塑形。理论分析与实验表明该分歧可靠反映token级正确性,CPO在域内外基准上大幅优于熵基RLVR方法,且保持强泛化能力,并将On-policy Distillation纳入统一框架。 \

Motivation:RLVR常用熵作为优势信号,但熵无法区分有用不确定性与有害混淆,限制了正确性判别能力。 \

Method:提出CPO,用参考引导分布与生成分布的逐token对比分歧替代熵,进行正确性感知的优势塑形。 \

Result:在域内外基准上显著优于熵基RLVR方法,且CPO将On-policy Distillation统一为特例。 \

Conclusion:对比分歧比熵更可靠地反映token正确性;正确与错误响应分别支持探索与利用,二者平衡最佳。

Context:属于LLM后训练中优势塑形与探索利用方向的研究,承接熵基RLVR方法并加以扩展,将On-policy Distillation纳入同一对比分歧框架。


Abstract

Reinforcement learning with verifiable rewards (RLVR) commonly uses entropy for advantage shaping. However, entropy cannot distinguish useful uncertainty from detrimental confusion, limiting its effectiveness as a correctness signal. We propose Contrastive Policy Optimization (CPO), which uses token-level contrastive disagreement between reference-guided and vanilla generation distributions for correctness-aware advantage shaping. Both theoretical and empirical results show that this disagreement reliably indicates token-level correctness. We further show that On-policy Distillation is a special case of CPO, where the posterior distribution is instantiated by an external teacher model. CPO also resolves the zero-advantage problem. Experiments on in-domain and out-of-domain benchmarks demonstrate that CPO substantially outperforms entropy-based RLVR methods while maintaining strong generalization. Further analysis shows that correct and incorrect responses naturally support exploration and exploitation respectively, and balancing both leads to the best performance.


论文详细总结(自动生成)

论文总结:超越熵——基于对比策略优化的正确性感知的优势塑形

1. 核心问题与研究动机

核心问题:可验证奖励强化学习(RLVR)虽然极大推动了数学与编程等领域的推理能力提升,但其代表性的 GRPO 范式仍存在两大根本局限:

  • 稀疏奖励粒度不足:仅以整条轨迹的对错()作为奖励,忽略了 token 级别的贡献;
  • 零优势问题(zero-advantage problem):在同一组采样结果中所有回复正确率相同时(如全对或全错),所有 advantage 归一化为 0,造成大量训练数据被浪费。

现有方案的瓶颈:近期工作普遍引入作为优势塑形信号(如奖励高熵 token 探索、抑制低熵 token 等),但熵仅度量"不确定性",无法区分:

  • 有益的不确定性(productively exploring alternative solutions);
  • 有害的混淆(becoming confused by incorrect paths)。

因此熵与正确性本质上是错位的,导致现有方法设计相互矛盾(有的奖励高熵,有的奖励低熵)。

整体含义:作者主张,正确性应通过"自身评估"与"参考引导评估"之间的对比来识别——正如学生对照参考答案才能发现自己的错误一样。这一直觉为 token 级的正确性感知的优势塑形提供了新的信号源。


2. 方法论:CPO(Contrastive Policy Optimization)

2.1 核心思想

定义 token 级的对比分歧(contrastive disagreement)

其中 为先验生成分布(vanilla policy), 为参考引导的后验分布(将参考答案 与问题 一同输入模型,诱导其按"参考思路"重新生成)。该差值度量了token 级别的概率变化方向——若生成某 token 后再叠加参考答案会让该 token 概率显著下降(),说明该 token 倾向于错误;反之()则倾向于正确。

2.2 理论支撑

定义位置级 oracle 正确性概率:

其中 。利用 Bayes 准则,理想正确性条件下的 token 分布可重写为:

其中 为前缀级正确性边际概率。

由此得到核心定理

该对数比对 严格单调递增,因此:

  • (错误倾向 token);
  • (正确倾向 token)。

由于 编码了 ground-truth,参考引导分布近似等于理想正确性条件分布:,故 可作为 的实用代理。

2.3 优势塑形设计

基础形式:,其中 为组内归一化的轨迹级 advantage。

为防止 token 级信号反转轨迹级信号的方向,作者设计了带裁剪的分段塑形规则

裁剪机制确保 token 级信号最多削弱一半的轨迹级优势,避免方向反转。

CPO 最终目标函数(替换 GRPO 中的 advantage 为 ):

其中

2.4 重要副产品:统一 On-Policy Distillation(OPD)

作者指出,OPD 中常用的 reverse KL 形式 恰好是 CPO 的特例——当 由外部教师模型实例化时得到 OPD;任何比当前策略更"正确性知情"的分布(外部教师、参考引导、critic 反馈等)都可作为 ,将 RLVR 与 OPD 统一在同一个正确性驱动的目标下。


3. 实验设计

3.1 训练与评估数据

  • 基础模型Qwen2.5-Math-7B(数学专用)、Qwen3-Base-4B(通用);
  • 训练集:MATH 数据集(7.5k 题)。

3.2 评测基准

  • 领域内(in-domain):MATH-500、AIME2024、AIME2025、AMC2023;
  • 领域外(out-of-domain):GPQA(知识型)、MMLU-Pro(综合理解)、KnowLogic(逻辑推理);
  • 主要指标:Pass@16(采样 16 次聚合)。

3.3 基线方法

  • 标准 RLVR:GRPO、DAPO;
  • 熵介入方法:Entropy-Tokens(Wang et al.,2025)、Entropy-Adv(Cheng et al.,2025)、EM-RL-token(Agarwal et al.,2025)、RL-ZVP(Le et al.,2025)、IB-reg(Lei et al.,2025);
  • 附录中:SFT、Distillation。

4. 资源与算力

  • GPU:8 块 A800;
  • prompt batch size:1024,每个 prompt 采样 8 个 rollout;
  • 采样温度:1.0;
  • 最大上下文长度:Qwen2.5-Math-7B 为 4096,Qwen3-Base-4B 为 8192;
  • mini-batch size:256,学习率KL 系数PPO clip
  • 组合强度
  • 额外开销:参考引导前向传播使训练时间增加约 20%
  • 统计可靠性:对 CPO、GRPO、DAPO 各跑了 3 次独立实验(结果在附录 F.1,CPO 标准差远小于 DAPO,例如 AIME2024 上 vs )。

5. 实验数量与充分性

  • 主实验表:2 张(Qwen2.5-Math-7B、Qwen3-Base-4B),共 7 个 benchmark × 9 个方法对比;
  • 消融实验:表 3 覆盖三大维度
  • 数据有效性(CPO 仅作用正确响应 vs 仅作用错误响应);
  • 参考引导 prompt 设计(单轮 vs 2-turn gold-shot vs 2-turn 1-shot);
  • 优势设计(加权分歧、轨迹级平均、无裁剪、disagreement regularization);
  • 后验分布消融:图 4 验证 不同实例化(教师、self|ref、教师|ref)的效果;
  • 零优势问题专项实验:附录 F.2 控制实验仅使用零优势 prompt 训练;
  • 训练动态分析:图 5 跟踪 accuracy、Pass@K、熵、响应长度;图 6 分析 比率;
  • token 词云对比:图 7 比较 CPO 与熵识别的高分歧 token 的语义差异;
  • 方法对比扩展:附录 F.3 与 SFT、Distillation 比较。

整体实验数量较为充分,涵盖了正确性验证(消融 + 失败案例 + 训练动态)公平性(多基线 + 独立重复 + 域内外)两个维度;但作者在论文主文中仅展示 Pass@16 单点估计(附录补充了统计检验),且仅在两类 4B/7B 模型上验证,模型规模覆盖有限。


6. 主要结论与发现

1. 整体性能大幅领先:在 Qwen2.5-Math-7B 和 Qwen3-Base-4B 上,CPO 平均分别超过 GRPO 7.7%8.5%,在 AIME2025(最难的 benchmark)上提升尤为显著(如 7B 模型上 43.3 vs 30.0);

2. 泛化能力保留:熵基方法常出现域外性能退化,而 CPO 在 GPQA、MMLU-Pro 上甚至超过基础模型(如 Qwen3-Base-4B 在 GPQA 上 78.3 vs 76.8);

3. 解决零优势问题:在仅使用零优势 prompt 训练时,CPO 比 RL-ZVP 平均高 +3.2%

4. 探索与利用天然分工

  • 正确响应 → 强化多样正确路径 → 维持高熵(探索);
  • 错误响应 → 聚焦错误位置纠正 → 降低熵(利用);
  • 时综合表现最佳;

5. CPO 与熵的本质差异:二者 76% 的高分歧 token 重合,但 CPO 聚焦于执行性 token(如 python, output, tau, equiv),而熵聚焦于话语标记(如 Please, Consider, Human),表明 CPO 与任务正确性更紧密对齐;

6. 训练动态优势:GRPO 将熵压至接近 0,导致探索坍缩;CPO 维持高熵平台且响应更长,Pass@K 在 K=1…16 全范围稳定提升。


7. 优点

  • 理论严谨:从 Bayes 重加权出发,给出"对比分歧与 oracle 正确性概率单调相关"的严格证明(Theorem C.8),不仅有动机直觉也有形式化保障;
  • 统一视角:将 OPD 的 reverse KL、CPO 的 self|ref、CPO 的 teacher|ref 等统一为"正确性知情的后验分布",揭示了多个看似不同的方法本质;
  • 细粒度信用分配:在 token 级别引入正确性信号,缓解 GRPO 的稀疏奖励与零优势两大痼疾;
  • 保留探索能力:与基于熵的方法天然过度压低熵不同,CPO 通过正确响应注入新梯度反而维持熵水平;
  • prompt 设计精细:使用第一人称、要求实时解题语气、禁止提及参考答案的单轮 prompt,最大化后验分布的正确性偏移(附录 D);
  • 公平对比充分:3 次独立重复实验、域内外、7 个 benchmark、多类基线(标准 RLVR + 5 种熵介入 + SFT + Distillation)。

8. 不足与局限

  • 额外算力开销:参考引导前向传播使训练时间增加约 20%,在更大规模模型或更长上下文下代价可能更显著;
  • 依赖参考答案:当前实现要求每题有 ground-truth 答案,限制了在开放式生成(无标准答案的主观任务)上的直接应用;
  • 应用域受限:实验仅针对数学推理,尽管有 GPQA、MMLU-Pro、KnowLogic 等域外测试,但核心训练场景单一;
  • 模型规模覆盖不足:仅在 4B 和 7B 模型上验证,未在 1B 以下或 13B+ 模型上确认可扩展性;
  • prompt 敏感:消融表 3 显示 prompt 设计对性能影响明显(如 2-turn 1-shot 比默认单轮低 ~6% 域内平均),实际部署中需要专门调优;
  • Pass@16 作为主要指标:该指标聚合 16 次采样,能缓解方差但相比 greedy decoding 对单点正确率提升的展示较弱;
  • 零优势控制的混杂因素:附录 F.2 在零优势 prompt 上对比 CPO 与 RL-ZVP 时,二者同时承担了"分配非零 advantage"与"塑形规则"两类差异,未完全解耦;
  • 未来方向:作者在 Limitation 中提到可尝试异步计算 、用 critic 反馈替代参考答案以扩展到开放域,但当前未给出实验验证。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记