arXiv 2606.28707v1 · 发布 2026-06-27

BV-Blend:基于不确定性加权历史基线的稳定无评论家可验证奖励强化学习

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

AUTHORS Yupeng Chang, Yuan Wu, Yi Chang
EVIDENCE 无评论家强化学习算法设计与优势估计稳定性分析
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 21:35:20 UTC

📝 TLDR

无评论家RLVR方法(如GRPO)依赖组内奖励归一化估计优势,在冷启动与二元验证器下若组内奖励完全相同,方差为零导致优势为零、学习停滞。BV-Blend将提示局部on-policy统计与按语义聚类条件化的历史奖励矩相结合,用EMA跟踪每个聚类的奖励均值与方差,并以标准误代理推导置信权重,将历史基线/方差与局部统计混合,形成标准化优势用于PPO风格裁剪更新。在可验证推理基准上提升训练稳定性与性能,且在组归一化方法失效的设定下保持鲁棒。

🧭 速览

动机

GRPO等无评论家方法的组内归一化优势在冷启动与二元奖励下因组内方差为零而塌缩为零,阻碍学习进程。

方法

按语义聚类用EMA追踪历史奖励均值与方差,以标准误代理计算置信权重,将历史基线与方差同提示局部统计融合,构造标准化优势。

结果

在可验证推理基准上提升训练稳定性与最终性能,并在组归一化方法停滞的失效场景下保持有效学习。

结论

BV-Blend以历史不确定性加权稳定无评论家RLVR的优势估计,缓解冷启动失效问题,扩展了critic-free范式的适用边界。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

BV-Blend 针对无评论家可验证奖励强化学习中组内奖励方差为零导致优势塌缩的致命问题,提出将提示局部的在策略统计量与语义聚类条件化的历史奖励矩相融合的方法。它用标准误(SEM)代理不确定性,通过指数衰减映射为置信权重,自适应地混合历史与局部统计形成稳定的标准化优势。在 Qwen2.5-Math-7B 上于数学推理和OOD泛化任务中同时取得最优,显著缓解了冷启动阶段的训练停滞问题。

研究背景与动机

可验证奖励强化学习(RLVR)已成为对齐大语言模型的主流范式,尤其在数学推理、代码生成等可自动验证的领域。通过设计确定性的验证器(例如检查最终答案是否匹配标准解),无需人工标注即可获得可靠的奖励信号,大幅降低了标注成本并提升了可扩展性。

在这类方法中,GRPO(Group Relative Policy Optimization)作为代表性范式,通过组内奖励归一化来估计优势函数,从而避免训练独立的评论家网络。相比 PPO 需要同时维护策略网络和价值函数的双网络架构,GRPO 显著降低了内存和计算开销,使得在消费级硬件上微调数十亿参数的语言模型成为可能。

然而,GRPO 的优势估计存在一个被长期忽视但极为关键的失效模式:当同一提示组内的所有采样轨迹获得完全相同的奖励时,组内方差为零,归一化后的优势信号退化为零。论文以定理形式严格证明了这一塌缩现象:

> 若提示 的 rollout 组满足 ,则 ,对所有 成立。

这一定理揭示了一个严峻的现实:在训练初期使用二元验证器时,冷启动阶段的模型往往表现较差,同一提示下要么全部采样正确、要么全部错误,导致优势函数长期为零。更隐蔽的是,即便模型逐渐学到部分正确行为,只要某个提示组的奖励仍然完全同质,该组就始终无法获得学习信号。实验数据显示,GRPO 在整个训练过程中有效信号比例显著偏低,这直接制约了 critic-free 范式的收敛速度与最终性能。

方法

BV-Blend 的核心洞察在于:优势估计的稳定性不仅取决于当前批次的统计量,更应考虑跨时间的奖励分布信息。基于这一直觉,它设计了一套将局部统计与历史矩相融合的框架,使得即便在组内方差为零时,也能借助历史积累的分布信息维持非退化的优势尺度。

语义聚类条件化是第一个关键设计。BV-Blend 使用冻结的句向量编码器 和离线训练、训练时固定的 K-means 码本 ,将每个提示映射到最近簇:

聚类的价值在于,同一簇内的提示通常具有相似的难度分布和奖励模式,历史统计因此具有语义上的可信度。例如,所有涉及"数论基础"的数学问题可能共享相似的正确率曲线,将它们的奖励信息聚合能够获得更稳健的均值与方差估计。

指数移动平均(EMA)追踪的历史奖励矩是第二个核心模块。对每个簇 ,BV-Blend 维护三个 EMA 统计量:均值 、二阶原点矩 、有效样本量 。给定当前 batch 的充分统计量,更新规则为:

由此可推导历史均值 、方差 与标准差 。EMA 的引入使得历史统计具有时间平滑性,既能捕捉长期趋势,又不会因短期波动而剧烈震荡。

不确定性到置信度的映射是连接历史与局部的桥梁。BV-Blend 用标准误代理量刻画历史统计的不确定性:

并通过指数衰减映射为置信权重:

这一设计的物理含义清晰:历史样本量越大、方差越小,标准误越小,置信权重越接近 1,方法越信赖历史信息;反之则越接近 0,回退到纯提示局部统计。温度参数 控制置信度变化的陡峭程度。

基线与尺度的混合将置信权重落到实处。对于提示 (对应权重 ),混合基线与方差为:

最终形成 BV-Blend 优势:

(组内方差为零)时,只要 ,混合尺度 仍非退化,优势信号得以保留。这一机制从根本上解决了一方差塌缩问题。

值得注意的是,BV-Blend 仅修改优势估计器,优化目标保持 PPO 截断形式不变,这意味着它可以无缝嵌入现有的 RLVR 训练管线,迁移成本极低。

实验与结果

论文在数学推理领域展开了系统评估。训练集来自 OpenR1-Math-220k 的 45,000 题筛选子集,使用 Math-Verify 作为二元验证器,奖励信号为通过(+1)或未通过(0)。主模型为 Qwen2.5-Math-7B,采用 128 条轨迹每轮(16 提示 × 8 rollout)、AdamW 优化器与余弦退火学习率。

在领域内数学基准上,BV-Blend 以 51.7% 的平均准确率显著超越所有对比方法。相比最强纯 on-policy 基线 Oat-Zero(43.8%),提升达 7.9 个百分点;相比使用外部演示数据的 ReLIFT(47.8%)和 LUFFY(50.1%),同样取得领先。在 OOD 泛化任务(ARC-C、GPQA-diamond、MMLU-Pro)上,BV-Blend 同样以 64.1% 的均值准确率位列第一,展现了跨领域迁移的稳健性。

训练动力学分析揭示了背后的机制。图 2d 追踪了有效信号比例(即归一化尺度非退化的提示组占比),BV-Blend 全程显著高于 GRPO,直接验证了历史统计对零方差塌缩的对冲作用。同时,BV-Blend 产生更长的响应、更高的策略熵残留,奖励曲线更平滑,且未出现无奖励 hacking 常见的长度爆炸现象。

难度分层分析进一步表明,BV-Blend 的优势在困难样本上最为显著。在 Hard 与 Hardest 桶中,其准确率提升最为明显,而响应长度与 GRPO 相当,说明性能收益并非来自冗长生成,而是真正提升了解题能力。

消融实验提供了精细的组件分析。简单固定权重 的历史平均反而比 GRPO 更差(43.7% vs. 45.5%),这有力地证明了历史信息需要选择性融合,盲目混合会引入偏差。不确定性驱动的 SEM 加权(49.7%)显著优于仅用 或仅用 的单一信号(49.7%/49.1%),二者协同达到完整的 51.7%,印证了置信权重设计的必要性。

跨 backbone 鲁棒性测试在 Qwen2.5-Math-1.5B、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 上均一致优于最强对比基线,尤其在 Llama-3.1-8B 上显著缓解了 prompt-local 估计器的不稳定性,说明方法不依赖于特定模型架构。

讨论与可借鉴点

BV-Blend 展示了通过不确定性驱动的时间信息融合来稳定在线学习这一思路的潜力。其核心贡献在于将一个看似工程性的调参问题(如何混合历史与局部统计)转化为有原则的统计推断问题。SEM 加权提供了一种自动调节置信度的机制,无需手工设定硬阈值,使得方法对不同训练阶段具有自适应能力。

然而,该方法也存在若干局限。首先,聚类质量高度依赖冻结编码器与固定码本,若训练分布发生显著漂移,簇条件化历史可能失去语义相关性。其次,EMA 追踪与分布式聚合引入了额外的实现复杂度和超参数(),在实际部署中需要仔细调优。再者,主实验集中在数学推理的二元验证场景,在代码生成、开放问答或非二元奖励下的有效性尚未验证。最后,极端稀疏场景下——若当前提示组与对应历史簇同时缺乏方差——BV-Blend 仍可能失去信号。

对于 [[强化学习]] 与 [[大语言模型对齐]] 社区而言,BV-Blend 的启示在于:critic-free 方法的瓶颈往往不在策略优化器本身,而在于优势估计的质量。未来的工作可以探索更精细的聚类策略(如在线更新码本)、更通用的时间融合机制(如 attention-based 历史聚合),以及在更广泛任务类型上的验证。

摘要

无评论家的可验证奖励强化学习(RLVR)以分组相对策略优化(GRPO)为代表,它无需训练价值函数(评论家),相较于基于评论家的 PPO 流程,在大语言模型对齐方面减少了内存和计算开销。然而,GRPO 式的优势估计依赖于提示局部(即同一提示组内)的奖励统计,可能不稳定。具体而言,当一个提示组中的所有采样结果获得相同奖励时,组内奖励方差为零,组归一化会使该组得到零优势,从而在具有二元验证器的冷启动场景下阻碍学习。我们提出了 BV-Blend,这是一种无评论家框架,通过将提示局部的在策略统计量与语义聚类条件下的历史矩相结合来稳定优势估计。BV-Blend 为每个聚类维护通过指数移动平均(EMA)追踪的奖励矩,从均值标准误(SEM)代理量中导出置信权重,并利用该权重将历史统计量与提示局部基线和方差统计量进行混合,得到用于 PPO 式截断更新的标准化优势。在可验证推理基准上的实验表明,BV-Blend 提升了训练稳定性与性能,并在组归一化方法可能停滞的场景下保持鲁棒性。

Abstract

Critic-free reinforcement learning with verifiable rewards (RLVR), exemplified by Group Relative Policy Optimization (GRPO), avoids training a value function (critic) and reduces memory and compute overhead relative to critic-based PPO pipelines for aligning large language models. However, GRPO-style advantage estimation depends on prompt-local (within-prompt-group) reward statistics and can be unstable. In particular, when all rollouts in a prompt group receive identical rewards, the within-group reward variance becomes zero, and group normalization yields zero advantages for that group, impeding learning in cold-start regimes with binary verifiers. We introduce BV-Blend, a critic-free framework that stabilizes advantage estimation by combining prompt-local on-policy statistics with semantic-cluster-conditioned historical moments. BV-Blend maintains EMA-tracked reward moments for each cluster, derives a confidence weight from a standard error of the mean (SEM) proxy, and uses this weight to blend historical and prompt-local baseline and variance statistics into a standardized advantage for PPO-style clipped updates. Experiments on verifiable reasoning benchmarks show that BV-Blend improves training stability and performance, and remains robust in regimes where group-normalized methods may stall.


论文详细总结(自动生成)

BV-Blend 论文总结

一、核心问题与研究动机

研究背景:可验证奖励强化学习(RLVR)已成为对齐大语言模型(LLM)的主流范式,尤其在数学、代码等可自动验证正确性的领域。相较于基于评论家(critic)的 PPO 流程,无评论家方法(如 GRPO)通过组内奖励归一化估计优势,节省了价值函数训练带来的内存与算力开销。

核心痛点:GRPO 式的优势估计完全依赖提示局部(prompt-local)的奖励统计——即对同一提示的 条采样轨迹求均值与方差后做标准化。当组内奖励方差为零时(如二元验证器冷启动下所有采样全部正确或全部错误),标准化优势退化为零,使得该提示组完全丧失学习信号。论文以定理形式证明了这一塌缩现象:

> 定理 1(GRPO 的提示局部塌缩):若提示 的 rollout 组满足 ,则 ,对所有 成立。

这一失效模式在 RLVR 的早期训练中频繁出现,显著降低了有效学习信号比例,制约了 critic-free 范式的稳定性与适用性。


二、方法论:BV-Blend

2.1 整体思想

BV-Blend 不训练评论家,也不引入额外监督,而是从优势估计器本身入手:将提示局部的在策略统计量与按语义聚类条件化的历史奖励矩融合,利用基于标准误(SEM)的不确定性度量自适应地控制融合权重,构造一个统一的标准化优势,从而避免零方差塌缩。

2.2 关键模块

(1) 提示语义聚类

使用冻结的句向量编码器 和离线训练、训练时固定的 K-means 码本 ,将每个提示分配到最近簇:

(2) 历史奖励矩(EMA)

对每个簇 维护三个 EMA 统计量:均值 、二阶原点矩 、有效样本量 。给定当前 batch 的充分统计量 ,更新规则为:

由此推导历史均值、方差与标准差:

冷启动处理:首次出现的簇以 初始化,并在该 batch 内将置信权重设为 (退化为纯提示局部归一化)。

(3) 不确定性到置信度的映射

用 SEM 代理量刻画历史统计的不确定性:

并通过指数衰减映射为置信权重:

历史越确定( 小、 大), 越接近 1,越信赖历史;反之则越接近 0,回退到提示局部统计。

(4) 基线与尺度的混合 + 单次标准化

对每条提示 (权重 )混合基线与方差:

并最终形成 BV-Blend 优势:

时,只要 ,混合尺度仍非退化,优势信号得以保留。

(5) PPO 风格优化目标

BV-Blend 仅修改优势估计器,优化目标保持 PPO 截断形式不变:

主实验中 ,仅依赖奖励统计本身区分信号。论文还提供了完整的伪代码(Algorithm 1:优势计算;Algorithm 2:训练循环)以及偏差–方差分析,从收缩估计的角度解释为何 SEM 加权的融合能降低方差并保留信息。


三、实验设计

3.1 数据集与训练集

  • 训练集:从 OpenR1-Math-220k 的默认 94k split 中筛选 45,000 题,经 Math-Verify 剔除无效或不可验证样本,并过滤生成超过 8192 token 的实例。
  • 任务领域:以数学推理为主——客观、可验证、可扩展、且对提示局部归一化构成天然压力测试。

3.2 评测基准

  • 领域内数学:AMC、MATH-500、Minerva、AIME 2024、AIME 2025、Olympiad;前两者用 avg@32,其余用 pass@1。
  • OOD 泛化:ARC-C(抽象推理)、GPQA-diamond(专家科学知识)、MMLU-Pro(多学科问题求解)。
  • 解码设置:温度 0.6;多选题做选项随机置换以缓解位置偏差。

3.3 对比方法

  • On-policy RLVR 基线:GRPO(本文复现)、SimpleRL-Zero、OpenReasoner-Zero、PRIME-Zero、Oat-Zero。
  • 混合/离策略方法:SFT、SFT→RL、ReLIFT、LUFFY(含扩展训练版本 LUFFY†)。

3.4 训练配置

  • 主模型:Qwen2.5-Math-7B(附加 Qwen2.5-Math-1.5B、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 鲁棒性测试)。
  • 优化器:AdamW,余弦退火 + 线性 warmup,峰值 LR
  • 每轮:128 条轨迹(16 提示 × 8 rollout),采样温度 1.0,minibatch 64。
  • 奖励:二元(Math-Verify 通过为 +1,否则 0),无中间或格式奖励。
  • 截断 ,熵正则系数 ,主实验中 KL 系数
  • EMA 更新率 ,稳定性常数
  • 训练轮数:500 iterations。

四、算力与资源

  • 硬件:单节点 8 张 NVIDIA RTX PRO 6000 GPU(每张 96 GB VRAM)。
  • 分布式训练:PyTorch FSDP 全分片数据并行。
  • 软件栈:PyTorch 2.4.0、HuggingFace Transformers/Accelerate、vLLM v0.6.3(CUDA 12.1)、FlashAttention v2.7.3、TensorDict v0.5.0、verl 库做 RL 编排。
  • 训练时长:未明确报告 wall-clock 时间。

五、实验数量与充分性

论文围绕一个核心方法(BV-Blend)展开了较为系统的实证评估:

类别数量/规模说明
主实验1 张主表,覆盖 10 个基准与 9 类基线对比,包含领域内与 OOD
训练动力学分析4 个曲线(图 2)响应长度、策略熵、训练奖励、有效信号比例
难度分层分析4 类提示 × 2 子集(图 3)Easy/Medium/Hard/Hardest × Standard/Complex,4 个 checkpoint
消融实验(SEM 置信度)5 个变体(表 2)GRPO、固定 、仅 、仅 、完整 SEM
置信度映射函数消融3 种 (表 4)1/(1+u)、线性衰减、指数衰减
跨 backbone 鲁棒性3 个额外 backbone(图 5)Qwen2.5-Math-1.5B、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct
理论分析1 个定理 + 偏差-方差讨论证明 GRPO 塌缩,给出 BV-Blend 的统计解释

充分性评价:覆盖较为全面——既有主指标对比、训练过程诊断、难度分层、组件消融,也含跨 backbone 鲁棒性测试,并提供了理论保证与偏差-方差解释。公平性方面,所有方法共享同一 PPO 截断目标与同一训练管线,仅替换优势估计器或上层策略,差异可归因于所提出的方法本身。但也存在下述局限(见第八节)。


六、主要结论与发现

1. 整体最优:在 Qwen2.5-Math-7B 上,BV-Blend 在数学推理均值(51.7%)与 OOD 泛化均值(64.1%)上同时取得第一,显著优于最强纯 on-policy 基线 Oat-Zero(43.8%,+7.9 分),并超过多个使用了外部数据(SFT/演示)的混合方法(ReLIFT 47.8%、LUFFY 50.1%)。

2. 冷启动失效缓解:图 2d 显示 BV-Blend 的有效信号比例(提示组中归一化尺度非退化的占比)全程显著高于 GRPO,验证了历史统计对零方差塌缩的对冲作用。

3. 训练动力学更平稳:BV-Blend 产生更长的响应、更高的策略熵残留、更平滑的奖励曲线,且不出现长度爆炸(图 2、图 3)。

4. 难样本上提升最显著:图 3 显示在 Hard/Hardest 桶中 BV-Blend 的准确率提升最为明显,而响应长度与 GRPO 相当,说明收益并非来源于冗长生成。

5. 消融结论:简单固定权重 历史平均反而比 GRPO 更差(43.7 vs. 45.5),表明历史信息需要选择性融合;仅用 或仅用 任一信号已有改善(49.7/49.1),二者通过 SEM 结合达到 51.7。

6. 跨 backbone 鲁棒:在 1.5B/7B Instruct/Llama-3.1-8B 上均一致优于最强对比基线,尤其在 Llama-3.1-8B 上明显缓解了 prompt-local 估计器的不稳定性。


七、优点与亮点

  • 问题定位精准:用简洁的定理直接证明 GRPO 在同质奖励下的优势塌缩,将工程痛点形式化。
  • 改造点干净:仅修改优势估计器,不动 PPO 截断目标,便于嵌入现有 RLVR 流程,迁移成本低。
  • 不确定性加权合理:用经典 SEM 代理量驱动置信度,物理含义清晰,并通过指数衰减平滑地调节信任度,无需硬阈值。
  • 统计解释完整:附录 D 给出偏差-方差分析,将 BV-Blend 视为历史-局部的收缩估计,解释其降方差、保留信息的机理。
  • 冷启动处理明确:未见过的簇设为 并初始化 EMA 状态,避免了不稳定历史造成负面影响。
  • 多维度评估:主指标 + 训练动力学 + 难度分层 + 消融 + 跨 backbone,结论相互印证。
  • 可复现性:码本与编码器离线固定、所有 EMA 缓冲以稠密长度 数组实现并提供 all-reduce 流程,附录给出完整符号表与伪代码。

八、不足与局限

  • 聚类依赖:性能依赖于冻结编码器与固定 K-means 码本的质量与粒度;若训练分布发生显著漂移,簇条件化历史可能不再适用。
  • 额外簿记与超参:需维护每簇 EMA 矩、有效样本量与分布式聚合;引入 等额外超参数,调参成本上升。
  • 域与验证器局限:主实验集中在数学(确定性二元奖励),未在代码、开放问答或非二元奖励下验证,泛化性仍待证明。
  • 极端稀疏场景仍可能停滞:若当前提示组与对应历史簇同时缺乏方差(),BV-Blend 仍会失去信号;论文坦诚地承认了这一边界。
  • **训练时长未披露

八、不足与局限(续)

  • 训练时长未披露:论文未给出 wall-clock 训练时间与每轮迭代的平均耗时,难以评估实际算力开销与收敛效率,不利于工程复现与部署评估。
  • 码本粒度敏感性(簇数)的选择缺乏系统搜索,仅给出默认值,离线 K-means 的最佳 与训练分布的匹配度可能影响历史统计的代表性。
  • 二值奖励假设:不确定性加权机制基于二元奖励场景设计,对连续奖励、部分正确奖励或带噪声的软标签场景未做适配与验证。
  • 公平性细节:与 LUFFY、SFT→RL 等混入外部数据/演示的方法对比时,未充分控制训练数据量与计算预算的一致性,可能放大或掩盖优势。
  • OOD 基准有限:OOD 评测仅 3 个基准(ARC-C、GPQA-Diamond、MMLU-Pro),覆盖推理、知识、理解三类,但缺少代码、Agent、指令遵循等更广泛的分布外测试。
  • 缺乏人工评估:所有指标均依赖自动验证器与选择题 logprob,缺少对开放式长回答的人工质量评估。

九、结论与展望

核心贡献总结:BV-Blend 针对 critic-free RLVR 中 GRPO 的提示局部零方差塌缩问题,提出了一种语义聚类条件化 + 不确定性自适应融合的优势估计器。它在不引入 critic、不改变 PPO 截断目标的前提下,通过历史奖励 EMA 矩与提示局部统计量的 SEM 加权混合,既保留了纯 on-policy 路径的简洁性,又显著提升了优势信号的稳定性与有效性,在 Qwen2.5-Math-7B 等多 backbone 上均取得一致的领先结果。

潜在研究方向

1. 动态/在线聚类:探索在训练中动态更新码本(如 EMA 词向量 + 增量 K-means),以缓解分布漂移;

2. 跨领域扩展:将 BV-Blend 推广至代码生成、可验证工具调用、多轮 Agent RL 等非二元奖励场景;

3. 与 critic-based 方法结合:研究 BV-Blend 风格的全局/语义基线能否替代或辅助价值函数,进一步节省 critic 的训练开销;

4. 不确定性度量的替代:尝试贝叶斯后验方差、共形预测等更严格的不确定性量化,替代启发式的 SEM 代理;

5. 理论深化:对融合估计的偏差-方差权衡给出更紧的有限样本收敛界,并刻画不同奖励分布下的最优融合权重。

总体评价:BV-Blend 是一项问题导向鲜明、改造点最小、统计解释清晰、实验支持充分的改进。其优势估计器层面的"小手术"带来了 RLVR 训练稳定性的"大改善",尤其在数学推理这一 GRPO 失效最严重的场景下展现出实用价值。对任何在 critic-free RLVR 范式中遇到过 early-stage 塌缩问题并寻求低成本修复方案的从业者而言,本文的诊断(定理 1)与方案(BV-Blend)均具有直接参考意义。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记