RLVR 中的奖励粒度:比较小语言模型数学推理的过程奖励与结果奖励结构
Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models
📝 TLDR
用GRPO比较RLVR中过程奖励与结果奖励粒度。
🧭 速览
系统研究RLVR奖励结构 使用GRPO。
方法与实现细节请参考摘要与正文。
结果与对比结论请参考摘要与正文。
总体而言,该工作在所述任务上展示了有效性,并提供了可复用的思路或工具。
📊 论文图表(共 4 张)
展开查看 4 张图
TL;DR
这篇论文在可验证奖励强化学习(RLVR)框架下,系统比较了过程奖励与结果奖励对小型语言模型数学推理能力的影响。以 Qwen2.5-0.5B 为基座模型、在 GSM8K 数据集上使用 GRPO 微调,实验发现纯过程监督的测试准确率达到 63.73%,比纯结果监督的 53.75% 高出近 10 个百分点。更有趣的是,混合奖励并非总是优于单一奖励:当过程权重极低(λ=0.1)时,混合信号的表现反而不如纯结果监督,暗示两种奖励机制在优化动态上存在冲突。研究表明,奖励粒度是 RLVR 的一阶设计决策,过程级监督在提升准确率和推理链忠实度方面均显著优于结果级奖励。
研究背景与动机
可验证奖励强化学习(RLVR)近年来已成为提升语言模型数学推理能力的热门方向。这类方法的核心思想是:当模型生成的答案可以被自动验证时(比如数学题的最终数值),可以绕过人类反馈,直接利用强化学习优化模型行为。然而,现有的 RLVR 工作几乎都采用结果级奖励——只有当最终答案正确时才给予正向信号,推理过程中的每一步都得不到反馈。这种稀疏的奖励信号对大型语言模型或许尚可接受,因为它们具备较强的内在推理和自我纠错能力;但对于参数规模较小的模型而言,缺乏中间步骤的约束可能导致推理链走向失控。
这正是这篇论文想要回答的核心问题:在小型语言模型上,过程级别的细粒度监督是否能带来显著收益?如果能带来收益,过程奖励与结果奖励的组合是否比单一奖励更优?混合使用时,不同的权重配比会产生怎样的效果?这些问题不仅具有学术价值,也直接关系到如何在资源受限的场景下高效训练模型。
从更深的层面看,这项研究触及了现代大模型研究的一个根本命题:模型能力的提升究竟是来自"推理能力的真实进步",还是仅仅学会了"更好地采样出看似合理的答案"。过程奖励由于对每一步推理都进行约束,理论上更能促进真实推理能力的培养,而结果奖励则可能让模型找到绕过严格推理的"捷径"。
方法
论文的核心方法是在统一的实验框架下,系统性地改变奖励函数的粒度设置,以此比较不同奖励策略对模型行为的影响。实验以 Qwen2.5-0.5B 作为基座模型,采用 GRPO(Group Relative Policy Optimization)作为强化学习算法,在 GSM8K 数据集上进行训练和评测。
关于奖励函数的设计,论文定义了三种类型的奖励机制。结果奖励(Outcome Reward)采用最朴素的方式:提取模型生成文本中的最终答案(支持 \boxed{answer}、#### answer 等常见格式),与真实答案进行比对,在 的数值容差范围内匹配即给予 1 分,否则为 0 分。这种二元奖励信号极为稀疏——模型只有在整道题答对时才能获得正向反馈。
过程奖励(Process Reward)则将监督信号细化到推理的每一步。具体而言,论文计算生成链中与真实解法中间步骤对齐的比例:
每一步的判断标准是:该步骤的计算结果是否与 ground-truth 中对应位置的计算值一致(同样采用 容差)。为了防止模型通过生成大量冗余步骤来"刷分",论文还设置了一条规则:当生成链长度超过真实解法步数的 1.5 倍时,施加额外的惩罚。
混合奖励(Hybrid Reward)则将两者加权组合:
实验设置了 三种混合权重,分别代表重过程、平衡、轻过程三种配置。
在训练流程上,模型通过 vLLM 推理引擎生成多个 rollouts(每个样本生成 5 条),奖励函数对每条 rollout 进行评估后,使用 GRPO 算法更新策略。所有实验共享同一组超参数(batch size 64、学习率 、KL 系数 0.001、temperature 0.6 等),唯一变化的变量就是奖励函数设计,这样的设置最大化了实验结果的可归因性。
实验与结果
实验在 GSM8K 数据集上进行,该数据集包含 8,792 道小学数学应用题,其中测试集 1,319 题。论文报告了端到端准确率和多维度的推理链质量指标。
从最终准确率来看,结果呈现出清晰的模式:纯过程监督(63.73%)显著优于纯结果监督(53.75%),两者相差近 10 个百分点。混合奖励的表现与过程权重总体呈正相关——λ=0.9 时达到 61.10%,λ=0.5 时为 57.40%。然而出现了一个耐人寻味的异常:λ=0.1(轻过程、重结果)时的准确率仅为 49.30%,不仅低于纯结果监督,甚至低于所有其他 RLVR 配置。这暗示当过程奖励占比极低时,两种奖励信号在优化动态上产生了冲突,而非简单的线性叠加。
为了更深入理解不同奖励策略对推理链质量的影响,论文构建了一个分层 45 题评估切片(简单、中等、困难题各 15 道),从多个角度分析模型生成的推理轨迹。结果显示,纯过程监督虽然最终准确率最高,但其推理链的步骤有效性(Trace Validity)仅为 0.22,远低于其他配置,同时生成链的长度偏差(Chain Length Deviation)高达 6.49,意味着模型倾向于生成比必要解法长得多的推理步骤。这一发现揭示了过程奖励的潜在隐患:它可能激励模型"过度推理",生成大量看似合理但冗余的中间步骤。
相比之下,混合奖励在各项指标上取得了较好的平衡。重过程配置(λ=0.9)下的推理链步骤有效性达到 0.60、过程步骤对齐比例达到 0.84,均为最高水平,同时避免了纯过程监督的过度生成问题。
论文还使用 GPT-4o 作为评判模型,对错误类型进行了分类分析。结果揭示了两种奖励策略塑造了截然不同的"失败模式":过程奖励模型生成的推理轨迹在结构上不够一致,但算术推理扎实,错误主要集中在步骤间的逻辑衔接上;结果奖励模型生成的推理链虽然更加简洁流畅,但推导错误频发——由于缺乏对中间步骤的约束,模型可能通过看似合理但实际上错误的推理路径得到正确答案,或者在正确的最终答案前插入错误的中间推导。
讨论与可借鉴点
这项研究的核心贡献在于揭示了奖励粒度对于 RLVR 训练效果的的决定性影响。对比实验设计严格、控制变量得当,在小模型场景下填补了过程奖励系统比较的空白。几个发现值得特别关注。
首先,过程奖励带来的近 10 个百分点的准确率提升表明,在缺乏自我纠错能力的小型模型上,密集的奖励信号比稀疏的最终反馈更有指导价值。这一结论对模型选择和训练策略具有直接的实践意义:如果你使用的是较小的模型,那么在条件允许的情况下,设计过程级奖励是值得优先考虑的投资。
其次,λ=0.1 混合配置的反常表现为我们理解奖励信号的交互机制提供了新的视角。论文将其解释为"相互冲突的优化信号",但并未深入探究冲突的具体机制。一个合理的猜测是:当过程奖励占比极低时,模型在优化过程中会面临两种不同的"压力"——过程奖励鼓励生成更多、更细粒度的中间步骤,而结果奖励只关心最终答案。两种压力的方向不一致,可能导致梯度更新的方向在训练过程中反复震荡。这一假设值得在未来工作中通过消融实验进一步验证。
第三,纯过程监督虽然在准确率上表现最佳,但其推理链质量指标(尤其是 Trace Validity 和 Chain Length Deviation)暴露了明显的缺陷。这提示我们,单纯追求最终答案的正确率可能以牺牲推理效率为代价。在实际应用中,如果需要模型输出可解释、可审计的推理过程,纯过程监督可能不是最优选择。
研究也存在若干局限性。最主要的是每个实验条件仅进行单次训练,未报告多 seed 的方差或置信区间,这在统计上限制了结论的可靠性。此外,实验仅在 Qwen2.5-0.5B 一个模型规模和 GSM8K 一个数据集上进行,无法回答奖励粒度的效应是否会随模型规模放大或在不同领域泛化。过程奖励的设计依赖 ground-truth 的逐步标注,这在无法获得细粒度标注的开放领域可能难以迁移。
对于后续研究而言,一个重要方向是在更大规模的模型上验证这一发现——大型语言模型是否仍然从过程奖励中获得如此显著的优势,还是它们已经具备了足够的推理能力来弥补稀疏奖励的不足。另一个方向是探索更优雅的混合策略,比如自适应调整过程与结果奖励的权重,或者设计能够自动识别关键推理步骤的机制,而非简单地依赖 ground-truth 步数对齐。
摘要
可验证奖励强化学习(RLVR)已成为提升语言模型数学推理能力的一种颇具前景的方法。然而,现有大多数 RLVR 工作仅对最终答案进行奖励(即基于结果的奖励),而对步骤级过程监督(过程奖励)的影响探讨不足,尤其是在缺乏在稀疏反馈下自我纠错能力的小型模型上。我们在 GSM8K 数据集上,针对使用组相对策略优化(GRPO)微调的 Qwen2.5-0.5B 模型,系统比较了五种奖励条件:无强化学习基线、仅过程奖励、仅结果奖励,以及三种过程权重为 的混合奖励。仅过程奖励监督的测试准确率达到 63.73%,而仅结果奖励为 53.75%,差距近 10 个百分点,同时仅过程奖励所生成的推理轨迹具有更高的步骤有效性,且与真实答案链长度的偏差更小。混合奖励总体上与过程权重呈正相关,但出现了一个值得注意的异常现象:低过程/高结果配置()的表现反而逊于纯结果监督,提示存在相互冲突的优化信号。以 GPT-4o 作为评判模型进行的错误分析揭示了不同的失败模式分布:过程奖励模型生成的推理轨迹在结构上不够一致,但算术推理扎实;而结果奖励模型生成的推理链虽然简洁,却容易出现推导错误。我们的结果表明,奖励粒度是 RLVR 的一阶设计决策,过程级监督能够显著提升小型语言模型的准确率与推理轨迹的忠实度。
速览
TLDR:RLVR多以结果级奖励训练语言模型数学推理能力,而对小模型而言过程级监督的效果尚未充分探究。本文以Qwen2.5-0.5B为基座、GRPO为算法,在GSM8K上对比无RL基线、纯过程、纯结果及三种混合权重(λ∈{0.9,0.5,0.1})共五种奖励条件。纯过程监督准确率达63.73%,比纯结果的53.75%高出近10个百分点,推理链步骤有效性与长度偏差均更优;混合奖励总体随过程权重提升而改善,但λ=0.1反不如纯结果。研究表明奖励粒度是RLVR的一阶设计决策,过程级监督在精度与推理忠实度上均显著优于结果级。 \
Motivation:现有RLVR多采用结果级奖励,对小模型在稀疏反馈下的过程监督效果缺乏系统比较。 \
Method:以Qwen2.5-0.5B搭配GRPO,在GSM8K上对比无RL、纯过程、纯结果及λ∈{0.9,0.5,0.1}三种混合奖励条件。 \
Result:纯过程监督准确率63.73%,比纯结果53.75%高近10个百分点;λ=0.1混合反不如纯结果。 \
Conclusion:奖励粒度是RLVR的关键设计选择,过程级监督显著提升小模型推理精度与链式忠实度。
Context:本文位于RLVR奖励设计研究脉络中,针对小模型场景补充了过程奖励的系统对比证据;揭示了混合权重下优化信号冲突这一尚未充分讨论的问题。
Abstract
Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a promising paradigm for improving mathematical reasoning in language models. Yet most RLVR work rewards only the final answer (outcome-based rewards), leaving the impact of step-level process supervision (process rewards) underexplored especially for small models that lack the capacity to self-correct under sparse feedback. We systematically compare five reward conditions applied to Qwen2.5-0.5B fine-tuned with Group Relative Policy Optimization (GRPO) on GSM8K: a no-RL baseline, process-only, outcome-only, and three hybrid weightings ( process weight). Process-only supervision achieves 63.73% test accuracy versus 53.75% for outcome-only, a nearly 10-percentage point gap while yielding reasoning traces with higher step validity and lower deviation from ground-truth chain length. Hybrid rewards generally correlate positively with process weight, with one notable anomaly: the low-process / high-outcome configuration () underperforms pure outcome supervision, suggesting conflicting optimization signals. Error analysis using GPT-4o as a judge reveals distinct failure mode distributions: process models generate structurally inconsistent but arithmetically grounded traces, while outcome models produce concise but derivation-error-prone chains. Our results demonstrate that reward granularity is a first-order design decision for RLVR, with process-level supervision substantially improving both accuracy and trace fidelity in small language models.
论文详细总结(自动生成)
论文总结:RLVR 中奖励粒度的对比研究
1. 核心问题与研究动机
- 背景:可验证奖励的强化学习(RLVR)已成为提升语言模型数学推理能力的重要范式,但既有 RLVR 工作几乎都只奖励最终答案(outcome-based rewards),缺乏对逐步过程监督(process rewards)的系统研究。
- 关键问题:在小模型(如 Qwen2.5-0.5B)中,由于缺乏自我纠错能力,稀疏的最终答案奖励容易导致推理过程缺乏约束,作者明确提出研究问题:
- 过程奖励是否提升推理链的连贯性与有效性?
- 过程奖励 + 结果奖励的组合是否能比单一奖励获得更稳定、更准确的推理?
- 更深层动机:区分"推理能力的真实提升"与"更好地采样出看似合理答案"这一现代 LLM 研究的根本命题。
2. 方法论
2.1 核心思想
在 GSM8K 上使用 GRPO(Group Relative Policy Optimization)微调 Qwen2.5-0.5B,并系统性地设计 5 种奖励粒度条件,对比它们对最终准确率与推理链质量的影响。
2.2 关键技术细节
过程奖励(Process Reward):
- 每步与 ground-truth 中间计算匹配(在 容差内)即得 1,否则为 0;
- 若生成链长度超过 ground-truth 步数的 则施加惩罚,以抑制过度冗长。
结果奖励(Outcome Reward):
- 仅提取最终答案(支持
\boxed{answer}、#### answer等格式)进行二元奖励。
混合奖励(Hybrid Reward):
- 实验覆盖 三个混合权重。
算法流程:
1. 基座模型 Qwen2.5-0.5B 通过 vLLM 生成多个 rollouts;
2. 奖励函数(process / outcome / hybrid)评估每个 rollout;
3. 使用 GRPO(在 VERL 框架下)更新策略;
4. 每训练一个 epoch 后在 GSM8K 测试集上报告 val-core/math/reward/mean@1。
2.3 评估指标
- CoT-Pass@1:单次采样的端到端正确率;
- Trace Validity:推理链是否逻辑自洽、无结构性矛盾;
- Chain Length Deviation:与 ground-truth 步数的偏差;
- Process Step Ratio:与 ground-truth 中间步骤对齐的比例;
- LLM-as-a-Judge:使用 GPT-4o 标注错误类型(推导错误、计算错误、漏步、矛盾、格式问题等)。
3. 实验设计
3.1 数据集与场景
- GSM8K(Cobbe et al., 2021):8,792 道小学数学应用题,训练集 7,473,测试集 1,319;
- 由于不同难度下推理特性差异较大,作者构建了一个分层 45 题评估切片:
- 简单(2–3 步)15 题、中等(4–5 步)15 题、困难(6–11 步)15 题;
- 难度由 ground-truth 解法步数客观定义,避免表层启发式。
3.2 对比方法
实验共设 5 种条件 + 1 个基线:
| 条件 | 说明 |
|---|---|
| Base(无训练) | Qwen2.5-0.5B 直接推理,33.13% |
| Process Only | 纯过程奖励 |
| Outcome Only | 纯结果奖励 |
| Process(0.9) + Outcome(0.1) | 重过程、轻结果 |
| Process(0.5) + Outcome(0.5) | 平衡 |
| Process(0.1) + Outcome(0.9) | 轻过程、重结果 |
4. 资源与算力
- GPU:单卡 A100 80GB;
- 训练框架:VERL(Volcano Engine RL)+ vLLM 推理加速;
- 训练时长:5 个 epoch,共 580 步(按 batch size 64 计算);
- 关键超参(全部条件共享):batch size 64、mini-batch 8、lr 、KL 系数 0.001、rollouts 5、temperature 0.6、prompt 512 tokens / response 1024 tokens;
- 基础设施:基于 Lightning.ai 的 A100 实例;
- 限制:作者明确指出未报告多 seed 方差或置信区间,所有结果均为单次训练。
5. 实验数量与充分性
- 实验数量:共 5 种奖励条件 × 1 个基线 = 6 组配置;外加推理质量分析(4 个指标)+ GPT-4o 错误分析 + 单题示例对比,整体实验结构较为紧凑。
- 客观性:
- 优点:所有 RLVR 条件共享超参与硬件,变量仅为奖励函数设计,对比公平;
- 不足:未做多 seed 重复,45 题切片样本量小,统计效力有限;LLM-as-a-Judge 的可靠性依赖 GPT-4o 自身判断。
6. 主要结论与发现
6.1 最终准确率(GSM8K 全部 1319 题)
| 条件 | 测试准确率 | 相对基线提升 |
|---|---|---|
| Base | 33.13% | — |
| Process Only | 63.73% | +30.60 |
| Outcome Only | 53.75% | +20.62 |
| Process(0.5) + Outcome(0.5) | 57.40% | +24.27 |
| Process(0.9) + Outcome(0.1) | 61.10% | +27.97 |
| Process(0.1) + Outcome(0.9) | 49.30% | +16.17 |
- 核心发现 1:纯过程奖励比纯结果奖励高出近 10 个百分点(63.73% vs 53.75%),表明密集奖励信号对小模型更有指导意义;
- 核心发现 2:混合奖励整体上与过程权重正相关;
- 核心发现 3(异常):(轻过程、重结果)反而差于纯结果监督(49.30% < 53.75%),暗示两种信号在低过程权重下出现冲突的优化动态,而非简单叠加。
6.2 推理链质量(45 题切片)
- CoT-Pass@1:Process Only 0.64 > Process(0.9)+Outcome(0.1) 0.61 > Outcome Only 0.54 > Base 0.33;
- Trace Validity:Process(0.9)+Outcome(0.1) 0.60(最高)> Outcome 0.40 > Base 0.56 > Process Only 0.22;
- Chain Length Deviation:Process Only 6.49(最大,最冗长)> Outcome Only 3.64 > Process(0.9)+Outcome(0.1) 3.49 > Base 3.00;
- Process Step Ratio:Process(0.9)+Outcome(0.1) 0.84 > Base 0.79 > Outcome Only 0.77 > Process Only 0.64。
6.3 错误模式(GPT-4o 标注)
- 过程模型:产生结构不一致但算术有依据的链(局部合理、整体不稳);
- 结果模型:链简洁但推导错误频发,对中间步骤缺乏约束;
- 混合模型(重过程):错误类型分布最均匀,最类人化。
6.4 综合结论
奖励粒度是 RLVR 的一阶设计决策(first-order design decision),过程级监督在小模型上同时显著改善准确率与推理链忠实度。
7. 优点与亮点
- 变量控制严格:所有 RLVR 条件共享超参、模型、硬件,仅改变奖励函数,最大化归因可信度;
- 多维度评估:除最终准确率外,还引入 Trace Validity、Chain Length Deviation、Process Step Ratio、CoT-Pass@1 等链质量指标;
- 混合权重系统性扫描:覆盖 5 种奖励配置(含 3 种混合权重),揭示了 这一非单调异常;
- 错误机制分析深入:通过 GPT-4o 做错误分类,刻画了不同奖励制度下模型的"行为指纹";
- 代码与数据承诺开源,便于复现;
- 研究问题具体且贴合实际:聚焦"小模型是否需要更密集奖励"这一实用问题。
8. 不足与局限
- 统计效力不足:每个条件仅单次训练,无多 seed 方差、无置信区间,10 个百分点的差距只能视为"指示性"而非统计确认;
- 样本规模较小:分层评估切片仅 45 题,限制了对难度层级差异的细粒度分析;
- 模型规模单一:仅在 Qwen2.5-0.5B 上实验,无法回答奖励粒度的效应是否随模型规模放大;
- 数据集单一:仅 GSM8K,未在 MATH、SVAMP、AQuA-RAT 或多跳问答上验证,难以判断结论的领域泛化性;
- 过程奖励依赖 ground-truth 步数对齐:在无法获得逐步标注的开放领域中难以直接迁移;
- 小模型对奖励噪声敏感:0.5B 模型容量限制可能放大奖励粒度的差异,结论未必可推广至大模型;
- LLM-as-a-Judge 偏差:GPT-4o 自身的判断可能不忠实于人类评估,错误分布结论需谨慎解读;
- 混合异常缺少机制解释: 下混合奖励为何劣于纯结果监督,作者仅提出"信号冲突"假设,未做进一步消融验证;
- 过程奖励的最大隐患未充分量化:过程模型 Chain Length Deviation 高达 6.49、Trace Validity 仅 0.22,说明过程奖励的"过度生成"问题真实存在但未深入分析。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。



