RL后训练算力应投向何处:模型规模、搜索、学习与反馈
Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback
📝 TLDR
系统研究RL后训练中模型规模、搜索、学习与反馈间的算力分配权衡规律。
🧭 速览
现有RL后训练实践常将受限算力汇总为单一FLOP预算,忽视模型规模、搜索量、学习强度与反馈开销之间的权衡。
提出GRPO后训练的FLOP核算框架,把算力拆为rollout/搜索、策略更新学习、奖励与反馈评估三部分,基于LoRA微调的Qwen2.5策略开展实验。
最优分配随模型规模、预算、奖励机制与评测目标变化;大策略单token开销高,同预算下更新与rollout被压缩;PRM反馈需显著预算用于奖励推理,规则奖励几乎不占非更新算力。
提出RACE作为诊断性pilot-grid协议,用于昂贵验证前识别分配区间,建议RL后训练论文应报告算力分配细节而非仅汇总总FLOP。
📊 论文图表(共 4 张)
展开查看 4 张图
TL;DR
这项研究回答了一个长期被忽视但至关实际问题:在 RL 后训练中,固定的算力预算到底应该花在更大的模型、更多的训练步数、更多的 [[Rollout|rollout]] 样本,还是更强的奖励信号上?研究者发现最优分配方案并非一成不变,而是随着模型规模、预算高低、奖励类型和评估任务呈现出「条件性分配前沿」特征——这意味着笼统报告总算力数字远远不够,算力在各个维度之间的具体分配同样需要透明交代。
研究背景与动机
大模型的后训练阶段正变得越来越重要。无论是让模型学会复杂推理、解决规划问题,还是在机器人学习中实现反馈驱动的策略优化,强化学习都成了标配工具。但在实际研究中,一个尴尬的现实是:受限的后训练资源往往被简化为一个笼统的「总算力预算」——比如「我们用了 FLOPs」。这个数字看起来直观,实际上却掩盖了一个关键决策问题:在相同的预算下,到底把钱花在哪里最划算?
这个问题之所以长期没有被认真对待,部分原因是 RL 后训练的算力消耗本身就很难拆解。一个训练周期可能涉及策略模型生成大量 [[Rollout|rollout]] 样本、计算奖励信号、执行策略更新——每一环节都消耗算力,而且这些环节之间还存在微妙的权衡:更大的模型每一步更新耗电更多,但表达能力更强;更多的 rollout 能覆盖更多探索空间,但每条轨迹的标注成本也随之上升。
研究者敏锐地捕捉到了这个空白。他们把这个问题形式化为「固定预算决策问题」:在相同的后训练 FLOP 预算下,策略选择涉及四个维度的分配——用多大的策略模型、将较小的模型训练更久、生成更多 rollout 搜索、还是投资更强的奖励反馈。这四个维度并非独立,而是相互耦合:比如选一个更大的模型,就意味着在同等 FLOP 预算下,用于训练迭代或 rollout 生成的份额会相应缩水。
方法
要回答「钱该怎么花」这个问题,首先得搞清楚「钱花在了哪里」。研究者针对 GRPO 后训练提出了一个 FLOP 核算框架,将总算力消耗明确分解为三个核心组成部分:
第一项是 rollout/搜索阶段消耗的算力,即策略模型生成 [[Rollout|rollout]] 样本的开销。第二项是策略更新/学习阶段的算力,对应反向传播和参数更新。这里研究者使用 [[LoRA]] 进行高效适配,因此更新阶段的 FLOPs 主要来自低秩矩阵而非全量参数。第三项是奖励或反馈模型评估的算力——当使用基于规则的手工奖励时这项基本可以忽略,但若采用 [[PRM|过程奖励模型]] 来提供更细粒度的反馈,这部分的消耗就会变得相当可观。
这个分解框架的价值不仅在于提供了统一的计量口径,更重要的是揭示了各部分之间的约束关系。研究者特别强调了模型规模与训练分配之间的耦合效应:较大的策略模型每处理一个 token 需要消耗更多 FLOPs,这意味着在固定的训练预算下,大模型能够购买的更新步数或 rollout 数量会比小模型少得多。直觉上「用大模型」似乎总是更好,但当考虑到同等预算下大模型只能训练更少的迭代时,这个结论就需要打上问号。
基于这个框架,研究者进一步设计了 RACE 诊断流程。RACE 是一种 pilot-grid 式的系统搜索方法,通过在不同分配维度上进行网格采样和消融实验,快速定位当前配置所处的「制度区间」——即算力瓶颈主要卡在哪个环节,从而指导后续应该往哪个方向投入更多资源。
实验与结果
研究团队在多种规模的 [[LoRA]] 适配 Qwen2.5 策略上开展了系统实验,覆盖了从 tiny 到不同参数量的模型规模。实验围绕几个关键维度展开:模型大小与训练时长的权衡、规则奖励与 [[PRM|过程奖励模型]] 的对比、以及不同评估任务的迁移效果。
实验最核心的发现是「条件性分配前沿」现象的存在。在不同的实验设置下,使模型表现最优的算力分配方案差异显著。例如,在某些任务上,较小的模型配合更长时间的训练能够超越较大模型的最终表现——这正是因为大模型的单步算力开销太大,导致在同等预算下无法积累足够的更新步数来发挥潜力。而在另一些任务上,增加 rollout 数量带来的收益则更为明显。
奖励系统的选择同样深刻影响着最优分配策略。当使用基于规则的奖励时,几乎所有非更新算力都被导向策略模型的 rollout 生成,因为这类奖励的计算开销极低。而切换到 [[PRM|过程奖励模型]] 形式的细粒度反馈后,奖励模型自身的推理消耗变得不可忽视:相当一部分预算被分配给了反馈模型的前向传播,而非策略的探索。这说明奖励系统的设计不仅仅是算法选择问题,也是一个算力分配决策。
此外,RACE 流程在实验中展现出了实际价值。通过系统性地探索分配空间,研究者能够提前判断当前瓶颈所在——是策略表达力不足(应该换大模型)、探索样本不够(应该多 rollout)、还是奖励信号不够精细(应该引入 PRM)。这种诊断能力对于资源受限的研究团队尤为重要,可以避免在错误的优化方向上浪费宝贵的算力。
讨论与可借鉴点
这项研究的意义首先在于打破了一个常见的认知误区:总 FLOPs 并不是衡量 RL 后训练资源的充分指标。研究者明确指出,报告总算力的同时必须说明算力在模型规模、搜索、学习和反馈之间的分配比例,否则同行很难判断这个预算是否真正用在了刀刃上。
从方法论角度看,RACE 流程提供了一种务实的工程思路:不追求理论上的最优解,而是通过系统性的诊断快速定位当前配置所处的制度区间。这对于资源有限的团队尤其有价值——与其盲目尝试各种配置,不如先搞清楚自己的瓶颈在哪里,再做针对性的投入。当然研究者也坦诚,RACE 只是诊断工具而非改进保证,找到的分配方案最终仍需在留出集上验证。
研究的局限同样值得关注。实验主要基于 Qwen2.5 和 [[LoRA]] 适配设置,结论在不同模型架构和训练范式下的迁移性还需要进一步验证。此外,RACE 的网格搜索在维度较高时可能面临组合爆炸问题,如何高效地探索高维分配空间仍是开放问题。
对于 RL 后训练研究的实践者,这篇论文的最大启发或许在于:资源规划应该更精细化。在设计实验时,不妨先用 RACE 或类似方法做一次诊断,摸清不同分配方案的边际收益曲线;论文投稿时,也应养成交代算力分配细节的习惯——这不仅有助于同行复现,更能推动整个社区对 RL 后训练算法规律的深入理解。
摘要
强化学习(RL)后训练正日益被用于适配基础模型,以服务推理、规划以及反馈驱动的机器人学习流水线;然而受限的后训练资源通常被简单压缩为一个 FLOP 总预算。我们针对这一做法背后的固定预算决策问题展开研究:在相同的后训练预算下,究竟应该选用更大的策略、将较小的策略训练更久、生成更多的 rollout 搜索,还是将算力投入更强的奖励反馈?我们针对 GRPO 后训练提出了一个 FLOP 核算框架,将算力分解为 rollout/搜索、策略更新/学习,以及奖励或反馈模型评估三部分。在多种基于 LoRA 适配的 Qwen2.5 策略上,我们发现了条件性分配前沿:观测到的最优分配会随模型规模、算力预算、奖励系统以及评估目标的改变而变化。在 FLOP 相同的条件下对不同模型规模进行比较,结果表明模型选择与训练分配之间存在耦合,因为较大的策略会消耗更多的每 token 算力,从而在同等预算下所能购买的更新次数或 rollout 数量更少。奖励系统同样会改变算力分配方式:基于规则的奖励几乎将所有非更新算力都消耗在策略 rollout 上,而 PRM 形式的反馈则会划拨预算中可观的一部分用于奖励模型推理。我们将 RACE 定位为一种诊断式的 pilot-grid 流程,用于在耗资巨大的验证运行之前识别分配方案所处的制度区间,但它并非对留集改进的保证;我们的结果表明,RL 后训练论文在报告总 FLOPs 的同时,还应说明算力在模型规模、搜索、学习与反馈之间的具体分配。
Abstract
Reinforcement Learning (RL) post-training is increasingly used to adapt foundation models for reasoning, planning, and feedback-driven robot-learning pipelines, but constrained post-training resources are often summarized by a single total FLOP budget. We study the fixed-budget decision problem behind this practice: under the same post-training budget, should one use a larger policy, train a smaller policy longer, generate more rollout search, or spend compute on stronger reward feedback? We introduce a FLOP-accounting framework for GRPO post-training that decomposes compute into rollout/search, policy-update/learning, and reward- or feedback-model evaluation. Across LoRA-adapted Qwen2.5 policies, we find conditional allocation frontiers: the best ob-served allocation changes with model size, compute budget, reward system, and evaluation target. Same-FLOP model-size comparisons show that model choice and training allocation are coupled because larger policies consume more per-token compute and therefore buy fewer updates or rollouts under the same bud-get. Reward systems also change the accounting: rule-based rewards spend nearly all non-update compute on policy rollouts, while PRM-style feedback allocates a visible part of the budget to reward-model inference. We present RACE as a di-agnostic pilot-grid protocol, not a guarantee of held-out improvement, for identi-fying allocation regimes before expensive validation runs; our results suggest that RL post-training papers should report total FLOPs together with how compute is divided among model size, search, learning, and feedback.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。



