arXiv 2607.05394v2 · 发布 2026-07-06

通过直接同策略蒸馏实现的由弱到强泛化

Weak-to-Strong Generalization via Direct On-Policy Distillation

AUTHORS Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
EVIDENCE 基于可验证奖励的强化学习结合直接在线策略蒸馏
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-13 21:48:24 UTC

📝 TLDR

RLVR提升语言模型推理能力的后训练成本随模型规模急剧上升。论文提出Direct-OPD方法,通过比较弱教师模型RL前后策略的log-ratio,将RL诱导的策略偏移作为密集隐式奖励信号迁移到强学生模型的on-policy状态上,无需在强模型上运行稀疏奖励RL。实验将Qwen3-1.7B在AIME 2024上从48.3%提升至58.3%,仅用4小时8卡A100。该结果表明RL成果可跨模型规模复用为隐式奖励信号,而非仅作为模仿的最终模型。

🧭 速览

动机

RLVR在大模型上后训练需大量rollout,成本高昂;直接蒸馏RL后弱教师的最终策略效果有限,因其策略已混入小模型自身的能力瓶颈。

方法

Direct-OPD将弱教师RL前后策略checkpoint的log-ratio作为密集隐式奖励,在强学生自身的on-policy生成状态上施加该信号,复用RL监督而不运行稀疏奖励RL。

结果

Qwen3-1.7B在AIME 2024准确率从48.3%提升至58.3%(4小时8卡A100),优于等步数直接RL,并支持多轮策略偏移的顺序组合。

结论

证明RL学习成果可跨模型规模以隐式奖励形式复用,扩展了弱到强蒸馏范式,从模仿模型输出转向迁移策略变化信号。

📊 论文图表(共 13 张)

展开查看 13 张图

TL;DR

这篇论文解决的是大语言模型后训练成本随规模急剧膨胀的问题:每次在新的大模型上跑强化学习都要生成大量 rollout,代价太高。论文提出的 Direct-OPD 另辟蹊径——在便宜的小模型上做强化学习,然后把 RL 学到的策略变化本身迁移给大模型。具体做法是比较弱教师模型 RL 前后的策略差异(log-ratio),将它作为隐式奖励信号直接作用在强学生模型的同策略状态上。实验仅用 4 小时 8 块 A100 就把 Qwen3-1.7B 在 AIME 2024 上的成绩从 48.3% 推到 58.3%,且优于在目标模型上直接跑 RL 的效果。

研究背景与动机

近年来,[[RLVR]](带可验证奖励的强化学习)已成为提升语言模型推理能力的标准后训练范式。无论是数学解题、代码生成还是逻辑推理任务,只要能设计出可验证的奖励信号,就能通过强化学习让模型习得更优的推理策略。然而,这种方法面临一个越来越突出的瓶颈:当需要将同样的训练流程迁移到一个规模更大、能力更强的目标模型上时,必须让这个大模型在训练过程中自己生成大量 rollout——这意味着 GPU 时间、显存和算力的消耗都会随模型规模急剧上升。

一个直观的解决思路是「弱到强」:既然大模型训练贵,那就先在小模型上跑 RL,因为小模型的 rollout 生成成本低得多。学完之后,把小模型学到的策略迁移给大模型。这条思路在概念上很自然——如果小模型通过 RL 掌握了某种解题模式,这种模式应当具有一定的通用性,理论上可以复用。

但论文指出,直接蒸馏 RL 后的弱教师模型存在根本性缺陷。弱教师的最终策略并非纯粹「有用的 RL 增益」,它还混杂着弱模型自身的能力上限——比如弱模型可能在某些推理步骤上因为容量不足而学了次优甚至错误的策略。直接让大模型模仿这份「精华与糟粕共存」的策略,既无法保证大模型能学到真正有价值的东西,又可能把弱模型的局限一并放大。

这就把问题推向了一个更精细的层面:真正值得迁移的,不是弱教师 RL 之后的「绝对答案」,而是它从 RL 中「学到了什么变化」。如果能精确捕捉到弱模型的策略在 RL 前后发生了怎样的偏移,再把这个偏移施加给大模型,就有望让大模型在自身的强能力基础上获得 RL 的增益,同时规避弱模型局限性的干扰。

方法

Direct-OPD 的核心设计正是围绕这一洞察展开的。论文不再把弱教师 RL 后的输出当作标准答案让学生去背,而是让弱教师的 RL 前和 RL 后两个检查点「同台对话」——它们之间的差异本身就构成了一条信息量极大的信号。

具体来说,给定一个弱教师模型 ,论文首先在某个任务分布上对其进行标准的 RLVR 训练,得到 RL 后的策略模型 。同时保留 RL 前的参考模型作为基线 。关键的一步在于计算这两个模型在每个 token 位置上的 log-ratio:

这个 log-ratio 衡量的是:在给定前缀 的条件下,RL 训练让弱教师模型对每个候选 token 的倾向性发生了多大变化——正的值意味着 RL 使模型更倾向于选择这个动作,负的值意味着 RL 让它更倾向于避免这个动作。整个 token 序列上的 log-ratio 求和,就构成了对这条完整推理路径的「策略偏移评分」。

这条评分被用作学生模型的密集奖励信号。强学生模型 在自己的同策略状态下(即它自己采样出的推理轨迹上)计算同样的 log-ratio,但使用它自己的策略概率分布与弱教师 RL 前后的概率比值的加权组合。更形式化地,Direct-OPD 优化的目标是在学生模型的每个 token 上,让它的策略分布倾向于那些在弱教师眼中 RL 增益最大的动作,同时避免那些 RL 让弱教师更不喜欢的动作。

这里有一个设计上的微妙之处值得强调:很多蒸馏方法会将教师模型的输出直接作为监督信号,要求学生的分布与教师匹配。但 Direct-OPD 的做法本质上是一种「比较式蒸馏」——它利用 RL 前后的对比来判断哪些动作是「好的变化」,而不是直接复制最终答案。这种设计使得学生模型不会被弱教师的绝对能力天花板所拖累:即使弱教师在某个状态下给出的最优动作本身质量不高,只要 RL 让它朝着更好的方向偏移,这个偏移方向就是有价值的信息。

整个训练流程可以概括为:固定弱教师的两个检查点,在强学生模型上进行标准的策略优化,但在奖励层面用弱教师策略变化 log-ratio 替代了原始的稀疏验证奖励。由于学生模型在自己采样的状态上学习,这也是一种 on-policy 的训练方式,保证了信号的匹配性——学生评估的正是它自己会实际遇到的推理状态。

实验与结果

论文在数学推理任务上进行了系统性的实验,主要使用 AIME 2024(美国数学邀请赛 2024)作为核心评测基准,同时在多个不同规模的 Qwen3 模型之间组合教师和学生。

最引人注目的结果出现在 Qwen3-1.7B 作为学生模型、Qwen3-0.6B 作为弱教师的场景下:仅需 4 小时的 8 块 A100 训练,AIME 2024 的准确率从基线的 48.3% 跃升至 58.3%,提升了整整 10 个百分点。这一提升幅度在纯后训练方法中相当可观。更关键的是,这个结果是在没有对大模型本身运行任何稀疏奖励 RL 的情况下实现的——所有关于「哪些动作是好的」的监督信号都来自小模型学到的策略变化。

论文还设置了与直接 RL 的对比实验。考虑到直接 RL 需要在目标模型上生成大量 rollout,其计算成本远高于 Direct-OPD,论文精心控制了总步数的一致性。结果显示,即使在相同的训练预算下,Direct-OPD 的效果仍然优于在目标模型上直接运行 RL。这说明弱到强的知识迁移策略不仅更省计算资源,还能带来更优的最终性能——这与直觉上「直接训练目标模型应当最优」的预期形成了有趣的反差。

论文还验证了 Direct-OPD 的可组合性。由于它迁移的是「策略偏移」而非固定策略,理论上可以将多个弱教师在不同阶段学到的策略变化顺序施加给同一个学生模型。实验表明,这种顺序组合确实能带来逐步累积的提升:先接受来自某个弱教师第一阶段 RL 的偏移,再接受来自另一个弱教师第二阶段 RL 的偏移,学生模型的性能可以在这两个教师单独使用时达到的水平之上继续上升。这暗示了 Direct-OPD 有望成为一个模块化的能力增强工具——每添加一组弱到强的策略偏移,学生模型就能解锁新的能力维度。

讨论与可借鉴点

这篇论文最值得关注的结论,是将 RL 训练产生的「策略变化」本身从具体模型中解耦出来,作为一种可迁移的隐式奖励信号。在传统范式下,一个模型的 RL 训练成果只能以该模型本身的形式被复用——换一个新模型就得从头再跑一遍 RL。Direct-OPD 通过 log-ratio 的形式把「RL 学到了什么」编码为一种与模型无关的中间表示,从而实现了跨模型规模的复用。

这个思路对后训练领域有几点潜在的启发。首先,它暗示未来可能不再需要为每个新发布的大模型单独设计 RL 训练流程——一套在小模型上优化好的策略变化信号可以直接迁移给所有更大的同系列模型。其次,它提供了一种比直接模仿更精细的知识迁移方式:判断「往哪个方向变」比直接输出「最终答案」包含了更本质的推理洞见。

当然,论文也存在一些局限性值得关注。目前 Direct-OPD 的实验主要集中在数学推理任务上,这类任务有清晰的验证信号和相对封闭的解空间。对于开放式生成任务(如创意写作、多轮对话),弱教师的策略变化是否仍然是一个有效的迁移信号,目前尚不明朗。此外,弱教师与强学生之间的规模差距如何选择、多个弱教师的策略偏移在什么情况下会产生冲突或互补,这些问题都需要更系统的研究。

总体而言,Direct-OPD 提供了一种在计算资源受限条件下提升大语言模型能力的新思路——不追求让每个模型都跑完整的 RL,而是通过精心设计的比较机制,将小模型的 RL 成果转化为大模型的可用信号。这种「以小撬大」的策略变化迁移范式,值得在更广泛的任务和模型族中进一步探索。

摘要

带可验证奖励的强化学习(RLVR)是提升语言模型推理能力的强大方法,但由于训练过程中目标模型必须生成大量 rollout,对每个新的强模型重复该过程代价高昂。随着模型规模增大,后训练本身成为瓶颈。我们研究一种由弱到强的替代方案:在较小的模型上运行强化学习(其 rollout 成本更低),然后复用该 RL 训练所学到的内容来提升一个更强的目标模型。直接蒸馏 RL 后的弱教师模型并不足够,因为教师模型的最终策略将 RL 带来的有用增益与较小模型自身的局限性混杂在一起。我们提出直接同策略蒸馏(Direct-OPD),转而迁移教师模型由 RL 引起的策略变化。Direct-OPD 将 RL 后的教师模型与其 RL 前的参考模型进行比较,并将二者对数比作为学生模型的密集隐式奖励。简而言之,这对检查点告诉我们 RL 使弱模型更可能或更不可能采取哪些动作,而 Direct-OPD 将该信号应用于更强学生模型自身的同策略状态上。这直接复用了弱模型的 RL 监督信号,无需在目标模型上运行稀疏奖励的 RL。实验上,Direct-OPD 持续利用较弱的教师模型来提升较强的目标模型;值得注意的是,它仅在 8 块 A100 GPU 上用 4 小时就将 Qwen3-1.7B 在 AIME 2024 上的表现从 48.3% 提升到 58.3%。它的性能优于步数对齐的直接 RL,并且能够将多个策略变化顺序组合起来。我们的结果表明,RL 的成果可以在不同规模的模型之间作为隐式奖励信号被复用,而不仅仅作为最终被模仿的模型。

Abstract

Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记