信任域策略蒸馏
Trust Region Policy Distillation
📝 TLDR
问题背景:On-Policy Distillation (OPD) 训练不稳定、梯度方差大,难以可靠用于数学推理等复杂任务。核心方法:本文提出 Trust Region Policy Distillation (TOP-D),通过动态构建近端教师策略,将高方差不稳定蒸馏转化为稳定训练范式。关键结果:理论上证明 TOP-D 可控制梯度方差并给出全局收敛性与单调改进界;实验在数学推理任务上显著提升训练稳定性、样本效率与最终性能。贡献意义:方法不引入额外计算开销,可作为 OPD 范式的实用替代方案。
🧭 速览
On-Policy Distillation 训练不稳定、梯度方差高,限制其在复杂推理任务中的可靠性。
动态构建近端教师策略,将高方差 OPD 转化为稳定训练范式,并给出梯度方差控制与全局收敛性理论分析。
在数学推理任务上显著提升训练稳定性、样本效率与最终性能,且不增加计算开销。
TOP-D 以零额外开销实现稳定可靠的策略蒸馏,是 OPD 范式的有力替代方案。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
TOP-D(Trust Region Policy Distillation)通过在概率空间对教师与学生策略做线性插值,将不稳定的高方差 [[On-Policy Distillation]] 转化为稳定可控的训练范式。实验表明,在数学推理任务上 TOP-D 相比标准 OPD 提升超过 25 个百分点,且完全不引入额外计算开销,可作为现有 OPD 范式的即插即用替代方案。
研究背景与动机
在大型语言模型的后训练阶段,如何高效利用更大规模教师模型的知识来提升学生模型的推理能力,一直是工业界与学术界共同关注的核心问题。[[On-Policy Distillation]] 作为一种将 [[Policy Gradient]] 方法应用于知识迁移的技术范式,本质上利用教师与学生策略的对数概率比作为即时奖励信号——当教师对某个 token 赋予较高置信度而学生置信度较低时,这种差异会转化为强烈的正向优化信号,推动学生向教师靠拢。
然而,这种看似自然的蒸馏方式在实际应用中暴露出严重的优化脆弱性。当教师对某个生成 token 赋予接近零的概率时(比如教师认为这个 token 完全不合适),对数概率比会急剧膨胀,即时奖励趋向负无穷,导致 [[Policy Gradient]] 的梯度方差爆炸式增长。这种现象在小模型向大模型蒸馏、或者说存在显著“容量鸿沟”的场景中尤为突出——容量较小的学生模型天然难以匹配容量较大的教师的行为分布,那些教师“认为不应该生成”的 token 会反复触发奖励发散,使得训练过程极不稳定。
现有的工程实践中已经积累了不少缓解这一问题的技巧:教师学生混合采样、奖励裁剪、top-p 截断、非策略冷启动等等。这些方法在特定场景下确实能改善训练稳定性,但它们本质上都是头痛医头的经验性补丁,缺乏理论保障,也难以系统性地推广到新场景。更关键的是,这些技巧从未触及问题根源——对数概率比的无界性。
本文的切入点正是回到这个根本机制:通过在概率空间而非 log 空间构造近端教师,从数学上严格保证奖励信号的有界性,进而从根本上驯服梯度方差这只“野兽”。
方法
TOP-D 的核心设计围绕两个相互协同的机制展开:外部近端教师负责控制奖励信号的有界性,内部信任域迭代负责提升样本效率与训练稳定性。二者缺一不可,共同构成了一个完整的解决方案。
外部近端教师的构造是整篇论文最精妙的设计之一。给定原始教师分布 与当前学生分布 ,论文提出通过线性插值构造近端教师:
其中 是控制插值强度的超参数。直观理解就是:我们不再让教师“单打独斗”,而是让它与学生“组队”——当教师对某个 token 的置信度极低时,学生自己的置信度会起到缓冲作用,避免奖励信号完全崩溃。将这个近端教师代入 OPD 的奖励定义,可以得到变换后的奖励形式:
这里 是原始的对数概率比。当 (即教师完全否定该 token)时,,奖励被严格限制在下界,避免了发散。当 时退化为原始 OPD, 时方差消失。论文特别强调必须在概率空间而非 log 空间做插值——后者只会产生平凡的线性缩放,无法解决根本问题。
内部信任域迭代则借用了 [[Policy Gradient]] 领域的成熟技术——受 PPO 启发的裁剪机制。传统 OPD 严格要求行为策略与目标策略一致,即每次更新的样本必须来自当前最新策略,这导致数据复用率极低。TOP-D 通过 [[Importance Sampling]] 打破这一限制,允许用稍旧策略采样的数据训练当前策略,并通过裁剪约束更新幅度:
这里的优势函数 采用 token 级的组内归一化,并结合长度归一化的未来回报,既保证了奖励信号的密集性,又防止模型倾向于生成过短或过长的回复。
从理论角度,论文建立了完整的分析框架。首先,在假设 score function 有一致上界的前提下,证明了 TOP-D 的梯度方差满足:
这意味着 扮演着“方差控制器”的角色——它直接决定了梯度方差的上界。其次,通过将近端教师视为策略空间的收缩算子,论文证明了全局收敛性,并揭示了一个关键权衡:要在大 (高方差)和小 (小更新步长)之间取得平衡,必须严格最小化单步优化误差。最后,通过将自回归生成建模为确定性 MDP,论文给出了单调改进的下界保证,将整体训练动态的可靠性以数学形式严格化。
实验与结果
实验在数学推理领域展开,这是检验推理能力的“试金石”,也是容量鸿沟问题最为明显的场景之一。论文选用 Qwen3 系列模型作为基础,学生模型涵盖 1.7B 和 8B 两种规模,教师模型则包括 14B 和 30B 配置,由此覆盖了从小到大多种容量差距组合。
核心结果呈现出压倒性的优势。在 Qwen3-8B 学生 + 30B 教师的配置下,TOP-D 在 AIME24 基准上达到 50.42% 的准确率(avg@32),相比标准 OPD 提升了 25.84 个百分点,相比同期提出的 DAPO 方法也领先 17.5 个百分点。这种差距在小模型上更为显著——1.7B 学生向 30B 教师蒸馏时,标准 OPD 几乎完全失效,性能反而低于不做蒸馏的 RLVR 基线,而 TOP-D 依然稳定地保持着 10 个百分点以上的优势。这一对比有力证明了“奖励有界”这一简单约束的威力:它不仅改善了训练稳定性,更释放了蒸馏的潜力上限。
消融实验进一步拆解了两大机制的贡献。移除外部近端教师(等价于 )后,训练波动剧烈,曲线在训练过程中反复震荡;移除内部信任域迭代后,样本效率大幅下降,最终性能也出现明显回落。这说明两个机制并非冗余设计——前者解决的是奖励信号的质量问题,后者解决的是数据利用效率问题,二者共同构成稳定高效训练的必要条件。超参数敏感性分析则表明, 区间内的性能差异微乎其微,验证了方法对超参数选择的鲁棒性。
讨论与可借鉴点
TOP-D 的核心贡献在于提供了一种“正确的问题分解”:它没有试图在表层修补 OPD 的种种症状,而是从奖励信号无界这一根本机制入手,用概率空间插值这一简洁操作完成了问题的重新建模。这种思路值得借鉴——当一个方法频繁出现训练不稳定、收敛困难等问题时,往往不是调参或加技巧能解决的,而是提示我们需要回到问题的数学形式化层面重新审视。
从工程角度看,TOP-D 的实现几乎零门槛。它仅需要对原始 OPD 奖励做一次代数变换,不引入任何额外的模型组件或计算图修改,可以无缝嵌入现有的分布式训练框架。这与很多理论上有效但工程实现复杂的方法形成鲜明对比,也是该方法极具推广价值的根本原因。
当然,论文也诚实地指出了若干局限:实验目前仅限于数学推理任务,在代码生成、多步规划、多模态推理等更复杂场景的泛化性尚未验证;训练步数控制在 200-400 步量级,长期训练下的性能上限和稳定性仍是未知数;理论分析依赖若干假设(如 score function 的一致有界性),这些假设在实际大规模模型上的满足程度有待进一步检验。此外,论文仅探索了单一固定教师的设置,多教师集成或教师动态切换等方向也留待未来探索。
总体而言,TOP-D 的价值不仅在于它提出的具体方法,更在于它示范了一种“从理论洞察出发,经由简洁设计,最终落地为实用方案”的研究范式。对于从事大模型后训练、RLHF、以及各类蒸馏相关工作的研究者和工程师而言,这篇论文提供了一个值得深入理解和实践的新工具。
摘要
宏大的目标难以一蹴而就;将其分解为若干小步则更为明智。我们提出了信任域策略蒸馏(TOP-D),它通过动态构建近端教师模型,将众所周知的不稳定、高方差的在策略蒸馏(OPD)转变为一种稳定的训练范式。在理论上,我们建立了一个严格的框架,证明 TOP-D 从根本上控制了梯度方差。通过提供形式化的全局收敛性分析以及单调改进界,我们以数学方式形式化了整体训练动态的可靠性和稳定性。在实证方面,TOP-D 在数学推理任务上显著提升了训练稳定性、样本效率与最终性能。更重要的是,TOP-D 不引入任何额外的计算开销,使其成为成熟的 OPD 范式的一个极具前景的替代方案。
Abstract
Big goals are hard to achieve all at once; breaking them into small steps is wiser. We present Trust Region Policy Distillation (TOP-D), which transforms the notoriously unstable, high-variance On-Policy Distillation (OPD) into a stable training paradigm by dynamically constructing a proximal teacher. Theoretically, we establish a rigorous framework demonstrating that TOP-D inherently controls gradient variance. By providing a formal global convergence analysis alongside a monotonic improvement bound, we mathematically formalize the reliability and stability of the overall training dynamics. Empirically, TOP-D dramatically enhances training stability, sample efficiency, and final performance on mathematical reasoning tasks. More importantly, TOP-D introduces zero additional computational overhead, positioning itself as a promising alternative to the well-established OPD paradigm.
论文详细总结(自动生成)
论文总结:信任域策略蒸馏(Trust Region Policy Distillation, TOP-D)
1. 核心问题与研究动机
- 背景定位:在策略蒸馏(On-Policy Distillation, OPD)已成为大语言模型(LLM)后训练的主流范式之一,其本质上等价于一种强化学习(RL),其中即时奖励由教师与学生策略的对数概率比定义。OPD 兼具 SFT 的非策略稳定性与 RLVR 的密集奖励优势,但存在严重的优化脆弱性问题。
- 核心瓶颈:OPD 的不稳定性源于教师与学生之间的容量鸿沟。其目标函数高度依赖对数概率比 ,当教师对生成 token 赋予近零概率()时,即时奖励 发散至负无穷,导致策略梯度方差爆炸。
- 现有方案的不足:学界已有多种经验性缓解手段(如 teacher-student 混合采样、奖励裁剪、top-p 采样、非策略冷启动、全词表监督等),但这些方法仅为启发式技巧,缺乏理论保障,未触及对数概率差无界这一根本机制。
- 本文目标:系统性解决 OPD 的优化不稳定性与样本低效问题,且不引入额外计算开销。
2. 方法论
2.1 核心思想
TOP-D 由两个相互协同的核心机制组成:
- 外部近端教师(External Proximal Teacher):通过在概率空间插值构造近端教师,平滑无界奖励信号。
- 内部信任域迭代(Internal Trust Region Iterations):解耦行为策略与目标策略,打破严格在策略的数据复用壁垒。
2.2 关键技术细节
(1)外部近端教师
定义近端教师为:
其中 控制插值强度。对应的新奖励为:
关键性质:
- 当 时退化为原始 OPD 奖励 。
- 当 时,,即奖励存在严格下界,避免发散。
- 仅需对原始 OPD 奖励做简单的代数变换,无需显式构造分布,零额外计算开销。
- 作者特别论证了在概率空间插值优于在 log 空间插值,因为后者仅产生 的平凡缩放。
(2)内部信任域迭代
采用类似 PPO 的裁剪目标函数(式 (7)):
其中 为重要性采样比率。优势函数 采用token 级组内归一化的密集奖励信号,并结合长度归一化的未来回报(式 (8)):
以防止生成过短或过长的回复。
2.3 理论分析
(1)有界方差定理(Theorem 4.2)
在假设 下,TOP-D 梯度估计量 的方差满足:
其中 为通用常数, 为词表大小。 直接作为方差控制器: 恢复 OPD 的无界方差, 方差消失。
(2)全局收敛性分析(Theorem 4.4)
将近端教师视为策略空间算子 ,则:
揭示了误差遗忘机制与理论权衡:要在不牺牲稳定性(保持小 )的前提下突破精度上限,必须严格最小化单步优化误差 。
(3)单调改进保证(Theorem 4.9)
通过将自回归语言建模形式化为确定性 MDP,并定义归一化状态访问测度,得到:
通过内部信任域迭代优化此下界,可保证 reverse KL 散度单调递减,并结合 Pinsker 不等式严格控制 ,从而紧密闭合整体渐近收敛间隙,形成完整理论闭环。
2.4 算法流程(Algorithm 1)
主要步骤为:在每次全局迭代中,先固定 ,用其采样 条回复,计算 TOP-D 奖励 、token 级回报 及组内归一化优势 ;然后进行 个内部 epoch 的信任域优化更新 。
3. 实验设计
3.1 数据集与基准
- 训练集:DAPO-Math-17k(高质量数学推理语料)。
- 验证基准:AIME24、AIME25、AIME26、AMC23、MATH-500、Olympiad(数学竞赛类)。
3.2 模型配置
- 学生模型:Qwen3-1.7B-Base、Qwen3-8B-Base。
- 教师模型:Qwen3-14B、Qwen3-30B-A3B-Instruct-2507。
- 覆盖不同师生容量鸿沟的学生规模。
3.3 对比方法
- RLVR 范式:GRPO、DAPO。
- 蒸馏范式:标准 OPD。
3.4 实现细节
- 每次 prompt 生成 8 条回复(group size = 8)。
- 全局 batch size = 512 prompts(4096 样本),mini-batch size = 32 prompts(256 样本)。
- 插值系数 或 。
- 采样温度 1.0,top-p = 1.0;验证温度 1.0,top-p = 0.7。
- 优化器 AdamW,学习率 ,10 步 warmup。
4. 资源与算力
- GPU 型号:NVIDIA H200。
- 数量:标准配置为 4 个计算节点,每节点 8 块 H200 GPU,共 32 块 GPU。
- 可复现性:作者强调完整 TOP-D 训练流程可在单节点 8 块 GPU 上复现。
- 训练时长:未明确报告单次实验的具体训练时长。论文指出 RLVR 基线训练窗口约为 200–400 步。
5. 实验数量与充分性
- 主要对比实验:在 2 个学生模型 × 2 个教师模型 × 6 个基准(AIME24/25/26、AMC23、MATH-500、Olympiad)上系统对比 GRPO、DAPO、OPD、TOP-D,共形成 2 个主表(Table 2、Table 3)及 1 个附录补充表(Table 4)。
- 消融实验:在 Qwen3-1.7B-Base + Qwen3-30B-A3B-Instruct-2507 配置下进行了完整消融(Figure 5),考察:
- 外部近端教师的影响( 退化为标准 OPD);
- 内部信任域迭代的影响(w/o off-policy 强制严格在策略);
- 插值系数 的敏感性分析。
- 充分性评估:
- 优点:覆盖了多种师生容量组合、多个数学推理基准、消融维度完整,且对超参数 进行了鲁棒性验证。
- 不足:实验主要局限于数学推理任务;训练步数(200–400)相对较短,论文自身也指出结果远未饱和;未在更大规模(如 30B+)学生模型上验证。
6. 主要结论与发现
- 性能大幅领先:在 Qwen3-8B-Base + Qwen3-30B-A3B 教师下,TOP-D 在 AIME24 取得 50.42% avg@32 准确率,比标准 OPD 提升 +25.84%,比 DAPO 提升 +17.5%。
- 小模型上 OPD 退化严重:在 Qwen3-1.7B-Base 上,标准 OPD 性能明显低于 RLVR 基线,凸显对数概率比无界的脆弱性;而 TOP-D 仍能稳定保持 10+ 百分点的优势。
- 机制有效性验证:消融实验证明外部近端教师(控制训练稳定性)与内部信任域迭代(提升样本效率)均为不可或缺的关键组件。
- 超参数鲁棒性: 区间内训练稳定性、收敛速度、最终性能差异极小。
- 零额外计算开销:TOP-D 仅是对 OPD 奖励的代数变换,天然兼容现有分布式训练与推理基础设施。
7. 优点
- 理论闭环完整:从梯度方差有界性、全局收敛性、单调改进性三个层面构建了严密的理论体系,并显式指出" 是方差控制器"以及" 是渐近误差瓶颈"等可操作的工程洞见。
- 方法简洁实用:核心修改仅是对奖励的代数变换 ,不需显式构造近端分布,真正实现零额外计算开销与即插即用。
- 样本效率与稳定性兼具:通过内部信任域迭代打破严格在策略限制,显著提升数据复用率。
- 问题切入精准:抓住了 OPD 无界对数奖励这一根本缺陷,而非停留于表层经验修补。
- 实验设计有层次:覆盖多师生容量、多基准、含完整消融与超参数敏感性分析。
8. 不足与局限
- 任务域单一:所有实验均集中于数学推理任务,未在通用语言任务、代码生成、多模态等更广泛场景中验证泛化性。
- 学生规模有限:未在 30B 以上大规模学生模型上验证(论文自身也承认这是未来工作)。
- 训练步数较短:仅 200–400 步,作者承认未观察到饱和迹象,长期训练下的稳定性与最终性能上限仍未知。
- 理论假设较强:方差有界性依赖 score function 的一致有界假设(Assumption 4.1);单调改进界依赖有限最大生成长度假设(Assumption 4.6)。
- 缺乏与传统蒸馏方法的全面对比:未与 SFT、知识蒸馏(如 MiniLLM)、off-policy 蒸馏等非 RL 类方法直接比较。
- 超参数 的选择:虽展示了 的鲁棒性,但未讨论极端值(如 或 )的情况,且未提供自动选择 的方案。
- 单教师设置:当前仅支持单一固定教师,未探索多教师集成或教师自适应切换。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




