DemoPSD:基于分歧调制的策略自蒸馏
DemoPSD: Disagreement-Modulated Policy Self-Distillation
📝 TLDR
在线策略自蒸馏训练大语言模型推理时,教师模型的密集token级监督常引发特权信息泄露,抑制探索并损害跨域泛化能力。DemoPSD提出基于反向KL重心目标的策略自蒸馏框架,将教师与学生分布进行加权几何组合,并依据二者分布差异逐token自适应调节融合程度。理论证明该方法可有效缓解信息泄露并保留探索能力。在SciKnowEval四个科学领域及分布外GPQA基准上的实验显示,DemoPSD均优于GRPO和SDPO,同时保持较高训练熵,展现稳健的泛化性能。
🧭 速览
在线策略自蒸馏中,教师以特权信息进行密集token级监督,易致过拟合、信息泄露、抑制探索并损害跨域泛化能力。
DemoPSD将师生分布的加权几何组合作为反向KL重心目标,逐token依据分布差异自适应调节融合权重。
在SciKnowEval四领域及分布外GPQA上均优于GRPO和SDPO,训练熵更高,跨域泛化稳健。
理论上同时实现信息泄露缓解与探索能力保留,为LLM推理自蒸馏提供了兼顾学习与自主性的新路径。
📊 论文图表(共 11 张)
展开查看 11 张图
TL;DR
大语言模型推理训练中,在线策略自蒸馏方法常因教师模型获得特权信息后提供的密集 token 级监督,导致学生编码答案依赖的捷径、抑制自身探索能力并损害跨域泛化。DemoPSD 提出通过反向 KL 重心目标对教师与学生分布做加权几何组合,并依据两者分布差异逐 token 自适应调节融合程度,从而在学习教师知识与保留学生推理自主性之间取得平衡。实验表明,该方法在 SciKnowEval 四个科学领域上优于 GRPO 和 SDPO,同时保持更高训练熵,并在 GPQA 分布外基准上展现稳健泛化能力。
研究背景与动机
在线策略自蒸馏(On-Policy Self-Distillation, OPSD)已成为训练大语言模型进行推理的一种实用范式。在这一框架下,单一模型同时扮演教师与学生两个角色——教师在获得特权信息 (如已验证的正确答案或推理轨迹)的条件下提供 token 级监督信号,而学生仅基于原始问题 生成响应。这种设计使得教师分布能够注入经过验证的知识,学生分布则保留自主探索的空间。相比传统的强化学习验证器方法(如 GRPO),OPSD 在 token 效率上提升数倍,已被工业界的旗舰模型广泛采用。
然而,这种看似优雅的设计背后隐藏着一个根本性缺陷:教师分布中始终残留着特权信息 对下一 token 的额外影响。具体而言,存在一个不可约的互信息差距 ,这意味着无论学生如何学习,其目标分布中始终包含测试时无法获取的信息。这一问题被论文定义为特权信息泄露(Privileged Information Leakage):学生在训练时被强制拟合依赖 的教师分布,却在测试时无法利用该信息,从而编码了答案依赖的捷径而非真正的问题解决能力。
这一问题带来两个具体的失败模式。其一是探索能力丧失:强制学生在每一 token 上拟合教师分布会压制其自身的推理多样性,导致训练熵塌缩,模型陷入教师分布所暗示的单一路径而丧失探索替代方案的能力。其二是跨域泛化退化:特权信息泄露使得学生习得的是特定于训练分布的模式,而非可迁移的问题理解能力,因此在新领域上表现明显下降。实验观察印证了这一理论分析——SDPO 等现有自蒸馏方法在训练初期性能快速上升,但后期逐步退化,在分布外基准(如 GPQA)上尤为明显。
方法
DemoPSD 的核心洞察是:教师监督并非全盘可信,当师生分布出现显著分歧时,往往意味着教师分布已被特权信息 过度影响,此时学生应依赖自身推理而非盲目采纳教师指导。这催生了选择性采纳教师指导(Selective Adoption of Teacher Guidance)的核心原则——关键在于如何量化分歧并据此调节采纳程度。
首先,DemoPSD 通过 Jensen-Shannon 散度(JSD)度量每个 token 位置 上特权教师分布 与学生分布 之间的分歧:
JSD 的对称性使其能够捕捉双向的分歧程度。在此基础上,论文通过重缩放 sigmoid 函数将 转换为逐 token 的泄露衰减系数 :
其中 控制门控灵敏度, 为上界(默认 0.15)。当师生分布高度一致时 , 趋近于零,教师指导被充分采纳;当分布显著分歧时 增大,学生自身推理被赋予更高权重。
接下来的关键设计是反向 KL 重心目标(Reverse-KL Barycenter Target)。不同于简单地混合概率,DemoPSD 采用几何混合定义目标分布:
几何混合与算术混合的本质区别在于:几何混合仅当两个分布同时赋予某 token 较高概率时才赋予其显著质量,这天然抑制了教师独享而学生不认可的"捷径 token"。相比之下,算术混合会导致模式平均(mode-averaging),使模型在多个峰值之间摇摆,造成不必要的熵膨胀。
从损失函数角度看,目标分布的对数为:
由于目标分布被 stop-gradient 包裹,规范化常数 为常数项,梯度简化为教师分布的加权形式,其中 作为分歧缩放因子,自动降低高分歧位置上的特权监督强度。
论文进一步从理论层面证明了 DemoPSD 的两大性质。泄露缓解定理指出,定义泄露率 (其中 ),DemoPSD 的有效泄露率满足:
且 与 正相关,使得抑制在泄露风险最高的位置最强。探索保留定理则证明,在合理的协方差条件下,目标分布的熵始终介于教师与学生分布之间且关于 非递减,从而保证蒸馏过程中探索能力的持续保留。
实验与结果
论文在 SciKnowEval 数据集上进行系统实验,该数据集涵盖 biology、chemistry、material、physics 四个科学领域,每个领域包含 4-选择多选题,用于评估模型在特定领域的推理能力。基模型选用 Qwen3-4B-Instruct,训练在 8 块 NVIDIA H20 GPU 上通过 FSDP 实现,配合 vLLM 生成 rollout 和 Flash Attention 加速计算。
主实验对比了 DemoPSD、GRPO 和 SDPO 三种方法,采用 mean@16、maj@16、best@16 三个指标评估性能。结果显示,DemoPSD 在四个科学领域均取得最优或接近最优的表现,尤其在 material 和 physics 领域优势明显。以 maj@16 指标为例,DemoPSD 在 biology、chemistry、material、physics 四个领域分别达到 57.4%、60.1%、57.0%、56.5%,普遍高于 GRPO 和 SDPO 的对应成绩。
分布外泛化能力的评估在 GPQA Extended 数据集上进行,该数据集包含研究生级别的生物、化学、物理题目,与训练领域存在一定差异。实验结果印证了理论分析——SDPO 在训练过程中准确率达到峰值后持续下降,显示出明显的过拟合迹象,而 DemoPSD 在整个训练过程中保持稳定并持续提升,最终显著优于 SDPO。这一对比有力证明了特权信息泄露确实损害了跨域泛化能力,而 DemoPSD 的选择性采纳策略有效缓解了这一问题。
训练熵的分析进一步揭示了方法间的差异。SDPO 在训练后期出现明显的熵塌缩现象,表明模型逐渐收敛至教师暗示的单一路径;GRPO 保持了较高的熵但整体性能较低,反映出缺乏有效知识迁移的代价。DemoPSD 则实现了二者兼顾——熵水平显著高于 SDPO,证明探索能力得到保留,同时性能优于 GRPO,验证了知识蒸馏的有效性。
消融实验围绕门控灵敏度参数 进行,扫描范围为 。实验发现 存在领域依赖性——physics 领域偏好更大的 值(更强的门控),而 material 领域则适合较小的 。这一发现表明不同领域的师生分布分歧模式存在差异,需要针对性调节。
讨论与可借鉴点
DemoPSD 的核心贡献在于揭示了在线策略自蒸馏中特权信息泄露这一根本性问题,并通过反向 KL 重心目标提供了一种原则性的解决方案。从工程视角看,该方法的实现相对轻量——只需在标准蒸馏框架上增加基于 JSD 的门控机制和几何混合目标,无需引入复杂的对抗训练或多教师架构。从理论视角看,论文的两大定理建立了方法性质与目标特性之间的严格联系,为后续研究提供了可信赖的收敛保证。
然而,该方法仍存在若干局限性。首先, 和 的设置依赖领域特定调优,缺乏自适应机制;其次,论文的实验集中在科学问答领域,在开放式生成或多步推理任务上的表现尚未验证;最后,理论证明中的协方差条件()是否在实践中普遍成立仍有待更多探索。
对于后续研究而言,DemoPSD 的选择性采纳原则具有广泛的启发意义。任何涉及教师-学生架构的方法都可以借鉴这一思路——不盲目信任教师输出,而是通过度量师生分歧动态调节知识迁移强度。此外,论文关于几何混合而非算术混合的设计选择也值得注意:在需要抑制模式平均、保留分布多样性的场景下,几何混合可能是更优的选择。
摘要
在线策略自蒸馏(OPSD)已成为训练大语言模型(LLM)进行推理的一种实用方法,其中单个模型以不同的信息访问级别同时充当教师和学生。然而,最近的研究发现,教师在获得特权信息条件下所提供的密集 token 级监督会导致对域内模式的过拟合、抑制探索并损害跨域泛化能力,同时还引入了一个更为根本的问题——特权信息泄露,即学生编码了在测试时无法获得的依赖答案的捷径。我们提出了 DemoPSD,这是一个通过选择性采纳教师指导这一理念来解决上述问题的新颖框架。DemoPSD 不是拟合教师的完整分布,而是引导学生朝向一个反向 KL 重心目标,即教师分布与学生分布的加权几何组合,从而在学习教师知识与保留学生自身推理能力之间实现自然平衡。我们度量二者分布之间的差异,并利用该差异在每个 token 位置上自适应地控制混合权重。我们以可证明的方式展示了 DemoPSD 实现了(1) 泄露缓解,即有效缓解特权信息泄露;以及(2) 探索保留,即在密集 token 级蒸馏下保留探索能力。在 SciKnowEval 上跨四个科学领域的大量实验表明,DemoPSD 在保持更高训练熵的同时,优于 GRPO 和 SDPO,并能鲁棒地泛化到分布外(OOD)的 GPQA 基准测试。
速览
TLDR:在大语言模型推理训练中,在策略自蒸馏方法存在过度依赖教师特权信息、抑制探索并损害跨域泛化的问题。DemoPSD提出选择性采纳教师指导的策略,通过反向KL重心目标将教师与学生分布做加权几何组合,并依据两者分布差异自适应调节每个token位置的融合强度。理论证明该方法可有效缓解特权信息泄露并保留探索能力。在SciKnowEval四个科学领域与GPQA分布外基准上的实验表明其优于GRPO和SDPO,并维持更高的训练熵。 \
Motivation:在策略自蒸馏中,教师利用特权信息进行密集token级监督,导致学生编码答案依赖捷径,损害探索能力与跨域泛化。 \
Method:采用反向KL重心目标,对教师与学生分布做加权几何组合,并按两者分布差异自适应控制每个token位置的融合强度。 \
Result:在SciKnowEval四个科学领域上优于GRPO和SDPO,在GPQA分布外基准上稳健泛化,同时保持更高训练熵。 \
Conclusion:理论证明可有效缓解特权信息泄露并保留探索能力,为自蒸馏提供更稳健的学习目标。
Context:属于LLM推理训练中策略优化与自蒸馏交叉领域,承接GRPO、SDPO等已有工作,针对其特权信息泄露与探索衰减痛点提出改进,适用于需保留模型自主探索的密集监督场景。
Abstract
On-policy self-distillation (OPSD) has emerged as a practical method for training large language models (LLMs) to reason, where a single model acts as both the teacher and the student with different levels of information access. However, recent studies have found that the teacher's dense token-level supervision, conditioned on privileged information, can lead to overfitting to in-domain patterns, suppress exploration, and hurt cross-domain generalization, while also introducing a more fundamental issue: privileged information leakage, where the student encodes answer-dependent shortcuts that are unavailable at test time. We introduce DemoPSD, a novel framework that resolves such problems through the idea of selective adoption of teacher guidance. Instead of fitting the full teacher distribution, DemoPSD steers the student toward a reverse-KL barycenter target, a weighted geometric combination of the teacher and student distributions, that naturally balances learning from the teacher with preserving the student's own reasoning capacity. We measure the difference between their distributions and use such a discrepancy to adaptively control the blending at each token position. We provably show that DemoPSD achieves (1) leakage attenuation, i.e., effective mitigation of privileged information leakage; and (2) exploration preservation, i.e., preservation of exploration capacity under dense token-level distillation. Extensive experiments on SciKnowEval across four scientific fields show that DemoPSD outperforms both GRPO and SDPO while maintaining higher training entropy and robustly generalizing to out-of-distribution GPQA benchmarks.
论文详细总结(自动生成)
DemoPSD 论文总结
1. 核心问题与研究动机
背景:在线策略自蒸馏(On-Policy Self-Distillation, OPSD)是一种新兴的 LLM 推理训练范式,单一模型同时充当教师与学生——教师在获得特权信息 (如已验证的推理轨迹或标准答案)条件下提供密集 token 级监督,学生仅基于问题 生成轨迹。该方法在 token 效率上比 GRPO 有数倍提升,已被工业界广泛采用(如 Qwen3、DeepSeek-V4)。
核心问题:尽管 OPSD 提供了细粒度的 token 级监督信号,但其训练目标在理论上存在一个不可约的互信息差距:
这意味着教师分布中始终残留着特权信息 对下一 token 的额外信息,导致两大失败模式:
- 特权信息泄露(Privileged Information Leakage):学生在测试时无法获取 ,却被训练去匹配依赖 的教师分布,从而编码"答案依赖捷径"(answer-dependent shortcuts)。
- 探索能力丧失:强制学生在每一 token 上拟合教师分布会压制学生自身的推理能力,导致训练熵塌缩,进而损害跨域泛化能力。
症状:SDPO 等现有方法在训练初期性能快速上升,后期逐步退化;在分布外(OOD)基准(如 GPQA)上,SDPO 在早期达到峰值后准确率明显下降。
2. 方法论
2.1 核心思想:选择性采纳教师指导
DemoPSD 的核心原则是:当师生分布较为一致时采纳教师指导;当二者显著分歧(表明教师分布被 过度影响)时,倾向于依赖学生自身推理。
2.2 度量师生分歧
对每个 token 位置 ,通过 Jensen-Shannon 散度(JSD)度量特权教师 与学生 之间的分歧:
2.3 泄露衰减系数
由 通过重缩放 sigmoid 生成逐 token 的泄露衰减系数 :
其中 控制门控灵敏度, 为上界(默认 0.15)。
2.4 反向 KL 重心目标
蒸馏目标定义为教师分布与学生分布的加权几何混合:
对数形式:
几何混合 vs 算术混合的几何直觉:(1)仅当两个分布同时支持某 token 时才赋予其显著质量,自然抑制教师独享的捷径 token;(2)避免算术混合的模式平均(mode-averaging)导致的熵膨胀。
2.5 损失函数与梯度
由于目标分布在 stopgrad 包裹下, 为常数,梯度简化为:
关键点: 作为分歧缩放因子,自动降低高分歧位置上的特权监督强度。
2.6 特权信息注入与重提示机制
- 教师输入:
[Question: x | Privileged Information: y* | Student Response: \hat{y}_{<t}] - 学生输入:
[Question: x | Student Response: \hat{y}_{<t}] - 若一组 rollout 中至少有一条正确,则随机抽取一条作为 ;否则该 prompt 被跳过。
2.7 理论性质
- 定理 1(泄露缓解,Leakage Attenuation):定义每步泄露率 ,其中 ,DemoPSD 的有效泄露率为:
且 与 正相关,使抑制在泄露风险最高的位置最强。
- 定理 2(探索保留,Exploration Preservation):在条件 (对所有几何插值 , )下,有:
且熵增益 关于 非递减。证明核心步骤沿几何路径推导熵导数:
3. 实验设计
3.1 数据集与场景
- 训练/域内评测:SciKnowEval(Feng et al., 2024)的四个科学领域——biology、chemistry、material、physics,4-选择多选题格式。
- 分布外评测:GPQA Extended(Rein et al., 2023),研究生级生物、化学、物理题,material science 无对应领域。
3.2 基模型与超参数
- 基模型:Qwen3-4B-Instruct
- 通用超参:学习率 、batch size 64、每 prompt 训练 8 次 rollout、prompt 最大长度 2048、响应最大长度 16384、warmup 10 步、3 epoch
- 蒸馏相关:top-、EMA 速率 、训练温度 1.0、测试温度 0.7
- DemoPSD 专属:, 按领域单独调优
- GRPO:、重要性采样比裁剪 2.0
3.3 对比方法
- GRPO(Shao et al., 2024):标准 RLVR 基线
- SDPO(Hübotter et al., 2026):在线策略自蒸馏基线,与 DemoPSD 共用同一代码库、基础设施与训练数据
3.4 评估指标
每 prompt 采样 16 次 rollout,报告三个指标:
- mean@16:16 次平均准确率
- maj@16:多数投票准确率
- best@16:16 次中最高准确率
4. 资源与算力
论文明确提及:8 块 NVIDIA H20 GPU,配合 FSDP(完全分片数据并行)进行训练,使用 vLLM 生成 rollout、Flash Attention 加速注意力计算。
未明确说明:(1)单次实验的 wall-clock 训练时长;(2)四个领域分别的具体训练时长;(3)超参调优过程所消耗的总 GPU·hours。
5. 实验数量与充分性
论文进行了较为系统的实验,主要包括:
| 实验类别 | 内容 | 充分性评估 |
|---|---|---|
| 主结果 | 4 个领域 × 3 种方法 × 3 种指标 = 36 组比较(Table 1) | 充分 |
| OOD 泛化 | 3 个 GPQA 领域 × 2 方法(Table 2)+ 全程曲线(Figure 3) | 充分 |
| 训练动力学 | 4 领域熵、平均 、平均 、active %(Table 3)+ Figure 1a | 较充分 |
| 敏感度 | 在 4 个领域扫描(Table 4、Figure 2b) | 较充分但未做交叉验证 |
| 分歧分布分析 | 4 领域每 token JSD 分布直方图与动态曲线(Figure 4、Table 5) | 较充分 |
| 消融实验 | 仅做了 敏感度(间接消融)与 的工程选择说明 | 较弱:缺少对几何 vs 算术混合、对 EMA 副本、对 值的直接消融 |
公平性评估:三种方法共用代码库、基础设施、基模型和训练数据,仅优化目标不同,保证了直接对比的公平性。但以下细节可能影响客观性:(1) 按领域单独调优而 SDPO/GRPO 无此自由度,可能造成 DemoPSD 在调优预算上的隐性优势;(2) 与 EMA 等实现选择虽给出了依据,但缺乏消融验证。
6. 主要结论与发现
6.1 域内性能(Table 1)
- DemoPSD 在所有 4 个领域、3 种指标上一致优于 GRPO 与 SDPO。
- 平均相对 SDPO 的增益:mean@16 +1.68、maj@16 +1.68、best@16 +2.82。
- 平均相对 GRPO 的增益:mean@16 +4.61,best@16 +6.70。
6.2 探索保留(Table 3、Figure 1a)
- DemoPSD 在所有领域保持比 SDPO 高 33%–98% 的最终训练熵,其中 material 领域差距最大(SDPO 熵降至 0.150,逼近熵塌缩)。
- 高熵直接转化为 best@16 上更高的分数(图 1b),表明保留的探索能力在采样时能浮现出更优推理路径。
6.3 分布外泛化(Table 2、Figure 3)
- 在 GPQA Extended 上,DemoPSD 相比 SDPO 平均高 7.91 个百分点。
- SDPO 的 OOD 准确率在训练中先升后降(如 chemistry 从 40.45 降至 28.62),符合泄露退化模式;DemoPSD 保持稳定并最终略有提升。
6.4 蒸馏稀疏性(Table 5、Figure 4a)
- 多数 token ,仅 2%–5% 的 token 超过 0.25,触发较强的 。
- 平均 仅 0.033–0.055,意味着大多数 token 上仍接受教师的密集监督,符合"选择性采纳"原则。
6.5 超参敏感性
- 平均分歧 较小的领域(如 physics )需要较大 以放大弱信号;分歧大的领域(如 biology )则适合较小 。
- 范围内 DemoPSD 始终不低于 SDPO,呈现中等鲁棒性。
7. 优点
1. 目标层面的创新而非启发式门控:与 RLSD、HDPO、EGRSD、SRPO、DASD、GATES 等基于熵、正确率或多教师共识的间接代理方法不同,DemoPSD 直接修改蒸馏分布目标本身,利用反向 KL 重心使师生差异自适应内化于训练目标。
2. 理论支撑完备:提供了两个明确可证明的性质——泄露缓解与探索保留(含完整证明),并给出了熵变化的几何路径分析。
3. 几何混合的动机清晰:论文明确解释了为何选择几何混合而非算术混合(避免 mode-averaging 与特权 token 泄漏),并引用 AMiD 的相关分析做支撑。
4. 实证维度完整:同时报告了域内准确率、OOD 泛化、训练熵、分歧分布、 敏感度五个维度,证据链互相印证。
5. 公平对比:GRPO、SDPO、DemoPSD 共用代码库与训练基础设施,仅目标函数不同,排除了工程实现差异。
6. 稀疏性揭示:Figure 4 与 Table 5 显示大多数 token 不需要衰减,仅少数高分歧 token 介入,这说明方法在保留密集监督优势的同时具备选择性。
8. 不足与局限
1. 消融实验不足:未对核心设计选择进行严格的直接消融——特别是:
- 几何混合 vs 算术混合的对照实验缺失;
- 在多个取值下的影响未做扫描;
- EMA 副本对性能的影响未做消融;
- JSD 与其他分歧度量(如前向 KL、、总变差)的对比缺失。
2. 调优的隐性优势:DemoPSD 按领域对 做手工调优,GRPO/SDPO 缺乏同等调优自由度,可能造成对比偏差。
3. 模型规模单一:仅在 Qwen3-4B-Instruct 上验证,未在小模型(<1B)或大模型(≥14B)上测试,方法的规模可扩展性未经验证。
4. 任务范围受限:实验仅覆盖 4-选择多选题形式的科学推理,未涉及开放式生成、代码生成、数学证明等任务。特权信息的形式(正确 rollout 作为 )是否适用于其他特权信号(如参考文档、检索结果)仍待验证。
5. 算力与训练时长未披露:仅列出 GPU 型号与数量(8×H20),未提供 wall-clock 时长、token 吞吐量、总 GPU·hours 等关键信息,难以评估训练成本。
6. 协方差条件(Condition 16)的验证不充分:定理 2 要求 ,但论文未实证验证该条件在所有领域、训练阶段是否始终成立;若条件不满足,探索保留的保证将弱化。
7. 特权信息泄露的度量间接:依赖 OOD 准确率与训练熵作为泄露代理指标,缺少对特权信息 在学生内部表示中编码程度的直接度量(如 probing classifier 或互信息估计)。
8. 重提示机制依赖:当 prompt 组中无正确 rollout 时跳过该样本(active % 在 64.8%–90.6%),会引入训练样本量的隐式差异,可能影响与 GRPO 的严格对比公平性。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。










