arXiv 2607.02234v1 · 发布 2026-07-02

纯化 OPSD:在保留思维能力下的在策略自蒸馏

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

AUTHORS Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye
EVIDENCE 用于 LLM 推理的在线自蒸馏方法,模型从自身学习
SCORE 0.9
GENERATED 2026-07-04 21:39:13 UTC

📝 TLDR

长链思维推理模型上,标准在线自蒸馏方法不仅收益有限,还会损害模型赖以工作的反思推理能力。论文将教师监督信号拆解,发现其中参考诱导的捷径记忆成分占主导,而真正可迁移的问题条件推理信号被压制。提出两步净化方案:先用仅参考教师模型分离不可迁移分量,再以点互信息构建净化后的目标分布。在四个长CoT模型与两个数据集上的实验表明,该方法稳定优于基座和标准OPSD,同时保留模型的自然认知与反思行为。

🧭 速览

动机

标准OPSD在长CoT推理模型上失效:教师监督信号被参考诱导的捷径记忆主导,压制了可迁移的问题条件推理信号。

方法

两步净化:先用仅参考教师模型分离不可迁移分量获得残差,再以点互信息将残差转化为净化后的目标分布。

结果

在四个长CoT模型与两个数据集上稳定优于基座与标准OPSD,并完整保留模型的反思推理与认知行为。

结论

通过分解并净化教师信号中的参考诱导分量,使OPSD在长CoT模型上恢复有效蒸馏且不损害推理能力。

📊 论文图表(共 28 张)

展开查看 28 张图

TL;DR

长链思维推理模型上,标准在策略自蒸馏方法几乎失效——教师的监督信号被参考答案的记忆成分主导,学生不仅学不到新东西,连原本依赖的反思推理能力也被破坏。该论文通过构造"参考独享教师"分离出监督信号中不可迁移的成分,再借助逐点互信息将残余的可迁移修正转化为合法目标分布,实现了蒸馏目标的净化。在四个长链思维模型与两个数据集上,该方法一致优于基座和标准 OPSD,同时完整保留了模型的自然认知行为。

研究背景与动机

在策略自蒸馏(OPSD)近年来成为提升大语言模型推理能力的重要范式。其基本思路是:让模型在自身生成的推理轨迹上进行"自我教学"——同一个模型充当"学生"生成当前策略下的解答,同时充当"特权教师"在能访问参考答案的条件下给出 token 级的监督信号。由于学生和教师都来自同一模型族,OPSD 天然避免了离线蒸馏中常见的分布失配问题,理论上应该是一种优雅且高效的自提升方案。

然而,当研究团队将这套方法搬到长链思维(long-CoT)推理模型上时,预期的收益并没有出现。他们在 AIME 2025 等数学竞赛基准上观察到一种令人担忧的模式:训练刚开始时模型性能短暂上升,但随后持续退化,最终往往低于基座水平。更棘手的是,模型的认知行为出现了明显异常——那些反映自我反思和探索的标记(如"Wait"、"Maybe"、"Perhaps"、"Let me think")在使用标准 OPSD 后要么整体消失,要么过度集中于某一个标记。这种现象在 Qwen3-8B 和 DeepSeek-R1-Distill-7B 等主流模型上都稳定复现,说明并非偶发的训练不稳定,而是某种系统性原因。

为什么长 CoT 模型会在这里"翻车"?研究者的直觉是:长 CoT 模型的核心能力在于它们能够停下来反思、质疑自己、尝试不同的思路分支。当模型已经知道"标准答案"时,这个反思过程就变得多余了——教师模型因为知道答案,所以倾向于跳过探索阶段,直接指向最短的记忆路径。反映在训练信号上,就是教师监督被参考答案特有的捷径成分主导,而真正有价值的、基于问题本身的推理修正反而被淹没。

方法

要解决这个问题,首先要能"看见"问题。研究者没有停留在"训练效果不好"的现象描述,而是尝试对教师监督信号进行结构性分解。他们的核心观察是:标准 OPSD 中,教师给出的监督方向可以写成

其中 是特权教师(在问题上附加参考答案的条件)给出的分布, 是学生当前的策略分布。如果能把这个总更新拆分成"真正有用的修正"和"参考答案带来的捷径"两个部分,就能有针对性地过滤掉后者。

顺着这个思路,研究者提出了一个巧妙的构造:构建一个"仅参考教师"(reference-only teacher)。这个教师拿到的是什么呢?只有参考答案本身,而没有原始问题。如果模型仅仅"记住"参考答案的表面形式,它在只有参考答案作为输入时仍然会生成类似的 token 序列;而如果某条推理路径真正依赖于对问题的理解,它在缺少问题语境时就会"迷路"。通过这个对照实验, 实质上捕获了监督信号中与问题无关、纯粹由参考答案驱动的成分。

基于这个仅参考教师,总更新可以正式分解为

研究者通过实验验证了这个分解的有效性: 在方向和幅度上都主导了总更新(),而 与总更新近乎正交甚至反向对齐。这说明标准 OPSD 的学生实际上主要在学参考答案的记忆模式,而非可迁移的问题解决能力。

分解找到了问题所在,但直接用 作为蒸馏目标存在数值障碍——它不是合法的概率分布。研究者转向逐点互信息(PMI)来构造一个形式良好的目标分布。他们将 解释为可迁移的奖励信号 ,然后求解一个 KL-正则化的最优策略问题:

其中 是干净基座分布(仅以当前问题为条件的初始策略), 控制修正强度。这个问题的闭式解恰好是

这正是 PMI 目标分布。通过这种方式,残余修正被锚定到一个合法的概率基座上,同时保留了可迁移推理信息的相对偏好。

在实际训练中,研究者还需要处理数值稳定性问题:log 空间的残差直接 softmax 可能导致数值爆炸。他们的解决方案包括两步。首先是均值中心化,将残差减去其在词表上的均值,避免极端值主导;其次是 tanh 软裁剪,将幅度限制在 的范围内,防止梯度爆炸。最终的目标分布构造为

整个训练流程非常紧凑:学生在线采样推理轨迹,教师和参考探针分别给出条件分布,冻结的基座模型提供干净基座,三者的 log 概率差值经均值中心化和软裁剪后,加回到基座分布的 log 概率上,用 JSD 散度作为学生策略与目标分布的匹配损失。值得注意的是,参考探针和干净基座的前向传播不参与反向传播,额外计算开销控制在 10% 以内。

实验与结果

研究者在四个不同架构的长 CoT 模型上验证了方法的有效性,包括通用型的 Qwen3-8B 和 Qwen3-4B、蒸馏型的 DeepSeek-R1-Distill-7B,以及开源复现的 OLMo-7B-Thinking。训练数据集覆盖了 DASD-10K 和 Math-CoT-20K 两个数学推理语料,评测基准则涵盖 AIME 2024、AIME 2025 和 HMMT 2025 三个难度较高的数学竞赛。

核心结果表格呈现了 4 模型 × 2 数据集 × 3 基准的完整性能格点。标准 OPSD 在几乎所有组合上都表现疲软,要么性能退化,要么仅有边际增益。相比之下,净化后的 OPSD-PMI 在每一个格点上都是最优的,相对于基座和标准方法都取得了显著提升。

训练动力学曲线揭示了更清晰的图景。在 AIME 2025 上,标准 OPSD 呈现典型的"先升后降"曲线,印证了反思能力被逐渐侵蚀的过程;而 PMI 方法在整个 200 步训练过程中保持稳定上升,没有出现退化迹象。这说明净化策略不仅提升了最终性能,还从根本上改善了学习曲线的形态。

认知行为分析是本研究的一个亮点。研究者统计了反思性标记("Wait"、"Maybe"、"Perhaps"、"Let me think" 等)在训练过程中的出现频率和分布均匀度。标准 OPSD 下,这些标记要么整体消失,要么被某单个标记(如"Wait")垄断——这反映了模型反思能力的坍缩或单一化。PMI 方法则成功将这些标记的数量和分布维持在基座水平,证明净化策略确实保护了模型的自然认知行为。

消融实验进一步确认了各组件的必要性。软裁剪阈值 的选择对结果有影响但不过于敏感, 在多数场景下表现稳健。修正强度 的敏感性略高,不同检查点可能在不同 值下达峰,但固定 仍然能取得不错的整体表现,说明方法对超参数具有一定鲁棒性。

讨论与可借鉴点

这项工作的核心贡献在于提供了一套因果诊断框架。面对 OPSD 在长 CoT 模型上的失效,大多数现有工作倾向于调整学习率或增加正则化项,而该论文从监督信号的组成结构出发,揭示了"参考诱导捷径"这一根本矛盾。这种从信号分析出发的诊断思路,在面对复杂的自训练失效模式时值得借鉴。

从方法论角度看,将可迁移修正锚定到干净基座分布上、通过 KL-正则化奖励最大化推导出 PMI 目标的做法,将启发式设计提升到了原理层面。这种"先诊断、后构造"的两步策略,可能对其他蒸馏场景也有参考价值——当教师信号包含混杂成分时,分离-锚定-转化的范式或许能通用。

当然,实验覆盖范围仍有局限。所有验证都集中在数学竞赛推理任务上,代码生成、开放域问答、多步工具调用等场景的迁移性尚未考察。训练也仅进行了 200 步并使用 LoRA,更长时间的全参数微调下方法的相对优劣尚不清晰。此外,教师模型同源于基座的假设意味着该方法依赖基座本身具备合理的推理和对齐能力,对于严重未对齐的模型效果未知。

一个值得深思的问题是:参考独享教师是否真的"只记住"了参考答案?如果某些推理模式本身在缺少问题语境时仍能保持部分语义连贯性(比如对称性的某种直觉), 可能会误捕一些真正有价值的信号。不过,这个问题不影响当前工作的结论——即便 过滤掉了一部分有用信息,残余的修正信号仍然足以驱动一致的性能提升。

摘要

在策略自蒸馏(OPSD)已成为提升大语言模型推理能力的一种颇具前景的范式,其中能够访问参考答案的特权教师在学生自身生成的轨迹上提供 token 级监督。然而我们发现,OPSD 在长链思维(long-CoT)推理模型上始终失效,最多只能带来边际增益,同时还破坏了这些模型所依赖的反思性推理能力。通过对教师监督信号进行一种新颖的分解,我们定位到根本原因:教师的监督被一种参考诱导的成分所主导,该成分驱动对参考专属捷径的死记硬背,而基于问题的、可跨推理迁移的成分则被忽视甚至被主动抵触。基于该诊断,我们提出一种两步解决方案。首先,我们构建一个纯参考教师(同一模型仅以参考为条件、不以问题为条件),以分离监督信号中不可迁移的成分;减去该成分后的残差承载了基于问题的、可迁移推理的修正信息。其次,我们以逐点互信息(PMI)作为转化机制,将该残差转化为一个形式良好的 PMI 目标分布,使学生能够直接对其进行蒸馏,由此过滤掉参考诱导的捷径。在两个数据集上对四个 long-CoT 模型的实验表明,相较于基础模型和标准 OPSD,本方法均取得了一致的性能提升,并在整个训练过程中保持了模型原有的认知行为。

速览

TLDR:On-Policy Self-Distillation (OPSD) 在长链思维推理模型上表现不佳,常因教师监督信号被参考答案捷径主导而破坏模型的反思能力。本文将教师信号拆分为"参考答案诱导"与"问题条件推理"两个成分,通过参考独享教师隔离非可迁移部分,并借助点互信息(PMI)将剩余的推理可迁移修正转化为学生可直接蒸馏的目标分布。在四个长CoT模型与两个数据集上的实验表明,该方法在稳定提升推理能力的同时保留了模型原有的认知行为。 \

Motivation:OPSD在长CoT推理模型上几乎失效,因为教师监督被参考答案特异性捷径主导,抑制了模型的问题条件推理与反思能力。 \

Method:构建仅以参考答案为条件的参考独享教师以分离非可迁移监督,再用其残差经PMI转化为学生可直接蒸馏的目标分布。 \

Result:在四个长CoT模型与两个数据集上一致优于基模型与标准OPSD,并全程保留模型天然的认知与反思行为。 \

Conclusion:通过对监督信号的成分拆解与PMI净化,OPSD可被安全用于长CoT模型,兼顾推理增强与认知行为稳定。

Context:该工作属于LLM推理增强中的自蒸馏与教师监督方向,针对OPSD在长CoT模型上失效的问题提出针对性解法,适用于兼顾推理性能与反思行为的后训练场景;PMI净化思路可推广至其他参考条件蒸馏框架,但仍需更多验证。


Abstract

On-policy self-distillation (OPSD) has emerged as a promising paradigm for improving LLM reasoning, where a privileged teacher with access to reference solutions provides token-level supervision on the student's own generated trajectories. However, we find that OPSD consistently fails on long chain-of-thought (long-CoT) reasoning models, yielding at best marginal gains while destabilizing the reflective reasoning capability these models depend on. Through a novel decomposition of the teacher's supervision signal, we identify the root cause: the teacher's supervision is dominated by a reference-induced component that drives rote memorization of reference-specific shortcuts, while the question-conditioned, inference-transferable component is ignored or actively opposed. Based on this diagnosis, we propose a two-step solution. First, we construct a reference-only teacher (the same model conditioned on the reference without the question) to isolate the non-transferable component of the supervision signal; the residual after subtracting this component captures the question-conditioned, inference-transferable correction. Second, we use pointwise mutual information (PMI) as the mechanism to transform this residual into a well-formed PMI target distribution that the student can directly distill from, filtering out the reference-induced shortcut. Experiments on four long-CoT models across two datasets demonstrate consistent improvements over both the base model and standard OPSD, while preserving the models' natural epistemic behavior throughout training.


论文详细总结(自动生成)

Purified OPSD:在保留思维能力下的在策略自蒸馏 —— 论文总结

1. 核心问题与整体含义

  • 研究背景:在策略自蒸馏(On-Policy Self-Distillation, OPSD)是近年来提升大语言模型(LLM)推理能力的重要范式。学生模型在自身生成的推理轨迹上,由一个能够访问参考答案的"特权教师"提供 token 级监督信号,从而缓解传统离线蒸馏的分布失配问题。
  • 观察到的失效现象:在长链思维(long-CoT)推理模型(如 OpenAI o1、DeepSeek-R1、QwQ 等)上应用标准 OPSD 时,几乎无收益甚至出现性能退化:
  • AIME 2025 准确率在训练过程中出现"短暂上升后持续下降"的模式;
  • 认知/反思性标记("Wait"、"Maybe"、"Perhaps"、"Let me think" 等)出现剧烈的异常波动(Qwen3-8B 整体坍缩,R1-Distill-7B 单一标记 "Wait" 异常膨胀)。
  • 核心假设:特权教师已"知道答案",因此不再需要反思、探索与自我纠正;其监督信号实质上驱动学生死记硬背参考专属的推理捷径,而非学习可迁移的推理能力。
  • 整体含义:OPSD 在 long-CoT 模型上的失败并非调参或训练不稳定问题,而是教师信号结构性的偏差所致;需要从根本上分离"可迁移修正"与"参考诱导捷径"两个成分。

2. 论文提出的方法论

2.1 教师监督信号的分解

  • 在标准 OPSD 中,教师更新方向可写为:
  • 论文提出构建一个仅参考教师(reference-only teacher),其输入仅含参考答案 而不含问题 ,从而将总更新分解为:
  • 诊断结论 在方向和幅度上均主导总更新(),而 几乎正交甚至与总更新反向对齐,说明学生实际学到的是参考记忆。

2.2 基于逐点互信息(PMI)的净化目标

  • 直接使用 作为蒸馏目标存在数值问题(不是合法概率分布)。论文将残差 锚定到干净基座分布 上,构建 PMI 目标分布:

其中 控制修正强度。

  • 最优性推导:若将 视为可迁移奖励 ,则求解 KL-正则化最优目标:

其闭式解正好给出 PMI 目标,从而为该构造提供了信息论与强化学习双重解释(与 RLHF/DPO 中的 KL-正则化策略改进同构)。

2.3 训练目标

2.4 稳定化实现流程(6 步)

1. 学生在线生成轨迹

2. 用冻结基座 做三次前向传播,分别得到教师分布 (含参考)、参考探针 (仅参考)、干净基座 (仅问题);

3. 在 log 概率空间计算残差

4. 均值中心化

5. tanh 软裁剪

6. 构造目标分布

2.5 计算开销

  • 相比标准 OPSD 额外增加 2 次冻结模型前向(参考探针 + 干净基座),且不参与反向传播;
  • 整体训练墙钟时间增加 ,无新增可训练参数。

3. 实验设计

3.1 模型

模型规模/类别
Qwen3-8B通用 long-CoT
Qwen3-4B通用 long-CoT
DeepSeek-R1-Distill-Qwen-7B蒸馏型 long-CoT
OLMo-7B-Thinking开源 long-CoT

3.2 训练数据集

  • DASD-10K:DASD 数据集的 10K 子集;
  • Math-CoT-20K:20K 竞赛级数学题,附详细 CoT 参考解。

3.3 评测基准(Benchmark)

  • AIME 2024AIME 2025HMMT 2025
  • 每 50 步评估一次、至 200 步,报最佳检查点;
  • 所有分数取 12 次运行的平均。

3.4 对比方法

  • Base:未经蒸馏的基座模型;
  • OPSD-Standard:标准 OPSD(Zhao et al., 2026)+ JSD 损失;
  • OPSD-PMI(Ours):将教师替换为净化后的 PMI 目标。

4. 资源与算力

  • 论文未明确说明 GPU 型号、卡数或总训练时长。
  • 仅披露以下训练超参:LoRA(rank 64)、学习率 、batch size 32、梯度检查点、vLLM 推理、最大生成长度 1024 token;
  • 自报额外前向传播开销 墙钟时间。

5. 实验数量与充分性

  • 核心主结果表:4 模型 × 2 数据集 × 3 基准 = 24 个性能格点(Table 1);
  • 训练动力学曲线:AIME 2025 跨 200 步轨迹,4 模型 × 2 方法对比(Figure 1 + Figure 4);
  • 认知标记分析:2 模型 × 2 方法的总数与按标记细分分布(Figure 2 + Figure 5);
  • 教师信号分解实验:2 模型 × 2 度量(余弦相似度、范数占比)跨 200 步(Figure 3);
  • 消融:软裁剪阈值 (2 模型 × 2 基准 = 4 图,Figure 6);修正强度 (2 模型 × 2 基准 = 4 图,Figure 7);
  • 充分性评价:跨多种模型架构(Qwen、DeepSeek、OLMo)与多种训练语料均观察到一致收益,并通过认知行为指标交叉验证,方法层面较为客观;但训练仅 200 步、采用 LoRA,结论的长期泛化性仍需更长时间尺度的验证。

6. 主要结论与发现

  • 诊断层面:标准 OPSD 的教师更新被参考诱导分量主导(),而问题条件、可迁移分量 被忽略甚至被反向抑制,这是 long-CoT 模型性能退化与反思能力失稳的根因。
  • 方法层面:通过"参考探针 + PMI 净化目标"两步策略,可将教师信号中可迁移的修正从参考诱导捷径中剥离,并将其转化为可学习的目标分布。
  • 效果层面
  • OPSD-Standard 在 4 模型上大多退化或仅边际增益;
  • OPSD-PMI 在 4 模型 × 2 数据集 × 3 基准的所有组合上一致超越基座与标准 OPSD,平均提升幅度显著;
  • 训练动力学稳定,无需精细的早停;
  • 反思性认知标记("Wait"、"Maybe" 等)保持在基座水平附近,未出现坍缩或单标记膨胀等退化模式。

7. 优点

  • 机制层面的因果诊断:通过构造 reference-only teacher 提出可解释、可量化的信号分解,定位 OPSD 失效的根因;
  • 原理性目标构造:PMI 目标并非启发式归一化,而是 KL-正则化奖励最大化问题的闭式最优解,理论与实践统一;
  • 实现简洁、可插拔:仅替换蒸馏目标,附加两次冻结前向,墙钟开销 ,无新增参数;
  • 跨模型/跨数据集稳定提升:在 Qwen3、R1-Distill、OLMo 等不同家族与两种数据上同时验证,且对 均具鲁棒性;
  • 行为层面的双重验证:不仅报准确率,还通过认知标记分析证明反思能力得到保留,避免"为性能牺牲推理风格"的隐性退化。

8. 不足与局限

  • 任务域单一:所有实验均集中在数学竞赛级推理(AIME、HMMT),未验证其在代码生成、开放问答、工具使用等领域的迁移性;
  • 训练预算有限:仅 200 步、采用 LoRA;更长的训练或全参数微调下的相对表现未知;
  • 教师同源 均来自同一冻结基座 ,依赖"基座本身具备合理推理与对齐"的前提;对严重未对齐的基座是否仍有效未讨论;
  • 诊断未覆盖全部失败模式:仅揭示"参考诱导捷径"这一根因,未排除 long-CoT 训练中其他可能影响 OPSD 的因素(如奖励稀疏、轨迹长度膨胀等);
  • 调参与稳定性:不同 在不同检查点达峰,无统一最优值;主实验固定 ,潜在的最优调度策略未被探索;
  • 依赖参考答案质量:训练需要高质量参考答案,在缺乏标注的场景下方法不可用;
  • 对比基线较少:未与 Self-Distilled Reasoner、Self-Distillation Zero、off-policy 长 CoT 蒸馏(S1、LIMO、R1-Compress 等)做直接对比,难以判断其在更广谱方法生态中的相对位置;
  • 评测仅 12 次平均:置信区间未在主表中展示,部分提升幅度较小处统计显著性需进一步验证。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记