重新思考面向思维模型的在策略自蒸馏
Rethinking On-Policy Self-Distillation for Thinking Models
📝 TLDR
自蒸馏被视为语言模型自我改进的有效方案,但其对思维模型长推理的影响尚不明确。研究者系统测试Qwen3与OLMo五个思维模型,在AIME24/25及HMMT25上发现特权上下文蒸馏反而导致avg@16准确率最高下降17%,且上下文隐藏越多、推理预算越长退化越严重。诊断显示特权信息改写高熵分叉处的学习信号,抑制了验证、回溯与犹豫标记的生成。结果揭示强思维模型的自蒸馏必须在token级、尤其是纠错步骤上精细化设计。
🧭 速览
自蒸馏在思维模型长推理链上的效果未知,特权信息作为教师信号的可行性需系统检验。
在Qwen3和OLMo五个思维模型上对比特权与普通on-policy自蒸馏,评测AIME24/25与HMMT25并分析分叉行为。
特权自蒸馏造成最高17%相对准确率下降,验证、回溯与犹豫标记显著减少,分叉率被压低。
强思维模型的自蒸馏需关注token级信号,尤其在纠错与回溯步骤处的学习信号设计。
📊 论文图表(共 9 张)
展开查看 9 张图
TL;DR
这篇论文研究了一个反直觉的现象:在 [[自蒸馏]] 框架下,当教师模型获得特权上下文(如数学题的完整解答)后,思维模型的表现反而会退化。在 Qwen3 和 OLMo 的五个 [[思维模型]] 上,特权上下文蒸馏导致 AIME24/25 及 HMMT25 的 avg@16 准确率最多下降 17%,且推理预算越长退化越严重。诊断分析揭示,特权上下文会抑制高熵分叉位置的学习信号,减少验证、回溯等关键 [[审议标记]] 的生成,从而削弱模型的自我纠错能力。
研究背景与动机
自蒸馏作为一种模型自我改进方案,近年来在语言模型训练中受到广泛关注。其核心思想是让模型在获得特权信息后充当自身教师,从而在没有外部监督的情况下提升能力。对于 [[测试时推理]] 模型而言,这种范式尤其具有吸引力——模型可以在推理过程中“看到”正确答案或完整解题思路,然后据此调整自身的推理策略。
然而,这一看似合理的假设在实践中却遭遇了意想不到的挫折。论文作者注意到,尽管已有方法如 OPSD、SDFT、SDPO、SD-Zero 等在指令调优模型或短生成预算场景下取得过成功,但这些方法对强 [[思维模型]] 在长推理轨迹上的效果始终缺乏系统验证。
研究的核心动机源于一个关键观察:当教师模型看到特权上下文时,它会在推理分叉位置做出更“确定”的选择——这种确定性是否反而剥夺了学生模型探索多种推理路径的机会?论文将此表述为一个根本性的设计问题:在 [[在策略蒸馏]] 中,特权信息究竟是帮助还是阻碍?
方法
论文首先对 [[在策略蒸馏]] 进行了严格的数学形式化。设输入问题为 ,学生模型采样得到的推理轨迹为 ,则蒸馏损失可表示为:
其中 为教师策略, 为学生策略, 为仅教师可见的特权上下文。关键设计在于,普通 OPD 对应 (无特权信息),而特权 OPD 则将完整解答或最终答案作为 注入教师模型。这种形式化使得研究能够精确控制特权信息的密度——完整解答对应“dense”条件,仅最终答案对应“sparse”条件。
为深入理解失败机制,论文引入了“分叉/锁定”诊断框架。在推理轨迹中,当 top-candidate 概率低于 0.25 时判定为分叉位(模型在多种合理路径间摇摆),高于 0.65 时判定为锁定位(模型已选定唯一路径)。通过对比有无敌权上下文时教师在分叉位的行为差异,研究者能够量化特权信息如何重塑 token 级的学习信号。
此外,论文还设计了 per-token log-ratio 分析和审议标记分析。审议标记指验证、回溯、对冲等反映模型元认知能力的词汇(如 "check"、"wait"、"maybe"),通过统计这些标记的出现频率,可以判断特权上下文是否抑制了模型的自我监督行为。
实验与结果
实验覆盖了 Qwen3 系列(1.7B、4B、8B、4B-Think-2507)和 OLMo-7B-Think 共五个 [[思维模型]],在 AIME24、AIME25、HMMT25 三个高难度数学基准上进行评测,生成预算从 4k 逐步扩展至 38k tokens。
主实验揭示了一个清晰的负面模式:全解答特权上下文导致所有五个思维模型的 avg@16 准确率全面退化。Qwen3-1.7B 从 0.372 降至 0.308,相对下降达 17%;Qwen3-4B 从 0.591 降至 0.534;即便是最强大的 Qwen3-8B 也从 0.635 降至 0.578。值得注意的是,退化程度与推理预算呈正相关——在 4k-8k tokens 的短预算下,特权 OPSD 与基线相当甚至略优;但在 32k-38k tokens 的长预算下,性能差距显著扩大。这恰好是 [[思维模型]] 能够获得最大增益的区间,特权蒸馏反而抹去了这部分收益。
对比实验进一步确认失败模式特属于特权上下文本身,而非 [[在策略蒸馏]] 范式。普通 OPD(无特权教师)能够改进思维模型的表现,而添加特权信息后这些收益立即被逆转。在 Countdown 数据集上的对照实验更揭示了一个有趣的二元分化:同样的特权 OPSD 对指令调优模型(Qwen3-4B-Instruct)反而有轻微增益(0.527 → 0.559),却损害了思维模型(0.776 → 0.765)。
诊断分析从机制层面解释了上述现象。在 Qwen3-4B 思维模型的 rollout 中,中位分叉率从约 0.083 骤降至 0.035(降低约 58%),而指令模型的分叉率始终保持在约 0.06 不受影响。这意味着特权上下文使思维模型在推理早期就锁定了路径,丧失了对替代推理分支的探索能力。per-token 信号分析显示,在自我纠正线索(如 "But wait"、"Maybe")处,无特权教师给出正优势信号,而特权教师反而给出负信号——直接惩罚了学生的再思考 token。审议标记统计进一步证实,使用特权教师训练的思维模型产生的验证、回溯、对冲标记明显更少,即便经过 [[长度归一化]] 后也是如此。
讨论与可借鉴点
这项研究的核心贡献在于揭示了一个此前未被充分认识的失败模式:对于强 [[思维模型]] 而言,特权上下文并非总是有益的监督信号。这一发现挑战了“自蒸馏中教师看到更多信息必然更好”的直觉,推动我们重新审视 [[测试时推理]] 与 [[自蒸馏]] 的交互机制。
从实践角度,研究指出了一个明确的改进方向:强推理模型的自蒸馏需要在 token 级别进行精细化设计,尤其是在纠错与推理步骤周围。具体而言,训练策略应保留学生在分叉位置探索多种路径的能力,避免过早锁定推理方向;审议标记的生成应被明确纳入优化目标,而非被特权信息所压制。论文提出的 epistemic-only OPD 和 random-fraction OPD 等消融实验为这一方向提供了初步验证。
研究的局限主要体现在几个方面。首先,评测基准规模较小(各 30 题),置信区间较宽,限制了结论的统计可靠性。其次,实验仅覆盖数学与 Countdown 领域,跨领域泛化能力有待验证。第三,训练-评测预算存在显著失配(4096 vs 38912),尽管对照实验部分缓解了这一担忧,但仍是潜在的混淆因素。
这一发现对当前 [[自蒸馏]] 研究具有重要的启发意义。它表明,简单地向教师注入特权信息并不能自动带来学生模型的改进,尤其是在模型已经具备较强推理能力的场景下。未来的工作或许需要探索更精细的 token 级奖励设计,或开发能够区分“有益探索”与“无谓穷举”的自适应机制。
摘要
自我蒸馏是语言模型自我改进的一种有前景的方法。在该设置中,当模型获得特权信息(例如数学问题的解答)时,便可以充当自身的教师。这对于思维模型尤其具有吸引力,因为后者可借助测试时推理来吸收特权信息。然而令人惊讶的是,我们发现特权自蒸馏会降低思维模型在长推理轨迹上的表现:在 AIME24、AIME25 和 HMMT25 上对五个 Qwen3 与 OLMo 思维模型进行评估,特权上下文蒸馏造成了平均 avg@16 准确率高达 17% 的相对下降。该退化随学生模型所保留特权上下文的减少而加剧,并在长 rollout 预算下最为明显——而正是在这种条件下,思维模型通常能够取得最大的增益。这一失败模式并非自蒸馏所独有:在策略蒸馏(OPD)能够改进思维模型,但特权 OPD 却会逆转这些收益。我们的诊断分析将这一失败模式与特权教师上下文如何重塑高熵分叉位置处的学习联系起来——在那些位置,多种续写路径仍属合理,并可能导向不同的推理过程。特权上下文降低了思维模型 rollout 中的分叉率,但对指令模型 rollout 却并无此作用。这导致了一种有趣的二元分化:特权上下文有助于指令调优模型,却会损害更强的思维模型。该效应在学生模型启动自我纠错分支时尤为明显——特权 OPD 会惩罚被采样的再思考 token,而普通 OPD 则支持这些 token。使用特权教师训练的思维模型即便在长度归一化之后,所产生的验证、回溯和对冲标记也更少。上述发现表明,针对强思维模型的自蒸馏需要关注 token 级别的信号,尤其是纠错与推理步骤周围的信号。
速览
TLDR:自蒸馏被视为大语言模型自我改进的有效路径。本文研究带特权信息(如解题答案)的在线自蒸馏对推理模型的影响。出乎意料的是,在Qwen3与OLMo五个思考模型上,特权自蒸馏在AIME24/25、HMMT25上导致高达17%的avg@16精度下降,且长推理预算下退化最严重。研究发现特权上下文会抑制高熵分叉位置的自我纠错行为,揭示思考模型自蒸馏需关注token级信号。 \
Motivation:探究特权信息自蒸馏对推理思考模型的真实影响,挑战特权上下文必然有益的默认假设。 \
Method:让思考模型充当自身教师,在已知答案的特权上下文下进行在线策略蒸馏,并在多个高难度数学基准上系统对比。 \
Result:特权自蒸馏使avg@16精度最多下降17%,降低高熵分叉率,抑制自我纠错,使验证与回溯标记减少。 \
Conclusion:强推理模型的自蒸馏需关注token级纠错信号,简单注入特权信息反而损害长链推理能力。
Context:承接自蒸馏与推理模型训练相关研究,定位特权上下文自蒸馏在强思考模型上的失败边界,指出token级纠错机制仍待设计。
Abstract
Self-distillation is a promising recipe for self-improvement in language models. In this setting, a model can serve as its own teacher when given privileged information, such as a solution to a math problem. This seems especially appealing for thinking models, which can use test-time reasoning to absorb the privileged information. Surprisingly, we show that privileged self-distillation degrades thinking models on long reasoning traces: across five Qwen3 and OLMo thinking models evaluated on AIME24, AIME25, and HMMT25, privileged-context distillation causes a relative drop of up to 17% in avg@16 accuracy. The degradation scales with the amount of privileged context withheld from the student and is most pronounced at long rollout budgets, where thinking models otherwise obtain their largest gains. This failure mode is not specific to self-distillation: on-policy distillation (OPD) improves thinking models, but privileged OPD reverses these gains. Our diagnostics link this failure mode to how privileged teacher context reshapes learning at high-entropy forking positions, where multiple continuations remain plausible and may lead to different reasoning paths. Privileged context lowers fork rates in thinking-model rollouts but not in instruction-model rollouts. This leads to an interesting dichotomy, where privileged context can help instruction-tuned models but hurts stronger thinking models. The effect is visible when the student begins a self-correction branch, where privileged OPD penalizes sampled reconsideration tokens that vanilla OPD supports. Thinking models trained with a privileged teacher produce fewer verification, backtracking, and hedging markers, even after length normalization. These findings indicate that self-distillation for strong thinking models requires attention to token-level signal, especially around correction and reasoning steps.
论文详细总结(自动生成)
论文总结:重新思考面向思维模型的在策略自蒸馏
1. 核心问题与研究动机
核心问题:自蒸馏(Self-Distillation)被视为语言模型自我改进的有效方案。当模型获得特权信息(如数学题的完整解答)后即可充当自身教师。思维模型(Thinking Models)——通过测试时推理(test-time reasoning)进行长链思考的模型——天然适合此类自改进。然而,本文报告了一个反直觉的负面结果:在特权上下文下的在策略自蒸馏(OPSD)反而会损害思维模型在长推理链上的表现。
研究背景与动机:
- 已有 OPSD 类方法(OPSD、SDFT、SDPO、SD-Zero)在指令微调模型、短生成预算或关闭思考模式的场景下取得过成功
- 但这些方法对强思维模型在长思考预算下的效果尚不明确
- 论文聚焦的核心疑问:给教师赋予特权信息是否会重塑高熵分叉位置(forking positions)的 token 级学习信号,从而抑制测试时搜索?
2. 方法论
2.1 在策略自蒸馏(OPSD)的形式化定义
论文使用上下文显式的在策略蒸馏目标:
其中:
- 为输入问题
- 为学生采样的在策略 rollout
- 为教师策略, 为学生策略
- 为仅教师可见的特权上下文(如最终答案或完整解答)
- 为 token 级散度,可为前向 KL、反向 KL、JSD 等
- 普通 OPD 对应 ;特权 OPD 设置 为额外信息
OPSD 中教师与学生为同一架构,通常从同一检查点初始化:教师看到特权上下文,学生看不到。
2.2 关键技术细节
- 训练截断:completion tokens 上限 4096
- 蒸馏方式:JSD,混合系数
- 批大小:有效 batch size = 64
- 优化器:余弦学习率衰减,warmup ratio 0.1,bf16 精度
- 分布式:FSDP 全分片,启用梯度检查点
- 生成引擎:vLLM
2.3 核心分析工具
- 分叉/锁定(Fork/Lock)诊断:参考 SSD 方法。设 top-candidate 概率阈值——分叉位:top 概率 ;锁定位:top 概率
- per-token log-ratio 信号分析:固定轨迹,对比有无特权上下文的教师对同一 token 的对数概率差
- 审议标记(deliberation markers)分析:识别 verification、backtracking、hedging 三类词族
3. 实验设计
3.1 训练数据
| 数据集 | 规模 | 特权上下文 | 学生提示 |
|---|---|---|---|
| OpenThoughts 15k(清洗自 29,439 行) | 15,000 | 完整参考解答(solution 列) | 仅问题 |
| Countdown(jasonrqh/Countdown-CoT-20k) | 15,000 训练 + 500 留出 | 后思维解答后缀 | datapoint_input_text |
3.2 模型
- 思维模型:Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-4B-Think-2507、OLMo-7B-Think
- 指令模型(对照组):Qwen3-4B-Instruct-2507、OLMo-7B-Instruct
- 教师模型:OPD 实验中使用 Qwen3-8B 作为更大教师
3.3 评测基准
- 数学竞赛:AIME 2024、AIME 2025、HMMT 2025(各 30 题)
- 域内评测:Countdown 留出 500 题
- 生成预算:4k / 8k / 16k / 32k / 38k tokens(主实验用 38,912)
- 采样数:每题 16 个 rollout
- 指标:avg@16(pass@1 的等价量)、pass@16(无偏估计器)、pass@k
- 解码参数:Qwen3 thinking 系列 ;Qwen3-4B-Instruct-2507
3.4 对比方法
1. Base 模型(不训练)
2. OPSD:特权上下文 = 完整解答(dense)
3. OPSD(仅答案):特权上下文 = 仅有最终答案(sparse)
4. OPD:使用更大无特权教师
5. OPD(带 gold demo):教师获得 gold 演示
6. OPSD(关闭思考):训练时禁用思考,评测时启用
7. Epistemic-only OPD / Random-fraction OPD:token 掩码消融
8. SD-Zero 流水线:SRT → SRT + OPSD
3.5 提示模板
学生提示:{problem}
特权教师提示:
```
{problem}
This is an example for a response to the question: {Answer}
Now answer with a response of your own, including the thinking process.
```
其中 {Answer} 在 dense 条件下为完整解答,在 sparse 条件下仅为 中的最终答案。
4. 资源与算力
| 配置项 | 取值 |
|---|---|
| GPU 型号 | NVIDIA H100 80GB |
| GPU 数量 | 每训练运行 8 张 |
| 训练时长 | 论文未明确给出端到端训练时长 |
| 精度 | bf16 |
| 分布式 | FSDP 全分片 |
| 推理引擎 | vLLM,eval GPU 内存利用率 0.9 |
说明:论文仅在附录 B.4 中列出硬件为 8 H100/GPU,但未报告具体的 wall-clock 训练时长或总算力消耗(GPU·hours)。
5. 实验数量与充分性
5.1 实验规模
- 主表 1(OpenThoughts 思维模型 5 个 × 3 基准):15 个数据点
- 表 2(Countdown 训练下 instruct vs thinking,4 模型 × 4 基准):16 个数据点
- 表 3(训练时是否启用思考的消融):3 个数据点
- 表 4(Qwen3-1.7B 不同 OPD 变体):4 变体 × 3 基准 = 12 个数据点
- 图 1、6、7:5 个思维模型 × 6 预算(4k–38k tokens)的 pass@k 与响应长度曲线
- 图 2:3 个 Qwen3 尺寸 × 教师/学生/基线对照
- 图 3:5 模型平均的预算相关 OPSD 效应(dense vs sparse)
- 图 4:Qwen3-4B-Instruct vs Thinking 的 fork/lock 率
- 图 5:3 个真实 rollout 窗口的 per-token log-ratio 案例
- 表 5、20–23:token 级 OPD 消融,含 epistemic-only 与 random-fraction 掩码
- 表 6:5 模型 × 3 基准 × 16 样本 = 7,200 对配对 rollout 的审议标记分析
- 表 14–19:配对 bootstrap 95% CI(10,000 次重复)
- 附录 F SD-Zero 流水线对比:6 设置
5.2 充分性与公平性评估
优点:
- 覆盖了 Qwen3 与 OLMo 两大系列、多种模型规模(1.7B–8B)
- 同时提供 pass@1 与无偏 pass@16,区分平均与多样性增益
- 配对 bootstrap 95% CI(10,000 次),置信区间反映了评测问题的不确定性
- 提供了多种 OPD 变体对比(vanilla、gold demo、no-thinking、SD-Zero),证明失败模式特异于特权上下文而非 OPD 本身
- 包含短训练预算(4k)与长评测预算(38k)的不匹配控制实验
不足:
- 评测基准仅 30 题/benchmark(AIME/HMMT),小样本下 CI 仍较宽
- 训练-评测预算失配(4096 vs 38912),虽通过 OPD 对照部分排除,但仍是潜在混淆因素
- 仅在数学与 Countdown 上验证,跨域泛化未覆盖
6. 主要结论与发现
6.1 经验性发现(五条核心观察)
1. OPSD 对指令模型更可靠,对思维模型常有害(Countdown 设置下,Qwen3-4B-Instruct 由 0.527 → 0.559,Qwen3-4B-Think-2507 由 0.776 → 0.765)
2. 全解答特权上下文导致 5 个思维模型全面退化:AIME24/25/HMMT25 上,Qwen3-1.7B avg@16 由 0.372 降至 0.308(17% 相对下降);Qwen3-4B 由 0.591 降至 0.534;Qwen3-8B 由 0.635 降至 0.578;Qwen3-4B-Think-2507 由 0.720 降至 0.683;OLMo-7B-Think 由 0.612 降至 0.604
3. 退化随特权上下文密度单调放大:仅最终答案(sparse)保留长预算行为优于完整解答(dense);dense 在 4k–8k 有增益,但 32k–38k 时反转甚至变负
4. 教师本身不退化:配带 gold 演示的 base 教师在更长预算下仍保持甚至提升 pass@k,但学生继承了较短响应长度而未继承 pass@k 增益
5. 退化集中在长 rollout 预算:4k–8k 时 OPSD 与基线相当或更优;32k–38k 时 OPSD 持平或低于基线——即 OPSD 移除了思维模型从更长思考中获得的增益
6.2 机制性发现(分叉抑制,Fork Suppression)
- 特权上下文降低思维模型 rollout 中的分叉率(Qwen3-4B 中位 fork 率从约 0.083 降至 0.035),但几乎不影响指令模型(始终约 0.06)
- per-token 信号反转:在自我纠正线索(如 "But wait"、"Maybe")处,无特权教师给出正优势,特权教师给负优势(如 "but" 处 log-ratio = -12.70)
- 学生产生更少审议标记:验证(-0.28/1k tokens)、回溯(-0.16/1k)、对冲(-0.17/1k),长度归一化后仍下降
6.3 综合结论
特权上下文通过重新加权高熵分叉位上的 token 级信号,抑制了支持测试时搜索的审议行为。这并非简单的"响应变短",而是改变了推理过程的 token 级结构。
7. 优点与亮点
- 系统性的负面结果:跨越 5 个不同规模、家族的思维模型,现象稳健
- 多层次诊断:不仅报告准确率下降,还在 fork/lock 分布、per-token log-ratio、审议标记密度三个层面验证机制
- 排除替代解释:通过 vanilla OPD 与 OPD-with-gold-demo 的并列对比,证实问题特异于特权上下文而非 OPD 或短训练预算
- 稀疏 vs 密集特权上下文的对比:为长视野 agent 训练(如 Composer 2.5 的短提示式反馈)提供了可操作的指导——短答案级提示比完整演示更安全
- 配对统计推断:使用 problem-level clustered bootstrap(10,000 次),4/5 模型主对比的 95% CI 不包含 0
- 与并发工作呼应:与 Kim et al. 2026 的 epistemic verbalization 抑制工作互补,本文将其扩展为更广泛的 fork 抑制机制
8. 不足与局限
8.1 方法论局限
- 因果性未确立:所有诊断为相关性证据而非因果证明。论文明确承认 "These diagnostics do not establish a causal explanation"
- 未提出解决方案:仅指出 OPSD 在思维模型上的失败模式,未给出修复方法(如如何保留特权信号同时保护分叉行为)
- Lexical 代理的局限:审议标记仅为 fork 的"词法代理",许多关键决策点发生在普通数学/连接词/格式 token 上
8.2 实验覆盖局限
- 仅限数学可验证域:Countdown 与 AIME/HMMT,未在持续学习、代码、开放问答等领域验证
- 训练-评测预算不匹配:训练上限 4096 tokens,评测上限 38912 tokens,虽通过对照部分排除但仍是潜在混淆
- 未探索多种教师特权形式:仅考察了 final-answer-only 与 full-solution 两种密度,未尝试其他特权信息类型(如错误反馈、过程评分)
- 未探索更优蒸馏目标:固定使用 JSD(),未与 forward KL、reverse KL、其他混合方式比较
8.3 偏差风险
- 评测样本量较小(AIME/HMMT 各 30 题),CI 较宽
- 未提供训练 seed 变异性分析
- 结论可能仅适用于"已大量 post-training 的强思维模型",对弱模型或纯 base 模型未必成立
8.4 应用限制
- 对长视野 agent 训练虽提出方向性建议(短提示优于长演示),但未在 agent 场景下实测
- 对在线学习/持续学习等 OPSD 的另一类应用未触及(虽然附录中提及 Shenfeld et al. 2026 的相关工作)
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。








