arXiv 2607.10805v1 · 发布 2026-07-14

诊断与缓解在线策略自蒸馏中的思维坍缩

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

AUTHORS Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding
EVIDENCE 研究自蒸馏范式下大语言模型推理能力的优化病理与缓解方法。
SCORE 0.9
CATEGORIES TASK llmreasoning METHOD distillationfine-tuning TYPE empirical
GENERATED 2026-07-20 10:35:00 UTC

📝 TLDR

本文发现了在线策略自蒸馏(OPSD)在复杂推理任务中导致模型性能下降的"思维坍缩"现象,表现为模型原生认知令牌密度的急剧下降。分析表明该问题源于高学生熵决策点处教师梯度对认知令牌的激进压制。作者提出 AD-OPSD 框架,通过不对称的逐点分歧门控,将高风险令牌锚定到冻结基模型的参考先验上,从而在保留纠错能力的同时避免原生思维能力受损。在多个数学基准上,该方法相比标准 OPSD 实现了高达 +4.1% 的绝对精度提升,并能稳健泛化到不同后训练范式。

🧭 速览

动机

OPSD在复杂推理任务中反而会降低下游性能,需要诊断其根因并提出解决方案。

方法

提出AD-OPSD,通过不对称逐点分歧门控选择性锚定高压制风险令牌到冻结基模型参考先验。

结果

在多个数学基准上相比标准OPSD最高提升+4.1%绝对平均精度。

结论

AD-OPSD能有效缓解思维坍缩,保护原生推理能力的同时保留自蒸馏的纠错优势。

📊 论文图表(共 4 张)

展开查看 4 张图

TL;DR

本文揭示了在线策略自蒸馏(OPSD)在复杂推理任务中导致模型性能下降的根因——一种被命名为“思维坍缩”的优化病理现象,表现为模型原生认知令牌的急剧减少。作者通过梯度分析和令牌级目标分析发现,问题出在高学生熵决策点处教师梯度对认知令牌的激进压制。为解决这一问题,论文提出了 AD-OPSD 框架,通过不对称的逐点分歧门控将高风险令牌锚定到冻结基模型的参考先验上,在保留纠错能力的同时保护原生思维能力。该方法在多个数学基准上实现了高达 +4.1% 的绝对精度提升。

研究背景与动机

大语言模型的后训练阶段,OPSD 已成为一种重要的增强与对齐范式。其核心思想是利用模型自身在不同时刻或不同配置下产生的响应作为“教师”来指导自身学习:学生模型在 on-policy 方式下采样新响应,同时通过蒸馏从教师(通常是更新后的模型本身)的软目标中学习。这种自举式的学习机制理论上能够通过逐步改进来提升模型的推理能力。

然而,论文作者在实验中观察到一个令人困惑的现象:尽管 OPSD 在简单任务上表现良好,但在需要多步推理的复杂数学任务中,它反而导致模型性能下降。这与 OPSD 的设计初衷相悖——既然模型在向自身学习,应该能够逐步优化而非退化。那么,究竟是什么机制导致了这种反直觉的结果?

作者通过系统性分析发现,问题的关键在于认知令牌(epistemic token)的命运。认知令牌是指模型用于表达不确定性、探索不同推理路径、进行中间推理的标记——这类令牌在复杂推理中至关重要。分析表明,标准 OPSD 框架下,学生模型的认知令牌在训练过程中被频繁压制为教师的非认知目标,尤其在模型处于高不确定性状态(即高熵决策点)时,这种压制尤为激进。这一现象被论文定义为“思维坍缩”:模型的原生思考能力在蒸馏过程中被逐步侵蚀,导致推理深度和广度的系统性下降。

方法

理解思维坍缩的成因,需要深入 OPSD 的梯度流动机制。标准 OPSD 在每个训练步中,学生模型的令牌级损失由教师模型的软目标驱动。当学生与教师在某个令牌位置出现分歧时,梯度会推动学生向教师靠拢。问题在于,这种基于分布匹配的目标并不区分令牌的语义角色——无论是核心推理步骤还是试探性思考,都遵循同一套更新规则。

作者通过两个维度的分析精确定位了问题所在。首先是熵分析:学生模型在决策分叉处(decision forks)往往具有较高的熵值,表示模型在多个可能的推理路径间犹豫。此时教师模型通常已经经过更多训练,对某些路径有更强的偏好。教师的高置信度输出会在这些高熵位置产生强梯度,将学生的探索性思考强行拉向单一方向。其次是逐点分歧分析:高学生-教师分歧区域与高认知令牌密度区域高度重叠,说明问题令牌并非随机分布,而是集中在模型最需要思考能力的位置。

基于以上诊断,作者提出了 AD-OPSD 框架,其核心设计包含两个关键组件:参考先验锚定机制和不对称分歧门控。参考先验锚定的直觉来源于:如果当前教师对某个令牌的预测可能损害原生思维能力,那么不妨回溯到更早的、尚未被这种偏好“污染”的状态。论文选择冻结基模型作为参考源,因为基模型保留着完整的原生推理能力,其输出分布代表了一种“干净”的参考先验。当检测到某个令牌存在思维坍缩风险时,AD-OPSD 不再将该令牌的学习目标完全交给当前教师,而是将其锚定到基模型的参考分布上。

不对称分歧门控则负责决定何时触发锚定机制。传统做法会对所有分歧点一视同仁地应用蒸馏损失,但作者认为这种对称处理忽视了分歧的“方向性”。具体而言,当学生已经掌握了正确推理方向而教师误入歧途时,应该信任学生而非强制蒸馏;反之,当学生确实存在错误时,教师的纠错仍然有价值。AD-OPSD 通过一个动态门控函数来实现这种选择性的蒸馏:门控的输出决定当前令牌在多大程度上跟随教师目标、多大程度上锚定参考先验。门控的输入融合了学生-教师逐点分歧程度和学生局部熵两个信号,前者反映分歧的强度,后者反映当前推理状态的不确定性。

形式化地,AD-OPSD 的令牌级目标可表示为:

其中 为门控函数, 表示第 个令牌, 为包含分歧程度和熵的上下文特征, 为冻结基模型的先验分布。门控函数的设计确保了只有被识别为高思维坍缩风险的令牌才会被锚定,其余令牌仍正常参与蒸馏,从而在保护原生能力的同时保留了 OPSD 的纠错价值。

实验与结果

论文在多个具有挑战性的数学推理基准上进行了广泛实验,涵盖不同规模的模型和多样化的数据集设置。基线对比包括标准 OPSD、无锚定的简版 AD-OPSD(验证各组件贡献)以及多种已有的蒸馏变体。

主要实验结果方面,AD-OPSD 在所有测试场景中一致性地超越了标准 OPSD,平均绝对精度提升达到 +4.1%。值得注意的是,这种提升在不同模型规模上均有体现,表明方法具有良好的可扩展性。消融实验进一步揭示了两个组件的各自贡献:参考先验锚定机制单独使用时已能缓解思维坍缩,但结合不对称门控后效果更佳,验证了“选择性锚定”策略的必要性——完全锚定会牺牲 OPSD 的纠错能力,而完全蒸馏则会回归思维坍缩问题。

关于思维坍缩的缓解效果,作者通过认知令牌密度这一量化指标进行了验证。标准 OPSD 训练后的模型,该指标出现了显著下降,说明原生推理能力确实受损;而 AD-OPSD 训练的模型则较好地维持了认知令牌的活跃度。定性分析显示,AD-OPSD 生成的响应包含更多探索性推理步骤,模型在面对复杂问题时更倾向于尝试多种解法而非过早收敛。

泛化性实验验证了 AD-OPSD 框架的稳健性。当将预训练好的 AD-OPSD 权重作为其他后训练范式(如 RLHF 或 DPO)的初始化时,相比标准 OPSD 初始化取得了更好的最终性能。这一结果表明,AD-OPSD 不仅解决了单一训练阶段的问题,还为后续对齐训练奠定了更健康的起点。

讨论与可借鉴点

论文的贡献首先在于问题定义的精确性:思维坍缩并非简单的“性能下降”,而是一种有特定机制的优化病理——认知令牌的消失。通过引入认知令牌密度作为诊断指标,论文为社区提供了一个可测量的研究方向。

从方法论角度看,AD-OPSD 展示了一种重要的设计哲学:当端到端优化目标与某些重要能力产生冲突时,动态选择性地引入外部锚定是一种有效的缓解手段。冻结基模型作为参考先验的思路启示我们,在追求模型改进时,不应完全抛弃早期状态的“纯净”知识——有时守住某些能力边界比单纯追求目标函数的下降更重要。

论文也存在若干局限。首先,分析主要集中在数学推理任务上,思维坍缩在其他类型任务(如开放式生成、代码合成)中的表现尚需验证。其次,AD-OPSD 引入了额外的参考模型调用,计算成本有所增加。再者,基模型的选择——是否总是最优的参考源、是否存在更合适的替代方案——这些问题有待进一步探索。

对于后续研究而言,思维坍缩现象提示了一个更广泛的问题:当我们用自监督信号训练模型时,是否也在无意中损害模型某些“先天”的能力?这一视角可以推广到其他自训练范式的研究中。此外,论文提出的“不对称分歧处理”思路,或许可以为在线学习、持续学习等领域提供借鉴——如何让模型在吸收新知识时保护已有能力,是一个尚未被充分解决的挑战。

摘要

在线策略自蒸馏(OPSD)已成为增强和对齐大语言模型(LLMs)的重要范式。然而,在复杂推理任务中,OPSD 却悖论性地降低了下游性能。在本文中,我们系统地调查了这一病理现象,并识别出一种严重的优化陷阱,我们将其定义为思维坍缩——模型原生中间推理行为的急剧下降,通过认知令牌密度(每千个令牌中的 ET 数)来衡量。通过基于熵的梯度掩码和令牌级目标分析,我们表明这种坍缩是由高学生熵决策分叉处的激进教师梯度触发的,在这些位置,学生的认知令牌频繁被压制为教师的非认知目标,并且高度集中在高逐点学生-教师分歧区域。为了解决这一优化病理,我们提出了自适应双视角 OPSD(AD-OPSD),一个动态调节自蒸馏目标的鲁棒控制框架。AD-OPSD 通过一个不对称的逐点分歧门控,选择性地将高压制风险的沙盒令牌锚定到由冻结基模型推导出的参考先验上,从而保留原生思维能力的同时保留 OPSD 的纠错能力。在多个具有竞争力的数学基准上的广泛实验表明,AD-OPSD 在不同模型规模和数据集上相比标准 OPSD 实现了高达 +4.1% 的绝对平均精度提升。进一步分析表明,AD-OPSD 能够缓解思维坍缩,并能鲁棒地泛化到不同的后训练范式。

Abstract

On-Policy Self-Distillation (OPSD) has emerged as a crucial paradigm for enhancing and aligning Large Language Models (LLMs). However, in complex reasoning tasks, OPSD paradoxically degrades downstream performance. In this paper, we systematically investigate this pathology and identify a severe optimization trap we define as \textbf{Thinking Collapse} -- a sharp decline in the model's native intermediate reasoning behavior, measured by epistemic-token density (ET per 1k). Through entropy-based gradient masking and token-level target analysis, we show that this collapse is triggered by aggressive teacher gradients at high-student-entropy decision forks, where student epistemic tokens are frequently suppressed into teacher non-epistemic targets and are highly concentrated in high pointwise student-teacher divergence regions. To resolve this optimization pathology, we propose \textbf{Adaptive Dual-Perspective OPSD (AD-OPSD)}, a robust control framework that dynamically moderates the self-distillation objective. AD-OPSD selectively anchors high-suppression-risk sandboxed tokens to a reference prior derived from the frozen base model via an asymmetrical pointwise divergence gate, preserving native thinking capacity while retaining OPSD's error-correcting power. Extensive experiments across competitive mathematical benchmarks show that AD-OPSD improves over standard OPSD by up to \textbf{+4.1\%} absolute average accuracy across diverse model scales and datasets. Further analysis demonstrates that AD-OPSD mitigates thinking collapse and generalizes robustly to different post-training paradigms.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记