arXiv 2607.01763v1 · 发布 2026-07-02

更密集≠更好:持续后训练中在线自蒸馏的局限性

Denser Better: Limits of On-Policy Self-Distillation for Continual Post-Training

AUTHORS Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu
EVIDENCE 用于持续后训练的在线自蒸馏及其与RL方法的比较
SCORE 0.8
GENERATED 2026-07-04 02:32:53 UTC

📝 TLDR

持续后训练需让基础模型在学习新知识的同时保留已有能力。论文重新审视自蒸馏策略优化(SDPO),发现其虽能加速领域内专精化,却在分布外泛化场景中表现欠佳。实验表明SDPO遗忘更严重且可能完全崩溃,而GRPO等on-policy强化学习方法更保守,能更好保留先验能力。进一步分析揭示密集自蒸馏会引发参数与响应空间更大漂移,并通过自强化循环放大高频格式伪影,表明仅靠on-policy数据不足以支撑持续学习。

🧭 速览

动机

持续后训练中需兼顾新知识获取与旧能力保留,on-policy自蒸馏被广泛视为有效方案,但实际稳定性存疑。

方法

提出SDPO自蒸馏策略优化框架,通过教师-学生在线蒸馏进行持续后训练,并与GRPO进行对比分析。

结果

SDPO在领域内专精化更快,但遗忘更严重甚至崩溃;密集蒸馏导致参数与响应空间漂移增大。

结论

密集自蒸馏不应作为持续后训练的默认稳定器,仅靠on-policy数据不足以解决持续学习问题。

📊 论文图表(共 48 张)

展开查看 48 张图

TL;DR

这篇论文系统地挑战了持续后训练领域的一个流行假设:在线自蒸馏(通过 SDPO 实现)是否真的是缓解灾难性遗忘的"灵丹妙药"?作者在四个领域(MATH、SCIENCE、TOOL USE、CODING)和十个分布外评测基准上进行了大量实验,发现稠密的自蒸馏虽然能在域内加速专业化,但会引发更严重的遗忘,甚至导致训练崩溃。与之对比,GRPO 等序列级强化学习方法虽然收敛更慢,却能更保守地适应新任务,同时更好地保留先前能力。论文进一步从参数空间漂移、响应空间漂移以及理论三个层面揭示了根源:密集自蒸馏会在教师—学生之间形成自强化循环,放大高频格式伪影,且当教师投影目标与真实最优策略不一致时,会产生超额 KL 漂移。

研究背景与动机

基础模型的持续后训练(Continual Post-Training)是当前大模型落地过程中的核心挑战之一。理想状态下,我们希望一个通用基础模型在依次学习数学推理、科学问答、工具使用、代码生成等不同领域时,既能快速掌握新技能,又不会遗忘已经学会的能力。然而,神经网络在学习新分布时天然倾向于覆盖旧知识,这一现象被称为灾难性遗忘。

近期研究(如 Lai et al., 2025;Shenfeld et al., 2025)发现了一个有趣的现象:使用在线强化学习方法(如 GRPO)进行后训练,比传统的监督微调遗忘更少。一个直观的解释是:在线策略方法只在模型自身生成的数据上进行更新,而这些数据天然与模型当前能力分布对齐,从而降低了干扰已有知识的风险。

基于这一观察,一类更激进的方法应运而生——在线自蒸馏。其核心思想是:不仅使用模型自身的在线数据,还要对每一个生成的词元提供稠密的 token 级监督。具体而言,SDPO 让模型同时扮演学生和教师两个角色:学生模型生成响应,而教师模型在额外上下文(如推理链、反馈信号、解题过程)的条件下生成"特权"响应,然后将学生每个 token 的分布与教师分布对齐。这种方式兼具了在线数据的遗忘缓解效应和稠密监督的高样本效率,在一些实验中确实表现出色。

然而,论文指出了一个被此前研究混淆的关键点:数据来源(on-policy)与训练目标(如何将在线 rollout 转化为更新信号)实际上是两个独立的因素。仅仅因为在线数据减轻了遗忘,不意味着任何利用在线数据的目标函数都能做到这一点。论文通过系统对比 SDPO 与 GRPO,重新审视这一乐观假设,发现稠密自蒸馏在持续学习场景下存在显著的隐性代价。

方法

论文的核心方法论围绕两个在线策略方法的系统对比展开,并辅以多层诊断分析。

SDPO 与 GRPO 的对比框架

GRPO(Group Relative Policy Optimization)是一种序列级强化学习方法。对每个输入 prompt ,模型采样 个响应并获得奖励,然后计算组内相对优势 ,最终优化一个裁剪的策略梯度目标,同时加入 KL 正则项防止策略过度偏离参考模型:

关键在于,GRPO 的监督信号是序列级的——奖励只在完整响应结束后才能获得,优势通过组内相对比较而非每个 token 的匹配度来计算。

SDPO(Self-Distillation Policy Optimization)则采用完全不同的策略:学生模型采样响应 ,而教师模型在额外上下文 (解法、反馈等)的条件下给出"特权"响应 ,每个 token 都施加 Jensen-Shannon 散度损失:

这种设计产生了两个重要后果:首先,SDPO 提供的监督是稠密且 token 级的,而 GRPO 只在序列级别提供稀疏监督;其次,SDPO 的教师是模型自身的一个条件变体,其稳定性高度依赖于额外上下文 的质量和覆盖度。

教师稳定性与新鲜度的两难困境

论文深入分析了 SDPO 中教师模型的更新策略。当教师和学生共享参数时,更新节奏成为一个敏感的超参数。论文测试了指数移动平均(EMA)更新率 ,发现没有一个全局最优值:冻结教师()能保持稳定但缺乏新鲜度,快速更新教师()虽然能追踪学生能力的快速变化,但会放大步间噪声,导致训练后期熵和 JS 散度急剧飙升。

为解决这一问题,论文提出了 StableSDPO(restart-and-freeze)策略:周期性刷新教师并冻结一段时间,以保留刷新点的新鲜度同时消除步间抖动。这种设计在实验中被验证为更稳健的折中方案。

漂移的多层诊断框架

论文从三个维度系统诊断密集自蒸馏带来的漂移:

参数空间漂移方面,论文对每个权重矩阵 做紧致 SVD 分解,并定义了归一化谱漂移(NSS)、最大主角度旋转(Max PA)、主掩码重叠度(PM Overlap)等指标,用于量化模型权重在持续训练过程中相对于初始化的偏移程度。

响应空间漂移方面,论文在十个分布外评测基准上追踪模型输出的嵌入余弦相似度变化,并分析格式伪影的频谱特征。

理论分析方面,论文给出了定理 1——教师投影诱发超额 KL 漂移。核心洞察是:在线 rollout 只控制了"在何处施加监督",但每个 token 的投影目标是带特权上下文 的教师分布,而非序列级奖励诱导的 KL-最小策略。当二者不一致时(这在分布偏移场景下几乎必然发生),教师投影会产生超出必要范围的额外 KL 散度,进而导致更严重的遗忘。

实验与结果

论文设计了一套全面的实验协议,覆盖四个训练领域(数学、科学问答、工具使用、代码生成)和十个评测基准,形成了一个典型的持续学习场景。

核心发现一:域内加速 vs 域外遗忘的 trade-off

实验结果揭示了一个清晰的规律:密集自蒸馏在域内任务上确实能加速专业化。以 MATH 为例,SDPO 在当前领域上的收敛速度显著快于 GRPO,这在短训练周期(仅 50 步)下尤为明显。然而,当我们把目光投向分布外场景时,情况发生了戏剧性的逆转。

在持续学习设置下(顺序学习 MATH → SCIENCE → TOOL USE → CODING),论文追踪了两个关键指标:Current(学完当前任务后立即评估)与 Last(全部任务学完后评估)。结果显示,SDPO 在后续任务上的遗忘明显更严重。例如,当模型依次学习 MATH 和 SCIENCE 后,在 MATH 上的性能回退幅度远大于 GRPO。更令人担忧的是,在某些配置下(尤其是高 EMA 率 ),SDPO 会进入完全崩溃状态——训练后期熵和 JS 散度急剧飙升,输出退化为无意义的重复或格式乱码。

GRPO 则展现出截然不同的行为模式:虽然在域内的收敛速度更慢,但其适应更加保守和稳定,在分布外基准上的遗忘幅度显著更低,最终的整体性能(Last 设定下)反而优于 SDPO。

核心发现二:漂移的量化证据

参数空间分析为上述行为差异提供了内部机制层面的解释。在持续训练的四阶段中,SDPO 的归一化谱漂移(NSS)和主角度旋转幅度均显著高于 GRPO。具体而言,SDPO 的参数更新方向更加"激进",在权重空间中走了更远的距离,而且这些更新的方向与保留先前能力所需的约束方向产生了更大的偏离。

响应空间分析进一步印证了这一发现。论文在十个分布外基准上追踪了模型输出嵌入与初始模型输出嵌入的余弦相似度,发现 SDPO 训练后输出的语义漂移幅度明显更大。值得注意的是,SDPO 在长格式输出(如数学推理链)上表现出更严重的高频格式伪影——例如过度使用特定的分隔符、编号格式或换行模式。论文将此归因于自强化循环:教师模型的输出格式会被学生模型模仿,而学生的输出又成为下一轮教师的输入,如果初始阶段存在微小的格式偏差,这种偏差会在每轮迭代中被放大。

核心发现三:CoT 蒸馏的双面性

论文还专门分析了链式推理(Chain-of-Thought)蒸馏的影响。实验表明,在短结构化输出(如工具调用)场景下,CoT 蒸馏能提供有意义的中间推理监督,对性能有益;但在长格式、推理链容易积累噪声的场景(如 MATH、SCIENCE)下,CoT 蒸馏反而会放大格式伪影,导致性能下降。这一发现进一步印证了核心论点:稠密监督并非越多越好,其收益高度依赖于教师信号的可靠性

崩溃缓解实验

论文设计了随机 token 掩盖实验(SDPO M25/M50/M75,即随机掩盖 25%/50%/75% token 的自蒸馏损失),发现即使是部分降低监督密度也能有效缓解崩溃风险,但代价是损失了部分专业化加速效果。这从反面验证了"密集自蒸馏→崩溃"的因果链条。

讨论与可借鉴点

这篇论文的核心贡献在于揭示了一个被广泛忽视的隐性 trade-off:稠密 token 级自蒸馏在持续后训练中并非免费的午餐,其加速专业化与加剧遗忘的效应如同一枚硬币的两面。

从理论层面来看,定理 1 的推导极具洞察力。它清晰地阐明了为什么在线数据本身不足以保证持续学习:在线 rollout 解决了"在何处"施加监督的问题,但监督目标的设定同样关键。当教师投影目标(带特权上下文的条件分布)与真实最优策略(序列级奖励诱导的分布)不一致时,超额 KL 漂移几乎是不可避免的。这种不一致在持续学习的分布偏移场景下是常态而非例外。

从实践层面来看,论文提供了几个重要的设计启示。首先,对于持续后训练任务,序列级强化学习方法(如 GRPO)可能比稠密自蒸馏方法更稳健,尽管收敛速度更慢。其次,如果必须使用自蒸馏,教师稳定性和新鲜度之间的平衡需要仔细调优,StableSDPO 的 restart-and-freeze 策略是一个值得参考的方案。第三,在长格式推理任务中,应谨慎使用 CoT 蒸馏,避免放大格式伪影。

当然,这项工作也存在一些局限。实验仅覆盖 4B–7B 规模的模型,是否能推广到更大规模(如 70B+)尚不确定。评测基准以英文 STEM 领域为主,多语言和人类对齐维度的遗忘情况未被考察。此外,持续训练仅持续 50 步(代码任务仅 20 步),长期收敛性和长期遗忘风险仍需进一步验证。

对于未来研究而言,一个有潜力的方向是探索混合策略:在域内早期使用稠密监督加速专业化,在域外泛化关键期切换到序列级方法以保护先验知识。另一个方向是从理论上进一步刻画教师投影与最优策略之间的 gap,探索能够自适应调节监督密度的机制。这篇论文的价值不仅在于其具体发现,更在于它示范了一种批判性审视"看似直观"方法的研究范式——在持续学习这一充满诱惑与陷阱的领域中,保持谨慎与严谨尤为重要。

摘要

持续后训练使基础模型能够在保留已有能力的同时获取新知识。近期研究表明,在线学习可以缓解遗忘问题,其中在线自蒸馏成为一种颇具吸引力的方法。在本文中,我们通过自蒸馏策略优化(SDPO)重新审视这一乐观观点。我们的实验表明,当教师信号稳定且高度对齐时,SDPO 能够加速域内特化,但在泛化到分布外场景时则表现不佳。在持续后训练中,SDPO 表现出更强的遗忘倾向,甚至可能发生崩溃,而在线强化学习方法(如 GRPO)则能更为保守地适应,并更好地保留先前的能力。进一步分析揭示,更密集的自蒸馏会在参数空间和响应空间中引发更大的漂移,并通过自强化的教师—学生循环放大高频的格式伪影。上述发现表明,仅靠在线数据不足以实现持续学习。当教师目标稳定且词元级监督可靠时,密集自蒸馏可以加速特化过程,但不应被视为持续后训练的默认稳定器。我们的代码已开源,地址为 https://github.com/Moenupa/SDPO-CL。

速览

TLDR:持续后训练需要在学习新知识的同时保留已有能力,而在线自蒸馏(SDPO)被广泛视为缓解遗忘的有效手段。本文重新审视SDPO在持续学习中的表现,系统对比其与GRPO等在线强化学习方法。实验表明,密集自蒸馏在域内可加速专业化,但在分布外场景遗忘更严重甚至崩溃。分析揭示,密集自蒸馏会引发参数和响应空间更大漂移,并通过自强化循环放大高频格式伪影,提示仅有在线数据不足以支撑持续学习。 \

Motivation:重新审视在线自蒸馏在持续后训练中作为通用抗遗忘手段的有效性与适用边界。 \

Method:在持续学习设置下对比SDPO与GRPO等在线策略方法,并从参数空间与响应空间漂移角度进行诊断分析。 \

Result:密集自蒸馏在域内加速专业化,但分布外场景下遗忘更严重甚至崩溃,参数与响应漂移均大于GRPO。 \

Conclusion:在线数据本身不足以支撑持续学习,密集自蒸馏不应被视为默认的稳定器。

Context:该工作承接持续学习与LLM后训练两条研究脉络,对将自蒸馏视为即插即用正则化手段的乐观观点提出挑战,指出在分布偏移与长序列更新下此类方法的适用边界。


Abstract

Continual post-training enables foundation models to acquire new knowledge while preserving existing capabilities. Recent work suggests that on-policy learning can mitigate forgetting, with on-policy self-distillation emerging as a particularly attractive approach. In this work, we revisit this optimistic view through self-distillation policy optimization (SDPO). Our experiments show that SDPO can accelerate in-domain specialization when teacher signals are stable and well aligned, but it struggles to generalize to out-of-distribution scenarios. In continual post-training, SDPO exhibits stronger forgetting and can even collapse, whereas on-policy reinforcement learning methods such as GRPO adapt more conservatively and better preserve prior capabilities. Further analyses reveal that denser self-distillation induces larger drift in both parameter space and response space, and can amplify high-frequency formatting artifacts through a self-reinforcing teacher--student loop. These findings suggest that on-policy data alone is insufficient for continual learning. Dense self-distillation can accelerate specialization when teacher targets are stable and token-level supervision is reliable, but it should not be treated as a default stabilizer for continual post-training. Our code is available at https://github.com/Moenupa/SDPO-CL.


论文详细总结(自动生成)

论文总结:更密集≠更好——持续后训练中在线自蒸馏的局限性

1. 核心问题与整体含义

  • 研究背景:基础模型的持续后训练(Continual Post-Training)要求模型在跨域、跨技能学习新知识的同时保留已有能力,避免灾难性遗忘。已有研究(如 Lai et al., 2025;Shenfeld et al., 2025;Chen et al., 2025)表明 on-policy 在线强化微调(RFT) 比监督微调(SFT)遗忘更少,并把这一优势归因于 on-policy 数据 的使用。
  • 流行假设:基于此假设,近期涌现的 在线自蒸馏方法(如 SDFT、SDPO)被视为持续学习的实用方案——将模型自身在演示/反馈/解法等额外上下文 下的输出作为教师,对每个生成词元提供稠密的 token 级监督,兼具 on-policy 的遗忘缓解与稠密监督的高样本效率。
  • 本文问题:论文系统地反思这一乐观观点,指出被混淆的两个因素——数据来源(on-policy)训练目标(如何把 on-policy rollout 转化为更新信号),并通过 SDPO vs GRPO 的对比实验,揭示"稠密自蒸馏在持续后训练中存在显著代价"。
  • 核心论断:仅靠 on-policy 数据不足以实现持续学习;稠密自蒸馏在教师稳定、token 可靠时可加速专精化,但不应作为持续后训练的默认稳定器

2. 方法论:核心思想、关键技术细节与公式

2.1 预备知识

  • GRPO(Shao et al., 2024):序列级(sequence-level)奖励策略优化。对 prompt 采样 个响应 ,得到奖励 ,计算组内相对优势 ,优化 PPO 风格的裁剪目标:

其中

  • SDPO(Hübotter et al., 2026):稠密 token 级自蒸馏。学生采样 ,教师在同一模型上但带额外上下文 (解法、反馈、推理过程等):。每个 token 处的损失为学生分布与停止梯度教师分布之间的 广义 Jensen–Shannon 散度

其中

2.2 教师稳定性–新鲜度困境(§3.1)

  • EMA 更新率扫描
  • StableSDPO(restart-and-freeze):以 周期性刷新教师并冻结:,保留刷新点的新鲜度同时消除步间抖动。

2.3 CoT 蒸馏:监督密度分析(§3.2)

  • 比较是否对中间推理链 token 也施加 token 级监督。
  • 蒸馏 CoT 改变了优化目标(从答案生成到特定推理轨迹),而非简单增加监督量。

2.4 持续后训练协议(§4.2)

  • 顺序学习:MATH → SCIENCE → TOOL USE → CODING。
  • 报告 Current(学完当前任务后立即评估)与 Last(全部任务学完后评估)两种设定。

2.5 漂移度量(§5.1)

  • 对权重矩阵 做紧致 SVD,定义:
  • 归一化谱漂移
  • 最大主角度旋转
  • 主掩码 IoU
  • 主掩码更新稀疏度

2.6 理论:超额 KL 漂移(§5.3)

  • 匹配成功度的 Razor 策略
  • 定理 1(教师投影诱发超额 KL 漂移):令 为 SDPO 教师投影的序列分布,,则
  • 含义:on-policy rollout 只控制"在何处施加监督",但每个 token 投影目标是带特权上下文 的教师,而非序列级奖励诱导的 KL-最小策略;二者不重合时会产生超额漂移,进而带来额外遗忘(推论 6)。

3. 实验设计

3.1 数据集与领域

  • 训练领域(4 个):MATH(DAPO-Math-17k)、SCIENCE(SciKnowEval)、TOOL USE(ToolAlpaca)、CODING(Dolci-Think-RL-7B)。
  • 评测基准(10 个):AIME(AIME24/25)、Math500、SCIENCE、GPQA、TOOL USE、BFCLv4、CODING、LCBv6、ZLogic(ZebraLogicBench)、MMLU-R(MMLU-Redux 2.0)。
  • 域间距离通过 Qwen3-Embedding-4B 嵌入并以 MMD (RBF kernel) 量化。

3.2 对比方法

  • GRPO(序列级,KL 系数 low/high = 0.20/0.28)。
  • SDPO 多个变体:
  • SDPO 0(EMA ,冻结教师)
  • SDPO 5%(,快速更新教师)
  • SDPO CoT₀(带 CoT 蒸馏)
  • StableSDPO(restart-and-freeze,
  • SDPO M25/M50/M75 5%(随机掩盖 25/50/75% tokens 的崩溃缓解实验)
  • 模型:Qwen3-4B-Thinking-2507Qwen3-4B-Instruct-2507Olmo-3-7B-Instruct-DPOOlmo-3-7B-Think-DPO(用作模型无关性验证)。

3.3 评测指标

  • Acc@8(每 prompt 采样 8 次取平均)。
  • 相对变化 ,分解为 Gain Forgetting
  • 嵌入余弦相似度、参数漂移指标(NSS、Max PA、PM Overlap、PM Update Sparsity)。

3.4 训练超参

  • 学习率:SDPO ,GRPO ;50 步(CODE 仅 20 步);batch size 32/8;rollout 数 8;AdamW + warmup 10 步;vLLM 推理。

4. 资源与算力

  • GPU 型号与数量:论文未明确披露。
  • 训练时长:未明确披露。
  • 可推断的信息
  • 基础模型规模为 4B–7B 参数,使用 vLLM 推理引擎与 SDPO 官方实现(https://github.com/lasgroup/SDPO)。
  • 单次单域训练仅 50 步(CODE 20 步),算力需求总体可控。
  • 缺口:算力数据缺失,无法复现完整资源消耗与对比基线。

5. 实验数量与充分性

  • 实验规模
  • 4 训练域 × 10 评测基准 × 多方法(GRPO、SDPO 0/5%、SDPO CoT₀、StableSDPO、SDPO M25/50/75)≈ 数百组配置
  • 单域训练 4 组 + 持续 4 阶段训练 × 多方法(GRPO、SDPO 0、SDPO CoT₀、SDPO 5%、SDPO M25/50/75 5%)+ 崩溃分析的数据顺序消隐 ≈ 十余条主要曲线
  • EMA 扫描 5 档 × 3 域(表 D.1,15 个配置);CoT 消隐 6 配置(表 D.2);模型无关性 4 个基模型 × 多方法(表 D.3);持续训练表 D.6 共 9 个变体。
  • 参数漂移矩阵 12 个(自注意力 Q/K/V/O + MLP Down/Up/Gate),单域与持续训练各 6 个(图 D.1)。
  • 嵌入漂移 6 基准(图 D.3);崩溃 JS 散度(图 8)。
  • 充分性评估
  • 优点:覆盖多领域、多模型、多变体、含消隐与跨模型迁移,证据面广;从行为指标到内部参数/响应漂移再到理论分析,多层证据交叉验证,较为客观。
  • 不足:仅 4B–7B 模型规模,缺乏更大模型(如 70B)验证;评测基准以英文/STEM 为主,未覆盖多语言与人类对齐维度;单域训练仅 50 步,长期收敛性未知。

6. 主要结论与发现

1. 稠密 token 监督并非"越多越好":CoT 蒸馏在 TOOL USE(短、结构化)上有益,但在 MATH/SCIENCE(长、易含噪声、含格式伪影)上有害。

2. 教师稳定性–新鲜度困境:EMA 无全局最优;快速更新教师()会放大步间噪声,触发熵与 JS 散度后期飙升;StableSDPO 的 restart-and-freeze 策略可同时获得新鲜度与稳定性。

3. SDPO 强专精但弱泛化:在源域上提升显著(AIME 32.71%→56.42%,LCBv6 提升 13.39%),但 OOD 性能呈 非单调的"中间距离干扰"模式——距离源域中等(GPQA 等)的任务最易受损。

4. 持续后训练中 SDPO 全面输给 GRPO:单域 SDPO 在早期阶段表现优于 GRPO,但在 MATH→SCIENCE→TOOL USE→CODING 顺序训练后,AIME 从 56.42% 跌至 34.38%,TOOL USE 从 37.35% 跌至 9.93%;GRPO 在所有评估类目上均超过基线。SDPO 5% 在第 3 阶段完全崩溃(接近零准确率)。

5. 稠密监督带来更大漂移:参数谱漂移、主角度、PM IoU 等指标均显示 SDPO 变体漂移显著大于 GRPO,排序 SDPO CoT₀ > SDPO 5% > SDPO 0 > GRPO;响应嵌入余弦相似度同样反映 SDPO 对响应流形重塑更强。

6. 崩溃源于"伪影放大":SDPO 5% 的完全崩溃表现为 \boxed 标记的无限重复;JS 散度在第 3 阶段骤降甚至归零,揭示学生-教师之间的确认偏差反馈回路——学生产生格式伪影、教师给出 token 级支持、下一次更新强化该伪影。

7. 理论解释:SDPO 在每个 token 上投影到带特权上下文 的教师,而非序列级奖励诱导的 KL-最小 Razor 策略,因此不可避免地产生超额 KL 漂移(定理 1),与持续学习的 KL-遗忘律结合即可预测额外遗忘。

7. 优点与亮点

  • 问题解耦:清晰区分"on-policy 数据"与"训练目标"两个常被混淆的因素,使结论具有方法论上的可推广性。
  • 多层证据链:从行为指标(Acc@8、增益/遗忘)→ 内部表征(参数 SVD 漂移、嵌入相似度)→ 训练动态(熵、JS 散度、响应长度)→ 理论(KL Razor + 定理 1)→ 案例(崩溃伪影),形成完整的因果链条。
  • 方法变体系统化:EMA 扫描、StableSDPO、CoT 开关、token 掩盖缓解策略,覆盖了稠密自蒸馏的关键超参与改进方向。
  • 跨模型验证:在 Qwen3-4B(Instruct/Thinking)与 Olmo-3-7B(Instruct/Think)上重复关键发现,提升结论的鲁棒性。
  • 开源承诺:代码已开源(https://github.com/Moenupa/SDPO-CL),便于复现与后续研究。
  • 建设性结论:不仅批判 SDPO,还提出若干改进方向——token 加权、教师控制、数据平衡——为未来工作留出空间。

8. 不足与局限

  • 算力信息缺失:未报告 GPU 型号/数量/训练时长,难以评估实际成本与复现门槛。
  • 模型规模受限:仅在 4B–7B 模型上实验,未验证更大模型(如 13B/70B)下结论是否依然成立;稠密蒸馏的计算开销随模型规模放大可能成为额外瓶颈。
  • 领域覆盖偏窄:以 STEM/代码/工具调用为主,缺乏通用对话、创意写作、安全对齐等场景;评测集主要为英文,对多语言和文化差异未涉及。
  • 训练步数偏短:单域 50 步、CODE 仅 20 步,可能未充分收敛;长期训练下 SDPO 的稳定性可能进一步恶化或改善,缺乏证据。
  • 崩溃案例分析不够深入:仅以数据重排、token 掩盖做部分缓解,未在算法层面给出根治方案(如教师停止梯度策略、token 重要性加权等)。
  • 理论假设较强:定理 1 依赖"严格散度(如广义 JSD)+ 确定性上下文 "等理想化假设,与实际 RLHF / SDPO 实现细节存在差距;前向 KL 漂移与实际遗忘的关联通过经验假设(KL-遗忘律)桥接,而非严格推导。
  • "on-policy 数据是否充分"的回答偏温和:论文指出"on-policy 数据不足以实现持续学习",但未系统比较不同 on-policy 比例或混合 on-policy/off-policy 数据的对照实验,留有进一步探索空间。
  • 可能的应用风险:在工业大规模持续训练场景中,SDPO 的崩溃风险与较大漂移可能带来难以回滚的代价,论文虽提及
  • 可能的应用风险:在工业大规模持续训练场景中,SDPO 的崩溃风险与较大漂移可能带来难以回滚的代价,论文虽提及建议在持续训练中倾向使用 GRPO 等序列级方法,但未给出明确的"何时使用 SDPO / 何时切换"的可操作决策框架。
  • 教师上下文 的来源单一:实验中教师上下文均来自模型自身生成或同源数据,未涉及人类专家标注、检索增强等异质教师源,限制了"教师质量可控性"的讨论深度。
  • 崩溃缓解仅作事后修补:token 掩盖虽能延缓崩溃,但本质上是在削弱稠密监督的优势,并未触及问题根源——"特权上下文下教师分布与 KL-最小目标分布的系统性偏差"。

9. 启示与未来方向

基于本文结论,可归纳以下研究启示:

1. 目标设计优先于数据来源:在持续后训练中,序列级、与奖励诱导分布对齐的训练目标比稠密 token 级自蒸馏更稳健;未来工作应在保留 on-policy 数据优势的同时,探索 KL-最小性质的稠密监督形式。

2. 教师稳定性是关键工程问题:EMA 不是万能解;周期性的 restart-and-freeze、动态 调度、或基于熵/JS 散度监控的自适应更新策略值得进一步研究。

3. 诊断工具值得推广:参数 SVD 漂移、嵌入相似度、熵/JS 散度监控等组合诊断可作为持续训练的"健康检查",在崩溃发生前预警。

4. 领域适配的监督密度:CoT 蒸馏并非普适收益,未来应根据任务结构(短答案 vs. 长链推理、确定性 vs. 创造性)自适应调整监督密度。

5. 统一理论框架:KL-遗忘律 + 教师投影超额漂移的组合分析为持续学习的算法选择提供了初步理论支撑,值得沿"目标函数→分布偏移→参数漂移→行为遗忘"的因果链做更系统的研究。

10. 总体评价

本文是一篇方法论反思型论文,核心价值不在于提出新算法,而在于通过严格的对照实验与理论分析,剥离出被广泛混淆的两个因素(数据来源 vs. 训练目标),揭示了"稠密自蒸馏 ≠ 更好"的反直觉结论。其证据链完整(行为 → 表征 → 训练动态 → 理论 → 案例),跨模型可复现性良好,对持续后训练领域具有校准预期的重要作用。

对研究者而言,本文提供了若干可立即采纳的实践建议(偏好 GRPO、谨慎使用 SDPO 5%、监控熵/JS 散度、考虑 StableSDPO 类教师控制策略);对领域发展而言,本文开辟了"目标函数与分布漂移"这一有理论深度的研究方向。

主要不足在于算力披露缺失、模型规模受限、领域覆盖偏窄以及崩溃根治方案的缺位,但作为一篇以概念澄清与机制揭示为核心的论文,其结论在当前证据下是稳健且有说服力的。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记