arXiv 2607.17558v1 · 发布 2026-07-20

为什么反馈增强的自蒸馏方法无法提升检索交错搜索智能体?

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

AUTHORS Fan Yang, Rui Meng, Yuxin Wen
EVIDENCE 面向搜索智能体的反馈增强自蒸馏方法研究
SCORE 0.9
GENERATED 2026-07-27 21:50:23 UTC

📝 TLDR

在面向智能体搜索任务的训练中,论文研究了无需独立教师模型的反馈增强自蒸馏方法FA-SD。研究发现模型会依赖重复的推理-搜索输出模板,产生与输入问题无关的轨迹,导致KL蒸馏信号失效,作者将此现象称为"解码坍缩"。进一步将不稳定因素分解为模型不一致与提示不一致,并提出用指数移动平均教师来稳定自蒸馏信号。实验表明EMA教师虽需预热期导致性能暂时回落,但最终能提供更稳定的监督、提升模型表现。

🧭 速览

动机

探索自蒸馏在复杂智能体搜索任务中的适用性,揭示现有评估指标难以捕捉的失败模式。

方法

实例化FA-SD自蒸馏算法,将成功演示作为特权信息,并将监督不一致性分解为模型不一致与提示不一致两部分。

结果

发现"解码坍缩"现象使KL信号失效;EMA教师虽需预热导致暂时性能下降,但最终提供更稳定的监督。

结论

提示不一致显著降低自蒸馏信号质量,需引入EMA教师稳定训练,自蒸馏方能有效提升智能体搜索性能。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

这篇论文深入探究了反馈增强自蒸馏方法(FA-SD)在训练搜索智能体时为何难以取得预期效果。研究发现,模型会陷入一种被称为“解码坍缩”的失效模式——依赖固定的推理-搜索模板生成看似多样但与问题无关的轨迹,导致KL散度蒸馏信号完全失效。论文进一步将不稳定的根源分解为模型不一致与提示不一致,并提出用指数移动平均教师来平滑自蒸馏信号。实验表明,尽管EMA教师需要预热期,但最终能提供更稳定的监督并提升模型表现。

研究背景与动机

在大语言模型执行复杂智能体任务时,如何高效训练模型使其能够自主完成搜索、信息推理等操作,是一个广受关注的问题。传统的训练范式通常依赖额外的教师模型进行知识蒸馏,但这种方式需要维护独立的教师网络,增加了计算开销和部署复杂度。

[[自蒸馏]]作为一种替代方案,允许模型从自身生成的高质量输出中学习,无需依赖外部教师。这一思路在分类、生成等任务上展现出不错的效果,但在复杂的多步推理和搜索任务上,其有效性尚未得到充分验证。

论文选择了一个具体的自蒸馏变体——反馈增强自蒸馏(FA-SD)作为研究对象。该方法的核心思想是:在训练过程中,先让模型生成多条轨迹,筛选出成功的轨迹作为正向反馈,然后利用这些成功案例通过KL散度约束来指导模型学习。直观上,这种做法应该能够让模型逐步改进其策略,但实验结果却表明事情远非如此简单。

方法

论文首先完整描述了FA-SD的实现框架。训练流程包含三个关键步骤:模型按照当前策略生成搜索轨迹,然后从这些轨迹中筛选出成功的示范作为反馈信息,最后利用这些成功示范通过KL散度损失来更新模型参数。形式化地,损失函数包含两项:第一项鼓励模型学习成功轨迹中的行为模式,第二项约束当前策略不要偏离原始策略太远。

然而,在实际训练中,研究者观察到一个令人困惑的现象:模型的表现虽然在某些评估指标上有所提升,但深入检查其生成的轨迹后发现,模型逐渐学会了一种取巧的策略——依赖反复出现的“推理-搜索”输出模板。具体来说,模型生成的轨迹表面上看似多样,不同问题会产生不同的搜索路径,但这些轨迹实际上与输入问题的具体内容几乎没有任何关联。模型只是机械地重复一套固定的模板:先输出一个看似推理的短句,再执行一次搜索操作,如此往复。

这种模式导致了一个严重的后果:由于所有输入都指向相似的固定模板,自教师(student模型)和参考策略(teacher模型)产生的分布几乎完全相同。此时,KL散度趋近于零,蒸馏信号失去了提供任何有意义监督的能力。研究者将这一现象命名为“解码坍缩”,并指出这一失效模式极易被常规的评估指标所遗漏——因为模型可能在最终准确率等指标上表现尚可,但其实际决策逻辑已经严重偏离正轨。

为了理解这一现象的深层原因,论文将训练不稳定的根源分解为两个因素:模型不一致性和提示不一致性。前者指自教师在不同时刻的参数波动,后者指输入提示或上下文的变化导致教师分布的差异。研究发现,提示不一致性的影响尤为显著——它会大幅降低监督信号的质量,使得自教师学习难以有效进行。

基于这一分析,论文提出引入[[指数移动平均]](EMA)教师机制。该方法不直接使用当前时刻的模型作为教师,而是维护一个历史权重的指数加权平均作为教师模型。这样做的好处在于,即使某次更新导致了较大的参数波动,EMA教师由于综合了多个时间步的信息,其输出分布会更加稳定,不易产生剧烈变化。

实验与结果

论文在面向智能体搜索任务的场景下进行了实验验证。基线对比包括标准自蒸馏、仅使用成功示范的策略学习方法等。核心实验结果显示,直接应用FA-SD确实会导致模型性能的不稳定波动,且存在明显的解码坍缩现象。

引入EMA教师后,虽然模型在初期需要一段预热期,在此期间性能可能暂时回退,但随着训练的推进,EMA教师逐渐稳定了监督信号,模型最终取得了更好的整体表现。定量分析表明,EMA教师提供的KL散度分布方差显著低于直接使用当前模型作为教师的方案,这验证了EMA在平滑监督信号方面的有效性。

此外,论文还通过消融实验证实,提示不一致性是导致监督信号质量下降的主要原因。当控制这一因素后,训练稳定性得到了明显改善。

讨论与可借鉴点

这篇论文的核心贡献在于揭示了自蒸馏方法在复杂智能体任务上的一个关键失效模式——解码坍缩,并提供了系统性的诊断框架和解决思路。

从局限性的角度看,EMA教师虽然有效,但其预热期的存在意味着训练初期仍可能产生次优的策略探索。如何缩短预热期或设计更平滑的过渡机制,仍有待进一步探索。此外,解码坍缩现象与模型架构、搜索动作空间的离散程度等因素之间的关系,也值得深入探究。

对于更广泛的研究社区而言,这项工作带来的启发在于:[[蒸馏]]信号的有效性不能仅看最终的KL散度数值,更要关注教师分布与输入内容之间的语义关联性。当模型开始依赖与任务无关的表面模式时,即使KL散度依然存在,其监督信号也已经失去了实质性的指导意义。这一教训同样适用于其他自监督或自奖励的学习范式——需要设计更细粒度的诊断指标来及时发现模型学习目标的偏移。

摘要

在策略自蒸馏(OPSD)为不依赖单独教师模型来训练大语言模型提供了一种前景广阔的方法。然而,其在复杂智能体任务上的有效性仍未得到充分探索。在本工作中,我们实例化了反馈增强自蒸馏(FA-SD),这是一种面向智能体搜索的自蒸馏算法,它将成功的示范作为特权信息加以利用。我们发现模型会依赖于反复出现的"推理—搜索"输出模板,所生成的轨迹看似多样,但实际上与输入问题几乎无关,从而使得基于KL的自蒸馏信号失去信息量。我们将这一现象称为解码坍缩(decoding collapse),这一失效模式容易被现有评估指标所遗漏。为理解其根本原因,我们表明尽管自教师取得了更强的性能,但学习过程由于监督信号的不一致性本质上仍不稳定。我们进一步将这种不一致性分解为模型不一致性和提示不一致性,并表明后者会显著降低监督信号的质量,从而限制自教师学习的有效性。为缓解这种不一致性,我们引入了指数移动平均(EMA)教师来稳定自教师并提供更一致的监督信号。尽管EMA教师需要一段预热期,在此期间性能可能暂时回退,但它最终通过提供更稳定的监督提升了模型性能。

Abstract

On-policy self-distillation (OPSD) offers a promising approach for training large language models without relying on a separate teacher model. However, its effectiveness on complex agentic tasks remains largely unexplored. In this work, we instantiate Feedback-Augmented Self-Distillation (FA-SD), a self-distillation algorithm for agentic search that leverages successful demonstrations as privileged information. We identify that models can rely on recurring reasoning-and-search output templates, producing trajectories that appear diverse but are largely agnostic to the input question, making the KL-based self-distillation signal uninformative. We term this phenomenon decoding collapse, a failure mode that can be missed by existing evaluation metrics. To understand its underlying cause, we show that although the self-teacher achieves stronger performance, learning remains inherently unstable due to inconsistent supervision signals. We further decompose this inconsistency into model inconsistency and prompt inconsistency, and show that the latter can significantly degrade the quality of the supervision signal, limiting the effectiveness of self-teacher learning. To mitigate this inconsistency, we introduce an exponential moving average (EMA) teacher to stabilize the self-teacher and provide more consistent supervision signals. Although the EMA teacher requires a warm-up phase during which performance may temporarily regress, it ultimately improves model performance by providing more stable supervision.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记