arXiv 2606.29863v1 · 发布 2026-06-29

KbSD:面向智能体搜索中行为校准的知识边界感知自蒸馏

KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

AUTHORS Tao Feng, Xinke Jiang, Chao Wu
EVIDENCE 面向智能体搜索的知识边界自蒸馏框架
SCORE 0.9
GENERATED 2026-07-04 21:36:18 UTC

📝 TLDR

智能体搜索让大语言模型具备动态检索能力,但强化学习在知识边界校准上受限于奖励稀疏。现有二元奖励难以指导模型在不同知识状态下区分参数记忆、外部检索与弃答的推理过程。KbSD提出知识边界自蒸馏框架,结合提示增强教师与象限自适应蒸馏目标,在不依赖更大外部模型的前提下提供密集监督。实验表明该方法在任务准确率与幻觉抑制上均优于强基线,且在稀疏奖励最弱的象限提升最显著。

🧭 速览

动机

智能体搜索中,稀疏二元奖励难以引导模型区分参数记忆、外部检索与弃答之间的推理行为。

方法

构建与学生同构的提示增强教师注入知识边界信号,并按象限采用反向、正向或双向KL蒸馏目标。

结果

在多基准上同时提升任务准确率与幻觉抑制效果,稀疏奖励信息最少的象限增益最大。

结论

无需更大外部模型即可获得密集token级监督,为知识边界校准提供有效自蒸馏范式。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

KbSD 解决的是大模型在智能体搜索场景下的「知识边界校准」难题:让模型学会在参数记忆、外部检索和弃答之间做出正确选择。核心思路是通过一个与学生模型架构相同的提示增强教师,以信息不对称的方式实现自蒸馏,同时针对四种知识象限的推理分布差异自适应选择 KL 散度优化方向。实验在 9 个基准、2 个模型规模上均取得最优表现,尤其在稀疏奖励最不提供信息的困难象限提升最为显著。

研究背景与动机

智能体搜索让大语言模型具备了动态调用检索工具、多轮整合外部知识的能力,这在知识密集型问答、多跳推理等任务上带来了显著提升。然而,一个根本性的挑战始终悬而未决:模型需要判断何时信任自己参数化记忆中的知识、何时依赖检索到的外部证据、何时应该坦然承认不知道而拒绝回答。这三个「何时」的边界,就是论文所指的知识边界校准

现有方法已经意识到这个问题可以通过四象限框架来建模:将查询依据内部确信度与外部检索质量划分为 Integrated(高确信、高检索质量)、External(低确信、高检索)、Internal(高确信、低检索)和 Refusal(低确信、低检索)四种模式。问题在于,主流的强化学习训练方法依赖二元奖励——只告诉模型最终答案对不对,却无法指导模型在推理过程中做出正确的象限决策。这种过程级监督的缺失造成了奖励稀疏:模型在困难象限几乎收不到有效信号,优化方向变得模糊。

更棘手的是,四个象限对应的推理分布具有本质差异。Integrated 象限要求模型在少数正确答案附近集中推理,像「收敛」;Refusal 象限要求模型在多种合理的拒绝方式中灵活选择,像「发散」;而 External 和 Internal 象限则需要同时兼顾精确性与覆盖度,是不对称的分布。传统的做法用单一的 KL 散度目标统一优化这些分布,无异于用同一把尺子去量形状截然不同的几何体——必然导致某些象限的校准效果被牺牲。

方法

KbSD 的核心设计围绕两个问题展开:如何从稀疏的结果奖励过渡到密集的 token 级过程监督?如何为不同象限的异构分布匹配合适的优化目标?

第一个问题的答案是信息不对称的自蒸馏。传统知识蒸馏需要训练一个比学生模型更大的教师模型来提供监督信号,成本高昂。KbSD 的关键洞察是:教师模型之所以能提供比学生更好的校准推理,不需要更大的模型容量,而只需要更多信息。具体而言,KbSD 构建了一个与学生模型架构完全相同、参数完全初始化的教师,它在输入端额外接收一个结构化的知识边界提示,包含参数化确信度 、语义稳定性 、检索质量分数 以及对应的象限标签 。这个提示拼接在原始查询前形成教师的输入 ,教师输出推理轨迹后停止梯度,只将知识传递给学生。

形式化地,设学生的参数化策略为 ,则教师的预测分布为:

这种「同构设计」使得 KbSD 无需依赖额外的庞大模型,却能通过边界信息的注入让教师产生高度校准的推理示范。学生模型在训练时同时从自采样轨迹和教师示范中学习,在测试时则依赖内化后的能力——无需提示。

第二个问题的答案是象限自适应的蒸馏目标。论文将 KL 散度的两种方向与象限分布的几何特性对应起来:反向 KL(reverse KL) 趋向于找到教师分布的主峰,适合 Integrated 象限集中化的推理分布;正向 KL(forward KL) 追求对教师分布的全面覆盖,适合 Refusal 象限多样化的拒绝策略;对于 External 和 Internal 这种同时需要精确性和覆盖度的不对称象限,论文通过求解帕累托最优问题,得到一个自适应的双向 KL 组合:

其中 分别是正向和反向 KL 的梯度。最终的象限蒸馏损失为:

整个训练框架以 GRPO 为基础,联合优化稀疏的结果奖励与密集的蒸馏损失。奖励函数包含最终答案奖励、过程奖励、象限对齐奖励以及过度弃答惩罚,通过多维度的信号引导模型同时提升任务准确率和校准能力。

实验与结果

实验覆盖了 9 个基准数据集,包括多跳 QA(HotpotQA、2WikiMultiHopQA、MuSiQue、Bamboogle)、开放域问答(NQ、TriviaQA、PopQA)以及智能体推理任务(FRAMES、GAIA),基座模型分别为 Qwen2.5-3B 和 Qwen2.5-7B。

核心结论可以从两个维度来看。在任务效用上,KbSD 在所有基准上均显著超越基线方法,将 3B 模型的不可靠率从 64.32 降至 47.60,7B 模型从 57.99 降至 41.18,绝对降幅达到约 17 个百分点。这一提升在统计上的一致性说明方法并非对特定数据集的过拟合。

更有意思的是象限分解的结果。在稀疏奖励本应最有效的高确信象限(Integrated 和 Internal),各方法表现相近;但在稀疏奖励信息量最少的低确信象限(External 和 Refusal),KbSD 的优势最为突出。这恰好验证了论文的核心假设:二元奖励的盲区恰恰是密集蒸馏的价值所在。消融实验进一步表明,去除蒸馏损失或固定使用单一 KL 方向都会导致性能退化,证明象限自适应设计的必要性。

域外泛化实验也值得注意:模型仅在 HotpotQA 和 2WikiMultiHopQA 上训练,迁移到 FRAMES 和 GAIA 等未见任务时仍保持优势。这说明知识边界校准是一种领域无关的元能力,而非对特定数据分布的记忆。

讨论与可借鉴点

KbSD 最值得借鉴的设计理念在于「信息不对称替代规模不对称」。过去知识蒸馏普遍依赖更大的教师模型,而 KbSD 证明,对于校准这类任务,模型容量并非瓶颈,过程级监督的密度才是。这启发我们在设计训练信号时,不妨多思考「给模型什么信息」而非「用多大的模型」。

帕累托自适应 KL 的闭式解推导也颇具美感——通过最小化梯度范数平方自动确定 forward/reverse KL 的权重,避免了手工调参的繁琐。这种将理论洞察转化为可计算闭式解的做法,在工程实践中往往比启发式超参数搜索更鲁棒。

局限方面,论文仅在 3B 和 7B 模型上验证,更大规模(13B、72B)的 scaling 假设缺乏数据支撑。数据集偏向英文多跳 QA,对中文、多模态或专业领域(医疗、法律)的泛化能力尚待考察。此外,训练过程中的超参数(如象限阈值 、蒸馏权重 )虽然给出了具体数值,但缺乏敏感性分析,读者难以判断这些参数在不同场景下的稳健性。

从更宏观的角度看,KbSD 聚焦于单轮或两轮检索的问答场景,而实际的智能体系统往往需要更长的多轮交互、工具调用链和自我纠错。如何将象限校准的思想拓展到更复杂的智能体轨迹上,是未来值得关注的方向。

摘要

智能体搜索为大语言模型赋予了动态检索能力,但现有的强化学习方法在知识边界校准方面仍受限于奖励稀疏性——即难以判断何时信赖参数化记忆、何时依赖检索证据、何时应予弃答。二元奖励虽能惩罚不良结果,却对跨不同知识状态进行校准决策所需的推理过程缺乏有效指导。为解决这一问题,我们提出了 KbSD(Knowledge boundary Self-Distillation,知识边界自蒸馏),一个通过密集的 token 级监督、结果级稀疏奖励以及象限自适应优化来应对上述局限的框架。KbSD 构建了一个增强提示的教师模型,其架构与学生模型完全相同,接收显式的知识边界信号——包括参数化确信度、检索质量和真实答案——以生成校准的推理示范。这种信息非对称的自蒸馏使得密集监督成为可能,无需依赖更大的外部模型。为进一步考虑跨知识状态的异构推理分布,我们引入了象限自适应蒸馏目标:对集中整合使用反向 KL,对多样弃答使用前向 KL,对同时需要精确性与覆盖度的不对称象限使用帕累托最优的双向 KL。在多个基准实验上的结果表明,KbSD 在任务准确性和幻觉缓解两方面均持续优于强基线模型,最大提升出现在稀疏奖励信息量最少的具有挑战性的象限中。

速览

TLDR:智能体搜索让大模型具备动态检索能力,但强化学习在知识边界校准上受限于奖励稀疏,难以判断何时依赖参数记忆、何时借助检索证据、何时放弃回答。为此提出KbSD框架,通过结构同构的提示增强教师模型进行自蒸馏,结合象限自适应优化目标,在多个基准上同时提升任务准确率并缓解幻觉,尤其在稀疏奖励信息最弱的困难象限获益最大。 \

Motivation:现有强化学习方法在智能体搜索的知识边界校准上存在奖励稀疏问题,二元奖励难以引导模型在不同知识状态下做出校准推理。 \

Method:KbSD通过结构同构的提示增强教师模型自蒸馏,融合参数确信度、检索质量与答案信号,并按象限采用反向、正向及双向KL目标自适应优化。 \

Result:在多个基准上一致提升任务准确率与幻觉缓解效果,困难象限增益最显著。 \

Conclusion:为智能体搜索知识边界校准提供密集自蒸馏方案,验证象限自适应蒸馏的有效性。


Abstract

Agentic search equips large language models with dynamic retrieval abilities, but existing reinforcement learning methods remain limited by reward sparsity in knowledge boundary calibration -- deciding when to trust parametric memory, when to rely on retrieved evidence, and when to abstain. Binary rewards can penalize undesirable outcomes, but provide little guidance on the reasoning process required to make calibrated decisions across different knowledge states. To address this, we propose KbSD (Knowledge boundary Self-Distillation), a framework that tackles this limitation through dense token-level supervision, outcome-level sparse rewards, and quadrant-adaptive optimization. KbSD constructs a hint-augmented teacher, architecturally identical to the student, that receives explicit knowledge boundary signals -- including parametric certainty, retrieval quality, and ground-truth answers -- to generate calibrated reasoning demonstrations. This information-asymmetric self-distillation enables dense supervision without requiring a larger external model. To further account for the heterogeneous reasoning distributions across knowledge states, we introduce a quadrant-adaptive distillation objective: reverse KL for concentrated integration, forward KL for diverse refusal, and Pareto-optimal bidirectional KL for asymmetric quadrants requiring both precision and coverage. Experiments on multiple benchmarks show that KbSD consistently improves both task accuracy and hallucination mitigation over strong baselines, with the largest gains appearing in the challenging quadrants where sparse rewards are least informative.


论文详细总结(自动生成)

KbSD:面向智能体搜索中行为校准的知识边界感知自蒸馏

一、核心问题与研究动机

智能体搜索(Agentic Search)让 LLM 在多轮交互中自主调度检索、整合证据、迭代推理,已成为知识密集型任务的关键范式。其中一个核心挑战是知识边界校准(Knowledge Boundary Calibration):模型需要判断何时信任参数化记忆、何时依赖外部检索证据、何时应当弃答。

现有工作(如 Search-R1、TC-RAG、KbPO 等)通过四象限分类(依据内部确信度与外部检索质量将查询分为 Integrated / External / Internal / Refusal 四种行为模式)来引导模型行为。然而,这些方法普遍面临过程级奖励稀疏(Reward Sparsity)的根本瓶颈:

  • 二元奖励只能标注"什么行为是错误的"(如幻觉或冗余检索),却无法揭示"应当采用哪种象限策略"以及"如何一步步推理到达该决策";
  • 四个象限对应的推理分布具有本质差异——Integrated 象限推理模式集中、Refusal 象限推理路径多样、External/Internal 象限则需兼顾精确性与覆盖度——一刀切的优化目标难以适配。

论文指出两大核心挑战:(1) 如何从稀疏奖励过渡到密集的 token 级过程监督;(2) 如何为不同象限设计适配其分布几何的优化目标。


二、方法论

2.1 整体框架

KbSD 包含三阶段流程:

1. 边界导向的数据合成:基于 HotpotQA、2WikiMultiHopQA 等种子 QA,通过 Fact Injection 与 Information Fuzzing 两个算子生成多跳难题;

2. 知识边界量化与象限映射:基于参数化确信度、语义稳定性、检索质量进行二元化,将查询分配至四象限;

3. 提示增强的自蒸馏 + 象限自适应 RL 联合优化:GRPO 提供稀疏结果级奖励,自蒸馏提供密集过程级监督。

2.2 知识边界量化

对每个查询

  • 参数化确信度(无检索下采样 次回答与真实答案的匹配率):
  • 语义稳定性(回答对的平均余弦相似度):
  • 检索质量分数

二元化得到 ,进而映射至四种象限

2.3 提示增强的自蒸馏

为每个查询构造结构化提示 ,将其拼接到查询前形成教师输入 。教师与学生同架构同初始化,但教师接收边界提示、停止梯度:

这种"信息不对称"使教师能产生按象限校准的完整推理轨迹,学生则在测试时无提示条件下学会内化这些行为模式。

2.4 象限自适应的蒸馏目标

正向蒸馏(mass-covering):在教师轨迹上做最大似然

反向蒸馏(mode-seeking):在学生自采样轨迹上匹配教师

帕累托双向蒸馏:对 External / Internal 象限,通过求解

得到闭式解 ,构成

象限分配规则:

2.5 联合 RL + 蒸馏训练目标

基于 GRPO,联合目标为

其中 为组内归一化优势, 分别控制 KL 正则与蒸馏强度。复合奖励 包含最终答案奖励、过程奖励、象限对齐奖励和过度弃答惩罚。


三、实验设计

3.1 数据集

  • 训练集:基于 HotpotQA 与 2WikiMultiHopQA 合成的多跳难题;
  • 评测集(共 9 个):
  • 多跳 QA:HotpotQA、2WikiMultiHopQA、MuSiQue、Bamboogle;
  • 开放域 QA:NQ、TriviaQA、PopQA;
  • 智能体推理:FRAMES、GAIA。

3.2 模型与检索

  • 基座:Qwen2.5-3B 与 Qwen2.5-7B;
  • 检索器:E5 密集检索,基于 2018 Wikipedia 语料,每查询取 top-3;
  • 训练框架:VERL + GRPO。

3.3 训练超参

(每查询采样 5 条轨迹),batch size=128,每批 8 条 rollout,共训 300 步;学习率 ,单查询最多 2 轮搜索迭代。

3.4 基线方法

  • 标准 RAG:Naive RAG、FS-RAG、FLARE;
  • 智能体 RAG:ReAct、IRCoT、Self-RAG、CRAG、TC-RAG;
  • RL 智能体:Search-R1、ARPO、AEPO、MEM1、KbPO。

3.5 评测指标

  • 任务效用:F1 分数;
  • 不可靠率(Unreliability Rate),越低越好。

四、资源与算力

论文未明确披露所使用的 GPU 型号、数量、训练时长或碳排放等算力信息。基于 Qwen2.5-3B/7B 基座、300 步训练、batch=128、每查询 5 条 rollout 的设置推断,整体训练规模属于中等,但具体硬件配置缺失,读者无法直接复现其计算开销。


五、实验数量与充分性

论文开展的实验较为充分:

1. 主实验:2 个模型规模 × 9 个基准 = 18 组主结果对比;

2. 消融实验(Qwen2.5-3B):4 个变体(KbSD 完整版、、Fixed-FKL、Fixed-RKL)× 5 个数据集 = 20 组消融结果;

3. 分析实验:模型规模效应分析(3B vs 7B 性能对比)、自适应弃答行为分析、难度与校准相关性分析;

4. 案例研究:2 个具体案例(Q4 Internal 象限的过度检索、Q3 Refusal 象限的正确弃答)。

实验设计覆盖了不同象限、不同模型、不同基线类别,并在域外基准(FRAMES、GAIA)上验证泛化能力。但仍存在以下不足:未在更大模型(13B/72B)、闭源模型或多模态场景上验证;消融仅在 3B 上进行,未给出 7B 上的消融一致性验证;缺乏对超参数(如 )的敏感性分析。


六、主要结论与发现

1. 整体性能领先:KbSD 在 9 个基准、2 个模型规模上均取得最低不可靠率,3B 模型上从 64.32(KbPO)降至 47.60,7B 模型上从 57.99 降至 41.18,绝对降幅约 17 个百分点。

2. 增益随模型规模放大:更大模型能更好地内化密集过程级监督,提示该瓶颈不在模型容量而在过程级监督密度。

3. 困难象限提升最显著:在稀疏奖励最不具信息量的 Q3(Refusal)和 Q4(Internal)象限,校准增益最大,证明密集蒸馏确实补足了稀疏奖励的盲区。

4. 域外泛化良好:仅在 HotpotQA/2WikiMQA 上训练,迁移到 FRAMES、GAIA 等未见基准仍保持优势,说明知识边界感知是领域无关能力。

5. 自适应弃答行为:在简单任务(2WikiMQA、PopQA)保持低弃答率,在困难任务(MuSiQue、FRAMES、GAIA)弃答率显著上升,体现"知之为知之,不知为不知"的校准。

6. 消融结论:移除蒸馏损失或使用固定 KL 方向均导致性能退化,证明象限自适应设计的必要性。


七、优点

1. 精巧的信息不对称设计:教师与学生同架构,仅通过提示注入边界信号,无需训练独立的大型教师模型,节省了计算成本同时提供了密集过程级监督。

2. 象限自适应的优化理论:将不同象限的分布几何(集中 vs 多样 vs 不对称)与 KL 方向选择严格对应(reverse KL mode-seeking / forward KL mass-covering / Pareto 双向),具备清晰的理论依据。

3. 帕累托闭式解:通过最小化梯度范数平方自动平衡 forward/reverse KL,无需手工调参,优雅且可解释。

4. 与 GRPO 互补:稀疏结果奖励 + 密集过程蒸馏的组合既保证最终答案优化,又提供过程级引导。

5. 大量实验与多维度评测:覆盖 9 个基准、2 个模型规模、3 类基线,引入不可靠率这一安全指标,并辅以案例分析。

6. 公开代码:附带代码仓库,便于复现。


八、不足与局限

1. 算力信息缺失:未披露 GPU 型号/数量、训练时长等,无法评估实际计算成本与可复现性。

2. 模型规模有限:仅在 Qwen2.5-3B/7B 上验证,未扩展到 13B、72B 等更大规模,对"规模放大假设"的论证不够充分。

3. 数据集覆盖偏向英文与多跳 QA:缺少中文、代码、多模态或医疗等领域的评测,泛化性论断适用范围有限。

4. 案例研究暴露的残余问题:Q4 Internal 象限中模型仍存在过度检索倾向(10 轮搜索后才收敛),说明双向 KL 并未完全解决"参数化记忆充足时的检索预算"问题,作者已坦承这是未来工作。

5. 提示泄露风险:教师所用提示依赖 等需在训练时通过多次采样与外部检索才能计算的信号,在线部署时若没有这些信号,学生需独立推断象限,该推断能力是否真正被学到,缺乏显式的代理评估。

6. 二元化阈值敏感性 的选择缺乏敏感性分析,不同阈值可能导致象限分布与最优 KL 方向错配。

7. 搜索迭代次数硬编码为 2:可能与 KbSD 案例中观察到的"过度检索"现象存在张力,未讨论动态搜索预算机制。

8. 公平性争议:部分 RL 基线(如 AEPO、ARPO)在 7B 上出现不稳定(不可靠率飙升),作者归因为 reward hacking,但未提供训练曲线或方差统计,结论的稳健性有待进一步验证。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记