DeepSearch-World:可验证环境中面向深度搜索智能体的自蒸馏方法
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
📝 TLDR
长程网页搜索智能体的自我改进训练面临难题:监督微调依赖固定教师轨迹,稀疏奖励强化学习对长程交互监督不足。本文构建可验证环境DeepSearch-World,含42万条多跳问答任务,并提出自蒸馏框架DeepSearch-Evolve,通过迭代轨迹生成、筛选、混洗与微调实现自我进化。基于此训练的9B模型无需更强模型蒸馏,即在BrowseComp、GAIA、HotpotQA上分别取得31.2%、61.5%、93.4%的成绩。整体开源环境、数据与模型,为自改进深度搜索智能体研究提供基础设施。
🧭 速览
长程网页智能体训练中,SFT受限于固定教师轨迹,稀疏奖励RL对长程交互监督弱,难以自我进化。
构建可验证环境DeepSearch-World及42万条多跳问答任务,提出自蒸馏框架DeepSearch-Evolve,通过迭代轨迹生成、筛选、混洗与微调实现自我进化。
9B模型无需更强模型蒸馏,在BrowseComp达31.2%、GAIA达61.5%、HotpotQA达93.4%。
可验证环境支持长程网页智能体的可扩展自进化,将开源环境、数据集与模型。
📊 论文图表(共 6 张)
展开查看 6 张图
TL;DR
这篇论文构建了一个名为 DeepSearch-World 的确定性可验证环境,内含 42 万条基于 Wikipedia 超链接图构造的多跳问答任务,并提出了自蒸馏训练框架 DeepSearch-Evolve,使智能体能够在该环境中通过迭代轨迹生成、筛选与微调实现自我进化。仅用 9B 参数模型,无需借助更强模型的蒸馏信号,即可在 BrowseComp、GAIA、HotpotQA 等多个基准上达到与开源顶尖智能体相当甚至更优的水平,例如 HotpotQA 提升 48.1 个百分点。
研究背景与动机
训练工具调用智能体(tool-use agents)从自身交互经验中持续改进,一直是构建可扩展智能体系统的核心难题。当前主流的两条路径各有致命缺陷:[[监督微调]] 依赖预先采集的教师蒸馏轨迹,性能上限受限于教师模型的能力与轨迹多样性,模型在少量优化步后便容易饱和;[[稀疏奖励强化学习]](如 GRPO)在长程工具调用任务中,仅在最终给出答案时才有监督信号,无法定位失败究竟发生在查询构建、工具选择、证据抽取还是答案综合阶段。
第三条路——在线自蒸馏(OPSD)——虽然在形式上提供了稠密的 token 级监督信号,但教师分布在工具调用的每个中间步骤上极易受到噪声影响,因为没有可靠的方式来评判一个尚未到达终点的轨迹究竟是对是错。论文的核心洞察是:长程工具调用智能体的自我进化之所以举步维艰,根本原因在于缺乏过程级(process-level)的监督信号。而过程级监督的前提,是一个能够对中间状态进行确定性验证的环境。
方法
论文的解决方案分为两个部分:可验证环境 DeepSearch-World 和自蒸馏框架 DeepSearch-Evolve。
DeepSearch-World:确定性可验证的工具环境
环境的构建基于 Wikipedia 超链接图 。作者对图中的实体节点进行随机游走,每条游走 定义一条 跳的推理链。通过对游走路径中显式的实体提及做模糊化处理(例如将"2014"改为"2010年代"),构造出需要多跳推理才能回答的问题。这种数据构造方式的优势在于:问题和答案都严格来源于 Wikipedia 的结构化知识,不存在开放域问答中常见的歧义性问题。
在工具层面,DeepSearch-World 提供了两个完全确定性的离线工具。web_search_wiki(x) 基于 Lucene BM25 索引(通过 Pyserini 实现),接收查询后返回 top-5 候选文档,每个候选包含确定性标题、摘要和 URL。visit_wiki(u_j) 则基于 SQLite 偏移索引,将 URL 映射到完整文章内容。这两个工具的输入输出 schema 与真实网页搜索和浏览工具保持一致,可以在需要时无缝替换为在线工具。
过程级验证机制是整个环境设计的精髓。每个问题 对应一个目标实体集 。在智能体执行过程中,环境维护一个已完成实体的集合 。每当工具返回的内容命中 中任意尚未被解决的实体时,环境即将其加入 。这种无顺序的实体级验证无需任何 LLM 评判介入,仅通过字符串匹配即可客观判断智能体在每一步的进展,从而为反思、错误恢复等认知行为提供了可信赖的信号来源。
DeepSearch-Evolve:迭代自蒸馏框架
框架的核心是一个多轮迭代的自进化循环。设第 轮的模型为 ,每轮执行以下步骤:模型在可验证环境中生成完整轨迹,对轨迹进行过滤筛选,将通过筛选的轨迹从 scaffold 格式转换为标准 [[ReAct]] 格式,然后用这些轨迹对模型进行 [[监督微调]] 得到 ,作为下一轮的教师模型。
在轨迹过滤阶段,作者采用了两层机制。首先是拒绝采样(RS),仅保留最终答案正确的轨迹,这是保证训练信号可靠性的基础。其次是质量过滤(QF),使用 Qwen3.5-9B 作为评判器,剔除那些虽然答案正确但包含冗余证据、弱目标对齐或不一致推理的低质量轨迹。实验表明,RS 和 QF 的组合优于任何单一过滤策略。
Scaffold-to-ReAct 转换是另一个关键设计。教师智能体采用三阶段的 scaffold 结构:Plan 阶段初始化结构化的进度状态(包含已完成列表、待办列表、经验总结和已验证信息四个字段),Act 阶段在环境反馈的驱动下执行工具调用并更新状态,End 阶段基于已验证的工作记忆生成答案。转换时,每个工具调用步骤中的进度状态和环境反思被改写为 <think> 块中的文本,保留动作的局部推理,将 scaffold 特有的结构化记忆转换为标准化的思维链。这种转换使得学生模型在训练时学会了在没有外部规划提示的情况下自主进行进度跟踪和错误恢复。
在数据混合方面,作者使用重要性采样策略,在跨轮次数据中以指数衰减因子 优先使用近期生成的轨迹,同时保留一定比例的历史数据以减轻灾难性遗忘。训练配置方面使用 Llama Factory 框架,学习率 ,余弦调度,10% warmup,最大序列长度 32,768,每轮训练 1 epoch。
实验与结果
实验覆盖了七个深度搜索与推理基准,包括 BrowseComp、GAIA、HotpotQA、HLE 等。DeepSearch-World-9B 在所有基准上都显著超越了基座模型 Qwen3.5-9B-Instruct:BrowseComp 提升 23.8 个百分点,HotpotQA 提升 48.1 个百分点,GAIA 提升 37.6 个百分点。与 12 个以上的开源智能体相比,DeepSearch-World-9B 在 BrowseComp 上达到 31.2%,在 GAIA 上达到 61.5%,在 HotpotQA 上达到 93.4%,展现出与当前开源顶尖系统相当甚至更优的能力。
消融实验揭示了几个重要发现。数据规模实验中,42 万数据池相比 10 万数据池在验证分数上始终保持优势,证明多样性比重复训练更能驱动性能提升。轨迹转换实验中,去除反思改写机制使 BrowseComp 性能从 31.9 骤降至 16.7,说明将环境反馈转化为自我纠错能力是模型获得长程推理能力的关键。过滤策略实验中,拒绝采样与质量过滤的组合优于任何单一策略,表明答案正确性提供了可靠的训练下限,质量过滤则在此基础上进一步提升了轨迹的推理质量。
行为分析显示,DeepSearch-World-9B 的平均交互轮数达到 18.0 步(基座模型仅 4.7 步),工具调用次数达到 5.4 次(基座模型仅 0.9 次),高级能力评分从基座的 19% 提升至 70%。这些数字直观地说明了可验证环境如何驱动模型从短程问答向真正的深度搜索行为转变。
讨论与可借鉴点
这篇论文最重要的贡献在于证明了可验证环境是长程工具调用智能体实现自我进化的关键基础设施。当环境能够对中间状态进行确定性验证时,原本稀疏的奖励信号被分解为稠密的过程级监督,原本依赖外部教师的蒸馏范式被替换为模型自身的迭代改进。Wikipedia 的结构化知识为此提供了一个理想载体——其超链接图天然编码了多跳推理路径,实体级别的标注使得过程验证无需 LLM 介入。
局限性方面,环境目前仅覆盖 Wikipedia 领域,难以泛化到医学、法律、代码等专门场景。训练数据全为英文也导致中文基准 BrowseComp-ZH 的表现受限。此外,论文采用的是 [[监督微调]] 而非强化学习,这限制了模型在训练过程中探索新策略的灵活性——反思和错误恢复能力是通过轨迹格式从教师侧转移过来的,而非模型自身在交互中发现并固化的。
对于同领域的研究者而言,DeepSearch-World 提供的核心启示是:构建可验证环境的工程投入与科学价值是成正比的。过程级验证机制不仅降低了训练成本,更重要的是解锁了一种此前不可行的训练范式——智能体可以在没有外部教师的情况下,通过与确定性环境的持续交互逐步提升能力。如果能将这种思路迁移到其他知识领域或工具场景,例如代码执行环境、API 调用环境或知识图谱查询环境,或许能催生出更多具备自进化能力的专业智能体。
摘要
训练工具调用智能体从自身经验中持续改进仍然充满挑战,因为监督微调依赖于固定的教师蒸馏轨迹,而稀疏奖励的强化学习则为长程交互提供了较弱的监督信号。我们提出了 DeepSearch-Evolve,一个面向 Web 智能体的自蒸馏框架,构建于 DeepSearch-World 之上;后者是一个确定性的、可验证的环境,配备了可复现的搜索与网页阅读工具。DeepSearch-World 包含 42 万个通过实体级随机游走构建的多跳问答任务,并支持对自进化过程至关重要的若干智能体认知行为,包括进度验证、基于事实的反思以及失败恢复。DeepSearch-Evolve 通过迭代执行轨迹生成、轨迹过滤、数据混合以及模型微调来训练更强的智能体。在不借助更强模型蒸馏的情况下,DeepSearch-World-9B 即可在与开源智能体的对比中取得具有竞争力的性能,在 BrowseComp 上达到 31.2%,在 GAIA 上达到 61.5%,在 HotpotQA 上达到 93.4%,表明可验证环境能够为长程 Web 智能体实现可扩展的自进化。我们将发布该环境、42 万规模的训练语料、验证集、模型与代码,以推动面向自改进深度搜索智能体的未来研究。
Abstract
Training tool-use agents to improve from their own experience remains challenging, as supervised fine-tuning relies on fixed teacher-distilled trajectories, while sparse-reward reinforcement learning provides weak supervision for long-horizon interactions. We present DeepSearch-Evolve, a self-distillation framework for web agents built on DeepSearch-World, a deterministic and verifiable environment with reproducible search and page-reading tools. DeepSearch-World contains 420K multi-hop QA tasks constructed from entity-level random walks and supports key agentic cognitive behaviors useful for self-evolving, including progress verification, grounded reflection, and failure recovery. DeepSearch-Evolve iteratively performs trajectory generation, filtering, data mixing, and fine-tuning to train stronger agents. Without distillation from more capable models, DeepSearch-World-9B achieves competitive performance compared with open-source agents, reaching 31.2% on BrowseComp, 61.5% on GAIA, and 93.4% on HotpotQA, showing that verifiable environments enable scalable self-evolution for long-horizon web agents. We will release the environment, 420K training pool, validation set, model, and code to facilitate future research on self-improving deep search agents.
论文详细总结(自动生成)
DeepSearch-World 论文总结
1. 核心问题与整体含义
研究背景:随着大语言模型(LLM)能力增强,工具调用智能体(tool-use agents)已能进行多步规划、网页搜索、文档阅读与迭代推理。然而,如何让智能体从自身交互经验中持续自我改进(self-evolving),仍是实现可扩展智能体系统的核心难题。
现有方法的三大瓶颈:
- 监督微调(SFT):依赖固定教师蒸馏的轨迹,性能上限受限于教师模型能力与轨迹多样性,容易在少量优化步后饱和。
- 稀疏奖励强化学习(RL,如 GRPO):长程工具调用任务中最终奖励过于稀疏,无法定位失败究竟来自查询构建、工具选择、证据抽取还是答案综合。
- 在线自蒸馏(OPSD):虽然提供稠密 token 级监督,但教师分布在工具调用步骤上极易受噪声影响,需要确定性、可验证的环境支持。
核心论点:长程工具调用智能体的自我进化,需要一个确定性且可验证的交互环境,以暴露过程级(process-level)的工具调用监督信号——这是现有范式所缺乏的。
2. 方法论
论文提出两大部分:DeepSearch-World(可验证环境)和 DeepSearch-Evolve(自蒸馏训练框架)。
2.1 DeepSearch-World:可验证工具环境
数据构造:
- 基于 Wikipedia 超链接图 ,采样实体级随机游走 ,每条游走定义一条 H-hop 推理链。
- 通过对显式实体提及做模糊化(feature fuzzification,例如 "2014" → "2010s"),构造多跳问答任务。
- 共构建 420K QA 实例,配套约 1000 万条 Wikipedia 条目的本地语料。
- 另保留 377 条专家验证的 DeepSearch-Val 验证集。
离线工具:
web_search_wiki(x):基于 Lucene BM25 索引(Pyserini)的确定性检索函数,返回 top-5 候选 ,其中 为标题、 为摘要、 为确定性 URL。visit_wiki(u_j):基于 SQLite 偏移索引的确定性阅读函数,将 URL 映射到完整文章 。- 两个工具的输入输出 schema 与真实网页搜索/浏览工具一致,可无缝替换为在线工具。
过程级验证:每个问题 对应一个目标实体集 。在 rollout 过程中,环境维护已完成集合 。每条工具响应 若命中 中任意未解决实体,则将其加入 。这种无顺序验证机制无需 LLM 评判即可识别客观进展,并触发分级反思(generic revision → 模糊描述 → 规范实体名)实现 grounded "search–fail–reflect–retry" 行为。
2.2 Scaffold 教师智能体
教师智能体采用三阶段 rollout:Plan → Act → End。
- Plan:初始化结构化进度状态 ,含四个可写字段:
completed_list、todo_list、experience、information。 - Act:最多 步,每步状态更新为
其中 为环境注入的反思信号。
- End:基于已验证的工作记忆生成最终答案,减少幻觉。
2.3 DeepSearch-Evolve:迭代自蒸馏框架
核心循环:第 轮模型 在可验证环境中生成轨迹 → 筛选后转换为标准 ReAct 格式 → 监督微训练学生 ,作为下一轮教师。
轨迹过滤:
- 拒绝采样(RS):仅保留答案正确的轨迹。
- 质量过滤(QF):使用 Qwen3.5-9B 评判器剔除冗余证据、弱目标对齐、不一致推理的轨迹。
Scaffold-to-ReAct 转换:对每个工具调用步 ,将进度状态和反思改写为 <think> 块:
其中 由进度状态 改写(总结已完成子目标、待办、失败经验、已验证证据), 将环境反思 改写为自我纠错, 保留动作 的局部推理。动作 和观察 保持不变。
目标函数:给定已验证轨迹 ,SFT 目标等价于硬标签 token 级策略蒸馏:
与之对比,OPSD 目标为:
两者均提供稠密 token 级监督,但 SFT 使用已验证离线前缀与硬目标,OPSD 使用在线策略前缀与软目标。论文选择 Evolving SFT 以保证长程工具调用训练的稳定性。
数据混合:异步生成与训练,使用重要性采样,跨轮次以指数衰减因子 优先使用近期数据,同时保留历史以减轻灾难性遗忘。
3. 实验设计
3.1 数据集 / Benchmark
七个深度搜索与推理基准:
| 基准 | 类型 | 规模 |
|---|---|---|
| BrowseComp | 英文网页浏览 | 1,266 |
| BrowseComp-ZH | 中文网页浏览 | 289 |
| HLE | 学术专家级推理 | 2,158 |
| GAIA-Text | 真实多步查询 | 103 |
| xbench-DeepSearch | 中文深度搜索 | 100 |
| HotpotQA / SearchQA | 多跳 QA 检索 | 多数据集 |
3.2 对比方法
- 专有系统:OpenAI Deep Research、OpenAI-o3。
- 开源智能体:R1-Searcher、Search-R1、ZeroSearch、ASearcher、DeepResearcher、PokeeResearch、WebSailor、OffSeeker-DPO、WebExplorer、Marco-DR、MiroThinker-v1.0、DeepDive。
- 基座对照:Qwen3.5-9B-Instruct(同模型规模基线)。
3.3 训练配置
- 训练轮次: 轮自进化循环。
- 每轮数据:每轮生成 10K 实例轨迹,达到 4K 通过率时触发训练;上限 步。
- 重要性采样:目标大小 ,衰减因子 。
- 微调参数:使用 Llama Factory,学习率 ,cosine 调度,10% warmup,DeepSpeed ZeRO-2,BF16,最大序列长度 32,768,每轮 1 epoch。
- 模板:
qwen3_5_nothink(训练时去除 <think> 标记以聚焦轨迹结构)。 - 真实工具微调:在 1,600 条真实工具实例上使用 GRPO(Google SerpAPI + Jina),以缓解离线到在线执行差距。
4. 资源与算力
- 硬件:单节点 8× H20 GPU。
- 生成吞吐:使用 vLLM(TP=4 或 TP=8),每批次处理约 10K 问题。
- 训练吞吐:单 epoch 4K 轨迹训练与下一批次生成并行。
- 端到端:完整 5 轮自进化循环在 2 节点 H20 集群上约 2–3 天完成。
5. 实验数量与充分性
实验覆盖较全面,可分为以下几组:
1. 主实验(表 1):7 个基准 × 2 类对比(专有 / 开源)= 约 14 组对比数据,展示跨基准泛化能力。
2. 数据规模消融(图 5):比较 420K vs 100K 数据池下的训练曲线,分析格式错误率、工具成功率、实体命中率随轮次的变化。
3. 工具使用行为分析(图 6):对比基座模型与 DSW-9B 在平均轮数、搜索/浏览调用次数、高级能力评分(5 维度 LLM 评判)上的差异。
4. 轨迹转换消融(表 3):4 组配置(Full pipeline / w/o state internalization / w/o reflection rewriting / w/o both),验证 ReAct 转换各组件贡献。
5. 过滤策略消融(表 2):5 组配置(RS only / QF only / w/o both / SDAR / Skill-SD / Full),对比不同自蒸馏范式。
6. 案例研究(附录 D):1 个完整 ReAct 轨迹示例(共 7 步推理),展示 student 模型在验证集上的真实行为。
充分性评价:整体消融较系统,覆盖了过滤、转换、数据规模、行为分析多维度;基线覆盖广泛,包含 12+ 开源智能体与 2 个专有系统。但 BrowseComp-ZH 仅用英文训练导致跨语言性能受限,且未与其他方法在完全相同工具配置下做严格控制变量的对比。
6. 主要结论与发现
1. 可验证环境是自进化的关键:在确定性环境中生成的轨迹可直接验证,规避了 OPSD 的噪声问题。
2. DeepSearch-World-9B 全面超越基座 Qwen3.5-9B:BrowseComp +23.8、BrowseComp-ZH +22.9、HLE +9.0、GAIA +37.6、xbench +29.0、HotpotQA +48.1。
3. 与开源先进智能体可比:在 BrowseComp(31.2%)、GAIA(61.5%)、HotpotQA(93.4%)上与 ASearcher、WebSailor、Marco-DR、MiroThinker-v1.0 等领先开源系统相当,但无需借助更强专有模型蒸馏。
4. 420K 数据池优于 100K:数据多样性比重复训练更能提升验证分数并维持稳定增益。
5. RS + QF 过滤组合优于单一过滤:答案正确性是核心保障,QF 进一步提升质量。
6. 反思改写至关重要:去除反思改写使性能从 31.9 降至 16.7,验证了将环境反馈转化为 self-correction 的关键作用。
7. 长程交互能力提升:DSW-9B 平均交互轮数 18.0(基座仅 4.7),访问工具调用 5.4 次(基座 0.9 次),高级能力评分 70%(基座 19%)。
7. 优点
- 环境设计精巧:离线但与真实工具 schema 一致,可无缝替换;过程级验证无需 LLM 评判,成本低且可解释。
- 端到端开源:环境、420K 训练池、验证集、模型与代码全部开源,具备较强可复现性。
- 过程级监督替代稀疏奖励:通过 scaffold-to-ReAct 转换,将教师侧的规划、记忆、反思能力注入标准 ReAct 策略,避免 student 依赖外部规划提示。
- 消融全面:覆盖数据规模、过滤策略、转换组件、行为分析多维度,分析充分。
- 实用性强:单一 9B 模型即可在多项基准上达到开源领先,无需依赖专有教师蒸馏。
- 异步训练效率高:生成与训练并行,2 节点 2–3 天完成 5 轮循环,工程实现优雅。
8. 不足与局限
- 领域覆盖受限:环境基于 Wikipedia,限制了知识广度与领域多样性,难以泛化到医学、法律、代码等专门领域。
- 跨语言能力受限:BrowseComp-ZH 上性能低于 BrowseComp,主要因训练数据全为英文。
- Evolving SFT 的局限:相比 RL 或 OPSD,探索能力和灵活性较低;如何在 RL 中注入规划、错误恢复等高级能力仍是开放问题。
- 过滤评判依赖 LLM:QF 阶段使用 Qwen3.5-9B 作为评判器,可能引入自身偏差。
- 真实工具泛化未充分验证:仅用 1,600 条真实工具实例做 GRPO 微调,是否能完全弥合 offline-to-online gap 尚需更多评测。
- 基准可比性不完全公平:与 7B–8B 开源智能体对比而非严格 9B 参数匹配,且未控制工具配置完全一致。
- 伦理与偏见:训练语料来自 Wikipedia,可能继承其中的社会偏见,论文仅提及未做深入分析。
- 轨迹多样性度量缺失:虽然强调数据池多样性的重要性,但未给出轨迹多样性的定量度量与消融。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





