arXiv 2607.15660v1 · 发布 2026-07-17

ToolVerse:解锁大规模环境与长程任务以赋能智能体强化学习

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

AUTHORS Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng
EVIDENCE 在复杂大规模工具集成环境中进行智能体强化学习
SCORE 0.9
GENERATED 2026-07-21 22:01:46 UTC

📝 TLDR

针对LLM智能体难以在大规模动态真实环境中稳健完成工具集成推理的问题,提出ToolVerse智能体强化学习框架。首先基于近400个真实MCP协议(约4500个工具)自动构建大规模可执行训练环境;其次提出基于工具依赖图的动态解锁采样算法,生成GUST长程任务数据集;最后设计Turn-Aware相对优势算法以缓解长程信用分配难题。实验显示该框架显著增强LLM的长程工具调用能力与动态环境推理鲁棒性。

🧭 速览

动机

现有LLM智能体在紧凑可控场景中推理能力强,但面对大规模、多样、动态的真实工具集成环境时鲁棒性和有效性不足。

方法

基于近400个MCP约4500个工具自动构建可执行训练环境,利用工具依赖图与动态解锁采样算法生成GUST长程任务,提出Turn-Aware相对优势算法优化信用分配。

结果

在多个智能体基准测试中显著提升LLM的长程工具使用能力和动态环境推理表现。

结论

ToolVerse成功扩展智能体强化学习环境规模与任务复杂度,为长程工具调用训练提供了有效方案。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

ToolVerse 提出了一个端到端的智能体强化学习框架,通过从近 400 个真实 MCP 协议自动构建大规模可执行训练环境、基于工具依赖图生成的长程任务数据集 GUST,以及专门针对多轮交互设计的 Turn-Aware 相对优势算法(TARA),显著提升了 LLM 在长程工具调用与动态环境推理中的鲁棒性与任务完成能力。实验在多个基准上实现了稳定且大幅的性能提升。

研究背景与动机

大语言模型在工具集成推理(Tool-Integrated Reasoning,TIR)任务上的能力已成为衡量其能否胜任真实世界任务的关键指标。当前的智能体强化学习研究虽然已在紧凑、可控的实验场景中展现出强大的推理潜力,但距离真实部署仍有显著差距。真实环境往往具有大规模、多样化、动态变化的特点,智能体需要能够在数百个工具中灵活选择、跨多轮持续规划,并在线适应环境反馈。然而,既有训练环境普遍局限于单一工具或小型工具集,缺乏支撑长程推理所需的领域广度和复杂度。

这种环境规模受限直接导致了两大训练瓶颈。其一是长程任务设计的系统性缺失——多轮、跨工具的推理轨迹难以人工标注,自动化生成又面临因果一致性的挑战。其二是[[信用分配]]问题的加剧:在稀疏奖励的长程轨迹中,标准强化学习算法难以区分中间步骤的正确与否,导致策略梯度方差过大、训练不稳定。具体而言,GRPO 等主流算法通常仅在轨迹末端施加单一标量优势信号,这对于跨越十余轮交互的复杂任务而言,几乎等同于在噪声中寻找信号。

ToolVerse 的核心切入点正是从环境、任务与算法三个维度同时发力,构建一个工业级规模的智能体强化学习基础设施,使 LLM 能够真正学会在真实动态环境中执行复杂的长程工具集成推理。

方法

ToolVerse 的方法论围绕三个递进的核心模块展开:可执行环境的自动规模化构建、基于工具依赖图的长程任务合成,以及针对多轮交互优化的奖励信号设计。

环境的自动规模化构建是整个框架的基石。研究者从近 400 个真实世界的 MCP(Model Context Protocol)协议出发,通过四个自动化阶段将其转化为可执行的智能体训练环境。首先对原始 JSON Schema 进行重构,对齐函数签名并消除文本噪声;随后以 Python 字典形式建模各领域的状态变量(如库存系统中的商品数量、电信系统中的用户套餐状态),这构成环境模拟器的核心后端;接着借助 LLM 基于 MCP 工具库生成可执行的函数集合;最后通过严格的单元测试与语法验证过滤,仅保留通过全部检验的可靠工具集,集成至 Verl 框架供训练使用。这一流水线保证了训练环境既具有真实世界的规模,又具备可重复验证的可执行性。

基于工具依赖图的任务合成是实现长程任务自动化的关键创新。研究者为每个场景构建工具依赖图 ,其中节点表示工具,有向边编码输出-输入依赖或语义时序关系。通过[[拓扑排序]]性质的动态解锁采样(Dynamic Unlocking Sampling,DUS)算法,系统从零入度就绪节点开始批量采样,执行后将更新后继节点的入度并将新解锁节点加入队列,如此迭代直至所有任务完成。这种基于图结构的任务采样天然保证了多轮轨迹中工具调用的因果一致性,比随机游走更具可解释性和可控性。最终生成的轨迹经 LangGraph 验证与教师模型 Pass@8 过滤后,形成高质量的 GUST 数据集。

轮次感知相对优势算法(TARA) 直面长程[[信用分配]]的难题。传统 return-to-go 估计在长程任务中面临方差爆炸问题,因为大量中间步骤的奖励贡献无法被准确归因。TARA 的核心设计将优势函数分解为局部优势与门控未来优势两部分。在每轮交互中,系统给出二值即时奖励:

其中字典级覆盖匹配允许同轮内依赖兼容的不同执行顺序。局部优势对该奖励进行轮次级归一化,而门控未来价值 通过一致性门 确保只有当前步骤有效时未来奖励才被计入。最终优势融合为 。论文附录中的理论分析证明,当 时 TARA 的方差严格小于标准估计,且干扰动作的总优势被压制为非正,从机制上抑制了错误信用传播。

实验与结果

研究者在 32 块 NVIDIA A100 GPU 上对 Qwen2.5-14B-Instruct、Qwen3-4B(Thinking)和 Qwen3-8B(Thinking)进行了广泛的[[智能体强化学习]]训练,学习率设为 ,全局 batch size 为 128。评估覆盖 BFCL-v3 Multi-Turn、τ²-Bench 和 ACEBench-Agent 三个主流基准,涵盖多领域(航空、零售、电信)的多轮多步交互场景。

实验结果揭示了三个核心发现。首先,ToolVerse 在所有模型规模和所有基准上均带来稳定的性能提升:Qwen3-8B(Thinking)在 ACEBench-Agent 上从 46.51 提升至 61.66,增幅达 15.15 分;Qwen2.5-14B-Instruct 在同基准上提升 13.88 分。其次,TARA 相对于朴素 GRPO 的优势在信用分配最紧张的多轮多步子任务上最为显著,例如 Qwen3-8B 在 ACEBench-Agent Multi-Step 子任务上从 53.44 提升至 60.00。第三,环境规模对泛化能力有明确正向贡献:从 100 环境扩展至 422 环境后,BFCL-v3 得分从 35.00% 提升至 37.50%,τ²-Bench 从 27.33% 提升至 32.37%,说明更大规模的多样性训练能有效提升智能体在未见场景中的鲁棒性。超参敏感性分析进一步表明,TARA 在 附近表现最佳且对取值变化较为鲁棒。

讨论与可借鉴点

ToolVerse 的贡献在于展示了如何系统性地解决[[智能体强化学习]]从 toy scenario 到真实规模的关键瓶颈。其环境自动构建流水线具有较高的工程可复用性,为后续研究提供了可直接利用的训练基础设施。DUS 算法利用[[拓扑排序]]强制因果一致性的思路,为长程任务合成提供了一种可解释、可控的自动化方案。TARA 算法对[[信用分配]]问题的细粒度处理——尤其是通过一致性门机制隔离干扰动作的影响——为长程[[强化学习]]的奖励设计提供了有价值的范式参考。

与此同时,这项工作也存在值得关注的局限性。工具依赖图依赖预定义的工具关系,限制了真正涌现式的工具组合发现能力;字典后端模拟器与外部依赖复杂的真实服务之间仍存在保真度差距;与 SALT、FTRL 等同期工作的完整对比因代码未公开而缺失;算力成本与训练效率的详细披露也有待补充。对于后续研究而言,如何在 TARA 的细粒度奖励框架下进一步融入语义级验证、如何扩展到开放域无结构化输出的工具调用场景,以及如何实现更轻量化的环境模拟将是值得关注的方向。

摘要

尽管大语言模型智能体在紧凑且定义明确的场景中展现出强大的推理能力,但当面对大规模、多样化且动态的真实世界环境(要求无缝的工具集成)时,它们难以保持鲁棒性和有效性。为弥补这一差距,我们提出了 ToolVerse,一个全面的框架,用于扩展智能体强化学习环境,并使智能体能够在工具集成推理(TIR)任务中执行复杂的长程推理。首先,ToolVerse 从近 400 个真实世界的模型上下文协议(MCP)中自动构建大规模可执行的智能体训练环境,其中包含约 4500 个工具。其次,我们提出了一种基于工具依赖图的任务设计策略,利用动态解锁采样算法生成长程任务,并构建了 GUST(Graph Unlocking Sampling Tasks,图解锁采样任务)数据集。第三,为了缓解长程智能体强化学习中的信用分配问题,我们提出了一种细粒度的轮次感知相对优势算法。我们使用 ToolVerse 进行了广泛的智能体强化学习训练,并在多个智能体基准上评估了我们的框架。实验结果表明,我们的框架显著增强了大语言模型在长程工具使用方面的能力,实现了显著的性能提升,并在动态环境中展现出鲁棒的推理能力。

Abstract

While LLM agents demonstrate strong reasoning abilities in compact and well-defined scenarios, they struggle to maintain robustness and effectiveness when faced with large-scale, diverse, and dynamic real-world environments that demand seamless tool integration. To address this gap, we introduce ToolVerse, a comprehensive framework that scales up agentic RL environments and enables agents to perform complex long-horizon reasoning in Tool-Integrated Reasoning (TIR) tasks. First, ToolVerse automatically builds the massive executable agent training environments from nearly 400 real-world Model Context Protocols (MCPs) that contain about 4500 tools. Second, we propose a task design strategy based on a tool dependency graph, utilizing Dynamic Unlocking Sampling Algorithm to generate long-horizon tasks, and produce GUST (Graph Unlocking Sampling Tasks) dataset. Third, to alleviate the credit assigment problem in long-horizon agentic RL, we propose a fine-grained Turn-Aware Relative Advantage algorithm. We conduct extensive Agentic RL training using ToolVerse and evaluate our framework on serveral agentic benchmarks. Experimental results demonstrate that our framework significantly strengthens LLMs' capabilities in long-horizon tool use, achieving a marked performance boost and showcasing robust reasoning within dynamic environments.


论文详细总结(自动生成)

ToolVerse 论文总结

一、核心问题与研究动机

现有的大语言模型(LLM)智能体在紧凑、可控的场景中已展现出强大的推理能力,但在面对大规模、多样化、动态且需要无缝工具集成的真实环境时,其鲁棒性与有效性显著下降。这一问题制约了智能体强化学习(Agentic RL)在真实世界中的落地。当前研究主要面临三大挑战:

  • 环境规模受限:既有 Agent RL 训练环境通常仅涉及单一工具或小型工具集(如代码解释器、搜索引擎),缺乏真实场景所需的领域广度。
  • 长程任务设计困难:多轮、跨工具的长程推理任务对连贯规划能力要求高,难以系统化生成。
  • 稀疏奖励下的信用分配难题:标准 GRPO 仅在轨迹级施加单一标量优势信号,无法区分长程轨迹中的正确中间步骤与致命错误,导致策略梯度方差大、训练不稳定。

二、方法论

ToolVerse 由三大核心模块构成,分别从环境、任务与训练算法三个维度对智能体强化学习进行扩展。

2.1 可执行智能体环境的自动规模化构建

针对原始工具集 ,通过四个自动化阶段将其转化为可执行的 MCP(Model Context Protocol)环境:

1. Schema 重构:对齐函数签名、消除文本噪声;

2. 领域字典数据库建模:以 Python 字典形式建模状态变量(如库存、用户档案);

3. 可执行代码生成:借助 LLM 基于 MCP 工具库生成函数集合

4. 单元测试与过滤:仅保留通过全部语法与单元测试 的工具集,并集成至 Verl 框架。

2.2 基于工具依赖图(TDG)的长程任务合成

  • TDG 构建:对每个场景构建图 ,节点为工具,边表示输出–输入依赖或语义时序依赖;
  • TDG 清洗:剔除环路与不可执行边,确保为 DAG;
  • 动态解锁采样(DUS)算法:维护零入度就绪队列 ,在每步以批量大小 采样当前阶段任务集 ,执行后更新所有后继节点的入度 ,并将新解锁节点加入 ,最终生成多轮轨迹
  • 逆向上下文重构:按拓扑顺序将工具骨架实例化为可执行的 Golden Trace,并经 LangGraph 验证与教师模型 Pass@8 过滤,得到 GUST 数据集。

2.3 轮次感知相对优势算法(TARA)

TARA 将优势函数分解为局部优势门控未来优势两部分,在轮次级进行归一化:

  • 二值即时奖励

其中 为第 轮的 Golden Tool 集合, 表示字典级覆盖匹配,允许同一轮内依赖兼容顺序。

  • 局部优势(Local Advantage)
  • 门控未来价值(Gated Future Value)

其中一致性门 ,保证只有当前步骤有效时,未来奖励才被计入。

  • 总优势融合

论文附录 A 给出了理论分析:当 时,TARA 的方差严格小于标准 return-to-go 估计(Theorem A.2),且对干扰动作(distractor)保证其总优势严格非正(Theorem A.4)。

三、实验设计

3.1 训练设置

  • 训练模型:Qwen2.5-14B-Instruct、Qwen3-4B(Thinking)、Qwen3-8B(Thinking);
  • RL 算法:GRPO(基线)与 TARA(完整);
  • 用户模拟器:DeepSeek-V3.2;
  • 训练数据:自主构建的 GUST 数据集,每个 MCP 环境作为一个工具集。

3.2 评估基准

  • BFCL-v3 Multi-Turn:含 Base、Miss-Func、Miss-Param、Long-Context 四类;
  • τ²-Bench:含 Airline、Retail、Telecom 三个真实域;
  • ACEBench-Agent:Multi-Step、Multi-Turn 两个子任务。

3.3 对比方法

  • 同框架消融:ToolVerse (w/ GRPO) vs ToolVerse (w/ TARA);
  • 公开可复现基线(Qwen2.5-7B-Instruct):ToolRL、AgentFlow、SimpleTIR;
  • 未直接对比的方法:SALT、FTRL(由于代码/实验工件不可获得,作者明确说明无法公平对比)。

3.4 评价方式

每个实验运行 4 次取平均@4。

四、资源与算力

  • 训练集群:32 块 NVIDIA A100 GPU
  • 关键超参:学习率 ,mini-batch size 32,全局 batch size 128,最大 prompt 长度 8192,最大响应长度 24000,单轮响应上限 1024,,KL 损失关闭;
  • 论文未披露具体的训练时长(小时/天)和总 token 数。

五、实验数量与充分性

论文涵盖了较丰富的实验组合,可粗略归纳为:

  • 主实验:3 个模型规模 × 3 个基准 × 2 种算法变体 = 18 组结果;
  • 公开基线对比:1 组(Qwen2.5-7B-Instruct × ToolRL/AgentFlow/SimpleTIR);
  • TARA 组件消融:4 组(base、+GRPO、turn-local only、turn-local+future w/o gate、full TARA);
  • 超参敏感性:分别对 在 9 个取值上扫描;
  • 环境规模消融:100 / 200 / 300 / 422 环境规模;
  • 训练动态分析:Qwen3-8B 的 Trace Score 与 Validation Score 训练曲线;
  • 环境与数据集统计:422 环境、4438 工具、2987 数据项,平均每数据项 3.8 任务、平均每环境 12.2 工具;
  • 案例研究:1 个长程工具使用定性样例;
  • 理论分析:方差缩减(Theorem A.2)与干扰抑制(Theorem A.4)的形式化证明。

总体实验设计较为系统,涵盖主效果、消融与超参敏感性。然而,与 SALT、FTRL 等方法缺少 head-to-head 对比,且部分组件消融仅展示单一模型(Qwen3-8B)的结果,未在多模型规模上验证,普适性可能受限。

六、主要结论与发现

1. ToolVerse 在多模型、多基准上均带来稳定的性能提升。例如 Qwen3-8B(Thinking)使用 TARA 后,ACEBench-Agent 综合得分从 46.51 提升至 61.66(+15.15);Qwen2.5-14B-Instruct 在同基准上提升 +13.88。

2. TARA 显著优于朴素 GRPO,在信用分配最紧张的多轮、多步子任务上增益最大(如 Qwen3-8B 在 ACEBench-Agent Multi-Step 从 53.44 提升到 60.00)。

3. 环境规模对泛化有正向贡献:从 100 环境扩展至全量 422 环境,BFCL-v3 从 35.00% 提升至 37.50%,τ²-Bench 从 27.33% 提升至 32.37%。

4. 超参稳健:TARA 在 附近表现最佳,对取值变化较为鲁棒。

5. 理论保证:方差严格小于标准 return-to-go;干扰动作的总优势被压制为非正,从机制上抑制错误信用分配。

七、优点

  • 端到端流水线完整:覆盖从原始 JSON Schema 到可执行 MCP 环境、再到 GUST 数据集与多轮 RL 训练,工业化程度高;
  • 任务结构化合成:DUS 算法利用拓扑排序天然强制依赖顺序,比随机游走更易产生因果一致的长程任务;
  • 奖励设计贴合任务特性:以 Golden Trace 为对齐目标构造的二值轮次奖励,配合门控机制可有效区分"看似成功但步骤错乱"的情形;
  • 可解释的信用分配:TARA 在轮次级提供稠密监督信号,理论分析为方法提供了方差缩减与干扰抑制的双重保障;
  • 跨模型、跨基准的一致性验证:对 Thinking 与 Non-thinking 模型、不同领域基准均展示出正向增益。

八、不足与局限

  • 依赖预定义依赖关系:TDG 由 LLM 推断工具间的参数与语义依赖,限制了"自发现新颖工具组合"的可能性,难以产生真正涌现的交互行为;
  • 奖励仍依赖规则化验证:TARA 在高度稀疏或模糊奖励场景(如语义开放任务)下,可能无法提供足够的轮次级监督信号;
  • 公开基线对比不完整:与 SALT、FTRL 等近期工作的 head-to-head 实验因代码或工件未公开而缺失,结论的横向比较具有局限性;
  • 超参与规模消融覆盖有限:组件消融与超参敏感性主要在 Qwen3-8B 上进行,未在多尺度模型上交叉验证,可能存在模型特异性的过拟合风险;
  • 环境真实性有限:约 20% 的初始工具集因依赖外部服务、复杂实时状态或领域副作用而无法用字典后端忠实模拟,模拟器与真实环境之间仍存在保真度差距;
  • 算力与训练成本披露不充分:仅提及 32 × A100,未给出 wall-clock 训练时长、wall-clock 与样本效率对比,限制了复现成本评估;
  • GUST 数据集未对外开放的具体统计细节(如每个环境的任务数量分布、训练集 / 验证集划分)尚需在附录中进一步确认其代表性。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记