arXiv 2607.10836v1 · 发布 2026-07-14

路由、通信与推理:用于高效多智能体推理的门控路由与自适应深度

Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

AUTHORS Sudipto Ghosh, Tanmoy Chakraborty
EVIDENCE 提出多智能体层级系统的门控路由与自适应深度机制,并基于 GRPO 改进的强化学习方法进行训练。
SCORE 0.9
CATEGORIES TASK agentreasoning METHOD moe TYPE method-paper
GENERATED 2026-07-20 10:35:00 UTC

📝 TLDR

论文针对多智能体推理中智能体选择、层级深度和通信开销不确定的问题,提出 GRADE 层级多智能体系统,通过四个可学习门联合控制路由、深度、通信和剪枝。采用无评论家的 CoGRPO 训练方法,将 GRPO 适配到多智能体层级并共享优势信号。配合可热插拔的专家注册表和逐智能体校准映射。在约 170 亿活跃参数下,在 GSM8K、MMLUPro 和 GPQA 上超越所有基线,并在 AIME-2025 上保持竞争力。

🧭 速览

动机

多智能体集成显著增加参数与推理成本,却缺乏对智能体选择、层级深度与通信开销的智能决策机制。

方法

提出 GRADE 层级多智能体系统,通过四个可学习门控制路由、深度、通信与剪枝,并采用无评论家的 CoGRPO 强化学习方法协同训练各门与智能体。

结果

在约 170 亿活跃参数下,GRADE 在 GSM8K、MMLUPro 和 GPQA 上优于所有基线,MMLUPro 上以一半计算量超越最强基线 4.8 分。

结论

门控路由、自适应深度与热插拔专家机制的结合,能在显著降低计算成本的同时提升多智能体推理性能。

📊 论文图表(共 1 张)

展开查看 1 张图

TL;DR

这篇论文提出了 GRADE 层级多智能体推理系统,通过四个轻量级可学习门动态控制智能体选择、推理深度、通信开销和分支剪枝。配合无评论家的 CoGRPO 训练方法在约 170 亿活跃参数规模下,在 GSM8K、MMLUPro 和 GPQA 上超越所有基线方法,尤其在 MMLUPro 上以一半的计算量取得 4.8 分的领先优势。

研究背景与动机

大语言模型在复杂推理任务中常常需要消耗大量计算资源,而单次调用的模式难以充分利用模型的专业化能力。多智能体集成作为一种有潜力的方案,让不同专业能力的智能体协同处理查询,却引入了一个深层矛盾:活跃参数数量和推理成本随智能体规模快速增长,而系统并未真正回答三个根本问题——应该咨询哪些智能体、查询需要在层级结构中深入到何种程度、以及智能体间的通信何时才值得付出其开销。

在 GRADE 之前,已有研究尝试用固定的路由策略或完全可学习的路由机制来选择智能体,但这些方案往往忽略了一个关键事实:不同查询的复杂度差异巨大,简单问题可能只需一两个智能体协作即可解决,而复杂问题则需要更深的层级和更充分的通信。固定的深度策略要么造成资源浪费,要么导致推理不足。此外,智能体间的无限制通信会带来平方级的注意力复杂度增长,如何在经济性和有效性之间取得平衡始终是一个悬而未决的难题。

这篇论文的切入点正是将这三个问题统一到一个联合学习的框架中:既然路由、深度、通信和剪枝本质上都是在决定「多少计算量是必要的」,那么用一个端到端可训练的系统来同时学习这些决策,比分别设计独立模块更加自然。

方法

GRADE 的核心设计围绕四个可学习门的协同工作展开。第一个门负责智能体选择,根据当前查询的表示决定激活哪些专家智能体参与推理;第二个门控制层级深度,学习在什么时机停止向下传递查询——这对应着「这个问题当前的智能体层级已经能够充分回答」这一判断;第三个门管理通信策略,决定在哪些层之间建立信息通道,使得需要跨领域知识的查询能够获得有效聚合;第四个门执行分支剪枝,在树状推理过程中丢弃那些看起来不太有希望的后继分支以节省计算。

这四个门的输出并非相互独立,它们被设计为联合优化——选择更多智能体可能意味着更深的层级更有价值,而通信策略的改变又会影响有效深度。这种耦合关系通过共享的特征表示来建模,使得每个门的决策都能考虑到其他门的状态。

训练方法 CoGRPO 是将 [[GRPO]](分组相对策略优化)适配到多智能体层级的关键创新。传统 [[强化学习]] 在多智能体场景下面临的优势估计难题——如何为参与一次完整推理的所有组件分配信用——在这里被巧妙地简化为共享优势信号的设计。具体而言,一次完整的推理被视为一个整体单元,根据最终答案的正确性计算一个优势值,然后这个优势值被无差别地传播给参与该次推理的每个门和每个智能体。这种「共同进退」的信号设计鼓励了门决策之间的协调:当某个门选择了特定动作而最终获得高奖励时,所有参与同一推理的门都会受到正向激励,反之亦然。

CoGRPO 的「无评论家」特性体现在它不需要单独训练一个价值网络来估计中间状态的优势函数。论文认为,在多智能体推理的尺度下,中间状态的优势估计既困难又不稳定,而直接使用最终奖励的相对比较(在 GRPO 中体现为组内基线)已经足够驱动学习。这种设计降低了训练复杂度,同时通过组内相对比较提供了稳定的优势归一化。

专家注册表机制解决了实际部署中的一个痛点:如何在不重新训练的情况下更新底座模型。论文为每个专家智能体维护一组校准映射参数,这些参数在模型替换时进行调整,使得新模型能够继承原有路由策略的行为,而无需重新执行完整的训练流程。

实验与结果

实验在三个不同难度级别的基准上评估:GSM8K 代表小学数学推理能力,MMLUPro 作为大规模多学科选择题挑战,GPQA 则聚焦于研究生水平的专业知识问答。此外还引入了 AIME-2025 来检验模型在竞赛数学上的深度推理能力。

基线方法涵盖了从单智能体到多智能体路由的多种方案,包括固定专家池选择、基于分数的路由、以及完全可学习的路由策略。GRADE 在 GSM8K、MMLUPro 和 GPQA 上均取得了最优表现,特别是在 MMLUPro 上,以约 170 亿活跃参数(相当于完整模型的一半)的计算量,超越了最强基线 4.8 分。这一结果清晰地表明,层级结构和动态深度控制能够在显著降低计算开销的同时提升准确率。

AIME-2025 的结果呈现出不同的图景:GRADE 虽然保持竞争力,但并未取得显著优势。论文将此归因于竞赛数学问题的特殊性质——这类问题往往需要单次深入的推理链条而非多智能体的协作,模型深度在这里比智能体组合的广度更为关键。这一发现提醒我们,多智能体架构并非万能解药,其适用性取决于任务本身的结构特征。

消融实验揭示了层级结构本身的重要性。当移除层级设计退化为扁平的多智能体系统时,准确率出现明显下降,这验证了分层的必要性。掩码交叉注意力——即限制某些层之间的信息流通以避免过度聚合——同样贡献显著,表明适度的信息隔离有助于保留各智能体的专业化能力。逐智能体校准映射的消融则证实了其在热插拔场景中的不可替代性:没有校准的模型替换会导致路由策略的严重偏移,而经过校准的替换则能维持稳定的性能。

讨论与可借鉴点

GRADE 最有价值的贡献或许不在于具体的技术细节,而在于它提出的问题框架:将多智能体推理视为一个「计算量分配」问题,用端到端的可学习系统来联合决定路由、深度、通信和剪枝。这种视角将原本分散的设计决策统一起来,为后续研究提供了新的出发点。

论文的局限性主要体现在两个方面。其一,在 AIME-2025 等需要深度单链推理的任务上表现平平,说明当前的层级设计可能更适合「广度优先」类型的查询;其二,CoGRPO 的共享优势信号虽然简化了训练,但可能无法充分捕捉每个智能体和门的独立贡献——当某个智能体选错了专家但最终答案碰巧正确时,正向奖励会被错误地强化其选择。

对于该领域的研究者而言,GRADE 的几个设计选择值得借鉴:四门联合学习的框架提供了一种可扩展的思路,可以根据具体场景增减门的数量;无评论家的 CoGRPO 为多智能体场景下的强化学习训练提供了一个简洁有效的baseline;而专家注册表配合校准映射的设计,则为实际部署中的模型更新提供了一条实用的路径。

摘要

多智能体集成会增加活跃参数数量和推理成本,却并未回答三个基本问题:应咨询哪些智能体、查询应在智能体层级中深入到何种程度,以及智能体间的通信何时才值得付出其开销。我们提出 GRADE(用于高效推理的门控路由与自适应深度),一种层级式多智能体系统,其中四个轻量级可学习的门联合控制智能体选择、层级深度、智能体间通信以及分支剪枝。训练过程采用 CoGRPO(协同分组相对策略优化),这是一种新颖的无评论家方法,将 GRPO 适配到多智能体层级结构,并为参与一次完整推理的每个门和智能体分配共享的优势信号。智能体模型从一个可热插拔的专家注册表中选取;逐智能体校准映射表允许在推理时替换专家而无需重新训练。在平均约 170 亿活跃参数规模下,GRADE 在 GSM8K、MMLUPro 和 GPQA 上优于所有基线方法,在 MMLUPro 上以一半的活跃计算量超越最强基线 4.8 分。在模型深度起主导作用的 AIME-2025 上,GRADE 仍然与现有框架保持竞争力。消融实验分离出层级结构和掩码交叉注意力是对准确率贡献最大的两个组件,并表明逐智能体校准是安全热插拔所必需的。

Abstract

Multi-agent ensembling multiplies active parameters and inference cost without answering three basic questions: which agents to consult, how deeply a query should traverse a hierarchy of agents, and when inter-agent communication is worth its cost. We present GRADE (Gated Routing and Adaptive Depth for Efficient Reasoning), a hierarchical multi-agent system in which four lightweight learned gates jointly govern agent selection, hierarchy depth, inter-agent communication, and branch pruning. Training uses CoGRPO (Collaborative Group-Relative Policy Optimization), a novel critic-free recipe that adapts GRPO to multi-agent hierarchies and assigns a shared advantage signal to every gate and agent that participated in a rollout. Agent models are drawn from a hot-swappable Expert Registry; per-agent calibration maps allow experts to be replaced at inference time without retraining. At 17B average active parameters, GRADE outperforms all baselines on GSM8K, MMLUPro, and GPQA, surpassing the strongest baseline by 4.8 points on MMLUPro at half the active compute. On AIME-2025, where model depth dominates, GRADE remains competitive to existing frameworks. Ablations isolate the hierarchy and masked cross-attention as the largest contributors to accuracy, and show that per-agent calibration is necessary for safe hot-swapping.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记