arXiv 2606.28925v1 · 发布 2026-06-27

多智能体路由作为集合值预测:WildChat 基准与成本感知评估

Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation

AUTHORS Ananto Nayan Bala, Faisal Muhammad Shah
EVIDENCE 针对 12 个代理目录的多智能体路由基准
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-04 21:42:00 UTC

📝 TLDR

智能体路由本质是集合值预测问题,单个查询可能需要调用多个智能体,过多选择则增加执行成本。本文基于 WildChat 构建了 3000 条提示、12 个智能体的多标签路由基准,并提出结合集合指标与成本分层的评测协议。在多种方法对比中,监督式路由器显著优于最近邻与零样本 LLM 路由;微调编码器在无约束集合准确率上最强,加权路由层 WAR 在其上带来最大的实用增益。该基准与协议支持对固定目录多智能体路由中精度-成本权衡的可复现研究。

🧭 速览

动机

单查询常需多智能体协作,工具路由本质为集合值预测,过度选择抬升执行成本,亟需兼顾精度与代价的评测基准。

方法

基于 WildChat 构建 3000 条 12-agent 多标签基准,结合集合级指标与序数成本分层约束加权路由,比较 NN、线性多标签、依赖基线、微调编码器、WAR 及零样本 LLM。

结果

监督路由器全面优于 NN 与零样本 LLM;微调编码器无约束集合准确率最高,线性多标签为最强实用基线;Encoder+WAR 在约束设置下增益最大。

结论

基准与协议支持固定目录多智能体路由中精度-成本权衡的可复现研究,验证加权路由层在强监督打分器上的实用价值。

📊 论文图表(共 8 张)

展开查看 8 张图

TL;DR

这篇论文将多智能体路由重新定义为一个集合值预测问题——单个用户查询可能需要调用多个智能体,而过度选择会直接推高执行成本。基于 WildChat 构建的包含 3000 条提示、12 个智能体的基准测试表明,有监督路由器在精度-成本权衡上显著优于最近邻匹配和零样本 LLM 路由,其中微调编码器在无约束集合准确率上表现最强,而加权路由层 WAR 叠加在强监督评分器上能带来最大的实用增益。

研究背景与动机

在现代 AI 系统中,单一智能体往往难以独立完成复杂任务,需要多个专门化智能体协同工作。智能体路由要解决的核心问题是:根据用户输入的自然语言提示,决定应该激活哪些智能体来处理该请求。这个问题看似简单,实际上面临一个根本性的张力——选择过少会导致能力覆盖不足,用户需求无法被完整满足;选择过多则会产生不必要的执行成本,包括延迟增加和资源浪费。

传统上,路由问题往往被简化为单标签分类或简单的规则匹配,这与实际场景中一个查询可能需要多个智能体协作的 reality 相去甚远。零样本 LLM 路由虽然灵活,但在需要精确匹配的固定目录场景中表现不稳定;基于检索的最近邻方法则受限于语义相似性的表层理解,无法捕捉查询与智能体能力之间的深层对应关系。更重要的是,已有研究缺乏对精度-成本权衡的系统性评估——没有一套统一的协议来衡量不同路由策略在效果与效率之间的真实取舍。

本文的切入点正是将路由重新建模为[[多标签分类]]问题:一个查询对应一个智能体集合的预测。集合的基数(即选多少个智能体)和集合的元素构成(即选哪些智能体)都需要被同时优化。此外,引入成本层级机制后,路由问题进一步扩展为带约束的集合值优化——在满足能力覆盖的前提下,尽量选择成本更低的智能体组合。

方法

论文提出的方法框架围绕三个核心设计展开。首先是多标签路由基准的构建。数据集源自 WildChat 对话日志,经过 AI 辅助的启发式标注,为每条提示分配对应的智能体子集。标注过程采用固定模式以保证一致性,并通过受控重平衡确保多标签分布的合理性——这避免了长尾标签被少数样本主导的问题。12 个智能体形成了一个功能分化的目录,覆盖代码执行、网页搜索、数据分析、文档生成等不同能力域。

其次是评估协议的设计。作者认为,单一的准确率指标无法刻画路由问题的复杂性,因此构建了一套多维度的评测体系。集合级指标包括精确率、召回率、F1 分数、Jaccard 相似度和完全匹配率,分别衡量预测集合与真实集合之间的重叠程度、覆盖完整性和绝对一致性。延迟指标捕捉执行效率,而面向执行的能力覆盖模拟则通过模拟路由决策后的实际调用链来评估端到端的可行性。最具创新性的是带约束加权路由设置:12 个智能体被划分为不同的成本层级(如高成本层级对应复杂推理模型,基础层级对应轻量模型),路由器需要在满足最低能力覆盖的前提下优化成本加权和。这相当于一个带预算约束的组合优化问题。

最后是方法对比的广度。论文系统对比了六类方法:最近邻匹配基于提示与历史样本的语义距离进行路由;线性多标签分类器使用 [[词嵌入]] 特征进行独立二分类;依赖感知基线在分类基础上加入了智能体间调用依赖的约束;微调编码器通过在大规模路由数据集上微调预训练语言模型来学习提示与智能体之间的细粒度关联;WAR(加权智能体路由)是一个确定性加权后评分层,可以叠加在任何评分器之上以注入成本意识;零样本 LLM 基线则利用大模型的推理能力直接决定路由。

WAR 层的引入值得特别关注。它的设计直觉是:已有评分器给出各智能体的独立置信度分数,但这些分数没有考虑成本因素。WAR 在此基础上引入成本加权项,使得在置信度相近的情况下优先选择低成本智能体。这种解耦设计允许 WAR 与任意评分器组合,形成模块化的精度-成本控制能力。

实验与结果

实验结果揭示了几个重要发现。在无约束设置(即不考虑成本、只追求召回最大化的场景)中,微调编码器的集合准确率全面领先,F1 分数和完全匹配率都显著高于其他方法。线性多标签模型虽然在精确率上可与之竞争,但召回率明显偏低。这说明端到端的表示学习能够更好地捕捉自然语言提示与智能体能力之间的复杂映射关系,而简单的线性分类器受限于特征工程的表达能力。

然而,当评估指标切换到实用价值时,情况发生了变化。线性多标签模型被选为最强实用基线,因为它在精度与召回之间取得了良好平衡,而极化的精确率或召回率在实际系统中往往意味着资源浪费或能力缺口。最近邻匹配的表现令人失望——尽管直觉上相似的历史查询应该导向相似的路由决策,但实验表明语义相似性并不能可靠预测智能体需求,查询的表面措辞与底层任务类型之间存在显著差异。

零样本 LLM 路由的失败最值得关注。论文分析指出,大模型在零样本条件下缺乏对特定智能体目录的能力边界认知,无法进行精细区分。特别是在存在能力重叠的智能体时,模型倾向于保守地选择更多智能体以避免遗漏,这在无形中增加了成本。

WAR 层的叠加效果在约束设置中得到了充分验证。当路由器需要在保证至少覆盖某个能力阈值的前提下最小化成本时,WAR 能够有效引导决策向低成本方向倾斜。最显著的增益出现在 Encoder+WAR 组合上——强编码器提供了准确的能力评估,WAR 在此基础上注入了成本敏感性,两者形成互补。这印证了论文的核心论点:精度与成本不是非此即彼的关系,而是可以通过模块化的评分-加权框架协同优化。

讨论与可借鉴点

这篇论文的核心贡献在于提供了一套关于路由问题的系统性认知框架。将路由重新定义为集合值预测,并配套完整的评估协议,这使得后续研究者可以在统一的基准上对比方法,而不必担心评估口径的不一致。对实践者而言,WAR 层作为轻量级插件的设计思路值得借鉴——它不依赖重新训练,而是以一种后处理的方式将成本约束注入现有系统,这意味着在已部署的路由模型上添加成本控制几乎没有迁移成本。

论文的局限性同样值得注意。基准中的智能体目录是固定的,这在企业内部场景下合理,但限制了方法的泛化性评估。12 个智能体的规模相对有限,更大规模的目录可能会暴露当前方法在组合爆炸上的挑战。此外,智能体间的依赖关系虽然在依赖感知基线中有所涉及,但处理方式相对简化,真实系统中的调用链优化仍是开放问题。

从更宏观的视角看,这项工作指向了一个关键趋势:随着 AI 系统变得越来越复杂,路由层的价值将持续上升。一个设计良好的路由机制不仅影响单个请求的响应质量,更决定了整个系统的资源利用效率和用户体验。精度与成本的权衡不会是零和博弈——正如本文所展示的,通过精细的建模和模块化的设计,两者可以实现有意义的协同提升。

摘要

从自然语言提示中进行工具与智能体路由本质上是一个集合值预测问题:单个查询可能需要多个智能体,而过度选择会增加执行成本。本文所引入的基准源自 WildChat,包含 3,000 条提示,涵盖固定的 12 个智能体目录,采用固定模式下的 AI 辅助启发式标注,并进行受控的重平衡以支持多标签评估。评估协议结合了集合级指标(精确率、召回率、F1、Jaccard 和完全匹配)、延迟、面向执行的能力覆盖模拟,以及基于序数智能体成本层级的带约束加权路由设置。所比较的方法包括最近邻匹配、线性多标签分类、依赖感知基线、微调编码器、通过加权智能体路由(WAR)进行的确定性加权后评分,以及零样本大语言模型基线。结果表明,有监督路由器实质性地优于最近邻和零样本大语言模型路由。微调编码器在无约束集合准确率上表现最佳,而线性多标签模型提供了最强的实用基线。在带约束设置中,当加权路由层叠加在强有监督评分器之上时,其效用得到改善,其中 Encoder+WAR 的增益最大。总体而言,该基准和评估协议支持对固定目录多智能体路由中准确率-成本权衡的可复现研究。

Abstract

Tool and agent routing from natural-language prompts is naturally a set-valued prediction problem: a single query may require multiple agents, while over-selection increases execution cost. The benchmark introduced here is derived from WildChat and contains 3,000 prompts over a fixed 12-agent catalog, with AI-assisted heuristic labels under a fixed schema and controlled rebalancing for multi-label evaluation. The evaluation protocol combines set-level metrics (Precision, Recall, F1, Jaccard, and Exact Match), latency, an execution-oriented capability-coverage simulation, and a constrained weighted-routing setting based on ordinal agent-cost tiers. Compared methods include nearest-neighbor matching, linear multilabel classification, dependency-aware baselines, a fine-tuned encoder, deterministic weighted post-scoring via Weighted Agent Routing (WAR), and a zero-shot LLM baseline. Results show that supervised routers substantially outperform nearest-neighbor and zero-shot LLM routing. The fine-tuned encoder achieves the strongest unconstrained set accuracy, while the linear multilabel model provides the strongest practical baseline. In the constrained setting, the weighted routing layer improves utility when applied on top of strong supervised scorers, with the largest gain observed for Encoder+WAR. Overall, the benchmark and evaluation protocol support reproducible study of accuracy-cost trade-offs in fixed-catalog multi-agent routing.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记