arXiv 2607.13359v1 · 发布 2026-07-15

面向多智能体系统的时延感知编排学习

Learning Latency-Aware Orchestration for Multi-Agent Systems

AUTHORS Xi Shi, Mengxin Zheng, Qian Lou
EVIDENCE 多智能体系统的延迟感知编排框架
SCORE 0.8
GENERATED 2026-07-20 21:43:24 UTC

📝 TLDR

多智能体系统通过结构化工作流协调多个LLM智能体,虽提升推理能力却带来高推理延迟。现有编排方法主要优化任务性能和成本,对延迟关注不足,且简单延迟优化可能因错误的算子级信用分配而损害准确率。为此提出LAMaS框架,训练时学习关键路径感知的执行图,推理时由轻量控制器动态剪除冗余交互。实验在四个基准上实现端到端延迟降低超50%且准确率持平或更优,模块化设计便于迁移至其他多智能体系统。

🧭 速览

动机

多智能体系统端到端延迟由关键执行路径决定,仅优化成本无法可靠降延迟,朴素延迟优化还会错误分配算子级信用而损害准确率。

方法

训练时通过关键路径感知的约束优化学习延迟感知执行图,推理时由轻量控制器依据运行时证据自适应消除冗余智能体交互。

结果

在四个基准上端到端延迟降低超50%,准确率持平或更优,并以极少改动迁移至其他多智能体系统。

结论

为多智能体编排提供兼顾延迟与准确率的模块化方案,展示了运行时自适应控制与训练时图学习相结合的方向。

📊 论文图表(共 4 张)

展开查看 4 张图

TL;DR

这篇论文研究了如何让基于大语言模型的多智能体系统在保持准确率的前提下大幅降低端到端推理延迟。核心挑战在于,系统的延迟由关键执行路径而非所有算子的总和决定,简单的延迟惩罚会导致算子级信用分配错误,从而损害准确率。LAMaS 框架在训练阶段通过关键路径感知的贡献度分配学习低延迟执行图,在推理阶段用轻量控制器自适应剪除冗余交互。实验在四个基准上实现了超过 50% 的延迟降低,同时准确率持平或更优,并具备良好的跨架构迁移能力。

研究背景与动机

基于大语言模型的多智能体系统通过结构化工作流协调多个专用智能体,能够完成单智能体难以胜任的复杂推理任务。然而,这种架构也带来了显著的推理延迟问题:在实际部署场景中,一个任务从发出到返回结果常常需要 10 到 60 分钟,这严重制约了系统的实用性。

现有编排方法主要关注两个优化目标:任务性能和推理成本。但论文指出了一个关键洞察——端到端延迟并非各算子执行时间的简单加总,而是由关键执行路径决定的。关键执行路径指的是从输入到输出所有可能路径中耗时最长的那条,系统的整体延迟等于这条路径上所有算子延迟之和。这意味着两个在准确率和总推理成本上相近的执行图,可能因为关键路径的差异而呈现出截然不同的延迟表现。因此,单纯降低总成本并不能可靠地减少延迟。

更棘手的是,在保持准确率的前提下优化延迟并非易事。论文将这个问题形式化为带准确率约束的优化问题:最小化延迟和成本的加权和,同时要求任务得分不低于某个参考基线。朴素的延迟优化方法会对所有算子施加同等的延迟惩罚,但由于非关键路径算子并不真正影响端到端延迟,这种做法会错误地分配算子层级的贡献度,最终损害任务准确性。

此外,训练阶段确定的执行图是静态的,无法利用推理时的运行时证据——例如部分智能体已经就某个答案达成共识,或者当前执行已经消耗了大量时间。这类动态信息对于进一步裁剪冗余交互至关重要,但在纯训练的视角下无法获取。

方法

LAMaS 的设计围绕两个核心层面展开,分别对应训练时和推理时的不同挑战。

训练阶段,论文将编排器建模为智能体超网络上的策略网络。给定查询和候选算子集合,策略网络按步采样算子,逐步构建执行图。每一步会输出对候选算子的概率分布,当累积概率首次超过某个阈值时停止该步,从而实现对图的宽度和深度的动态调整。这种设计使得执行图不再是预设的固定结构,而是根据查询特点自适应生成。

关键路径感知的信用分配是训练阶段的核心创新。论文定义了算子的路径关键性权重,其中 是经过算子 的最长路径长度, 是关键执行路径的总延迟。这个权重的物理含义是:位于关键路径上的算子权重接近 1,远离关键路径的算子权重接近 0。基于此,算子级奖励定义为:

这个奖励函数的结构非常精妙:关键路径算子承受完整的延迟惩罚 ,准关键路径算子接受衰减后的份额,而非关键算子几乎不承担延迟信号。这解决了朴素延迟优化中信用分配错误的根本问题。

为了确保训练过程中准确率不跌破参考基线,论文引入了拉格朗日松弛技术。通过引入自适应对偶变量 将准确率约束融入目标函数:

当准确率低于下限 时, 自动增大,使得奖励函数中准确性项的权重提升,从而优先保证正确性;满足约束后 减小,系统可以更激进地削减延迟。这种自适应机制避免了手动调参的不确定性。

推理阶段,由于训练时确定的执行图无法利用运行时证据,LAMaS 补充了一个轻量级执行控制器。控制器是一个小型 MLP,输入包括执行进度(已完成步数与总步数的比例)、答案共识度(已完成智能体中达成一致的比率)、以及查询的低维嵌入表示。控制器的输出是"控制优势",即在当前步停止相比继续执行到最后的预期收益。当控制优势超过阈值时,控制器决定提前终止后续交互。

控制器的训练方式也别具一格:先冻结训练好的编排器,收集其在验证集上的完整执行轨迹,然后对每个决策点回归预测控制优势。这种两阶段训练策略使得控制器能够继承编排器学到的延迟感知行为,同时学习如何利用推理时的动态信号做进一步优化。

实验与结果

实验在四个不同类型的基准上展开:代码生成任务(HumanEval)、数学推理任务(GSM8K 和 MATH)、以及知识推理任务(MMLU-Pro)。基线方法涵盖非多智能体系统(Generate、Chain-of-Thought、Self-Consistency)和学习型多智能体系统(GDesigner、AgentDropout、MaAS),评估指标包括任务准确率、API 调用成本和端到端墙钟延迟。

主实验结果表明,LAMaS 在四个基准上均实现了学习型多智能体系统基线中的最低延迟。相比最强基线 MaAS,延迟相对降低幅度从 55.6% 到 75.6% 不等:GSM8K 从 48.11 秒降至 11.73 秒,MATH 从 109.87 秒降至 28.41 秒。更重要的是,这些延迟削减伴随着准确率的持平或提升——例如 MATH 准确率从 31.1% 提升至 31.8%,MMLU-Pro 准确率从 36.8% 提升至 37.0%。

消融实验验证了三个机制的必要性。去除执行控制器后,延迟上升 16.5% 到 21.1%,成本上升 16.0% 到 25.2%,说明控制器在推理阶段发挥了重要的冗余剪除作用。去除关键路径信用分配后,所有指标均出现退化,证实了路径感知加权对于避免错误信用分配的核心价值。去除延迟目标(即仅优化成本)后,延迟膨胀 24% 到 70%,这直观地验证了延迟与成本的非等价性。朴素的延迟惩罚(对所有算子施加同等延迟信号)则导致准确率下降 1.30 到 5.34 个百分点。

论文还引入了关键路径输出 token 数(CP Tokens)作为结构化辅助指标。实验发现 CP Tokens 与端到端延迟呈强正相关(Pearson 相关系数 0.901,Spearman 相关系数 0.878),说明延迟削减主要来源于关键路径本身的缩短,而非孤立的算子加速。

迁移性实验验证了 LAMaS 的模块化特性。将完整 LAMaS 流水线集成到 GDesigner 和 AgentDropout 中,在四个基准上实现了 27% 到 39% 的延迟降低,同时准确率在统计噪声范围内持平。这表明 LAMaS 的设计不依赖于特定编排器的内部实现,具备良好的跨架构迁移能力。

讨论与可借鉴点

LAMaS 的一个重要贡献在于问题建模的深刻性:明确区分了成本(可加性的总资源消耗)和延迟(关键路径最大值的结构化度量)这两个本质不同的概念。这一洞见不仅适用于多智能体系统,也为其他需要同时考虑效率和性能的场景提供了分析框架。已有工作中将延迟简单塞入加权奖励的做法,实际上混淆了这两个概念,导致优化目标与实际需求错位。

拉格朗日松弛技术的应用也值得借鉴。通过自适应对偶变量将硬约束转化为软目标,系统能够在训练过程中自动平衡准确率和延迟这两个竞争目标,无需人工在两者之间做固定权衡。这种自适应机制在多目标优化场景中具有广泛的适用性。

LAMaS 仍存在一些局限性。首先,论文的优化范围仅限于编排延迟,未涉及底层大语言模型和工具的安全性问题(如不安全输出、幻觉或社会偏见),这些在安全敏感的应用中可能成为更关键的瓶颈。其次,实验使用的训练集规模较小(33 到 264 条样本),虽然表明方法对数据效率有一定要求,但也在一定程度上限制了对大规模训练场景的指导意义。第三,执行控制器虽然设计为轻量级 MLP,但其本身引入的决策延迟和工程复杂度在论文中未被单独量化。

从更宏观的角度看,这项工作揭示了多智能体系统中一个长期被忽视的效率维度。随着这类系统在生产环境中的部署越来越广泛,端到端延迟将从"可接受的不便"演变为"必须解决的核心问题"。LAMaS 提出的训练加推理协同优化思路——训练时学习低延迟图结构、推理时利用动态证据进一步裁剪——或许能为后续工作提供启发:在追求更强大推理能力的同时,不忘效率这一基础约束。

摘要

多智能体系统(MAS)通过结构化工作流协调多个由大语言模型驱动的智能体,从而获得更强的推理能力,但也因多步执行和重复的模型调用而产生较高的推理延迟。现有的编排方法主要优化任务性能和推理成本,对延迟问题鲜有关注。在多智能体系统中,端到端延迟由关键执行路径决定,因此仅降低总成本并不能可靠地减少延迟。此外,在保持准确性的同时优化延迟并非易事:朴素的延迟优化可能会错误地分配算子层级的贡献度,从而损害任务准确性。为填补这一空白,我们提出了时延感知多智能体系统(LAMaS),这是一种面向学习型多智能体系统的时延感知编排框架。LAMaS 在两个层面应对这一挑战:在训练阶段,它通过带有关键路径感知贡献度分配的约束优化来学习时延感知的执行图;在推理阶段,由于训练时确定的执行图无法利用运行时证据,它在图构建的基础上补充了一个轻量级控制器,随着执行的推进自适应地消除冗余的未来智能体交互。在四个基准上的实验表明,LAMaS 在所评估的学习型多智能体系统基线中取得了最低的延迟,在保持具有竞争力或更优准确性的同时,将端到端延迟降低了超过 50%。LAMaS 还具有模块化特性,能够以最小改动迁移到其他多智能体系统,并持续带来延迟削减。

Abstract

Multi-agent systems (MAS) coordinate multiple LLM-powered agents through structured workflows, gaining reasoning power but incurring high inference latency from multi-step execution and repeated model invocations. Existing orchestration methods primarily optimize task performance and inference cost, leaving latency largely unaddressed. In MAS, end-to-end latency is governed by the critical execution path, so reducing total cost alone does not reliably reduce latency. Moreover, optimizing latency while preserving accuracy remains non-trivial: naive latency optimization can misassign operator-level credit and degrade task accuracy. To address this gap, we propose Latency-Aware Multi-agent System (LAMaS), a latency-aware orchestration framework for learning-based multi-agent systems. LAMaS addresses this challenge at two levels: at training time, it learns latency-aware execution graphs through constrained optimization with critical-path-aware credit assignment; at inference time, since a graph committed at training time cannot exploit runtime evidence, it complements graph construction with a lightweight controller that adaptively eliminates redundant future agent interactions as execution unfolds. Experiments on four benchmarks show that LAMaS achieves the best latency among evaluated learning-based MAS baselines, reducing end-to-end latency by over 50\% while maintaining competitive or better accuracy. LAMaS is also modular and transfers to other MAS with minimal changes, consistently yielding latency reductions.


论文详细总结(自动生成)

论文总结:面向多智能体系统的时延感知编排学习(LAMaS)

1. 核心问题与研究动机

  • 问题背景:基于大语言模型的多智能体系统(MAS)通过结构化工作流协调多个专用智能体,提升推理能力,但多步执行和重复模型调用带来了高昂的推理延迟。现实部署中(如电脑操作、自主研究等场景),单个任务常需 10–60 分钟,延迟成为关键瓶颈。
  • 关键洞见:MAS 的端到端延迟由关键执行路径(critical execution path)决定,而非所有算子的总执行时间。因此,仅优化推理成本(additive objective)无法可靠降低延迟;两个执行图可能在准确率和总成本相近的情况下,延迟差异显著。
  • 现有方法的不足

1. 主要优化任务性能和推理成本,对延迟关注不足;

2. 朴素的延迟优化会产生错误的算子级信用分配(对关键路径算子与非关键算子施加同等惩罚),损害任务准确率;

3. 训练时固定的执行图无法利用推理时的执行证据(如部分答案共识、已用时间)。

  • 本文目标:在保持任务准确率不低于参考基线的前提下,最小化端到端延迟。

2. 方法论

2.1 问题形式化

将编排建模为有约束优化问题:

其中 为任务得分(0/1), 为 API 调用成本(USD), 为端到端墙钟延迟(秒), 为准确率下限(设为参考准确率), 为固定权重。

关键路径定义(端到端延迟的图结构度量):

2.2 编排器架构

  • 将编排器建模为智能体超网络(agentic supernet)上的策略网络,输出对候选算子集 的概率分布;
  • 按步采样算子,当累积概率首次超过阈值 时停止该步,从而按查询动态调整图的宽度和深度

2.3 关键路径感知的信用分配

为每个算子 定义路径关键性权重

其中 为经过 的最长路径长度。算子级奖励定义为:

  • 关键路径算子()承受完整延迟惩罚;
  • 准关键路径算子()接受衰减后的份额;
  • 远离关键路径的算子()几乎不承担延迟信号。

2.4 拉格朗日松弛与对偶更新

通过自适应对偶变量 强制准确率约束:

准确率下降时 自动增大以优先保证正确性;满足约束后 减小,允许更激进的延迟削减。

2.5 学习目标

策略梯度损失(含 EMA 归一化以降低方差):

2.6 推理时执行控制

  • 控制优势,衡量第 步停止相比跑完所有算子的优劣;
  • 控制器:轻量 MLP,输入包括执行进度 、答案共识度 、查询嵌入的低维投影
  • 停止概率,其中 由训练集正例标准差计算;
  • 训练方式:在冻结编排器上收集完整执行轨迹,每个决策点用 MSE 回归预测 ,继承编排器的拉格朗日目标。
  • 共识定义:GSM8K/MATH 提取 boxed 答案或最终数值;MMLU-Pro 比较选项字母;HumanEval 比较测试用例的 pass/fail 结果。

2.7 完整训练流程(Algorithm 1)

  • Phase 1:训练编排器,采用拉格朗日约束策略梯度 + 关键路径信用分配;
  • Phase 2:冻结编排器,收集执行轨迹训练执行控制器;
  • 推理:编排器构建执行图,控制器在每个算子完成后自适应消除后续冗余交互。

3. 实验设计

3.1 数据集

任务类型基准规模 (Train/Test)指标
代码生成HumanEval33 / 131pass@1
数学推理GSM8K264 / 1055Accuracy
数学推理MATH119 / 486Accuracy
知识推理MMLU-Pro125 / 500Accuracy

3.2 基线方法

  • 非 MAS 基线:Generate、CoT(Chain-of-Thought)、SC(Self-Consistency);
  • 学习型 MAS 基线:GDesigner、AgentDropout、MaAS。

3.3 评估指标

  • 任务准确率(pass@1 或 accuracy);
  • API 成本( USD/query);
  • 端到端墙钟延迟(秒/query);
  • 关键路径输出 token 数(CP Tokens,作为结构化辅助指标)。

3.4 实现细节

  • 后端 LLM:gpt-4o-mini-0718(主实验),另用 qwen3.5-flash(OpenRouter)与 qwen3.5-9b(vLLM 本地部署)评估泛化性;
  • 超参数:,超网络层数 ,batch size = 4,训练 4 轮;
  • 查询编码:冻结的 all-MiniLM-L6-v2 SentenceTransformer;
  • 温度 = 1,每组实验取 3 次独立运行的均值与标准差。

4. 资源与算力

  • 训练编排器与执行控制器:每跑使用 单块 NVIDIA H100 80GB GPU,在 Slurm 集群上运行;
  • 本地后端评估qwen3.5-9b 通过 vLLM 部署在 2 块 NVIDIA B200 GPU 上;
  • 底层 LLM 不进行微调;训练算力需求较小(modest local compute);
  • 论文未明确报告训练总时长(如小时数或收敛所需 epoch 耗时),仅给出 batch size 与训练轮数等间接信息。

5. 实验数量与充分性

实验类别数量与覆盖
主对比实验4 数据集 × 6 基线(含非 MAS 与 MAS)= 24 个单元格
消融实验4 变体(去控制器、去 CP 信用、去延迟目标、朴素延迟)× 4 数据集 = 16 单元格
迁移性实验2 个外部架构(GDesigner、AgentDropout)× 4 数据集 = 8 单元格
超参数敏感性4 个超参()× 2 数据集 = 8 组扫描
CP Token 与延迟相关性4 MAS 方法 × 4 数据集()的相关分析
Oracle 控制器对比2 数据集(HumanEval、MMLU-Pro)的决策一致性与端到端性能
训练动态可视化2 数据集(GSM8K、MMLU-Pro)的 曲线
未见算子兼容性HumanEval 上的 Debate 算子
跨后端泛化2 后端 × 2 数据集 = 4 单元格
  • 充分性:实验设计较为全面,覆盖主结果、消融、迁移、超参敏感、训练动态、oracle 上界、跨后端泛化、归纳灵活性;
  • 客观性:所有结果均为 3 次独立运行的均值 ± 标准差;同一 API 提供商与运行时下评估,不使用响应缓存;
  • 公平性:所有 MAS 基线在同一 train/test 划分、同一骨干 LLM、同一延迟/成本测量协议下评估。

6. 主要结论与发现

1. 延迟最优:LAMaS 在四个基准上均为学习型 MAS 基线中延迟最低,相对最强基线降低 55.6%–75.6%(如 GSM8K 从 48.11s 降至 11.73s;MATH 从 109.87s 降至 28.41s),同时准确率持平或更优;

2. 关键路径缩短:CP Tokens 显著减少(如 GSM8K 从 2501 降至 622),与端到端延迟强相关(Pearson ,Spearman );

3. 三个机制缺一不可

  • 去控制器:延迟上升 16.5%–21.1%,成本上升 16.0%–25.2%;
  • 去 CP 信用:三项指标均退化;
  • 去延迟目标():延迟膨胀 24%–70%;
  • 朴素延迟项:准确率下降 1.30–5.34 pp,收益有限;

4. 迁移性强:完整 LAMaS 流水线集成进 GDesigner/AgentDropout,跨四基准延迟降低 27%–39%,准确率在 3 跑噪声范围内持平或略升;

5. 接近 oracle:学习到的控制器在 HumanEval 与 oracle 一致率 73.5%、MMLU-Pro 70.8%,端到端性能仅落后 oracle 约 2 秒延迟与 0.3 pp 准确率;

6. 跨后端稳健:在 qwen3.5-flashqwen3.5-9b 上,LAMaS 相对 MaAS 在 HumanEval 上延迟降约 60%,MMLU-Pro 上降约 43%;

7. 未见算子兼容性:在 HumanEval 上插入未见 Debate 算子,仍分配到 14.8% 的概率(与 Generate、ScEnsemble 等见过的算子相当)。


7. 优点

  • 问题建模深刻:明确区分"成本"(可加)和"延迟"(关键路径最大)的结构性差异,避免了将延迟简单塞入加权奖励的常见误区;
  • 方法学严谨:通过拉格朗日松弛显式建模准确率下限,避免延迟优化侵蚀正确性;
  • 关键路径信用分配:用 实现平滑的瓶颈感知加权,无需显式枚举路径;
  • 训练 + 推理协同:训练时构造低关键路径的图,推理时再由控制器动态消除冗余交互,覆盖了静态优化与动态证据两个层面;
  • 模块化与可迁移:与具体编排器解耦,能以最小改动集成进 GDesigner、AgentDropout 等不同 MAS 架构;
  • 实验充分且透明:包含 oracle 上界对比、训练动态分析、超参敏感性扫描、跨后端验证、未见算子归纳测试,且所有结果均报告均值与标准差;
  • 额外指标设计:引入 CP Tokens 作为结构化代理指标,与端到端延迟呈强相关,便于解读延迟削减来源。

8. 不足与局限

  • 范围有限:仅关注编排延迟,未涉及底层 LLM 与工具的风险(不安全输出、幻觉、社会偏见),论文在 Limitations 章节明确声明;
  • 未明确训练时长:论文未报告训练至收敛所需的总 GPU 小时数或墙钟时间;
  • 数据集规模较小:训练集仅 33–264 条样本(MMLU-Pro 仅 125 条训练样本),可能影响训练稳定性与泛化;
  • 控制器开销:执行控制器虽为轻量 MLP,但仍引入额外的决策延迟与工程复杂度,论文未量化控制器本身的推理开销;
  • 迁移性边界:在 GDesigner/AgentDropout 上的迁移收益(27%–39%)小于原生 LAMaS 设置(55%+),提示迁移受限于原架构的图构建策略,具体哪些架构可受益、哪些不行仍待探索;
  • 公平性局限:主要实验依赖闭源 gpt-4o-mini,API 速率与排队波动可能影响延迟测量的可重复性;
  • 场景覆盖:仅在四个推理/编码基准测试,未覆盖真实延迟敏感场景(如交互式对话、流式工具调用、多模态协作),亦未在电脑操作、自主研究等长时任务上端到端评估;
  • 准确性约束的"参考准确率"依赖 设为参考架构在 下的准确率,若参考架构本身欠拟合,则 可能偏低,反而允许过度削减延迟。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记