多智能体系统在何种情况下有帮助?一种信息瓶颈视角
When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
📝 TLDR
LLM驱动的多智能体系统(MAS)与单智能体系统(SAS)在不同任务上表现差异缺乏系统性解释。本文从信息瓶颈视角分析两者差异:SAS使用单一共享推理上下文,MAS采用隔离的局部上下文并通过有界中继消息连接。无限带宽下MAS可模拟任意SAS,有界中继则引入压缩-信息损失的基本权衡,该权衡可由有效参数β刻画。在五个基准、三种模型规模上完成18组对照实验验证。结果表明:中继近充分时MAS对弱模型持续有益;当中继造成信息损失时,强模型因能从冗余上下文中提取信息反而表现更佳,MAS增益消失或反转。该研究将多智能体设计刻画为信息瓶颈优化问题。
🧭 速览
MAS相对SAS的优势缺乏统一解释,性能随场景波动明显,难以判断多智能体协作何时真正有效。
提出信息瓶颈分析框架,以有效参数β刻画有界中继下压缩收益与信息损失之间的权衡,并通过18组跨基准、跨模型规模的对照实验进行验证。
中继近充分时MAS对弱模型持续有益;中继导致信息损失时,强模型因能从冗余上下文中提取信息反而表现更佳,MAS增益消失或反转。
多智能体设计本质上是一个信息瓶颈优化问题,揭示了有界智能体间通信何时提升或损害性能的条件。
📊 论文图表(共 3 张)
展开查看 3 张图
TL;DR
这篇论文从信息瓶颈的理论视角回答了一个长期困扰多智能体系统研究的问题:多智能体系统(MAS)到底在什么情况下比单智能体系统(SAS)更有优势?作者将 MAS 的核心机制重新建模为有界中继通信引入的压缩-信息损失权衡,发现 MAS 增益可以分解为"上下文缩减收益"减去"中继信息损失成本"两个部分,分别由模型能力参数 和任务的中继复杂度 调控。在五个基准、三种模型规模上的 18 组对照实验验证了这一理论:当 时 MAS 一致地有益于所有模型,当 时强模型的 MAS 增益会缩小甚至反转。
研究背景与动机
近年来,由大语言模型驱动的多智能体系统在软件工程、数学推理、科学发现等复杂任务上展现出令人振奋的能力。研究者们普遍观察到,当任务被分解给多个专业化的 worker 协作完成时,系统往往能取得比单一大语言模型更好的效果。然而,这种优势并不稳定——在某些场景下多智能体系统表现出色,在另一些场景下却不如单智能体,甚至更差。这种不一致性长期缺乏系统性的解释。
既有研究对这一问题的探讨多停留在经验层面。一些工作发现多智能体系统的优势会随着基础模型能力的提升而衰减;另一些研究则将性能差异归因于额外的算力投入而非架构本身的优势。这些观察固然有价值,但它们描述的是"是什么"而非"为什么",无法为实际设计提供可预测的指导。一个真正令人满意的回答需要深入到 MAS 与 SAS 之间结构差异的核心,从机制上解释信息在两种系统中的流动方式如何不同。
这篇论文的切入点正是这样一个看似简单却常被忽视的结构差异:单智能体系统将完整的推理轨迹累积在一个共享的上下文中,而多智能体系统则让每个 agent 持有相互隔离的局部上下文,彼此之间仅通过有限容量的中继消息进行通信。这一结构差异意味着,在 MAS 中,信息在 agent 之间传递时必须经历某种压缩——而这种压缩既可能是优势,也可能是负担,取决于压缩是否恰当地移除了冗余信息而保留了关键信息。
方法
作者将上述直觉形式化为一个优雅的信息瓶颈优化问题。首先,他们严格定义了单智能体系统与多智能体系统的信息流结构差异。在单智能体系统中,上下文 在每个时间步累积全部历史信息;而在多智能体系统中,第 个 worker 仅持有局部上下文 ,与下一个 worker 的通信必须通过压缩后的中继消息 完成。
一个关键的理论结果是,在无限中继带宽的假设下,任何单智能体系统都可以被一个传递完整上游上下文的 MAS 所模拟。这意味着多智能体系统的非平凡优势不可能来自任务分解本身,而必然来自有界中继通信带来的压缩效果。
正式地,中继压缩的信息瓶颈目标函数写作:
这个目标函数表达了一个核心权衡:第一项要求我们尽可能压缩上游信息以提高通信效率,第二项则要求我们保留对下游任务有用的预测信息。参数 在这里扮演了关键的调节角色——它实际上是由下游大语言模型的能力决定的:弱模型对噪声更敏感,需要更强的信息保留(对应较小的 ),而强模型能够从冗余上下文中主动提取有用信息,因此可以容忍更大的压缩率(对应较大的 )。
基于这一框架,作者进一步推导出了 MAS 增益的精确分解:
其中第一项 是上游上下文缩减带来的收益——压缩得越多,这项越大;第二项 是中继信息损失,衡量压缩后的消息相比原始上下文丢失了多少对下游有用的信息。这个分解的直觉含义清晰:多智能体系统产生正向增益,当且仅当"上下文缩减"带来的好处超过了"能力加权后的信息损失"。
值得注意的是,这个框架还能解释为什么同一中继设计可能对不同能力的模型产生截然相反的效果。当模型较弱时,较大的 意味着信息损失的代价很高,压缩必须非常保守;当模型足够强时,较小的 允许更大的压缩空间,但如果压缩过度导致了关键信息丢失,那么 的增大可能会使整个增益变为负值。
作者还定义了中继复杂度 作为任务的固有属性,刻画不同任务在多大程度上依赖于完整的上游上下文。 的任务对中继内容相对不敏感,而 的任务一旦中继信息不足就会遭受严重性能下降。
实验与结果
为了验证上述理论框架,研究者在五个不同中继复杂度的 agentic 基准上开展了系统性的对照实验。他们设计了三套严格控制的原型系统:标准单智能体系统(SAS)使用单一共享上下文;SAS-contextflow 使用与 MAS 相同的任务分解,但保持完整的共享上下文;MAS 则采用隔离的局部上下文并通过压缩中继连接。这一设计的关键在于,通过对比 SAS-contextflow 和 MAS 可以精确分离出"任务分解结构"与"中继压缩"两种效应各自扮演的角色。
实验覆盖了三种模型能力梯度:较弱的 Qwen2.5-7B-Instruct、中等能力的 GPT-4o-mini、以及较强的 Qwen3.5-27B-AWQ-4bit。结果呈现出清晰的规律性。
在中继接近充分的任务(),如 ALFWorld、WideSearch 和 TravelPlanner-CS,MAS 在所有三个模型上一致地超过 SAS-contextflow,增益范围从 +0.011 到 +0.194。有趣的是,MAS 的增益随模型能力增强而缩小——弱模型从多智能体协作中获益最多,强模型的增益相对较小但仍然为正。
在中继不完全充分的任务(),如 WebShop 和 TravelPlanner-HC,情况开始发生变化。弱模型和中型模型仍然从 MAS 中受益,但强模型(Qwen3.5-27B)的增益出现了反转——它反而偏好完整的共享上下文而非压缩后的中继消息。
在中继严重不充分的任务(),如 WorkBench,所有三个模型相对 SAS-contextflow 的表现均为负值。这表明当任务对中间结果的精确传递有强依赖时,压缩造成的信息损失压倒了上下文缩减带来的效率收益。
消融实验进一步确认了几项关键机制。首先,对比 SAS 和 SAS-Plan(即使用相同分解但单上下文的版本)发现,单纯的分解并不能带来增益——真正重要的是上下文隔离而非任务分配。其次,通过人为删除中继消息中的特定字段,研究者验证了 所刻画的信息损失具有真实的因果效应,而非仅仅是描述性的量。
讨论与可借鉴点
这项研究的理论贡献在于,将多智能体设计重新表述为一个信息瓶颈优化问题。它提供了一个统一且可量化的视角,解释了为什么 MAS 的优势取决于任务属性和模型能力的匹配关系。这一框架的实用价值在于,它将设计问题从"要不要用多智能体"的二元选择转化为"如何调优压缩率以平衡效率与信息保留"的连续优化问题。
然而,这项工作也存在若干局限。研究者明确指出, 和 目前只是定性参数,缺乏可计算的估计量,因此理论框架无法直接用于预测具体任务的性能。此外,实验仅覆盖中等规模受控的 agentic 任务,对于超长上下文、多工具链或强开放性的真实场景,其适用性尚未得到验证。与成熟的多智能体框架如 MetaGPT、AutoGen、ChatDev 的对比也付之阙如,这限制了研究结论的行业参考价值。
从更广泛的视角看,这篇论文的核心洞见——多智能体协作的收益取决于信息压缩与传递的权衡——可能具有超越具体实现的启发性。对于实践者而言,关键的设计启示是:应当将中继消息视为需要主动优化的对象,而非简单的信息传递通道。当下游 agent 能力较弱或任务对信息精度要求极高时,应采用更保守的压缩策略;反之,可以适度牺牲信息完整性以换取通信效率。自适应中继机制——即根据 agent 能力动态调整压缩强度——是一个值得探索的自然方向。
摘要
由大语言模型驱动的多智能体系统(MAS)已成为处理复杂任务的一种有前景的范式。然而,它们相对于单智能体系统(SAS)的优势仍不明确,在不同设置下性能表现并不一致。在此,我们从信息瓶颈的视角来阐明MAS与SAS之间的差异。具体而言,我们的关键观察是:SAS将完整的推理轨迹累积在一个共享的上下文中,而MAS则使用相互隔离的局部上下文,并通过有界的中继消息进行连接。我们证明了,在无限中继带宽条件下,任何SAS都可以被一个传输完整上游上下文的MAS所模拟。因此,MAS的非平凡优势出现在有界中继条件下,此时压缩引入了一个基本的权衡:减少冗余上下文可以提高效率,但也可能导致任务相关信息丢失。我们将这一权衡形式化为一个由有效参数β控制的信息瓶颈,该参数刻画了这种平衡如何随模型能力的变化而移动,并表明当上下文缩减带来的收益超过中继信息损失时,MAS才会产生增益。我们在五个基准和三种模型规模上进行了18项受控实验来验证我们的理论研究。我们观察到,当中继接近充分时,MAS始终有帮助,尤其对于较弱的模型而言。相反,当中继导致信息损失时,MAS的增益会缩小甚至逆转,特别是对于那些已经能够从冗余上下文中提取有用信息、因而从压缩中获益甚微的较强模型。我们的研究表明,多智能体设计本质上是一个信息瓶颈优化问题。这一视角解释了有界智能体间通信在何时有帮助、何时有害。
Abstract
LLM powered multi-agent systems (MAS) have emerged as a promising paradigm for complex tasks. However, their advantages over single-agent systems (SAS) remain unclear, with performance varying inconsistently across settings. Here, we provide an information bottleneck perspective on elucidating the differences between MAS and SAS. Specifically, our key observation is that a SAS accumulates its full reasoning trace in one shared context, while a MAS uses isolated local contexts connected by bounded relay messages. We show that, under infinite relay bandwidth, any SAS can be simulated by a MAS that transmits the full upstream context. Thus, the nontrivial advantage of MAS arises under bounded relays, where compression introduces a fundamental trade-off: reducing redundant context can improve efficiency, but may also incur loss of task-relevant information. We formalize this trade-off as an information bottleneck controlled by an effective parameter , which captures how the balance shifts with model capability, and shows that MAS gains arise when context reduction outweighs relay information loss. We conduct 18 controlled experiments across five benchmarks and three model scales to validate our theoretical studies. We observe that MAS consistently helps when relays are near-sufficient, especially for weaker models. In contrast, MAS gains shrink or reverse when relays incur information loss, especially for stronger models that can already extract useful information from redundant context and thus gain little from compression. Our study shows that multi-agent design is fundamentally an information-bottleneck optimization problem. This perspective explains when bounded inter-agent communication helps or hurts.
论文详细总结(自动生成)
论文总结:多智能体系统在何种情况下有帮助?一种信息瓶颈视角
1. 核心问题与研究动机
- 现象层面的核心困惑:基于 LLM 的多智能体系统(MAS)在软件工程、数学推理、科学发现、规划等领域表现出一定优势,但其在不同设置下的性能不一致,缺乏对"MAS 何时真正优于单智能体系统(SAS)"的系统性解释。
- 既有研究的缺口:既有 MAS 与 SAS 的对比研究多停留在经验层面,要么指出 MAS 增益随基础模型能力提升而衰减,要么把优势归因于额外算力而非架构优势,缺少对结构性机制的解释。
- 作者的核心问题:在统一的规划分解下,信息是如何在 MAS 与 SAS 之间流动,并由此决定 MAS 增益何时为正、何时为负?
- 整体含义:将多智能体设计重新表述为信息瓶颈(Information Bottleneck, IB)优化问题,使"何时使用 MAS/如何设计 MAS"具备可被量化、可被预测的理论依据。
2. 方法论:核心思想、关键公式与流程
2.1 SAS 与 MAS 的信息流结构差异
- SAS:在单一共享上下文 中累积全部思维轨迹、动作与观测。
- MAS:由规划器将任务 分解为 ,第 个 worker 持有相互隔离的局部上下文 ,仅通过有界中继消息 与下一 worker 通信。
- 关键观察:当 来自 且与 在给定 下条件独立时,存在如下 Markov 关系:
2.2 无限带宽下的 MAS–SAS 等价
- 定义系统级中继带宽 ,使得每个 relay 的熵满足 。
- Proposition 3.1:在 SAS 上下文轨迹每步熵有限的假设下,当 时,对任意 SAS 都存在一个 MAS 满足 ,即 MAS 可通过传递完整上游上下文完全模拟 SAS。
- 推论:非平凡的 MAS 增益并非源自任务分解本身,而源于有界中继通信带来的压缩。
2.3 中继压缩的信息瓶颈建模
- 中继 IB 目标:在压缩上游信息的同时尽可能保留下游任务相关信息:
- 有效参数 :被解释为由下游 LLM 能力诱导的有效参数——弱模型对噪声更敏感,对应较小 ,倾向更强压缩;强模型能利用富信息,对应较大 ,倾向保留预测信息。
- SAS 对应"无压缩中继"基线 :
2.4 中继信息损失与 MAS 增益分解
- Definition 4.1:中继信息损失
- MAS IB 目标等价改写为:
- Theorem 4.1:MAS 增益分解
- 正向增益条件:,即"上下文缩减"必须超过"能力加权后的信息损失"。
- 下游充分性条件:局部中继充分性 在满足"中介式下游依赖"与"下游上下文无干扰"两个结构性假设时,才能沿 worker 链传播到 。
2.5 实证代理量:中继复杂度
- 定义单步 stage-wise 中继复杂度:
- 用 (充分)、(中等不充分)、(严重不充分)刻画任务的中继结构。
3. 实验设计
3.1 数据集 / 基准
- 共 5 个 agentic benchmark,覆盖不同中继复杂度:
- :ALFWorld(文本家居任务)、WideSearch(结构化信息检索)、TravelPlanner-CS(常识检查)
- :WebShop(电商选择)、TravelPlanner-HC(硬约束)
- :WorkBench(多域办公,需精确中间读结果)
- WideSearch 使用 DuckDuckGo 作为实时搜索后端,其余使用离线环境。
3.2 三种受控原型
- SAS:标准单智能体,单一共享上下文。
- SAS-contextflow:使用与 MAS 相同的 planner 分解与子指令序列,但保持完整共享上下文。
- MAS:相同分解,但各 worker 上下文隔离,仅通过压缩中继 通信。
- 此外设计 SAS-Plan(与 MAS 同子指令但单上下文)用于消融。
3.3 模型规模与能力轴
- 弱:Qwen2.5-7B-Instruct;中:GPT-4o-mini;强:Qwen3.5-27B(AWQ 4-bit 量化)
- 解码统一使用 greedy,温度 。
3.4 对比方法
- 主体对比:MAS vs. SAS-contextflow vs. SAS,用于分离分解结构与中继压缩两类效应。
- 消融:SAS-Plan 对比分解结构贡献;刻意损毁中继信息的实验验证 的因果性。
4. 资源与算力
- Qwen2.5-7B-Instruct:在 单张 NVIDIA RTX A6000 GPU 上以 bfloat16 通过 vLLM 本地部署。
- Qwen3.5-27B-AWQ-4bit:在 单张 NVIDIA RTX A6000 GPU 上通过 vLLM + AWQ 4-bit 量化部署。
- GPT-4o-mini:通过 OpenAI Chat Completions API 调用。
- 论文未单独列出训练时长、GPU 数量、训练算力等指标(本研究不涉及模型训练,仅为推理与提示工程),也未给出总推理成本;这是论文的明显缺失信息之一。
- 评估设定了统一的步预算(如 ALFWorld 50、WebShop 60、WorkBench 50、WideSearch 30、TravelPlanner 60)。
5. 实验数量与充分性
- 18 项受控对比(Table 2:6 条任务/指标 × 3 模型)+ 详细主结果表(Table 6–10),合计约 5(基准)× 3(模型)× 3(原型)= 45 项核心评估点。
- 两项消融:
- Table 3:SAS vs. SAS-Plan(3 任务 × 3 模型),验证"分离分解与上下文隔离"。
- Table 4:ALFWorld + WebShop × 3 模型的"充分中继 vs. 人为不充分中继",验证 的因果效应。
- 两项案例研究:TravelPlanner
tp_1( 引致 MAS 增益反转)、WorkBenchmulti_domain_165(跨 的中继损失主导)。 - 充分性评估:
- 覆盖了三种中继复杂度(, , )× 三档能力梯度,能直接读出交互效应;
- 三种原型(同分解同预算)严格分离了分解与中继的作用,实验设计严谨;
- 不足:基线数量较少(无 SOTA 多智能体框架作对照,如 MetaGPT、AutoGen、ChatDev)、未做超参数敏感性扫描、未报告统计显著性(多次运行均值/方差)。
6. 主要结论与发现
- 统一的增益分解:MAS 增益 ;同一中继可同时对弱模型有利、对强模型有害。
- 区域(ALFWorld、WideSearch、TravelPlanner-CS):MAS 在三个模型上一致地超过 SAS-contextflow(+0.011 至 +0.194),且增益随模型增强而缩小。
- 区域(WebShop、TravelPlanner-HC):增益随能力提升由正转负,强模型(Qwen3.5-27B)反而偏好完整上下文。
- 区域(WorkBench):三类模型相对 SAS-contextflow 全为负(−0.005、−0.086、−0.014),严重的中继信息损失主导代价。
- 分解单独不足以带来增益:SAS-Plan 在多数任务上低于 SAS,证明上下文隔离(而非分解结构)是 MAS 优势的核心机制。
- 中继信息损失具有因果效应:刻意删除中继中下游所需字段,会一致降低所有模型性能,验证 是真实代价项而非纯描述量。
- 设计准则:MAS 设计应被视作 IB 优化——尽量移除与下游无关的上游信息、保留下游相关信息;自然的下一步是自适应中继,使 与异构 agent 团队能力相匹配。
7. 优点
- 理论一致性:从无限带宽等价命题出发,把"什么时候 MAS 帮助"压缩为单一不等式 ,理论简洁且可解释。
- 实验设计的"可分离性":通过 SAS-contextflow 与 SAS-Plan 的对照,把"分解"与"中继压缩"两个常被混淆的因素干净地拆开。
- 覆盖梯度合理:5 基准 × 3 模型覆盖了 与能力两个维度,并通过案例研究补充机制性解释。
- 工程细节完备:附录给出全部原型 prompt(附录 D)、每基准预算(Table 5)、总步数对齐,保证对比公平。
- 因果验证:使用"人为删除中继内容"的反事实实验,强化了对 的因果解释。
8. 不足与局限
- 与 仅为定性参数:作者明确承认为"定性能力/任务参数",未给出可计算的估计量,因此理论无法直接用于预测具体性能,仅可作趋势性解释。
- 与既有 MAS 框架缺少对照:未与 MetaGPT、AutoGen、ChatDev、AgentVerse 等成熟多智能体框架做对比,难以判断在开放任务上该 IB 视角是否仍成立。
- 缺少统计显著性检验与多次运行方差:单次 greedy 解码结果,未给出置信区间或多次实验的标准差,难以评估小幅度差距是否可靠。
- 算力与成本披露不足:仅列出本地推理所用单卡 A6000,未提供 API 调用规模、总推理 token 数、端到端成本。
- 任务范围受限:基准均为中等规模受控 agentic 任务,对超长上下文、多工具链、强开放性的真实场景适用性尚未验证;附录中 TravelPlanner 的 MAS 在强模型下 HC 失败(−0.233)说明对强模型更优替代方案仍待设计。
- 等价只在无限带宽下成立:实际推理 token 预算受限时,该等价仅作为参考基准,并非真实上界;论文未量化"近似无压缩"所需 token 量。
- 缺乏对"自适应中继"的实证:结论中建议联合优化 relay encoder(学习 、适配 ),但论文并未给出相应实现或对照结果。
- 变量混淆风险:在 SAS-contextflow 中"完整上下文"包含原始任务指令、规划器分解与所有历史步骤,可能天然使长上下文模型受益,从而轻微高估 SAS-contextflow 的能力,需谨慎解读。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。


