arXiv 2607.06157v1 · 发布 2026-07-07

用于协商协作的LLM智能体:部分可观测下的联合决策研究

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

AUTHORS Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu
EVIDENCE 部分可观测下多智能体协同联合决策研究
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-13 21:48:29 UTC

📝 TLDR

研究在部分可观测条件下LLM智能体的协商协作能力。针对现有协作多智能体研究缺乏对协商过程的系统评估,本文形式化协商协作为部分可观测合作式联合决策问题,并提出可扩展基准。实验发现,即使借助数学工具,SOTA语言模型在信息对齐协商或复杂推理决策环节仍可能失败;但协商也带来反思与纠错机会,有时优于集中式基线。该工作为LLM协商协作智能体的评估与改进奠定基础。

🧭 速览

动机

现有LLM多智能体协作研究缺乏对协商过程在部分可观测条件下的系统评测。

方法

形式化协商协作为部分可观测合作式联合决策问题,构建多任务多域可扩展基准并系统评测多种代表性LLM。

结果

复杂协商协作任务仍对SOTA语言模型构成挑战,可能在信息对齐或推理决策环节失败。

结论

协商过程可提供反思纠错机会,部分场景优于集中式基线,为相关研究建立评测基础。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

这篇论文系统研究了大型语言模型智能体在部分可观测条件下的协商协作能力。研究者将协商协作形式化为一个协作式联合决策问题,并构建了可扩展的评估基准。实验表明,即使是当前最先进的语言模型,在协商过程中的信息对齐或决策时的复杂推理环节仍可能失败;但协商本身也提供了反思与纠错的机会,在某些场景下能使性能超越集中式基线。

研究背景与动机

协商是人类协作中自然而然发生的事情。当两个人共同完成一项任务时,他们需要交流信息、对齐理解、消除分歧,最终达成共识。这种看似简单的行为背后,实际上涉及复杂的推理过程:我们需要理解对方知道什么、不知道什么,同时清晰地表达自己的想法,并在必要时调整自己的观点。

然而,现有的多智能体系统研究中,对于协商过程的关注远远不足。大多数研究要么假设智能体拥有完备信息,要么将协作简化为任务分配与执行,而忽视了智能体之间通过对话交换信息、对齐认知这一关键环节。这种忽视导致了两个问题:一是缺乏对协商能力本身的系统评估,二是难以理解为什么某些协作任务中智能体会失败。

这篇论文的切入点正是填补这一空白。研究者注意到,现实世界中的协作决策往往是[[部分可观测]]的——每个参与者只能看到全局的一部分信息;而且这些观测通常是不对称的——不同的人掌握不同的关键细节。在这种情况下,协商不再是可有可无的辅助环节,而是完成任务不可或缺的核心能力。

方法

论文首先从形式化的角度定义了什么是一个好的协商协作问题。研究者将其描述为:多个智能体各自拥有独立的私有信息,它们必须通过[[协商]]过程交换必要的信息,最终做出一个对所有智能体都有利的联合决策。这个决策的奖励是共享的——要么大家一起成功,要么大家一起失败。

这种设定与传统的[[多智能体强化学习]]场景有显著区别。传统方法通常假设智能体可以通过某种协议直接共享信息,或者假设存在一个中心化的控制器可以协调所有行为。而这篇论文关注的是更贴近人类协作的模式:智能体必须主动决定说什么、问什么、如何解释对方的回复,以及如何在信息不完整的情况下做出最佳判断。

为了将这个框架实例化为可评估的任务,研究者构建了一个可扩展的[[benchmark]]。这个基准覆盖了多个任务设置和领域,每个任务都经过精心设计,确保满足以下条件:信息的不对称分布是任务成功的必要条件,智能体必须通过协商才能获取做出正确决策所需的全部信息,而且最终决策的质量可以直接量化验证。

在具体实现上,研究者为协商智能体设计了一个参考[[脚手架]](scaffold)。这个脚手架定义了智能体在进行协商时应该遵循的基本流程:接收对方的消息、理解其中包含的信息、更新自己的知识状态、决定下一轮要说什么、以及最终做出决策。每个环节都可能出错——理解可能偏差、更新可能遗漏、决策可能失误——而评估协议需要能够精确诊断失败发生在哪个环节。

实验与结果

研究者选取了多个代表性的大型语言模型进行系统评估,包括不同规模、不同训练方式的模型。评估在设计的benchmark上进行,每个模型都需要完成一系列协商任务,这些任务的难度被精心控制,既有简单的信息传递场景,也有需要复杂推理的决策场景。

实验结果揭示了几个重要发现。首先,复杂的协商协作任务确实对当前最先进的语言模型构成挑战。即使借助外部数学工具的辅助,模型仍可能在两个关键环节失败:一是协商过程中用于对齐信息的环节,比如错误理解对方的意思、遗漏关键信息、或者表述不够清晰导致对方误解;二是决策过程中用于整合信息的推理环节,比如在收到所有必要信息后仍然做出错误判断。

这个发现本身并不令人惊讶,但它的意义在于精确诊断了失败的位置。研究者发现,失败往往不是全面的——一个模型可能在某些任务上表现良好,在另一些任务上却栽跟头;即使在同一个任务中,协商阶段的失败和决策阶段的失败也可能独立发生。这意味着改进方向应该是多元的:既需要提升协商沟通的能力,也需要增强复杂推理的能力。

另一方面,诊断分析也揭示了协商过程的价值。尽管协商可能引入失败的风险,但它同时也提供了传统集中式系统不具备的机会:反思和纠错。当智能体需要向对方解释自己的想法时,它被迫审视自己的推理链条;当收到对方的反馈时,它有机会发现自己的盲点。这种对话式的交互有时能够帮助模型发现和修正单独决策时会被忽略的错误。

值得注意的是,在某些任务设置下,经过良好协商的智能体其性能能够超越集中式基线。这暗示着,当任务本身就具有信息不对称的结构时,让每个智能体专注于自己拥有的信息、通过协商汇总,比试图让一个系统同时处理所有信息更加高效。

讨论与可借鉴点

这篇论文为理解和改进基于大型语言模型的多智能体系统提供了几个重要启示。

首先,它表明协商能力应该被作为独立的评估维度加以关注。现有评估往往关注最终任务的完成率,而不问智能体是如何达到那个结果的。这种评估方式可能会错过协商过程中的重要缺陷——一个智能体可能恰好通过试错达到了正确答案,而另一个智能体虽然通过严谨的协商得出了同样答案,却被判定为"效率低下"。更全面的评估应该包含对协商过程本身的度量。

其次,研究揭示了即使是强大的语言模型,在需要精确信息交换的场景中仍然脆弱。这提示我们在构建真实世界的多智能体系统时,不能假设智能体之间的通信是可靠的。需要设计冗余机制来检测和纠正协商过程中的误解。

最后,论文关于协商带来纠错机会的发现,为混合式架构提供了依据。让多个专业化的智能体各自处理自己擅长的信息类型,通过标准化的协商接口进行协作,可能是比训练一个"全能型"智能体更可行的路径。

当然,这项工作也存在局限。benchmark的规模和多樣性还有提升空间,更复杂的真实世界协商场景(如涉及多方利益冲突的情况)尚未被覆盖。未来的研究可以在这些方向继续探索。

摘要

协商在协作中起着至关重要的作用;当人类共同工作时,他们自然会进行交流以对齐信息并达成共识。在本文中,我们研究部分可观测联合决策任务下的协商型大语言模型(LLM)智能体。我们将协商协作形式化为一个具有部分且不对称观测的协作式联合决策问题,并引入一个可扩展的基准,该基准在多个任务设置和领域中将该问题实例化,在这些设置和领域中,智能体必须通过协商交换信息以达成具有共享奖励的联合决策。然后,我们为协商智能体实例化一个参考脚手架与评估协议,并对一系列代表性LLM进行系统评估。结果表明,复杂的协商协作任务仍然对最先进的语言模型构成挑战。即使借助外部数学工具的辅助,语言模型仍可能在用于对齐信息的协商过程中,或在用于做出决策的复杂推理过程中失败。另一方面,诊断分析表明,协商过程也可能提供反思和纠错的机会,有时能使其性能超越集中式基线。总体而言,我们的工作为评估和改进协商协作中的LLM智能体奠定了基础,并提供了对当前基于LLM的多智能体系统的优势、局限与特性的洞见。

Abstract

Deliberation plays a crucial role in collaboration; when humans work together, they naturally engage in communication to align information and reach an agreement. In this paper, we investigate deliberative large language model (LLM) agents under partially observable joint decision-making tasks. We formalize deliberative collaboration as a cooperative joint decision problem with partial and asymmetric observations, and introduce a scalable benchmark that instantiates this problem across multiple task settings and domains in which agents must exchange information through deliberation to reach a joint decision with a shared reward. We then instantiate a reference scaffold and evaluation protocol for deliberative agents and conduct a systematic evaluation of a range of representative LLMs. The results reveal that complex deliberative collaboration tasks continue to challenge state-of-the-art language models. Even with the aid of external mathematical tools, language models may fail in either the deliberation process for aligning information or the complex reasoning process for making the decision. On the other hand, diagnostic analysis reveals that the deliberation process may also provide opportunities for reflection and error correction, sometimes improving performance over centralized baselines. Altogether, our work establishes a foundation for evaluating and improving LLM agents in deliberative collaboration and provides insights into the strengths, limitations, and properties of current LLM-based multi-agent systems.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记