arXiv 2606.28182v1 · 发布 2026-06-26

LLawCo:面向具身多智能体行为建模的合作法则学习

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

AUTHORS Qinhong Zhou, Chuang Gan, Anoop Cherian
EVIDENCE 为具身多智能体学习合作行为法则
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-04 02:37:27 UTC

📝 TLDR

在去中心化、部分可观测环境中,LLM驱动的具身智能体常出现与协作伙伴或环境状态不一致的行为,导致协作效率低下。本文提出LLawCo框架,让智能体通过反思历史失败提炼高层行为法则(如必要时沟通、等待伙伴),并经监督微调融入思维链。同时构建PARTNR-Dialog多智能体通讯协作基准。在PARTNR-Dialog和TDW-MAT上分别取得4.5%和6.8%的平均成功率提升,跨四种骨干LLM均有效。

🧭 速览

动机

现有LLM具身智能体在去中心化协作中行为常与伙伴或环境不一致,造成协作低效和任务失败。

方法

LLawCo让智能体反思失败并提炼高层协作法则,通过监督微调将显式法则注入思维链推理过程。

结果

在PARTNR-Dialog与TDW-MAT基准上,四种骨干LLM平均任务成功率分别提升4.5%和6.8%。

结论

该框架通过学习显式协作法则,实现了智能体与伙伴及任务目标的自主管控和高效协作。

📊 论文图表(共 6 张)

展开查看 6 张图

TL;DR

本文提出 LLawCo(Learning Laws of Cooperation)框架,让去中心化、部分可观测环境中的 LLM 驱动的具身智能体通过反思历史失败经验来自动提炼「必要时应沟通」「应等待合作伙伴」这类高层行为法则,并将其融入[[思维链]]推理过程中,从而使智能体的行为与协作伙伴及环境状态保持对齐。在新构建的 PARTNR-Dialog 多智能体通信协作基准和已有的 TDW-MAT 基准上,该方法在四种骨干 LLM 上分别实现了 4.5%6.8% 的平均成功率提升,验证了合作法则学习这一范式的有效性。

研究背景与动机

在真实世界的许多场景中——例如两台机器人协同搬运物体、多个智能助手共同完成家庭任务——智能体往往运行在去中心化部分可观测的环境中。每个智能体只能看到自己的局部视角,无法直接获知其他智能体的完整意图与当前状态,这就为有效的协作带来了根本性挑战。

近年来,基于[[大语言模型]]的[[具身智能体]]在单智能体任务上取得了显著进展,但将这些能力迁移到多智能体协作场景时却暴露出一个核心问题:智能体的行为常常与协作伙伴不一致,或者与环境实际状态脱节。一个典型例子是,智能体A自信满满地执行了一个动作,却发现智能体B基于完全不同的假设也在行动,两者相互干扰导致任务失败。这种对齐失效并非源于单个智能体的能力不足,而是一种系统性的协作失调。

此前的工作从通信协议设计、信息共享机制等角度做了大量探索,但这些方法往往依赖人工设计的规则或额外的通信开销,缺乏一种让智能体自主发现并内化协作原则的机制。本文正是由此切入:与其手动告诉智能体「什么时候该说话、什么时候该等待」,不如让智能体自己从反复的失败经历中提炼出这类高层行为法则,并让这些法则引导其推理过程。

方法

LLawCo 的核心思想可以概括为「从失败中学习、在推理中践行」,具体分为三个阶段。

第一阶段:轨迹收集与失败识别。 让多智能体在任务环境中进行大量协作尝试,收集完整的交互轨迹,包括每个时间步各智能体观察到的信息、所采取的动作以及最终的任务结果。通过分析失败轨迹,LLawCo 自动识别出那些导致协作失效的关键节点——这些节点往往对应着某种未对齐的行为模式。

第二阶段:行为法则提炼。 这是整个框架最关键的一步。对于每一类识别出的未对齐模式,框架引导 LLM 进行结构化的反思,抽象出高层次的、通用的行为法则。举例来说,如果发现某次失败是因为智能体A在智能体B尚未到达指定位置时就急于行动,系统会提炼出一条法则:「等待合作伙伴到达预定位置后再继续」;如果发现频繁的无效通信导致了时间浪费,则可能提炼出「在必要时才进行通信」这样一条法则。这些法则不是针对某一次具体失败的补救措施,而是能够跨场景复用的协作原则。

第三阶段:融入思维链的监督微调。 提炼出的行为法则需要被真正整合到智能体的推理过程中。LLawCo 将这些法则作为思维链(Chain-of-Thought)的显式组成部分进行[[监督微调]]:在训练时,为每个决策步骤额外提供一个「法则上下文」,模型在学习预测下一步动作的同时,也学习在推理过程中主动参考这些法则。例如,在决定是否发送通信消息时,模型会被引导去思考「根据法则X,我此时是否真的需要通信」。这种设计使得合作法则不再是外部约束,而真正成为模型推理推理管道的有机环节。

整个流程的巧妙之处在于它不需要人工标注合作法则,也不需要为每个新任务重新设计规则——智能体自主完成了从「观察失败」到「形成原则」再到「依原则行动」的闭环。

实验与结果

为了全面评估 LLawCo,本文构建了一个名为 PARTNR-Dialog 的全新基准。该基准基于 PARTNR 环境构建,聚焦于多智能体之间的通信与协作规划,包含多样化的任务场景和交互模式,能够系统性地测试智能体在通信时序、协调策略等方面的表现。

实验选用了四种主流骨干 LLM 作为基础模型,并将 LLawCo 与当前最先进的开源通信智能体框架进行对比。在 PARTNR-Dialog 上,LLawCo 带来了 4.5% 的平均成功率提升;在 TDW-MAT 基准上,提升幅度达到 6.8%。更值得注意的一点是,这两项提升在四种不同的骨干模型上均稳定出现,说明合作法则学习并非依赖特定模型的某些特性,而是一种具有通用性的能力增强方式。

除了端到端的成功率提升之外,论文还进行了消融分析,验证了「反思-提炼-融入」三阶段中每个环节的必要性。例如,仅有反思阶段而无法则提炼,或者仅有法则而未融入思维链,效果都会打折扣。这进一步印证了合作法则作为一种中介表示的关键价值:它足够抽象以捕获通用协作原则,又足够具体以指导具体决策。

讨论与可借鉴点

LLawCo 提出了一条有别于「设计更好的通信协议」或「增大模型规模」的路径来提升多智能体协作效果——即让智能体自主发现协作原则并将其内化为推理习惯。这一思路对整个 [[多智能体系统]] 领域具有直接的启发意义:合作法则作为一种高层抽象,可以作为一种轻量级的、模型无关的协作增强手段嫁接到不同的基础模型上。

当然,这项工作也存在一些局限。首先,法则提炼的质量依赖于失败轨迹的多样性和数量——如果初始协作策略过于贫瘠,智能体可能根本没有足够的失败样本来提炼有效法则。其次,当前的方法聚焦于行为层面的对齐,对于深层意图不一致的问题(例如两个智能体对任务目标本身存在不同理解)的处理能力有待探索。此外,PARTNR-Dialog 基准虽然规模可观,但仍在模拟环境中运行,在真实物理环境中的表现尚需验证。

从更宏观的角度看,这项工作提示我们,在 [[具身智能体]] 研究中,「如何让智能体学会合作」和「如何让智能体理解物理世界」是两个同等重要却长期被分开研究的课题。LLawCo 通过将合作法则纳入思维链的尝试,实际上是在为智能体的社会认知能力提供一种可扩展的训练范式,这或许是未来具身多智能体研究的一个重要方向。

摘要

近年来,在去中心化且部分可观测环境中运行的具身智能体受到了越来越多的关注。然而,现有基于大语言模型(LLM)的智能体常常表现出与协作伙伴不一致或与环境状态不符的行为,导致合作效率低下和任务完成效果不佳。为应对这一挑战,我们提出了一种新颖的框架——合作法则学习(Learning Laws of Cooperation, LLawCo),使具身智能体能够自主地与合作伙伴及任务目标保持对齐。该框架允许智能体反思过去的失败经验,提取未对齐的行为模式,并据此提炼出高层级的行为法则,例如“必要时交流”和“等待合作伙伴”。这些法则通过监督微调被显式地融入智能体的思维链中,使其推理过程与任务需求以及其他智能体的行为保持对齐。为了评估我们的方法,我们引入了 PARTNR-Dialog,这是一个基于 PARTNR 环境构建的大规模多智能体通信与协作规划基准。在现有任务及我们新提出的基准上的实验表明,该方法在协作效率和任务成功率方面均有显著提升。在四种骨干大语言模型上,我们的方法在 PARTNR-Dialog 基准上的平均成功率比当前最先进的开源通信智能体框架提升了 4.5%,在 TDW-MAT 基准上提升了 6.8%。详见 LLawCo 项目页面:https://www.merl.com/research/highlights/LLawCo

Abstract

Embodied agents operating in decentralized and partially observable environments have attracted growing attention in recent years. However, existing large language model (LLM)-based agents often exhibit behaviors that are misaligned with their partners or inconsistent with the environment state, leading to inefficient cooperation and poor task success. To address this challenge, we propose a novel framework, Learning Laws of Cooperation (LLawCo), that enables embodied agents to autonomously align with both their partners and task objectives. Our framework allows agents to reflect on past failures to extract misaligned behavioral patterns, which are used to derive high-level behavioral laws, such as "Talk when necessary" and "Wait for partner." These laws are explicitly incorporated into the agents' chains of thought via supervised fine-tuning, aligning their reasoning with task requirements and the behavior of other agents. To evaluate our approach, we introduce PARTNR-Dialog, a large-scale multi-agent communicative and cooperative planning benchmark built on the PARTNR environment. Experiments on existing tasks and our new benchmark demonstrate significant improvements in cooperative efficiency and task success rates. Across four backbone LLMs, our method achieves average success rate improvements of 4.5% on the PARTNR-Dialog benchmark and 6.8% on the TDW-MAT benchmark over state-of-the-art open-source communicative agent frameworks. See the LLawCo project page for details: https://www.merl.com/research/highlights/LLawCo

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记