Mosaic:运行时高效的多智能体具身规划
Mosaic: Runtime-Efficient Multi-Agent Embodied Planning
📝 TLDR
Mosaic通过以智能体为中心的语义记忆与整数线性规划协调,显著降低多智能体具身规划延迟与失败动作。
🧭 速览
基于LLM的多智能体具身规划因执行延迟过高难以实用,失败动作是核心瓶颈,根源在于部分可观测下状态追踪不准与多智能体协同低效。
Mosaic框架以智能体为中心的语义记忆存储相对坐标实现轻量级几何变换,并通过整数线性规划在每步分配动作以强制物理可行性与协同约束。
在AI2-THOR与搜救基准上,Mosaic执行速度提升27%–32%,LLM调用减少30%–33%,完成任务步数减少25%–31%,成功率提升4–10个百分点。
高效记忆机制与约束引导的协同策略是大规模低延迟多智能体规划的关键,二者对性能提升具有决定性作用。
📊 论文图表(共 14 张)
展开查看 14 张图
TL;DR
Mosaic 是一个运行时高效的多智能体具身规划框架,通过以智能体为中心的语义记忆解决状态跟踪不准确的问题,并借助[[整数线性规划]]在每个规划步骤分配动作以实现高效协调。在 AI2-THOR 与搜索救援基准上的实验表明,该方法将执行速度提升 27–32%,同时将成功率提高 4–10 个百分点,为大规模多智能体系统的低延迟规划提供了可行方案。
研究背景与动机
现实世界中许多任务——协同搜索救援、家庭物品整理、环境探索——都需要多个智能体在共享空间中同时运作。相比单一智能体,多智能体系统能够并行化子任务、覆盖更大区域,并在某智能体发生故障时从局部失败中恢复,从而实现更快、更鲁棒的任务完成。近年来,[[大语言模型]](LLM)作为多智能体环境中的规划器展现出强大的推理时泛化能力,能够处理非结构化任务与跨领域场景。然而,LLM 驱动的多智能体规划在实际应用中仍面临严峻挑战:执行延迟过高,难以满足真实部署的需求。
研究者在实验中发现,当前最先进的 LLM 多智能体系统在完成简单具身任务(如“关闭水龙头并关灯”)时需要约 7.2 分钟,而更复杂的任务(如“从火灾区域救出两人”)在简化模拟环境中也需要 10.5 分钟。深入分析运行时开销后,论文将失败动作识别为主要的性能瓶颈。实验数据显示,智能体在高达 16–51% 的规划步骤中执行了失败动作,这些失败会触发重规划、恢复或冗余探索,从而以两种关键方式增加延迟:其一,失败动作消耗执行时间却不推进任务完成;其二,失败会引发连锁延迟,导致其他智能体停滞等待或执行空操作,造成严重的资源闲置。
失败动作的根源可归结为两个核心挑战。第一个挑战是[[部分可观测性]]下的状态跟踪不准确:每个智能体只能感知其局部视野范围内的信息,难以获得环境的全局准确状态。当智能体基于不准确的空间估计制定规划时,往往会尝试到达不可达的目标或执行违反前提条件的动作。第二个挑战是协调效率低下:缺乏有效机制的智能体可能同时执行冲突或冗余的动作,导致资源浪费和执行混乱。这两个挑战相互交织,共同造成了当前系统在资源受限或时间敏感场景中的不可用状态。
方法
针对上述两个核心挑战,Mosaic 采用了双管齐下的解决思路:语义记忆保证准确而轻量的状态跟踪,[[整数线性规划]]确保高效协调的动作分配。
以智能体为中心的语义记忆是 Mosaic 状态跟踪的核心组件。传统方法通常维护一个全局共享的世界模型,但这种方法在多智能体场景下面临同步开销大、信息冗余等问题。Mosaic 采用了以每个智能体为中心的记忆架构,每个智能体维护自己的语义记忆,记忆中的物体以相对坐标存储。这种设计的优势在于:相对坐标天然支持几何变换,当智能体移动或旋转时,只需对记忆中的坐标进行相应的坐标变换即可,无需重新查询全局状态。同时,相对坐标表示使得不同智能体的记忆可以方便地进行对齐与融合,从而支持智能体间的协调。
语义记忆的内容包含环境中物体的空间位置、属性以及它们之间的关系。例如,当智能体 A 看到一张桌子时,它会在记忆中记录“桌子在我的右前方 2 米处”,而不是记录绝对的笛卡尔坐标。当智能体 B 需要与 A 协调时,B 可以将其感知到的信息转换为与 A 视角一致的相对坐标,从而判断两者看到的是否为同一物体,或者判断是否存在空间冲突。这种表示方式既保证了状态跟踪的准确性,又保持了记忆的轻量性,避免了存储完整全局状态的开销。
整数线性规划动作分配是 Mosaic 协调机制的核心。在每个规划步骤,系统需要决定每个智能体应该执行什么动作。直接让每个智能体独立规划虽然简单,但容易产生冲突动作(如两个智能体同时尝试拿起同一物体)或冗余动作(如多个智能体前往同一位置搜索)。Mosaic 将动作分配问题形式化为一个[[整数线性规划]]优化问题,在每个规划步骤求解最优的动作分配方案。
具体而言,动作分配问题包含物理可行性约束和协调约束两类约束。物理可行性约束确保每个智能体的动作满足环境中的物理规律,例如:如果智能体当前手持一个物体,它就不能再拿起另一个物体;智能体不能穿过墙壁等障碍物。协调约束则保证智能体之间的动作不会产生冲突或过度冗余,例如:同一时刻只有一个智能体可以操作某个物体;如果多个智能体需要前往同一区域,系统会分配它们以不同路径或顺序到达。通过将这些约束显式地编码到优化问题中,ILP 求解器能够自动搜索满足所有约束的动作组合,并选择使得预期任务进度最大化的方案。这种基于优化的协调方式相比启发式规则或简单的通信协议具有更强的全局最优性保证。
实验与结果
论文在两个广泛使用的基准上评估 Mosaic:AI2-THOR(家庭环境中的具身任务)和搜索救援模拟环境。实验对比了 Mosaic 与多个基线方法,包括直接使用 LLM 进行多智能体规划的系统以及现有最先进的协同规划框架。
主要实验结果呈现出全面提升的态势。在执行速度方面,Mosaic 相比基线方法实现了 27–32% 的提升,这一改进直接源于失败动作数量的减少——当智能体能够准确感知环境状态并协调行动时,它们不再花费时间尝试不可行的动作或从冲突中恢复。LLM 调用次数减少了 30–33%,表明语义记忆有效减少了对语言模型的查询需求,因为智能体可以通过记忆中的信息进行推理而不必每次都向 LLM 请求指导。规划步骤减少 25–31% 则反映了协调效率的改善:避免了冗余和冲突动作后,完成任务所需的步骤自然减少。
最关键的是成功率指标:Mosaic 将任务成功率提高了 4–10 个百分点。这一提升具有重要意义,因为它表明改善延迟并不以牺牲任务完成质量为代价。事实上,由于失败动作被有效压制,系统能够更稳定地执行规划,最终完成任务的成功率反而更高。消融实验进一步揭示了各组件的贡献:以智能体为中心的语义记忆主要减少了对不可达目标的尝试,而 ILP 协调主要消除了冲突和冗余动作,两者的结合产生了超越各自独立贡献的协同效果。
讨论与可借鉴点
Mosaic 的成功揭示了一个重要洞见:对于多智能体具身规划,状态跟踪的准确性与协调机制的效率是相互依赖的两个维度。粗糙的状态估计会导致大量失败动作,即使协调机制再精巧也无法弥补;反之,缺乏有效协调的系统会浪费大量资源在冗余和冲突上,即使每个智能体的局部规划都正确也无法高效完成任务。Mosaic 通过将语义记忆与 ILP 优化相结合,同时在两个维度上发力,为这一领域提供了一种可扩展的设计思路。
论文也坦诚地指出了当前方法的局限。首先,语义记忆依赖相对坐标表示,对于需要精确全局定位的任务(如在大型开放空间中的精确导航)可能存在累积误差问题。其次,ILP 求解虽然能够保证全局最优性,但对于大规模智能体群体,计算开销可能成为新的瓶颈。论文提及未来工作可以探索分层规划或近似算法来应对可扩展性挑战。此外,当前的 ILP 约束是预定义的,如何让系统能够根据任务需求动态学习或调整约束也是一个值得探索的方向。
对于更广泛的多智能体系统研究,Mosaic 的贡献在于示范了一种“约束引导协调”的设计范式。与其依赖复杂的通信协议或昂贵的学习方法,不如将问题结构化为带约束的优化问题,让求解器在满足物理可行性和协调约束的前提下自动搜索最优方案。这种思路可以迁移到其他需要多实体协调的场景,如自动驾驶车队协调、工业机器人协同装配等。
摘要
基于大语言模型的多智能体具身规划由于执行延迟过高而始终难以实用。我们将失败动作识别为主导瓶颈,其根源在于两个核心挑战:在部分可观测性下不准确的状态跟踪,以及低效的协调所导致的冗余或冲突动作。我们提出了 Mosaic,一个运行时高效的多智能体规划框架,用以同时应对上述两个挑战。Mosaic 通过以智能体为中心的语义记忆来保持准确而轻量的状态跟踪,该记忆以相对坐标存储物体,从而支持几何变换与协调。它还借助整数线性规划在每个规划步骤分配动作,强制施加物理可行性约束与智能体间的协调约束,从而保证高效协调。在 AI2-THOR 与搜索救援基准上,Mosaic 实现了执行速度提升 27–32%、大语言模型调用次数减少 30–33%、规划步骤减少 25–31%,以及成功率提高 4–10 个百分点。这些结果表明,高效的记忆与约束引导的协调对于可扩展、低延迟的多智能体规划至关重要。
Abstract
LLM-based multi-agent embodied planning re-mains impractical due to prohibitively high ex-ecution latency. We identify failed actions as the dominant bottleneck, stemming from two core challenges: inaccurate state tracking un-der partial observability and inefficient coordi-nation that produces redundant or conflicting ac-tions. We introduce M OSAIC , a runtime-efficient multi-agent planning framework that addresses both challenges. M OSAIC maintains accurate yet lightweight state tracking through agent-centric semantic memory that stores objects in rela-tive coordinates, enabling geometric transforma-tions and coordination. It ensures efficient co-ordination through Integer Linear Programming that allocates actions at every planning step, en-forcing physical feasibility and inter-agent co-ordination constraints. Across AI2-THOR and search-and-rescue benchmarks, M OSAIC achieves 27–32% faster execution, 30–33% fewer LLM calls, 25–31% fewer steps, and 4–10% points higher success rates. These results demonstrate that efficient memory and constraint-guided co-ordination are critical for scalable, low-latency multi-agent planning. ## 1. Introduction Many real-world embodied tasks such as collaborative search and rescue, household rearrangement, and environ-mental exploration require multiple agents (physical or sim-ulated entities executing coordinated plans or policies) op-erating simultaneously in shared spaces (Liu et al., 2024; Qian et al., 2025; Skrynnik et al., 2024; Chen et al., 2024). Leveraging multiple agents offers clear advantages: they can parallelize subtasks, cover larger areas, and recover from lo- > ∗ Partial work completed during an internship at Adobe. > 1 College of Information and Computer Sciences, University of Massachusetts, Amherst 2Adobe, San Jose. Correspondence to: Kunjal Panchal <kpanchal@umass.edu >. Proceedings of the 43 rd International Conference on Machine Learning , Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s). cal failures (Qian et al., 2025; Nayak et al., 2024), leading to faster and more robust task completion compared to single-agent systems. Recent works have explored the use of Large Language Models (LLMs) as planners in such multi-agent environments, demonstrating impressive inference-time gen-eralization across unstructured tasks and domains (Zhang et al., 2025e; Bai et al., 2025). In this paradigm, LLMs generate action sequences for each agent, while the agents execute these planned actions in the environment. However, practical deployment of LLM-driven multi-agent planning remains limited due to prohibitively high latency, which include both physical action execution time and LLM inference overhead. For example, running a state-of-the-art multi-agent system (Nayak et al., 2024) to solve a sim-ple embodied task such as “Turn off the faucet and light” requires approximately 7.2 minutes to complete. More com-plex tasks such as “Rescue two people from a fire-affected area” in a simplified simulation environment require 10.5 minutes to complete. We find that a substantial portion of the runtime is spent on failed actions during execution, which trigger replanning, recovery, or redundant exploration. Figure 1 illustrates a sequence of such failed actions in a rescue scenario: Agent B repeatedly fails to navigate to a person due to spatial rea-soning errors (steps 1–2), then violates action preconditions by attempting to carry the person while holding debris (step 4), while Agent A remains idle waiting for coordination (steps 2–3, 5). In our preliminary experiments on state-of-the-art LLM-based multi-agent systems for embodied plan-ning (Nayak et al., 2024; Zhang et al., 2023b), agents spent up to 16–51% of planning steps on failed actions, frequently attempting unreachable goals due to incorrect spatial esti-mates or poor coordination. Failed actions increase runtime latency in two critical ways: (a) they consume execution time without contributing to task completion, as agents must retry or replan after each failure; and (b) they cause cascad-ing delays, forcing other agents to stall or execute no-ops while waiting for failed actions to resolve, leading to severe underutilization (as shown in Agent A’s idle periods in Fig-ure 1). As a result, current systems remain impractical for resource-constrained or time-critical applications, requiring up to 9 minutes per episode for tasks such as search and rescue, and 15.6 minutes for fast-paced household activities.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。













