arXiv 2607.09330v1 · 发布 2026-07-13

异构LLM具身智能体在算力网络中的通信高效数字孪生协同

Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks

AUTHORS Yang, Nuocheng, Wang, Sihua, Chen, Zihan, Quek, Tony Q. S., Yin, Changchuan
EVIDENCE LLM智能体数字孪生协同,通信高效
SCORE 0.8
CATEGORIES TASK mas
GENERATED 2026-07-20 02:29:20 UTC

📝 TLDR

在算力网络上为异构LLM具身智能体提出通信高效数字孪生协同框架,降低通信开销。

🧭 速览

动机

异构LLM具身智能体团队协作面临通信开销随规模激增、能力受限于模型异构性、迭代协商引入动作延迟三重耦合难题,现有自然语言对话框架难以适配受限网络资源。

方法

提出LDT-Coord网络化协调框架,智能体向轻量数字孪生上报动作与共享资源时序约束,DT以免训练规则编排器消解冲突,上报控制建模为约束部分可观马尔可夫决策过程。

结果

该框架将协调性能与语言推理能力解耦,有效降低多轮协商延迟与异构能力瓶颈,C-POMDP决策机制压缩上报通信量,提升受限网络下大规模团队协作吞吐。

结论

LDT-Coord为算力网络下异构LLM具身智能体协同提供了通信高效、能力解耦的轻量化数字孪生协调范式。

📊 论文图表(共 6 张)

展开查看 6 张图

TL;DR

本文针对异构大语言模型驱动的多智能体协同系统,提出了一种基于轻量级数字孪生的通信高效协同框架 LDT-Coord。该框架通过将动作决策与时间约束上报至数字孪生服务器进行集中编排,将协同性能与各智能体的语言推理能力解耦,同时将通信控制建模为约束部分可观测马尔可夫决策过程并用 PPO-Lagrangian 算法求解,在保持任务成功率的前提下,将通信开销降低了超过 70 倍。

研究背景与动机

随着大语言模型技术的快速发展,由异构 LLM 驱动的具身智能体正在智能工厂、仓储物流、服务机器人等物理人工智能场景中得到广泛应用。这类智能体团队需要相互协作来完成复杂任务,例如在自动化仓库中协调多个机器人完成货物分拣与搬运,或在智能工厂中协调多个机械臂协同装配零部件。

然而,要让这些装备了不同能力水平大语言模型的智能体有效协同,面临三个相互耦合的核心挑战。第一个挑战是通信开销问题:当智能体数量增加时,它们之间用于协商的多轮自然语言对话会产生大量的网络流量,这在算力网络资源有限的场景下会成为严重瓶颈。第二个挑战是 LLM 异构性问题:团队中各智能体的语言理解、推理和规划能力参差不齐,这直接制约了协同质量的“天花板”——当某个能力较弱的智能体无法准确理解协作意图时,整个团队的协调效果都会受到影响。第三个挑战是动作延迟问题:现有的多轮迭代协商机制虽然能够实现较高质量的协同,但每次协商都需要等待各方响应,这种往返延迟可能导致智能体错失最佳动作执行时机。

这三个挑战之间存在微妙的耦合关系:为了追求更好的协同质量,智能体需要进行更频繁、更深入的对话,但这会进一步加剧通信开销;而为了控制开销而减少通信频次,又可能导致协同决策不够完善。因此,论文认为需要一种全新的协同范式,从根本上将协同质量与自然语言推理能力解耦开来。

方法

LDT-Coord 的核心思想是引入一个轻量级的[[数字孪生]]服务器作为协同中枢,将原本分散在各智能体之间的协商过程集中化处理。具体而言,每个智能体不再需要与团队中的其他智能体进行自然语言对话,而是独立地选择其意图执行的动作,然后将该动作决策连同对共享资源的时间约束一起上报给数字孪生服务器。

这里的时间约束是 LDT-Coord 设计的一个关键创新点。在传统的多智能体协同中,智能体需要用自然语言描述自己的计划、解释自己的意图,这要求各智能体具备较强的语言生成和理解能力。而在 LDT-Coord 中,智能体只需提供结构化的时间约束——比如“该动作需要在时刻 T 之前完成”或“这个资源的使用窗口是 [T₁, T₂]”——这种结构化的信息表示不依赖于任何特定的自然语言能力,从而实现了协同性能与 LLM 异构性的解耦。

数字孪生服务器接收到所有智能体的上报信息后,会执行一个无需训练的基于规则的编排算法。这个算法的核心任务是检测并解决跨智能体的资源冲突。例如,如果两个智能体都意图在同一时间段使用同一个机械臂,数字孪生会根据预设的优先级规则或公平性原则,为其中一个智能体重新安排执行时间或分配替代资源。由于这个编排过程完全基于规则执行,不涉及任何机器学习模型的推理,因此计算效率极高,能够在毫秒级时间内完成决策并向各智能体返回协调指令。

为了进一步降低通信开销,论文还将智能体的上报控制问题建模为[[约束部分可观测马尔可夫决策过程]](C-POMDP)。在这个问题模型中,每个智能体需要在通信开销与协同效果之间做出权衡:频繁上报能够获得更及时的协调指令,但也消耗更多网络资源;减少上报频次可以节省带宽,但可能导致冲突未被及时发现而引发更大的损失。论文采用 PPO-Lagrangian 算法来求解这个 C-POMDP,该算法结合了策略梯度方法的探索能力和拉格朗日乘子法对约束条件的处理,能够在满足通信预算约束的前提下,最大化任务成功的期望回报。

整个 LDT-Coord 框架的工作流程可以概括为:首先,各智能体基于自身感知独立决策动作并生成时间约束;然后,智能体根据 C-POMDP 策略决定何时以及是否向数字孪生上报决策;接着,数字孪生服务器快速执行冲突检测与编排算法;最后,各智能体接收协调指令并执行最终的动作。

实验与结果

论文通过仿真实验对 LDT-Coord 进行了全面评估。实验构建了一个包含多个异构智能体的协同任务场景,这些智能体装备了不同规模、不同能力水平的大语言模型,模拟了真实世界中团队成员能力差异的情况。基线方法包括传统的多轮对话协同方案以及几种基于规则的协同方法。

实验结果显示,LDT-Coord 在任务成功率指标上与传统的多轮对话协同方法表现相当,这证明了基于数字孪生的集中编排方案能够有效替代分布式的自然语言协商。与此同时,LDT-Coord 的通信开销相比传统方法降低了超过 70 倍,这一惊人数字主要得益于两个方面的优化:一是智能体之间不再需要进行冗长的自然语言对话,而是上报简洁的结构化决策信息;二是 C-POMDP 上报控制策略能够智能地选择上报时机,避免了不必要的通信。

特别值得注意的是,LDT-Coord 在 LLM 异构条件下展现出良好的鲁棒性。当团队中混入能力较弱的智能体时,传统方法的协同质量会出现明显下降,因为那些较弱的智能体无法准确理解和表达复杂的协作意图;而 LDT-Coord 由于将协同逻辑完全转移到数字孪生服务器执行,各智能体只需提供格式正确的结构化数据,因此不受 LLM 异构性的影响。

讨论与可借鉴点

LDT-Coord 的设计思路为多智能体协同研究提供了有价值的启发。首先,通过引入数字孪生作为协同中枢,将决策能力集中化,能够有效规避分布式协商带来的通信爆炸问题,这种中心化的轻量协调思路值得在其他类似场景中借鉴。其次,将协同性能与具体实现技术解耦的设计原则非常关键——当协同质量不再依赖于某个特定模型的能力时,整个系统对技术演进的适应性会大大增强。

然而,LDT-Coord 也存在一些局限性。基于规则的编排算法虽然高效,但灵活性有限,对于复杂的多智能体博弈场景可能难以制定完善的规则来处理所有可能的冲突情况。此外,数字孪生服务器本身成为系统中的单点,如果服务器发生故障或网络分区,整个协同过程将陷入瘫痪。未来工作可以考虑将部分编排逻辑分布式化,或引入容错机制来增强系统的鲁棒性。

摘要

由异构大语言模型(LLM)驱动的具身智能体团队正被广泛应用于智能工厂、仓储与服务机器人等物理人工智能场景。为了在该智能体团队内部实现协作,需要在有限网络资源下可靠运行的、高效的协同机制。然而,现有依赖多轮自然语言对话的异构LLM智能体协同框架带来了三个相互耦合的挑战。其一,智能体之间的对话所产生的通信开销随团队规模迅速增长。其二,协同质量受限于智能体团队中各LLM异构的能力。其三,由于迭代式协商,智能体可能面临动作延迟。为应对上述挑战,我们提出LDT-Coord,一个基于轻量级数字孪生(DT)的网络化协同框架。具体而言,每个智能体独立地选取其意图执行的动作,并将该动作决策以及对共享资源的结构化时间约束上报至DT服务器,从而将协同性能与自然语言推理能力解耦。随后,DT执行一种无需训练、基于规则的编排算法以解决跨智能体冲突,并向智能体返回协同指令以避免此类冲突。为进一步降低通信开销,我们将智能体的上报控制建模为约束部分可观测马尔可夫决策过程(C-POMDP),并采用PPO-Lagrangian算法对其求解。仿真结果表明,LDT-Coord在任务成功率上与传统的协同方法相当,同时将通信开销降低超过70倍,并在LLM异构条件下保持良好的鲁棒性。

Abstract

Embodied agent teams powered by heterogeneous large language models (LLMs) are being widely deployed in physical artificial intelligence such as smart factories, warehouses, and service robotics. To enable collaboration among such an agent team, efficient coordination mechanisms that operate reliably under limited network resources are required. However, existing heterogeneous LLM-agent coordination frameworks that rely on multi-round natural-language-based conversations introduce three coupled challenges. First, inter-agent dialogue incurs communication overhead that grows rapidly with team size. Second, the quality of coordination is constrained by the heterogeneous capabilities of the agent team's LLMs. Third, agents may suffer from action delays due to iterative negotiation. To address these challenges, we propose LDT-Coord, a networked coordination framework built upon a lightweight digital twin (DT). Specifically, each agent independently selects its intended action and reports both the action decision and a structured temporal constraint over shared resources to the DT server, thereby decoupling coordination performance from natural-language reasoning ability. Then, DT executes a training-free, rule-based orchestrator algorithm to resolve cross-agent conflicts and returns coordination instructions to prevent such conflicts. To further reduce communication overhead, we formulate agent reporting control as a constrained partially observable Markov decision process (C-POMDP) and solve it with the PPO-Lagrangian algorithm. Simulation results show that LDT-Coord achieves a task success rate comparable to conventional coordination methods while reducing communication overhead by more than 70x and maintaining robustness under LLM heterogeneity.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记