当潜在智能体说谎:多智能体LLM协作中的KV-Cache完整性
When Latent Agents Lie: KV-Cache Integrity in Multi-Agent LLM Collaboration
📝 TLDR
多智能体LLM协作中,智能体间传递KV-cache潜状态可提升证据整合效果,但该隐藏状态难以审计,存在被恶意篡改的安全隐患。论文在多智能体问答场景中验证了潜态协作的优势,同时展示了恶意智能体可在文本承诺看似正常的情况下通过篡改KV-cache瓦解最终答案。提出基于HMAC-SHA256的传输清单方案,将智能体、会话、模型、承诺、张量元数据与载荷摘要绑定。实验显示该方案接受全部774条诚实载荷并拒绝全部295条篡改载荷,论证了将KV-cache视为安全敏感对象的必要性。
🧭 速览
多智能体协作中传递KV-cache潜状态可提升效果,但隐藏状态难以检测篡改,构成安全风险。
为KV-cache载荷构造HMAC-SHA256清单,绑定智能体、会话、模型、承诺、张量元数据与摘要。
潜态协作EM/F1达0.338/0.486优于纯文本0.231/0.369;清单方案接受全部774条诚实载荷、拒绝全部295条篡改载荷。
全KV潜态记忆应被视为安全敏感对象,需在传输层保护完整性而非依赖内容检查。
📊 论文图表(共 6 张)
展开查看 6 张图
TL;DR
这篇论文揭示了多智能体 LLM 协作中一个此前未被充分关注的安全漏洞:当智能体之间传递 KV-cache 隐藏状态时,恶意智能体可以在表面文本承诺看起来完全正常的情况下,通过篡改隐藏状态显著降低甚至完全瓦解最终答案的质量。论文在 Qwen3-4B/Qwen3-8B 和 HiddenBench/HotPotQA 数据集上验证了潜态协作在诚实环境下的优势,并展示了多种攻击方式。随后,论文提出基于 HMAC-SHA256 的传输清单方案,将智能体身份、会话、模型、承诺、张量元数据和载荷摘要绑定在一起,实现了对全部 774 条诚实载荷的接受和对全部 295 条篡改载荷的拒绝。核心启示是:完整 KV 的潜在记忆可以是有用的工具,但必须被视作安全敏感对象,而非普通的内部模型状态。
研究背景与动机
多智能体 LLM 系统正在成为处理复杂推理任务的主流范式。在这类架构中,多个专家智能体各自只掌握部分证据,它们需要通过协作向最终的协调器提供信息。传统方式下,智能体之间只传递文本——智能体生成一段文字说明自己的判断,协调器阅读这些文本后做决策。但文本传递存在固有的信息瓶颈:模型的内部激活中蕴含着大量文本无法完整编码的推理线索和中间状态。
正是这种瓶颈催生了「潜态协作」(Latent Collaboration)的思路。一个智能体在发送简短可见消息的同时,可以将自身完整的 KV-cache 状态一并传递给下游模型。KV-cache 记录了模型在处理输入时每一步的键值对,蕴含了远比最终输出文本更丰富的信息——包括注意力分布、中间推理的隐含表征、以及模型在处理特定证据时的内部状态。通过共享这些隐藏状态,多个智能体可以让协调器在更深层次上「看到」各专家处理证据时的思维轨迹,从而做出更明智的综合判断。
论文在多智能体问答场景中验证了这一思路的价值。实验采用 HiddenBench 变换集和 HotPotQA 数据集,让专家智能体各自只看到问题的一部分证据(比如 Wikipedia 条目的部分段落),然后将承诺和 KV-cache 都传给协调器。结果显示,基于 Qwen3-4B 的潜态协作达到了 0.338 的精确匹配率(EM)和 0.486 的 F1 分数,而同等条件下的纯文本协作仅为 0.231 和 0.369,提升幅度相当显著。Qwen3-8B 的实验也呈现相同的改进方向。这些数字表明,KV-cache 潜态共享确实能在诚实协作场景中带来可观的质量增益。
然而,这种协作模式引入了一个此前被忽视的安全盲区:KV-cache 作为模型内部的隐藏状态,难以被直接检视。协调器收到的是经过解码的文本承诺和被序列化传输的 KV 张量,它没有任何可靠手段判断这些张量是否保持了智能体生成时的原始状态。就像一个密封的信封——收信人只能看到信封上写的简短附言,却无法知道信封内真正的信息是否被中途调换过。这个「信封」里装的是模型推理的核心素材,其完整性直接影响最终决策的正确性,但现有的多智能体框架对这一环节缺乏系统性的安全保护。
方法
论文的方法论遵循「先展示价值、再揭示漏洞、最后提出防御」的三段式论证结构。
在潜态协作框架的构建上,论文设计了一个简洁的多智能体问答流程。假设有 个专家智能体 ,每个智能体 接收到问题 和对应的部分证据 。智能体首先在自己的上下文中处理这些输入,生成中间激活状态(即 KV-cache),然后输出一个简短的承诺 ——通常是一句话概括自己的判断或关键发现。协调器 接收所有智能体的文本承诺 以及它们对应的 KV-cache 张量 ,基于这些信息生成最终答案。与纯文本协作的差异在于,协调器不仅能看到「智能体说了什么」,还能在某种程度上「重演」智能体的推理过程。
这个框架的优势在于信息保真度。纯文本协作要求每个智能体将复杂的内部状态压缩为一个离散的文本序列,这个过程必然丢失信息——就像把一幅油画的全部笔触压缩成一句「这幅画很美」。而 KV-cache 传递保留了更多的中间表征,协调器在处理这些状态时可以重新激活原始推理路径上的注意力模式,从而做出更精准的综合判断。
在攻击面的分析上,论文识别出了两条主要路径。第一条是文本层面的操控:恶意智能体生成看似合理但实际上具有误导性的承诺文本。这在纯文本协作中也可能出现,但论文指出,在有 KV-cache 传递的系统中,攻击者可以进一步利用第二条路径——直接篡改隐藏状态。即便承诺文本本身无懈可击,攻击者也可以修改 KV 张量中的某些关键值,使得协调器在处理这些状态时产生错误的注意力分布,进而导向错误的最终答案。这种攻击的隐蔽性在于:协调器看到的是一个「正常」的承诺和一个「正常」的 KV-cache,它没有任何内在依据怀疑后者已被篡改。
论文还探讨了防御的可能性边界。一种直觉上的防御思路是检查 KV 张量的幅值是否在合理范围内——如果某个值被大幅篡改,其绝对值可能会偏离正常分布。实验表明,这种简单的数值检查确实能捕获一些极端的篡改方式。但问题是,自适应攻击者可以设计出「精细化」的篡改策略:在不显著改变张量幅值分布的前提下,精确地调整某些关键位置的值,使得攻击效果依然存在,同时通过幅值检查的筛选。这种攻防博弈揭示了一个根本性的困难:很难从隐藏状态自身的统计特征来判断它是否被篡改,因为「正常」的分布空间非常大,而攻击者可以在这个空间内找到有效的攻击点。
基于这一观察,论文提出了核心的方法论转向:与其猜测隐藏状态是否看起来正常,不如在传输过程中对它进行保护。具体而言,论文设计了一个基于 HMAC-SHA256 的传输清单(manifest)方案。当专家智能体准备发送 KV-cache 时,它生成一份清单,其中包含以下字段的哈希绑定:专家智能体标识 、会话标识 、模型标识 、可见承诺的哈希值 、张量元数据(形状、数据类型等)的哈希值 、以及整个 KV 载荷的摘要 。这些字段拼接后,用一个仅由发送方和接收方共享的密钥 计算 HMAC-SHA256,得到认证标签 。清单被附加在载荷头部一并传输。
接收方在收到清单和载荷后,用相同的密钥重新计算 HMAC 并与收到的标签比对。如果匹配,说明载荷在传输过程中未被篡改;如果不匹配,则拒绝该载荷并触发安全告警。这个设计的核心洞察是:它将对 KV-cache 完整性的信任建立在密钥安全的基础上,而非对张量内容的假设。只要密钥 不泄露,任何对载荷任何部分的篡改都会导致 HMAC 验证失败,因为攻击者无法在不知道密钥的情况下生成有效的认证标签。
实验与结果
论文的实验分为两个主要部分,分别对应潜态协作的优势验证和安全漏洞的实证。
在诚实协作的验证中,论文采用了 HiddenBench 的变换集,测试了 Qwen3-4B 和 Qwen3-8B 两个规模的模型。实验设置了三种条件:仅协调器(无协作)、文本协作(智能体只传递文本承诺)、以及潜态协作(智能体传递文本承诺和 KV-cache)。结果显示,Qwen3-4B 在 HiddenBench 变换集上,文本协作的 EM/F1 为 0.231/0.369,而潜态协作提升至 0.338/0.486,相对提升幅度约为 46% 和 32%。Qwen3-8B 在 HotPotQA 上的实验同样显示潜态协作优于文本协作。这些数字有力地证明了在诚实环境下,KV-cache 潜态共享确实能够带来实质性的性能增益。
安全漏洞的验证则通过构造恶意智能体来完成。论文设计了两种攻击方式:第一种是文本注入攻击,即让恶意智能体生成与证据不符的文本承诺;第二种是 KV-cache 注入攻击,即在保持承诺文本基本正常的前提下,篡改 KV 张量中的关键值。实验测量了不同攻击强度下最终答案的正确率。结果显示,当恶意智能体采用 KV-cache 篡改时,最终答案的 EM 分数可以下降到接近随机水平,而此时文本承诺在人工评估中仍然被判定为「合理」或「可接受」。这直观地说明了 KV-cache 篡改的隐蔽性和破坏力——它可以在不引起文本层面警觉的情况下,完全瓦解协作系统的可靠性。
在防御方案的评估中,论文首先测试了简单的幅值检查,发现其能捕获约 60% 的明显篡改,但对自适应精细攻击的捕获率显著下降。随后,论文评估了 HMAC-SHA256 清单方案的效果。通过收集 774 条诚实传输的载荷(涵盖不同问题、不同智能体、不同模型配置),清单方案在验证阶段全部通过。同时,针对 295 条已记录的篡改载荷(涵盖多种攻击策略),清单方案在验证阶段全部拒绝。这两个数字——100% 的诚实接受率和 100% 的篡改拒绝率——构成了论文防御方案有效性的核心证据。
论文还进行了消融实验,分析清单中各个字段的贡献。结果表明,去除任何字段(如省略承诺哈希或张量元数据)都会削弱方案的安全性,因为攻击者可以只篡改被排除在外的字段而保留清单中的有效标签。完整的绑定设计确保了载荷的每一个组成部分都被纳入认证范围。
讨论与可借鉴点
这篇论文最重要的贡献在于范式层面的提醒:[[多智能体系统]]中的[[KV-cache]]不应被视为普通的内部状态,而应被当作需要完整性保护的敏感对象。长期以来,社区在设计多智能体框架时关注的是如何高效传递信息、如何让协调器更好地整合来自多个智能体的输出,但较少系统性地考虑信息传递通道本身的可信性。KV-cache 作为模型激活的原始记录,其内容远丰富于最终输出的文本,也正因如此,它的篡改空间更大、攻击手段更隐蔽。
从实践角度,HMAC-SHA256 清单方案提供了一种可行的技术路径。它的计算开销相对有限(主要是一次哈希和一次 HMAC 操作),兼容性较好,可以作为多智能体通信协议的扩展模块嵌入现有系统。当然,论文也坦诚地指出了局限:当前方案依赖于预共享密钥 ,在动态加入的智能体场景中需要额外的密钥分发机制;此外,清单方案保护的是传输过程的安全性,而非智能体本地存储的安全性——如果攻击者在智能体生成 KV-cache 之后、本地序列化之前进行篡改,清单方案无能为力。
更广泛地看,这项工作打开了多智能体 LLM 系统安全研究的一个新方向。论文主要在问答场景下验证了攻击和防御的有效性,但类似的攻击向量可能存在于其他任务类型中——代码生成、多步推理、具身智能体等场景都可能涉及智能体间的状态传递,这些场景是否面临同样的风险,值得进一步探索。另外,论文的攻击策略相对直接(篡改张量值),更复杂的攻击——比如在 KV-cache 中嵌入触发器(trigger),使得协调器在特定条件下才产生错误输出——尚未被系统研究。
对于从业者而言,一个直接的可借鉴点是在设计多智能体通信协议时默认启用完整性验证。当前许多系统在智能体之间传递中间状态时没有任何认证机制,这在单可信环境的原型阶段是可以接受的,但一旦部署到开放或多方的场景中,就可能成为被攻击的薄弱环节。论文的工作表明,即使在看似「内部」的通信路径上,也不能假设数据完整性是天然成立的——它需要被显式地保证。
摘要
LLM智能体可以共享的不仅仅是文本。在某些系统中,一个智能体可以发送一条简短的可见消息,同时将其完整的KV-cache状态传递给另一个模型。这种隐藏状态可以帮助最终模型综合来自多个智能体的证据,但也难以检视。可见消息看起来可能无害,即便隐藏状态已被篡改。
我们在多智能体问答设置中研究这一问题。多个专家智能体各自只看到部分证据,发送一个简短的承诺,并将完整KV-cache状态传递给协调器。在干净运行下,这种潜在协作优于匹配的纯文本版本。在基于Qwen3-4B的HiddenBench变换集上,其EM/F1达到0.338/0.486,而文本协作仅为0.231/0.369。Qwen3-8B和HotPotQA上的实验也呈现出相同的改进方向。
问题出现在某个专家智能体是恶意的情况下。某些虚假的可见承诺可以引导答案。更严重的是,改变隐藏的KV状态会显著降低性能,即便可见承诺看起来仍然合理。仅检查文本的验证器会漏掉这种失效模式。简单的幅值检查能捕获一些明显的损坏,但自适应攻击可以在规避它们的同时仍损害最终答案。
我们发现最可靠的修复方式不是猜测隐藏状态是否看起来正常,而是在传输过程中对其进行保护。我们实现了一个HMAC-SHA256清单,将专家智能体、会话、模型、可见承诺、张量元数据和载荷摘要绑定在一起。它接受了所有774个诚实重放的载荷,并拒绝了所有295个记录的篡改载荷。核心启示在于:完整KV的潜在记忆可以是有用的,但它应被视为安全敏感的对象,而非普通的内部模型状态。
Abstract
LLM agents can share more than text. In some systems, an agent can send a short visible message while also passing its full KV-cache state to another model. This hidden state can help the final model combine evidence from several agents, but it is also hard to inspect. A visible message may look harmless even if the hidden state has been changed. We study this problem in a multi-agent question-answering setup. Specialists each see part of the evidence, send a short commitment, and pass full KV-cache state to a coordinator. In clean runs, this latent collaboration improves over a matched text-only version. On transformed HiddenBench with Qwen3-4B, it reaches EM/F1 of 0.338/0.486, compared with 0.231/0.369 for text collaboration. Qwen3-8B and HotPotQA runs show the same direction of improvement. The problem appears when one specialist is malicious. Some false visible commitments can steer answers. More seriously, changing the hidden KV state can collapse performance even when the visible commitment still looks plausible. A verifier that checks only text misses this failure mode. Simple magnitude checks catch some obvious corruptions, but adaptive attacks can evade them while still damaging the final answer. The most reliable fix we find is not to guess whether hidden state looks normal, but to protect it in transport. We implement an HMAC-SHA256 manifest that binds the specialist, session, model, visible commitment, tensor metadata, and payload digest. It accepts all 774 honest replayed payloads and rejects all 295 recorded tampered payloads. The main lesson is that full-KV latent memory can be useful, but it should be treated as a security-sensitive object, not as ordinary internal model state.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





