在隐藏信息社交推理游戏中审计信念条件化的大语言模型智能体
Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games
📝 TLDR
在9人狼人杀等隐藏信息多智能体博弈中评估LLM智能体面临结果方差大、决策过程不透明的问题。本文提出可审计框架,通过外部信念状态追踪与信念-动作偏差结构化日志支持冻结对局回放与离线差案例审查。1080局实验显示,激活信念使好人阵营胜率由0.205升至0.390(McNemar χ²=16.4,p<0.001),但动作-信念一致性仅约0.21,机制无法直接归因,核心贡献在于审计框架本身。
🧭 速览
隐藏信息多智能体场景下LLM决策不透明,仅凭终局胜负难以解释行为原因,亟需可审计的诊断手段。
在9人狼人杀环境中以代码级信息隔离构建外部信念追踪与信念-动作偏差日志框架,支持冻结回放、离线差案例复审与多臂对照实验。
信念激活条件下好人阵营胜率由0.205升至0.390(配对McNemar χ²=16.4,p<0.001),女巫毒药不可逆误用减少,但动作-信念一致性仅约0.21,机制难以归因。
贡献在于审计框架本身,将外部信念定位为高噪声隐藏信息博弈中可审计的认知基线,附带决策信号,使策略效应与负载混淆得以分离。
📊 论文图表(共 8 张)
展开查看 8 张图
TL;DR
在9人狼人杀这类高噪声隐藏信息博弈游戏中,LLM智能体的决策过程往往如同黑箱——最终胜负受太多随机因素干扰,很难说清某个动作是好是坏、失败究竟源于策略错误还是信息不足。本文构建了一套可审计的外部信念追踪框架,在代码级信息隔离下完整记录智能体的信念状态与动作偏离,1080局冻结对局实验表明:激活信念条件使好人阵营胜率从0.205显著提升至0.390(p<0.001),但更关键的发现是动作与信念之间的精确一致性仅有约0.21,且仅给狼人方配备信念反而比仅给好人方配备信念更有利于好人阵营——这些反直觉的结果揭示了信念机制的作用方式远比"持有者推断增强→胜率提升"这一朴素解释复杂。文章的核心贡献并非某个超越性的性能数字,而是将不透明的智能体行为转化为可回放、可审计、可争议的证据链。
研究背景与动机
在[[隐藏信息博弈]]中,每个参与者只知道自己的私有身份,而最终胜负要等到游戏终局才能揭晓——这种设定对LLM智能体的评估提出了根本性挑战。以狼人杀为例:好人阵营需要通过投票驱逐狼人,同时保护预言家的查验结果不被干扰;狼人阵营则需要在夜间协调杀人,白天伪装成好人发言。即便是最优策略也可能因为队友失误或对手运气而输掉单局,而糟糕的决策反而可能侥幸获胜。这种高方差特性使得"胜率"这个最直观的指标变得不可靠。
更棘手的是[[可解释性]]问题。当一个智能体投票驱逐了自己的预言家、毒杀了友方猎人、或者忽略了明显的狼人发言时,事后很难判断这究竟是证据不足导致的合理失误、信念追踪出现bug、LLM负载过高产生的随机输出、还是模型根据自身推理做出了与设计者预期不同的策略选择。传统的评估方法——无论是端到端测试还是在线学习——都缺乏对这一决策链条的细粒度回溯能力:单局黑箱输出无法区分上述各种失败模式,在线学习则可能因为某次运气好的随机输出而固化错误的策略关联。
本文的切入点在于:如果无法在单局粒度上建立因果归因,那就退而求其次,在机制层面构建可审计性。具体而言,研究者不再追求"信念条件是否因果地提升了胜率"这个难以回答的问题,而是将注意力转向构建一套能够将智能体的内部认知过程外化为可观测证据的基础设施——信念状态被维护为一个显式的外部变量,信念更新被分解为可追溯的因子,动作与信念之间的偏差被分类记录,所有这些都以结构化日志的形式永久保存,支持冻结对局的回放与离线差案例审查。
方法
整个框架的工程核心是严格的代码级信息隔离。在典型的LLM智能体实现中,提示词是控制信息流动的主要手段,但这种方法存在被prompt injection绕过的风险。本文采用了更彻底的做法:游戏引擎作为唯一的真相存储组件,负责维护所有玩家的真实角色和游戏规则状态;每个智能体在运行时只能通过序列化JSON接口接收经过角色-相位双重过滤的可见上下文。例如,一个狼人智能体永远不会在自己的上下文中看到"谁是狼人"这条信息,它只能通过发言和投票等公开事件来推断其他玩家的身份。真实的角色映射仅在终局结算后用于评估对齐质量,永不在运行时被任何智能体读取。这种设计从架构层面消除了信息泄漏的可能性,使得后续的所有信念状态追踪都建立在可信的信息流之上。
外部信念状态被实现为一个对数几率空间(logit space)上的概率分布。对于观察者在时刻对目标玩家持有角色的信念,每次观察到新事件后,信念增量被分解为三个因子的乘积:
其中是事件的基础权重,描述该事件对特定角色的证据方向(例如,"某玩家投票反对预言家"对狼人身份是弱正证据,对村民身份是弱负证据),而是观察者对该事件来源的可信度评估。这种因子化设计的优势不在于实现精确的贝叶斯推断——实际上这些因子都是手工指定的启发式权重——而在于提供可追溯性:如果某个智能体在某局中出现了明显的信念错误,审计者可以逐因子检查是哪一步的权重设置导致了偏差累积,最终定位到是提示设计问题、证据解释问题还是信源可信度校准问题。
信念状态有两种运行模式。Shadow模式下,信念仅作为后台诊断工具存在,不注入智能体的决策上下文;Active模式下,信念以结构化格式(通常是top候选角色及其概率)作为额外提示输入给LLM。研究者还设计了三种[[消费策略]]来控制信念注入的时机:无消费(信念仅记录)、主动注入(每轮强制加入)、以及置信门控(只在分布熵低于阈值时才注入)。这三种策略构成了实验中的重要变量。
当LLM的实际动作与信念推荐动作不一致时,系统触发偏差诊断流程。研究者将偏差划分为三类:有害偏差指智能体无视了置信度很高的信念而做出了明显不利的动作;合理覆盖指信念信号本身就很弱或平坦,此时LLM利用其他上下文线索做出不同决策是合理的;策略性偏差则指出于博弈论原因故意背离——例如狼人在关键时刻投票给队友,以制造"票型分散"的假象降低自身被怀疑的程度。这种分类框架为后续的差案例分析提供了语义锚点,使得"这局输了"这样的粗糙评价能够被分解为"信念质量良好但被策略性无视了"或"信念本身就在关键问题上给出了错误信号"等更精确的诊断。
整个改进循环被刻意设计为防御性的离线批次模式。具体流程是:批量运行多个对局 → 收集结构化日志 → 计算聚合指标并挖掘差案例 → 生成候选策略洞察 → 强制人工审核 → 审核通过后版本化发布。系统明确禁止单局级别的在线学习,每次策略更新都必须基于一批对局的整体证据,且必须经过人工把关后才能部署。这种设计在架构上阻断了随机噪声直接污染策略的可能性。
实验与结果
实验在自实现的9人狼人杀环境中进行,使用deepseek-chat模型(温度0.6),设置了8个实验臂共1080局冻结对局。主对比臂A0(信念禁用,保留提示结构但移除信念内容)与A1(主动信念注入)共享7000-7199号随机种子,实现严格的配对设计。
最核心的结果是配对比较中好人胜率的显著提升:从A0的0.205上升至A1的0.390,配对McNemar ,,95%置信区间不重叠。女巫错误毒杀的比例也从76%降至36%,方向性检验Fisher 。这些数字看起来相当漂亮——信念条件几乎将好人胜率翻倍。
然而,研究者并没有止步于这个表面上的成功。他们深入挖掘了信念与动作之间的实际关联,发现了一个令人困惑的图景:信念状态的质量指标其实相当不错(top-1命中率68.6%,top-2命中率82.5%,狼-好分离度0.356),但动作-信念的精确一致性只有约0.21——这意味着在绝大多数决策时刻,LLM并没有按照它自己信念状态所推荐的方式行动。这是一个巨大的鸿沟:智能体持有良好的信念,但只在五分之一的情况下将信念转化为对应动作。
更反直觉的是阵营受限实验的结果:仅给狼人方配备信念(A3,好人胜率0.313)比仅给好人方配备信念(A2,好人胜率0.253)更有利于好人阵营。这直接否定了"信念让持有者的推断增强,因此持有者胜率提升"的朴素假设。如果这个逻辑成立,应该是获得信念的一方受益才对。
为了探究一致性低的原因,研究者设置了C1(置信门控消费)与C2(强制消费,即无论信念分布平坦与否都强制注入)对比。结果显示强制消费虽然将动作-信念一致性从0.250小幅提升至0.280,但好人胜率反而从0.412降至0.362。这一负向发现直接证伪了"只要让LLM更多接触到信念就能提升性能"的简单想法:当信念分布本身缺乏信息量时,强制注入只是在LLM的注意力上叠了一噪层,并不能改善决策质量。
高负载臂(L1,并发度32 vs 主臂的4)则排除了基础设施伪影:即使在32倍并发压力下,LLM错误率仍为0%,好人胜率0.300落在其他信念臂的区间内,说明主对比结果并非由服务端限速或资源竞争所驱动。
讨论与可借鉴点
这项工作的最重要贡献在于方法论示范:它展示了一套如何在高噪声、结果高度不确定的环境中构建可信评估基础设施的完整方案。对于类似的研究方向,有几点值得特别注意。
首先,信念内容的直接归因是一个陷阱。本研究发现信念与胜率之间存在强关联,但这种关联几乎不能通过动作-信念一致性来解释。这提示我们,LLM可能通过其他途径——比如prompt结构效应、注意力重新分配、或者对信念文本本身的元认知处理——间接利用了这些信息,而并非像人类那样将信念显式地纳入推理链条。对于未来的研究而言,设计更精细的控制实验来分离这些可能机制将是重要挑战。
其次,负向发现与正向发现同等重要。强制消费被实证否定的案例提醒我们,在复杂系统中基于直觉做出的"显然有效"的干预可能适得其反。可审计框架的价值不仅在于测量预期效应,还在于提供能力来排除那些看似合理但实际有害的假设。
最后,这项工作的定位是认知基线而非终极方案。作者明确指出,外部信念追踪在隐藏信息博弈中的首要价值是将不透明的智能体行为转化为可回放的证据,而非声称某种最优的信念机制设计。框架本身是通用的——任何需要在高不确定性环境中评估和迭代LLM智能体的场景都可以借鉴其核心理念:代码级信息隔离、因子化信念追踪、偏差引导诊断、防御性离线改进。这套基础设施使得研究者和实践者能够从"这局好像有问题"的模糊印象出发,系统性地定位到"信念更新的某个因子在校准上存在系统偏差"这样的精确诊断,从而支撑真正有据可查的策略迭代。
摘要
在隐藏信息的多智能体设定中评估大语言模型智能体是困难的:最终结果具有高方差,并且很少揭示智能体为何做出这样的决策。我们在一个九人狼人杀环境中对此展开研究,其中智能体在严格的、代码级别的信息隔离下行动;我们构建了一个可审计的框架,该框架对隐藏角色维护一个外部信念状态,将信念更新与信念—动作偏离记录为结构化证据,并支持一种防御性的离线改进循环,在任何策略变更之前审查不良案例。跨1,080局冻结游戏,涵盖信念禁用、主动信念、核函数消融、阵营受限、消费策略与高负载等多个实验臂,并包含一项种子配对的A0/A1比较,主动信念条件与显著更好的好人方结果相关:在200种子的A0/A1比较中,好人方胜率由0.205上升至0.390(配对McNemar χ² = 16.4, p < 0.001),且不可逆的女巫毒药错误更少。然而,我们并未将此变化归因于信念内容本身。直接的“动作—信念”一致性较低(约0.21),而仅将信念给予狼人一方,比仅将信念给予好人方更利于好人方,这与简单的“持有者受益”解释相矛盾;因此我们将该效应作为一种关联来报告,并将其机制视为悬而未决。本工作的贡献在于审计框架本身:它使效应可被测量,暴露出低水平的直接动作—信念一致性,以证据否定了不可靠的强制消费干预,并将策略效应与负载混淆分离。据此,我们将高噪声隐藏信息游戏中的外部信念主要定位为一种可审计的认知基线,同时也承载决策相关信号,将不透明的智能体行为转化为可回放的证据,以支撑更安全、可控的迭代改进。
速览
TLDR:在9人狼人杀等高噪声隐藏信息博弈中,LLM智能体的最终结果方差大、难以解释其决策依据与内在机制。作者构建了基于外部信念状态的可审计框架,在代码级信息隔离下记录信念更新与信念-动作偏离作为结构化证据;1080局冻结对局显示激活信念条件使好人胜率从0.205升至0.390(McNemar χ²=16.4, p<0.001),但动作-信念一致性仅约0.21,且给予狼人信念反而更利好人,效应机制仍待解决,核心贡献在于审计框架本身。 \
Motivation:隐藏信息多智能体博弈中,LLM智能体最终胜负方差大、难以揭示决策依据与因果机制。 \
Method:在9人狼人杀环境中构建代码级信息隔离与外部信念可审计框架,记录信念更新与动作偏离并支持离线防御性改进循环。 \
Result:1080局实验显示激活信念使好人胜率由0.205升至0.390(p<0.001),但动作-信念一致性仅约0.21,狼人侧信念收益反而更大。 \
Conclusion:外部信念在隐藏信息博弈中应被视为可审计的认知基线,其因果机制尚未明确。
Context:该工作承接LLM智能体博弈评估与可解释性研究,以狼人杀为受控测试床,强调审计能力而非单纯性能提升,揭示信念信号与决策行为间的弱一致性。
Abstract
Evaluating LLM agents in hidden-information multi-agent settings is hard: final outcomes are high-variance and rarely reveal why an agent decided as it did. We study this in a 9-player Werewolf environment where agents act under strict, code-level information isolation, and we build an auditable framework that maintains an external belief state over hidden roles, logs belief updates and belief-action deviations as structured evidence, and supports a defensive offline improvement loop that reviews bad cases before any strategy change. Across 1,080 frozen games spanning belief-disabled, active-belief, kernel-ablation, camp-restricted, consumption-policy, and high-load arms, and including a seed-paired A0/A1 comparison, the active-belief condition is associated with substantially better good-side outcomes: in the 200-seed A0/A1 comparison the good-side win rate rises from 0.205 to 0.390 (paired McNemar , ), with fewer irreversible witch-poison errors. We do not, however, attribute this shift to belief content. Direct action-belief consistency is low (), and giving belief only to the werewolves helps the good side more than giving it only to the good side, which argues against a simple holder-benefit account; we therefore report the effect as an association and treat its mechanism as unresolved. The contribution is the audit framework itself: it makes the effect measurable, exposes low direct action-belief consistency, rejects an unreliable forced-consumption intervention with evidence, and separates strategy effects from load confounds. We accordingly position external belief in high-noise hidden-information games primarily as an auditable cognitive baseline that also carries decision-relevant signal, turning opaque agent behavior into replayable evidence for safer, controlled iteration.
论文详细总结(自动生成)
论文总结:在隐藏信息社交推理游戏中审计信念条件化的大语言模型智能体
1. 核心问题与整体含义
研究动机
- 在隐藏信息多智能体博弈中,LLM 智能体需要基于不对称私有信息进行推理、解读可能欺骗性的公开沟通,并做出只有终局才能揭示其质量高低的决策。
- 仅用最终胜率评估存在三个根本缺陷:
- 高方差:单局结果受队友错误、对手失误等多因素干扰,优秀决策可能输,糟糕决策可能赢。
- 不透明:投票错误、毒杀队友、忽略强信号等失败,无法归因于证据缺失、信念追踪失误、提示诱导、负载失败,还是合理策略覆盖。
- 缺乏可审计性:黑箱 LLM 智能体的行为难以回放、诊断与受控迭代。
研究目标
构建一个可审计框架,使隐藏信息博弈中 LLM 智能体的认知、行动与失败模式变成可测量、可回放、可争议的证据,支撑安全、受控的策略迭代。
2. 方法论
2.1 整体架构(五大组件)
1. 可审计信念层(Auditable Belief Layer):为每个智能体维护对其他玩家隐藏角色的概率分布 ,区分 shadow 模式(仅用于后台诊断)与 active 模式(注入智能体上下文作为决策支持)。
2. 因子化信念更新(Factorized Belief Update):将每个事件的信念增量分解为三个可解释因子。
3. 信念消费策略(Belief Consumption Policies):定义无消费、主动注入、置信门控三种注入方式。
4. 偏差引导诊断(Deviation-Guided Diagnosis):对比信念推荐动作与 LLM 实际动作,将偏差分类为有害/合理/策略性。
5. 防御性离线改进循环(Defensive Offline Improvement Loop):以批次证据驱动策略更新,强制人工审核后版本化发布。
2.2 关键技术细节
#### 信息隔离边界
- 引擎是唯一存储真实角色与规则状态的组件;智能体仅接收序列化 JSON 的、按角色-相位过滤的可见上下文。
- 真实角色映射仅在终局后用于评估,永不在运行时被读取。
#### 动作接口
小型、面向规则的动作集:
经过解析 → 规范化 → 规则校验 → 兜底四级管道后送入引擎,所有解析/兜底事件均被记录。
#### 因子化信念更新公式
对观察者 、目标 、角色 :
其中 为事件基础权重, 为证据方向, 为信源可信度。在对数几率空间累积:
- 因子化为手工指定的启发式,非精确贝叶斯后验估计,目的在于可追溯性而非最优推断。
- 私有确定性角色(如狼人队友)受锁定保护,免受公开事件更新覆盖。
#### 偏差分类框架
- 有害偏差:忽略锐利信念导致己方受损。
- 合理覆盖:信念信号弱或平坦,LLM 利用其他上下文作出更优决策。
- 策略性偏差:出于博弈论原因故意背离(如狼人投票队友以降低怀疑)。
#### 离线改进循环
强制五步流程:批量运行 → 结构化记录 → 聚合指标+挖掘差案例 → 生成候选策略洞察 → 人工审核后才版本化更新;刻意不做单局在线学习。
3. 实验设计
3.1 场景/基准
- 基准环境:自实现的 9 人狼人杀(3 狼人 + 1 预言家 + 1 女巫 + 1 猎人 + 3 村民),作为高噪声隐藏信息多智能体环境的受控测试床。
- LLM 模型:
deepseek-chat(温度 0.6,合同版本 2.2,记录的 git commit)。 - 指标体系:
- 结果指标:好人方/狼人方胜率、95% 置信区间。
- 信念质量:top-1/top-2 命中率、狼-好分离度、Brier 分数、信念分布熵。
- 消费指标:动作-信念一致性率、偏差记录数。
- 决策质量:错误毒杀、错误猎人射击、非法动作、兜底使用、解析失败、重试次数。
- 资源与稳健性:token 使用、上下文截断、超预算次数、延迟、负载相关 LLM 失败。
3.2 对比实验臂(共 8 臂,1,080 局)
| 臂 | 描述 | 局数 | 好人胜率 |
|---|---|---|---|
| A0 | 信念禁用(保留信念导向提示结构但移除信念内容) | 200 | 0.205 |
| A1 | 主动信念注入,因子化核 | 200 | 0.390 |
| A2 | 仅好人方获得信念 | 150 | 0.253 |
| A3 | 仅狼人方获得信念 | 150 | 0.313 |
| ABL-add | 加性信念核(消融基线) | 120 | 0.333 |
| C1 | 置信门控消费基线 | 80 | 0.412 |
| C2 | 强制消费变体 | 80 | 0.362 |
| L1 | 高并发(32 并发)A1 副本 | 100 | 0.300 |
主对比 A0/A1 共享种子 7000–7199,实现配对 A/B 设计。
4. 资源与算力
- 论文未明确披露所用 GPU 型号、数量或训练时长。
- 仅记录了部署层面的运行配置:
- 主臂并发度 4;高负载副本(L1)并发度 32。
- 上下文预算 4000 token(实验全程零超限)。
- LLM 提供商:
deepseek-chat,温度 0.6。 - 计算开销可通过指标间接推断:A1 单臂 200 局产生 11,724 次决策,82,967 次信念快照保存与 746,703 个信念曲线点;所有 1,080 局零 LLM 错误率、零重试、兜底仅 28 次(0.24%)。
5. 实验数量与充分性
规模
- 共 1,080 局冻结对局,覆盖 8 个实验臂。
- 主 A0/A1 配对对比各 200 局,统计功效充分:58 个种子翻转为好人方胜 vs 21 个反向,配对 McNemar ,,95% CI(±5.6pp / ±6.8pp)不重叠。
- 女巫毒杀方向性检验(22 vs 4 次错误毒杀)经 Fisher 精确检验 ,但样本量小,Wilson 区间 [0.58, 0.88] vs [0.15, 0.65] 部分重叠,作者明确标注为方向性而非紧致估计。
公平性控制
- 配对种子共享模型、合同版本、提示族与种子范围。
- 所有臂记录 LLM 错误率、重试、兜底明细与并发度;任何错误率异常臂单独分析而非混入主对比。
- 单元与集成测试覆盖 1,138 项(零跳过),包括合同模式、信息隔离、规则终止、解析、信念更新等。
充分性局限
- A2、A3、ABL-add、C1、C2、L1 各臂样本量相对较小(80–150 局),论文将其定位为探索性诊断而非独立因果主张,且未做多重比较校正。
- A0 是信念内容消融而非原生无信念提示,限制了归因清晰度。
- 单一模型、单次冻结快照,缺乏跨模型与多 provider 验证。
6. 主要结论与发现
1. 稳定且安全的实验基底:A1 臂 11,724 次决策中 LLM 错误率与重试率均为 0;规则兜底 0.24%;角色/元/CoT 泄漏 0;上下文预算零超限;1,138 项测试全通过。
2. 主效应(关联,非因果):在配对 200 种子对比中,主动信念使好人方胜率由 0.205 升至 0.390(,),且女巫错误毒杀由 22/29(76%)降至 4/11(36%),方向性显著(Fisher )。
3. 信念信号可用但消费低:A1 聚合 sidecar 信念诊断 top-1 命中率 0.686、top-2 命中率 0.825、分离度 0.356;但动作-信念精确一致性仅约 0.21,且仅好人方投票命中率与约 0.375 的机会水平相比仅略高。
4. 阵营受限结果违背"持有者受益"直觉:仅好人方信念胜率 0.253,低于仅狼人方信念的 0.313,表明机制并非简单的"持有方推断增强"。
5. 强制消费被实证否定:C2 相对 C1 一致性仅由 0.250 升至 0.280,胜率反由 0.412 降至 0.362(±11pp CI 内不显著),证实信念平坦时强制服从无益。
6. 负载混淆可被排除:L1(并发 32)LLM 错误率仍为 0%,胜率 0.300 落在其他信念臂区间内,主对比不被基础设施伪影解释。
7. 核心定位:在隐藏信息博弈中,外部信念应被定位为可审计的认知基线,附带决策相关信号;其首要价值在于把不透明行为转化为可回放、可争议的证据。
7. 优点与亮点
- 严格的代码级信息隔离:以序列化 JSON 边界而非提示词约束实现,真正做到运行时无真相泄漏。
- 端到端可审计管道:从决策、解析、兜底、信念快照到真实角色事后标注全程留痕,1,080 局零失败重放。
- 因子化信念更新设计:将对数几率空间的增量分解为 三因子,每一信念变化可追溯到少数可解释变量。
- 偏差分类框架:把"动作-信念分歧"概念化为有害/合理/策略性三类,提供后续自动标注与定量验证的概念锚点。
- 防御性离线改进循环:以批次证据为更新单位,强制人工审核,从架构上阻断单局噪声直接污染策略。
- 实验设计诚实:明确区分主配对比较(n=200)与探索性小臂(80–150),不滥用显著性,透明标注小样本与重叠置信区间。
- 负向发现的实证支持:用 C1/C2 对照直接证伪"强制消费总是更好"的直觉假设,展示框架的诊断与拒绝能力。
- 基础设施混淆的显式控制:将并发度作为受控变量并单独报告负载臂,避免假性策略效应。
8. 不足与局限
因果归因未解决
- 动作-信念一致性仅约 0.21,信念内容被实际消费的程度与胜负提升之间存在显著缺口。
- 阵营受限臂违背"持有者受益"假设,提示效应可能源于提示结构而非信念内容。
- A0 并非原生无信念提示,而是"保留信念导向提示结构、仅移除信念内容",使信念内容 vs 提示结构的归因无法直接分离。
- 论文明确列出两项未运行的控制:原生无信念基线(A0-native)与随机打乱信念内容的提示(A-rand)。
实验覆盖不足
- 仅使用单一 LLM(deepseek-chat),缺乏跨模型、跨 provider 复现。
- A2、A3、C1、C2、L1 等臂样本量偏小,仅作探索性诊断,且未做多重比较校正。
- 没有单局逐决策标注的案例研究,偏差分类仍停留在概念层面,大规模自动标注与定量验证被明确列为未来工作。
- 仅一个冻结快照,未做时间维度稳健性测试。
方法覆盖有限
- 信念规则为手工启发式,可能遗漏细粒度语言信号、长程欺骗模式与角色特定策略。
- 信念层未建模嵌套心智(如"A 认为 B 认为 C 是…"),对高级欺骗与说服能力受限。
- 系统未实现全自动自演化:离线循环产出候选洞察,但必须人工审核,不构成完整的自主学习智能体。
迁移与适用性
- 仍是游戏环境(狼人杀),与真实欺诈检测、谈判、网络安全等对抗性场景的迁移仅作为架构性假设提出,未经验证。
- 缺乏人机混合或人类基线对照,难以判断 LLM 智能体的相对能力天花板。
- 强制消费在信念平坦时失败的结论受样本量限制,是否在更大规模、更多决策类型下仍成立待验证。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。







