MafiaScope:面向社交推理游戏中 LLM 智能体的非侵入式、时序分辨信念探测
MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games
📝 TLDR
大语言模型在社交推理中的公开行为难以反映其真实信念,猜对的投票或成功的谎言都不暴露内心判断。为此提出 MafiaScope,将桌游狼人杀改造为机器心智理论的测量平台:每轮公开发言后,代理私下回答结构化探针问题,答案不返回游戏流程,由引擎对照真值自动打分。DeepSeek 32 局实验共解析 13,815 条探针回答,发现自报置信度校准差(ECE 0.17),且代理高估被怀疑概率达 1.5 倍;引擎、可视化器及 200+ 跨模型对局全部开源。
🧭 速览
LLM 代理的公开行为难以反映其社交推理与真实信念,常规评估无法区分猜测与真正理解。
将狼人杀改造为非侵入式探针平台,代理每次发言后私下回答结构化问题,答案不回流游戏,由引擎对照真值自动评分。
DeepSeek 32 局共 13,815 条探针显示自报置信度校准差(ECE 0.17),代理高估被怀疑概率约 1.5 倍。
提供首个时间分辨、非侵入的 LLM 心智理论评测基准,引擎、可视化器与 200+ 跨模型对局全部开源。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
MafiaScope 将经典社交推理游戏狼人杀(Mafia)改造为一个专门用于测量大型语言模型 [[机器心智理论]] 能力的测试平台。该系统在不干扰游戏正常进行的前提下,于每轮公开发言后让智能体私下回答一组结构化探针问题,并根据游戏引擎掌握的底层真值自动评分。在 DeepSeek 模型完成的 32 局游戏、共计 13,815 条探针回答中,研究者发现智能体的置信度校准存在明显缺陷,[[ECE]](期望校准误差)达到 0.17,且对自身被怀疑程度的预估高出实际值约 1.5 倍。引擎、可视化器以及包含 200 余局跨模型对局的语料库均已开源。
研究背景与动机
大型语言模型在多智能体交互场景中展现出的能力日益受到关注,但如何评估这些模型在社交推理任务中的真实水平,长期以来面临一个根本性的困难:模型的公开行为与其内部推理过程之间存在巨大的鸿沟。一个在投票环节做出正确选择的智能体,可能并非基于准确的推理,而仅仅是随机猜测的结果;同样,一个善于编织谎言的智能体,其流利的言辞也不会留下任何关于它实际信念的蛛丝马迹。传统的评估方式——无论是观察最终胜负还是记录公开发言——都只能触及行为表象,无法触及推理的实质。
这一困境呼唤着非侵入式探测手段的出现。所谓非侵入式,是指在不改变智能体行为模式的前提下,直接获取其内部状态信息的方法。研究者意识到,要真正理解 [[机器心智理论]] 在 LLM 中如何运作,需要一个能够暴露智能体对他人信念、意图和判断的测量工具。这个工具必须满足两个关键条件:其一,测量过程不能干扰智能体的正常决策;其二,测量结果必须能够与 ground truth 进行对照验证。
方法
MafiaScope 的核心设计思路,是将一个经过改造的狼人杀游戏引擎同时充当游戏系统和测量仪器的双重角色。狼人杀本身的游戏结构天然适合作为社交推理的测试床:玩家需要在信息不完整的情况下,通过观察他人发言和投票行为,推断其他玩家的真实身份(好人或狼人),同时也要考虑他人对自己的看法——这正是 [[机器心智理论]] 的核心命题。
系统的技术创新体现在探针机制上。每当一轮公开发言结束后,游戏引擎会暂停正常流程,向每个智能体发送一组预先配置的结构化探针问题。这些问题覆盖了多个维度的心理状态:智能体对自己判断准确性的自我评估、对其他玩家怀疑程度的估计、对他人投票意向的预测,以及对自身预测置信度的主观评分。关键在于,智能体的回答完全在私下进行,且这些答案不会以任何形式重新进入游戏流程。引擎掌握着游戏的全部 ground truth(谁是好人是狼人、各玩家的真实身份等),因此可以自动将探针回答与真值对比,生成精确的评分。
这种设计具有双重保证:智能体不会因为真实作答而受到游戏层面的惩罚(从而不会刻意隐瞒或表演),同时 engine-side 的自动评分确保了测量的可扩展性和客观性。为了让研究者直观地理解信念如何随游戏进程演变,系统提供了一个交互式可视化器,包含三种互补的视图。扮演模式从单个智能体的视角重建游戏场景,让观察者理解该智能体在每一步看到了什么、相信了什么。面板中绘制了时间对齐的准确率曲线和校准曲线,揭示判断质量随游戏进程的动态变化。反事实回放功能则允许研究者从任意已记录的步骤进行分叉,重新模拟如果采取不同行动会导向怎样的后续发展。
实验与结果
研究者使用 DeepSeek 模型开展了一项系统性的案例研究,涵盖 32 局完整的游戏对局,共收集了 13,815 条经过解析的探针回答。这一规模的实验数据为揭示 LLM 社交推理的内部机制提供了相当丰富的实证基础。
实验结果揭示了两个值得高度关注的问题。第一,智能体的置信度校准表现不佳。期望校准误差 ECE 达到 0.17,这个数值意味着模型在概率估计与实际准确率之间存在明显的系统性偏差。简单来说,当模型以 80% 的置信度做出某个判断时,其实际正确率远低于 80%。第二,智能体表现出对自身被怀疑程度的过度预估——其预测的被怀疑频率约为实际值的 1.5 倍。这一发现暗示模型在社交情境中可能存在过度自我中心的倾向,它对他人如何看待自己的判断,与真实情况之间存在显著偏差。
研究者还专门设计了一个包含 30 次分叉的回放实验,用于验证反事实回放功能的有效性。这个实验完整地走通了从分叉点到新路径演化的整个工作流程,证明了该工具不仅在概念上可行,在实践中也确实能够支持对推理过程的深入分析。
讨论与可借鉴点
这项工作最直接的方法论贡献,在于为 [[机器心智理论]] 研究提供了一个可控、可量化、且具有生态效度的测试平台。相比于传统的问答式心智理论测试(如萨勒测试或巴克斯特测试),在真实社交推理游戏中进行测量具有天然的优势:游戏本身的博弈结构激励智能体进行认真推理,而探针机制则提供了绕过公开表演、直接窥探内部状态的窗口。
非侵入式探针的设计理念也值得在更广泛的任务中借鉴。研究者通常面临一个两难选择:要么让模型自由行动从而无法获知其真实想法,要么通过精心设计的提问引导模型暴露信息——但后者往往改变了模型的原始行为。MafiaScope 通过将探针完全隔离于游戏流程之外,有效地化解了这一矛盾。这一原则或许可以推广到其他需要测量 LLM 内部状态的场景中。
实验发现的置信度校准缺陷则指向了一个更基础的研究问题:LLM 产生的概率数值究竟在多大程度上反映了其真实的不确定性?1.5 倍的被怀疑程度高估表明,模型在社交情境推理中对自身处境的判断存在系统性偏差,这可能与训练数据中社交互动的分布有关。这些发现为后续研究指明了方向:如何在保持推理能力的前提下改善校准表现?探针问题的措辞是否会影响模型的作答?跨模型的对比又会揭示怎样的差异?
当然,这项工作也存在一定的局限性。结构化探针虽然便于自动评分,但可能无法覆盖更丰富、更细腻的推理过程。实验目前仅覆盖 DeepSeek 模型,其他主流模型的对比分析有待后续探索。此外,探针问题的设计本身是否带有某种隐性的引导性,这方面的消融实验在论文中没有充分展开。
摘要
一个 LLM 智能体的公开行为几乎无法揭示其社交推理过程:一个正确投票的智能体可能只是在猜测,而一个擅长说谎的智能体也不会留下其真实信念的任何痕迹。我们提出了 MafiaScope,一个开放的测试平台,将社交推理游戏 Mafia(狼人杀)转化为用于机器心智理论(Theory of Mind)测量的工具。在每一次公开发言之后,每个智能体私下回答一组可配置的结构化探测问题;这些回答不会重新进入游戏流程,而是由引擎根据其所掌握的底层真实情况自动评分。一个交互式可视化器渲染出信念轨迹:扮演模式(impersonate mode)从单个智能体的视角展示游戏过程,面板绘制了按时间线对齐的准确率与校准度曲线,反事实回放(counterfactual replay)可以从任何已记录的步骤进行分叉重放。在一项使用 DeepSeek 模型、涵盖 32 局游戏、共计 13,815 条解析后探测回答的案例研究中,所陈述的置信度校准较差,期望校准误差为 0.17,智能体将自身被怀疑的频率过度预测为实际值的 1.5 倍;此外,一项包含 30 次分叉的回放实验完整地走通了反事实回放的工作流程。引擎、可视化器以及一个包含 200 余局跨模型游戏的语料库以开放许可证发布;在线演示:https://karpovilia.github.io/mafiascope/;演示视频:https://vimeo.com/1208920221。
速览
TLDR:LLM智能体的公开行为无法反映其社交推理过程——正确投票可能是猜测,善意的谎言也不暴露真实信念。本文将社交推理游戏狼人杀改造为机器心智理论测量平台MafiaScope,在每次公开发言后让智能体私下回答结构化探针问题,答案不参与游戏而由引擎对照已知真值自动评分,并提供信念轨迹可视化与反事实回放功能。DeepSeek 32局共13815条探针结果显示智能体置信度校准差(ECE 0.17)、过高估计被怀疑程度约1.5倍。引擎、可视化器及200余局跨模型语料以开源形式发布。 \
Motivation:LLM智能体的公开行为难以揭示其真实社交推理与内心信念状态,亟需非侵入式的内部信念测量手段。 \
Method:将狼人杀游戏引擎改造为信念测量平台,每次发言后插入不影响游戏流程的结构化探针问答并对照真值自动评分,配套时间对齐的可视化与反事实回放工具。 \
Result:DeepSeek 32局13815条探针数据显示智能体置信度期望校准误差为0.17,且高估被怀疑概率约1.5倍。 \
Conclusion:提供开源测量框架、可视化分析工具与200余局跨模型对局语料,支撑LLM心智理论的系统性实证研究。
Context:属于LLM心智理论与社交推理博弈评估方向,将多玩家推理游戏作为可控测试床;适用于评估多智能体隐藏信念、谎言生成与概率校准能力,但探针设计本身仍受任务形式制约。
Abstract
An LLM agent's public behaviour reveals little about its social reasoning: an agent that votes correctly may be guessing, and an agent that lies well leaves no trace of what it actually believes. We present MafiaScope, an open testbed that turns the social deduction game Mafia into a measurement instrument for machine Theory of Mind. After every public utterance, every agent privately answers a configurable set of structured probe questions; the answers never re-enter the game and are scored automatically against the ground truth the engine knows. An interactive visualizer renders the belief trajectories: impersonate mode shows the game as one agent sees it, panels chart timeline-aligned accuracy and calibration, and counterfactual replay forks any recorded step. In a 32-game DeepSeek case study with 13{,}815 parsed probe answers, stated confidence is poorly calibrated, with expected calibration error 0.17, agents over-predict being suspected 1.5 times, and a 30-fork replay experiment walks the counterfactual replay workflow end to end. Engine, viewer and a corpus of 200+ cross-model games are released under an open licence; live demo: https://karpovilia.github.io/mafiascope/; screencast: https://vimeo.com/1208920221.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




