arXiv 2606.30454v1 · 发布 2026-06-29

大语言模型智能体中无个体忠诚性的集体合作

Collective cooperation without individual fidelity in LLM agents

AUTHORS Henrique Ferraz de Arruda, Carlos Gracia Lázaro, Alberto Aleta, Yamir Moreno
EVIDENCE 网络化囚徒困境基准测试LLM智能体的集体合作
SCORE 0.8
CATEGORIES TASK mas
GENERATED 2026-07-04 02:28:07 UTC

📝 TLDR

大语言模型越来越多地被用作社会系统仿真中的智能体,但其行为能否忠实代理人类决策尚不清楚。本研究将9个开源权重LLM与大规模网络化囚徒困境人类实验进行直接基准对比,采用相同的交互协议、收益结构和网络拓扑。结果表明,所选模型在宏观层面复现了合作动态的早期下降与后期稳定,但在个体层面低估了行为异质性,条件合作模式也与人类存在差异。这揭示了LLM社会代理中的宏观-微观脱节现象,提示验证需覆盖聚合动态、个体异质性和情境依赖决策规则。

🧭 速览

动机

LLM被广泛用作社会仿真代理,但在网络博弈中能否忠实代理人类行为缺乏直接实证基准。

方法

将9个开源LLM与大规模人类网络囚徒困境实验对比,使用相同协议、收益和拓扑,并混入部分随机代理。

结果

LLM在宏观合作动态上接近人类,但低估个体异质性,条件合作模式存在系统性偏差,混入随机代理仅部分改善。

结论

LLM代理存在宏观-微观脱节,验证其作为人类替代品需跨多层次行为比较而非仅看聚合结果。

📊 论文图表(共 27 张)

展开查看 27 张图

TL;DR

这项研究将九个开源大语言模型与一项大规模人类网络化囚徒困境实验进行直接对比,在相同的交互协议、收益结构和网络拓扑下检验 LLM 能否忠实地代理人类决策。结果显示,LLM 在宏观层面成功复现了合作率的早期下降与后期稳定,但在个体层面显著低估了行为异质性,条件合作模式也与人类存在根本差异。这一发现揭示了一种"宏观—微观脱节"现象:集体结果看似人类化,底层的行为分布与决策机制却并不相似。

研究背景与动机

大语言模型正被广泛应用于社会系统仿真、行为实验和集体决策场景,被寄予厚望地充当人类行为的"数字替身"。然而,一个根本性的验证问题始终悬而未决:当 LLM 智能体的输出与人类行为在统计上相似时,我们能否据此推断它复现了产生这些结果的行为模式与决策过程?

从理论角度看,现有关于 LLM 博弈行为的研究呈现出复杂的图景。一方面,部分研究表明 LLM 在重复博弈中表现良好,能够形成集体惯例;另一方面,存在一系列系统性偏差的担忧:对齐训练(alignment)可能压缩行为异质性,导致"模式坍缩";LLM 可能依赖词汇联想与统计先验而非真实的情境推理;其行为对提示框架和模型选择可能高度敏感。这些担忧指向一个核心张力——LLM 或许能在特定指标上模仿人类结果,但生成这些结果的过程可能与人类截然不同。

本研究采取了一种直接而严格的实证策略:找到一项已有的大规模人类网络化[[囚徒困境]]实验数据,然后在与人类完全相同的条件下运行 LLM 智能体,从宏观动态、个体异质性和情境依赖决策规则三个层级进行系统比较。这种"直接基准对比"的方法避免了"自创基准"的陷阱,让结论建立在可重复的实证基础之上。

方法

研究团队构建了一个多智能体仿真框架,将网络化[[囚徒困境]]实验中的每个节点映射为一个 LLM 控制的自主智能体。框架使用 CrewAI 作为编排层、Ollama 作为本地推理后端,确保无外部 API 依赖的自包含执行。每个智能体仅依据本地提示做出决策,提示包含邻居上一轮的选项与归一化收益,避免向智能体泄露全局信息。

收益矩阵采用颜色标签(GREEN 表示合作,BROWN 表示背叛)而非经典博弈术语呈现,这一设计用意深远——它避免了 LLM 凭借预训练中关于"囚徒困境"的先验知识识别任务类型,从而更接近人类受试者在实验中的信息状态。每一轮结束后通过 JSON 解析提取智能体选择,失败时默认合作以最小化对整体动态的人为干扰。

研究在三个层级上构建了分析框架。宏观层级关注合作率的时间序列 ,使用 RMSE、MAE 和 Pearson 相关 比较人类与 LLM 轨迹。更关键的是对差分序列拟合 [[AR(1)模型]],通过持久性差异 和隐含均值增量差异 评估动态结构的相似性。微观层级则聚焦个体合作倾向 ,用一阶 [[Wasserstein距离]] 衡量个体行为异质性的分布差异。决策规则层级通过条件合作概率 刻画智能体在不同邻居合作比例和自身上一动作条件下的策略选择。

为模拟人类实验中部分参与者"无稳定策略甚至随机选择"的现象,研究还引入了混合代理机制——将比例 的 LLM 智能体替换为随机选择代理,系统扫描 从 0 到 0.9 的全范围,以主成分分析确定的 作为代表值进行深入分析。

实验与结果

实验选取了 9 个覆盖多个家族与规模的的开源 LLM,包括 LLaMA 3.1 系列(8b、70b、16x17b)、DeepSeek(7b、67b)、Qwen3:32b、SmolLM2.1:7b,以及部分模型的对齐修改变体。基于规则格网络上的初步筛选结果,llama4:16x17b 被选定为主分析模型。

宏观层面的结果令人振奋:选定的 LLM 成功复现了人类合作动态的核心特征——早期下降与后期稳定的经典 U 型轨迹,跨不同网络拓扑(规则格网络与异质性网络)均观察到类似的收敛模式。时间序列相关性 达到中等至高度显著水平,AR(1) 分析显示动态结构的某些方面也具有可比性。

然而,这种宏观一致性未能延伸至微观层级。LLM 群体的合作倾向分布显著窄于人类——在规则格网络上,人类合作倾向分布的 ,而 LLM 仅为 ,差距超过一倍;在异质性网络上也观察到类似的压缩效应。一阶 [[Wasserstein距离]] 揭示,LLM 的个体行为多样性远不足以匹配人类群体。引入随机代理后,虽然 在某些条件下有所改善,但这种改善有限且不一致。

最具揭示性的发现来自条件合作分析。LLM 生成的决策规则与人类存在定性乃至定量的根本差异:人类受试者通常表现出"条件合作"倾向——当邻居合作率高时倾向于合作,当邻居合作率低时倾向于背叛,但这种关系在 LLM 群体中表现不同。特别是在"背叛后"的条件下,LLM 的条件合作曲线出现斜率反转,与人类的响应模式形成鲜明对比。即使引入 20% 随机代理改善了部分波动同步性指标,仍未能消除决策规则层面的失配——这表明随机性虽然是塑造行为多样性的必要成分,但单靠噪声不足以恢复人类决策的机制特征。

讨论与可借鉴点

这项研究最重要的贡献在于揭示了一种"宏观—微观脱节"现象:LLM 智能体可以在聚合层面复现人类行为,同时在个体层面和决策机制层面存在显著差异。这提醒我们,在评估 LLM 作为人类行为代理时,宏观指标的匹配既不是必要条件也非充分条件——行为分布和决策规则的相似性同样不可或缺。

研究还凸显了模型选择本身即是一种实质性的建模假设。不同 LLM 在相同激励与网络结构下产生显著不同的合作水平,同一基座模型的对齐修改变体(abliterated 版本)也产生系统性差异的合作轨迹。这意味着在没有多层级验证的情况下,任何单一模型的结果都可能被过度解读。

从实践角度,研究提出了一个更具操作性的验证框架:需要在总体动力学、个体异质性和情境依赖决策规则三个层级同时进行比较,而非仅依赖结果层面的一致性。对于计划将 LLM 智能体用于数字孪生、政策仿真或 agent-based 建模的研究者,这提示应当审慎选择评估指标,避免将宏观层面的表面相似误认为机制层面的忠实复现。

研究的局限也值得重视。人类基准仅来自单一实验,缺乏跨文化或跨情境的外部效度验证;闭源旗舰模型的行为尚不清楚;单次运行的依赖性意味着结论对随机种子和运行变异的敏感性尚未充分探索。此外,LLM 推理过程中产生的"reasoning"文本未被纳入分析,错过了检验 LLM 是否以类人推理路径做出决策的机会。

展望未来,一个有前景的方向是在更大规模的模型、更多样的博弈结构和更丰富的提示变体下重复这一多层级验证框架,逐步刻画 LLM 社会代理的能力边界与可信应用场景。

摘要

大语言模型(LLM)越来越多地被用作社会系统模拟中的智能体,但它们的行为在何时可被解释为对人类决策的真实代理仍不清楚。本研究将LLM智能体与一项直接的实证基准进行对比:一项大规模的网络化囚徒困境人类参与实验。在相同的交互协议、收益结构和网络拓扑下,我们将九个开放权重LLM与人类数据进行比较。选定的模型再现了合作动力学的若干宏观层面的特征,包括合作的早期下降和后期稳定。然而,这种总体一致性并未均匀地延伸至更精细的行为层面。LLM群体低估了个体层面的异质性,并生成了与人类观察结果不同的条件性合作模式。引入一定比例的随机智能体虽然改善了微观层面一致性的某些方面,但并未消除决策规则上的不匹配。这些发现揭示了基于LLM的社会智能体中存在的宏观—微观分离:即使在底层行为分布和机制并不相似的情况下,集体结果仍可能呈现类人特征。它们表明,将LLM智能体验证为人类替代物需要在总体动力学、个体异质性和情境依赖决策规则等多个层面进行比较,而非仅依赖结果层面的一致性。

Abstract

Large language models (LLMs) are increasingly used as agents in simulations of social systems, yet it remains unclear when their behavior can be interpreted as a faithful proxy for human decision-making. Here we test LLM agents against a direct empirical benchmark: a large-scale networked Prisoner's Dilemma experiment with human participants. Using the same interaction protocol, payoff structure, and network topologies, we compare nine open-weight LLMs with the human data. The selected model reproduces several macro-level features of cooperation dynamics, including the early decline and later stabilization of cooperation. This aggregate agreement, however, does not extend uniformly to finer levels of behavior. LLM populations underestimate individual-level heterogeneity and generate conditional cooperation patterns that differ from those observed in humans. Adding a fraction of random agents improves some aspects of micro-level agreement, but does not remove the mismatch in decision rules. These findings reveal a macro--micro dissociation in LLM-based social agents: collective outcomes can appear human-like even when the underlying behavioral distributions and mechanisms are not. They suggest that validating LLM agents as human surrogates requires comparisons across aggregate dynamics, individual heterogeneity, and context-dependent decision rules, rather than outcome-level agreement alone.


论文详细总结(自动生成)

论文总结:LLM 智能体在网络化囚徒困境中"无个体忠诚性的集体合作"

1. 核心问题与研究动机

  • 研究问题:随着大语言模型(LLM)越来越多地被用作社会系统仿真、行为实验和集体决策中的"人类替代品"(human surrogate),一个基础性的验证问题被提出:当 LLM 智能体的输出与人类结果一致时,是否意味着它真的复现了生成这些结果的行为模式与决策过程?
  • 理论背景:现有研究表明 LLM 在重复博弈(特别是迭代囚徒困境)中表现良好,能形成集体惯例;但同时存在系统性偏差——可能依赖词汇联想与统计先验而非情境推理、对齐训练(alignment)可能压缩行为异质性、产生模式坍缩(mode collapse)等。
  • 研究定位:论文不使用宏大叙事,而是采用直接实证基准——将 LLM 与大规模人类网络化囚徒困境实验数据进行多层级对比,回答 LLM 能否成为人类决策的忠实代理。

2. 方法论

2.1 核心思想

构建多智能体仿真框架,将每个网络节点映射为一个 LLM 控制的自主智能体,在与人类实验完全相同的网络结构、收益矩阵和交互协议下运行重复囚徒困境游戏,然后在三个层级上比较 LLM 群体与人类群体:宏观动态、个体异质性、条件合作决策规则。

2.2 仿真框架

  • 使用 CrewAI 作为编排层管理 LLM 智能体;使用 Ollama 作为本地推理后端,实现无外部 API 依赖的自包含执行。
  • 每个智能体仅依据本地提示做出决策,提示包含邻居上一轮的选项与归一化收益。
  • 收益矩阵(每邻居 ECUs):
自身 \ 邻居GREEN(合作)BROWN(背叛)
GREEN70
BROWN100
  • 采用颜色标签(GREEN/BROWN)而非经典博弈术语,以避免 LLM 凭先验知识识别任务。
  • 每一轮结束后通过 JSON 解析(最多 10 次重试)提取智能体选择;失败时默认 GREEN。

2.3 三个层级的分析度量

宏观层级——合作率时间序列:

使用 RMSE、MAE、Pearson 相关 (原始序列与一阶差分 )比较人类与 LLM 轨迹。

时间依赖性——对差分序列拟合 AR(1) 模型:

通过 (持久性差异)与隐含均值增量差异 评估动态结构相似性,并以保留边际分布的 Monte Carlo 零模型(B=10,000)评估显著性。

微观层级——个体合作倾向:

使用一阶 Wasserstein 距离衡量个体行为异质性的分布差异:

决策规则层级——条件合作概率(以前一动作 和上一轮邻居合作比例分箱 为条件):

2.4 混合代理(Hybrid)模型

为模拟原实验中部分参与者"无稳定策略甚至随机选择"的现象,引入比例 随机代理(均匀选择 GREEN/BROWN),其余 仍由 LLM 控制;系统扫描 ,主文以 为代表。

3. 实验设计

  • 基准数据集:Gracia-Lázaro 等人(2012)的大规模人类网络化囚徒困境实验,包含
  • 规则格网络(Lattice):625 节点,平均度 4;
  • 异质性网络(Heterogeneous):604 节点,度
  • 控制条件:保留度序列但每轮随机重连(time-varying);
  • 三种 backstory 变体(STUDENT / GENDER / STUDENT AND GENDER)。
  • 对比方法(LLM 模型):9 个开源权重 LLM,跨多个家族与规模——LLaMA 系列(3.1:8b、3.1:70b、4:16x17b)、对齐修改变体(abliterated 版本)、DeepSeek(7b、67b)、Qwen3:32b、SmolLM2.1:7b。
  • 温度敏感性:补充从 均匀采样的随机温度实验。
  • 主要代理选择:基于规则格网络上与人类合作的整体匹配度,选取 llama4:16x17b 作为主分析模型。
  • 对照基准:与人类数据对比的同时,构造参数化零模型(各智能体按网络平均合作率独立 Bernoulli 抽样)作为异质性匹配的基线参照。

4. 资源与算力

  • 论文未明确报告使用的 GPU 型号、数量、训练时长或总算力消耗。
  • 仅说明采用本地 Ollama 后端运行开源权重模型,无外部 API 依赖;智能体逐节点独立查询。由于分析对每个智能体每轮独立调用 LLM 推理,可推断存在显著的计算开销,但具体规模未披露。
  • 没有任何模型训练过程——所有模型均为预训练/指令调优版本直接推理使用。

5. 实验数量与充分性

  • 模型筛选阶段:9 个 LLM 在规则格网络上各运行 1 次,得到 9 条宏观合作轨迹用于横向比较。
  • 主分析阶段:选定 llama4:16x17b 后,覆盖 2 网络 × 2 条件 × 2 代理组合(full LLM / 80% LLM + 20% Random)× 3 种 backstory,并辅以 Qwen3:32b 的重复验证。
  • 微观稳健性:对条件合作进行 20 次独立运行(lattice 与 heterogeneous),置信区间以 Cluster bootstrap 估计。
  • 参数扫描:随机代理比例 的系统扫描(10 个取值)。
  • 温度扫描:补充实验(见补充材料)。
  • 充分性评价
  • 优点:跨宏观/微观/决策规则三层级、多种网络与条件、多模型对比、混合代理的消融测试,方法学上较为系统;并通过 Monte Carlo 零模型提供显著性。
  • 不足:每个实验大多仅运行单次实现(除条件合作分析外),单次运行的可重复性、随机种子敏感性未充分报告;人类基准本身也仅来自一项实验,缺乏跨实验/跨群体的外部效度验证。

6. 主要结论与发现

  • 宏观-微观脱节(macro–micro dissociation)是本文的核心结论:选定的 LLM(llama4:16x17b)能复现人类合作动态的若干宏观特征——早期下降、后期稳定、跨网络拓扑收敛——但未能复现个体行为分布与决策规则
  • 模型不可互换:9 个 LLM 在相同激励与网络下产生显著不同的合作水平;qwen3:32b 合作率最高,llama4:16x17b 最接近人类;同一基座的对齐修改变体(abliterated)产生系统性差异的合作轨迹。
  • 行为异质性低估:LLM 群体的合作倾向分布显著窄于人类(如异质性网络:经验 σ=0.158 vs. LLM σ=0.148;格点网络:σ=0.170 vs. σ=0.069)。
  • 条件合作规则失配:LLM 群体在邻居合作比例与自身上一动作条件下呈现的条件合作曲线与人类存在定量乃至定性差异(如格点网络中"背叛后"响应出现斜率反转);该差异在合作后()条件下尤为突出。
  • 混合代理部分改善:引入 20% 随机代理改善了部分网络条件下的波动同步性()与个体异质性匹配(),但未能消除决策规则层面的失配——暗示随机性是塑造人类行为多样性的必要成分,但仅靠噪声不足以恢复人类决策机制。
  • 零模型对比:在某些条件下 LLM 的 已接近甚至优于独立 Bernoulli 零模型,说明 LLM 的异质性部分可由"围绕均值的随机波动"解释,缺乏人类那种结构性多样化。
  • 方法学含义:验证 LLM 代理须覆盖聚合动态 + 个体异质性 + 情境依赖决策规则三层级,而非仅依赖结果层面的一致性;模型选择本身即是实质性的建模假设而非技术细节。

7. 优点

  • 直接实证基准:以已发表的、可重复获取的人类实验数据作为对照,避免"自创基准"陷阱。
  • 多层级评估框架:宏观轨迹 → AR(1) 动态结构 → Wasserstein 个体异质性 → 条件合作规则,层层递进,揭示了被聚合指标掩盖的失配。
  • 零模型与显著性检验:采用保留边际分布的时间序列零模型与标准零相关检验,避免单凭绝对数值下结论。
  • 模型对比的系统性:覆盖 4 个家族、9 个模型、含对齐修改变体,结论不依赖单一模型。
  • 混合代理的诊断价值:将"随机代理"作为对照,而非将其当作"修正器",清晰地分离了噪声贡献机制贡献
  • 稳健性检查:跨 backstory、温度、第二个模型(Qwen3)的重复验证,降低结论对单一设置过拟合的风险。
  • 结果可视化完整:提供合作率轨迹、合作倾向直方图、条件合作曲线等多类图形,附带补充材料中详尽的分布与统计表。

8. 不足与局限

  • 基准单一:人类数据仅来自一项实验、单一受试群体与制度情境,未在不同社会困境或文化群体上重复检验,外部效度受限。
  • 模型范围有限:仅评估开源权重 LLM(截止 2026 年 3 月可用版本),闭源旗舰模型(如 GPT-4 系列、Claude 系列)行为可能不同;不同提示结构与微调路径的稳健性仍待探索。
  • 单次运行依赖:除条件合作分析外,多数主结果基于单次仿真实现,未充分报告跨随机种子与多运行的方差;尽管补充材料给出 20 次运行的补充结果,但宏观轨迹层面仍以单次实现为主。
  • 提示设计可能影响结果:使用颜色标签(GREEN/BROWN)和"邻居是人类"的表述显著改变了行为,说明 LLM 输出对提示框架敏感,但本文未做大规模提示敏感性扫描。
  • 混合代理的最优 选择主观 来自系统扫描后的"折中"判断,缺乏将混合代理作为生成模型的明确理论框架。
  • 算力与成本信息缺失:未披露推理所需的硬件、运行时间与能源消耗,影响方法的可复现性评估
  • 应用边界:作者明确指出 LLM 智能体目前不能替代人类实验作为实证基准;但若用于"在接近基准的条件下预测有限聚合结果"仍有一定价值——这一边界的具体刻画仍较粗略。
  • 行为多样性成因未深入:仅推测"对齐训练导致行为压缩与模式坍缩"是 LLM 个体异质性不足的可能原因,但未提供对该假设的直接检验(如未对齐变体虽然提及但未系统比较)。
  • 可解释性局限:LLM 返回的"reasoning"文本字段未被纳入分析,错过了检验 LLM 是否以类人推理路径做出决策的机会。

总结性判断:本文以严谨的多层级实证设计,揭示了 LLM 在社会仿真中作为人类替代品的层级依赖性——宏观结果可信并不等于微观机制可信。这一结论对将 LLM 代理用于数字孪生、政策仿真、agent-based 建模的研究具有重要的警示意义:模型选择本身就是建模假设,验证须跨聚合、分布与机制三层级。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记