arXiv 2606.27443v1 · 发布 2026-06-25

个性组成何时对多智能体大语言模型团队重要?

When Does Personality Composition Matter for Multi-Agent LLM Teams?

AUTHORS Aryan Keluskar, Amrita Bhattacharjee, Huan Liu
EVIDENCE 多智能体LLM团队的合作与对抗动态
SCORE 0.8
CATEGORIES TASK mas
GENERATED 2026-07-04 02:38:02 UTC

📝 TLDR

多智能体大语言模型团队中,性格提示虽能改变沟通风格,但这些行为变化是否真正影响任务表现尚不清楚。本研究在结构化编码、开放式研究协作和竞争性议价三种任务中,系统操纵前沿大模型的性格组合,考察其对团队表现的影响。结果表明,性格效应高度依赖任务结构:编码任务几乎不受影响,而开放式协作与议价任务在低宜人性操纵下表现显著下降。该发现为多智能体系统设计提供了重要启示,并揭示了性格操纵的边界。

🧭 速览

动机

已有研究表明性格提示可改变LLM沟通风格,但其对客观任务表现的影响尚未在多领域系统检验。

方法

在前沿LLM上操纵性格特质,在编码、开放式协作、竞争性议价三类任务中评估团队表现。

结果

性格效应取决于任务结构:编码任务里程碑完成几乎不受影响,开放式协作与议价任务显著退化。

结论

研究揭示了多智能体系统中性格操纵的有效边界,为团队配置设计提供了参考依据。

📊 论文图表(共 3 张)

展开查看 3 张图

TL;DR

这项研究系统考察了[[大语言模型]]的人格提示是否会影响多智能体团队的任务表现。研究者在三种不同任务类型中操纵模型的性格特质,发现性格效应与任务结构密切相关:结构化程度高的编码任务几乎不受性格影响,而在需要灵活协作与社交互动的开放式任务中,低宜人性的提示会显著损害团队表现。这一发现揭示了性格操纵的有效边界,为多智能体系统的设计提供了重要的实践指导。

研究背景与动机

多智能体大语言模型系统近年来成为AI研究的重要方向。这类系统通过多个具备不同角色的[[智能体]]协作完成复杂任务,从代码生成到数据分析,展现出强大的能力。在设计这类系统时,一个常见做法是通过人格提示(personality prompting)来塑造智能体的交流风格——比如赋予某个智能体更激进或更温和的性格特征。然而,一个根本性的问题始终没有得到充分回答:这些表面上的交流风格变化,是否真正影响了团队完成任务的客观能力?

已有研究表明,当大语言模型被提示具有低宜人性(low agreeableness)时,会产生更多对抗性和争论性的语言;而被提示高宜人性的模型则表现得更加合作友好。这些发现让人们相信,通过精心设计的性格组合,可以让多智能体团队更高效地运作。但这种直觉是否经得起实证检验?交流风格的改变与任务结果之间是否存在必然联系?更重要的是,这种联系是否受到任务本身性质的调节?

这些问题之所以重要,是因为多智能体系统正在被部署到越来越多的实际应用场景中。如果我们对性格与表现之间关系的理解还停留在直觉层面,就可能导致系统设计决策缺乏科学依据,甚至产生适得其反的效果。例如,开发者可能会为了增加"团队活力"而给所有智能体赋予竞争性人格,却没有意识到这可能会在某些任务类型中严重拖累整体表现。

方法

研究团队采用了系统性的实验方法,在三种具有代表性的任务类型中操纵前沿大语言模型的人格特质。这种任务选择的设计本身就蕴含着对任务结构的深刻洞察:编码任务高度结构化,有明确的对错标准;开放式研究协作需要灵活的知识整合和创造性思考;竞争性议价则涉及复杂的社交动态和策略性互动。

人格操纵的具体方式沿用了该领域此前研究的标准做法,即通过系统提示词明确指定模型的性格特征。研究特别关注了[[宜人性]](agreeableness)这一核心人格维度,它在人类心理学中与亲社会行为、合作倾向密切相关。高宜人性的提示会使模型倾向于表达支持、认同和建设性意见,而低宜人性则导致更多质疑、反驳和对抗性语言。

为了全面考察性格组合的效果,研究者不仅测试了同质化的人格配置(全团队高宜人性或全团队低宜人性),还包括了混合配置场景,从而考察团队内部的性格多样性是否会产生不同影响。实验控制也相当严格,确保观察到的效果确实来源于人格操纵而非其他混淆因素。

实验与结果

实验结果呈现出鲜明的模式,揭示了任务结构在性格效应中的关键调节作用。

在结构化编码任务中,研究者观察到一个令人意外的现象:低宜人性的操纵确实导致了显著的交流变化,智能体之间产生了更多的技术争论和相互质疑。团队内部的讨论变得更加激烈,有时甚至出现了明显的分歧。然而,当最终考察里程碑完成情况时,这些交流风格的巨大变化几乎没有产生实质影响。任务完成的准确率、代码质量等关键指标在不同性格配置下保持稳定。

这一发现指向了一个重要事实:对于具有明确客观标准的任务,过程的有效性比表面的和谐更重要。争论本身并不一定是坏事——只要最终产出符合标准,激烈的技术讨论反而可能帮助发现潜在的缺陷。

然而,在开放式研究协作和竞争性议价任务中,情况截然不同。当智能体被提示低宜人性时,团队表现出现了显著且稳定的下降。在研究协作任务中,低宜人性的团队难以达成共识,知识整合的效率明显降低;在议价场景中,对抗性倾向导致双方陷入僵局频发、互不让步的困境,最终达成的交易数量和质量都大幅下滑。

这些结果清晰地表明,当任务的成功高度依赖于协作意愿、社交灵活性和关系维护时,人格配置就成为决定性因素。此时的交流风格不再只是"表面现象",而是直接塑造了互动质量,从而影响最终产出。

讨论与可借鉴点

这项研究最核心的启示在于揭示了性格操纵的有效边界。并非所有任务类型都值得在人格设计上投入精力——对于高度结构化的任务,人格配置的影响可以忽略不计,设计者应该将注意力放在更直接的因素上,如任务分解策略和工具使用效率。但对于依赖协作与社交的任务,性格组成就成为需要认真考虑的设计决策。

研究也揭示了当前研究的一些局限性。首先,人格操纵的长期效果尚未被考察——在实际部署场景中,初始配置的性格是否会随交互而发生漂移,这个问题仍有待回答。其次,混合性格配置的效果虽然被纳入考察,但研究者坦承其分析还不够深入,不同性格组合如何产生协同或对抗效应,值得进一步探究。最后,研究主要聚焦于二元对立的高低宜人性,而人类人格的复杂性远超这一维度,未来工作可以拓展到更丰富的人格特质空间。

对于多智能体系统的实践设计者而言,这项研究提供了明确的方向:先明确任务的核心性质,再决定是否需要在人格设计上下功夫。对于需要高协作性的应用,可以考虑给所有参与协作的智能体赋予较高宜人性的提示;对于涉及多方博弈的场景,则可能需要更精细的性格分配策略。关键是要认识到,性格是工具而非目的——它应该服务于任务需求,而非成为额外的复杂性来源。

摘要

人格提示塑造着大语言模型的交流方式,但这些行为变化是否会影响客观任务结果仍未得到充分探索。已有研究表明,被提示具有低宜人性的智能体会产生对抗性语言,而被提示具有高宜人性的智能体则变得更具合作性,但交流风格与任务表现之间的关系尚未在多个领域中被系统检验。在本工作中,我们通过在三个任务领域——结构化编码、开放式研究协作和竞争性议价——中操控前沿大语言模型的人格特质,调查个性组成是否影响多智能体团队的表现。我们发现,人格效应关键取决于任务结构。在编码任务中,低宜人性导致大幅度的交流偏移,但对里程碑完成几乎没有影响。在开放式协作和议价任务中,相同的操控则显著降低了表现。我们讨论了对多智能体系统设计的启示以及人格操控的局限性。

Abstract

Personality prompting shapes how large language models communicate, yet whether these behavioral shifts affect objective task outcomes remains under-explored. Prior work shows that agents prompted with low agreeableness produce adversarial language, while those prompted with high agreeableness become cooperative, but the relationship between communication style and task performance has not been systematically examined across multiple domains. In this work, we investigate whether personality composition matters for multi-agent team performance by manipulating personality traits across frontier LLMs on three task domains: structured coding, open-ended research collaboration, and competitive bargaining. We find that personality effects depend critically on task structure. In coding tasks, low agreeableness leads to large communication shifts that have little effect on milestone completion. In open-ended collaboration and bargaining, the same manipulation substantially degrades performance. We discuss implications for multi-agent system design and the limits of personality manipulation.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记