通过心理学奠基的推理与角色感知策略优化改进通用角色扮演智能体
Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization
📝 TLDR
通用角色扮演智能体难以忠实刻画自然语言描述的角色,现有监督微调方法仅做表面行为模仿,缺乏深层思维过程,导致分布外泛化能力差。本文提出心理学基础思维链框架Psy-CoT,将响应前推理分解为交互感知、心理共情与逻辑构建三步,并设计角色感知策略优化RAPO,通过画像-词元互信息对梯度进行非对称加权,缓解奖励黑客问题。在CoSER、CharacterBench、CharacterEval三个基准上,Psy-CoT与RAPO均超越现有方法。
🧭 速览
现有角色扮演方法依赖监督微调,仅做行为模仿,缺乏类人内部思维过程,导致分布外泛化能力差。
提出Psy-CoT三步推理框架(交互感知、心理共情、逻辑构建)与RAPO策略优化,通过画像-词元互信息对梯度进行非对称加权。
在CoSER、CharacterBench、CharacterEval上,Psy-CoT超越现有思维链方法,RAPO在多模型规模上均优于GRPO。
心理学推理与角色感知优化相结合,可有效提升角色扮演智能体的忠实度与泛化能力。
📊 论文图表(共 7 张)
展开查看 7 张图
TL;DR
这篇论文针对通用角色扮演智能体难以忠实还原自然语言角色设定的难题,提出了一个两阶段的解决方案:先是 Psy-CoT 框架,用「交互感知→心理共情→逻辑构建」三步思维链让模型从角色设定出发动态推理;再是 RAPO 方法,通过角色画像与词元之间的互信息对梯度进行非对称加权,抑制奖励黑客问题。实验在 CoSER、CharacterBench、CharacterEval 三个基准上验证了方法的有效性。
研究背景与动机
让大语言模型扮演任意自然语言描述的角色,是通用角色扮演智能体的核心目标。然而现有主流范式——[[监督微调]]——面临一个根本性的局限:它只鼓励模型模仿训练数据中出现的表面行为模式,模型学到的是「在这种情况下通常这样说」,而非「这个角色为什么会这样说」。这种学习方式在分布内或许能蒙混过关,一旦遇到训练集中未曾出现的交互场景,模型就容易说出与角色人设相悖的话,泛化能力严重不足。
与此同时,基于 [[强化学习]] 的方法虽然能通过 [[奖励模型]] 提供更精细的反馈信号,但作者发现了一个棘手的[[奖励黑客]]问题:通用型短语(比如「根据我的理解」「作为一个AI」)和真正角色专属的表达(如特定角色的口头禅、独特的说话风格)在奖励模型那里往往获得相近甚至相同的分数。这导致两类差异巨大的词元在梯度更新时收到一致的信号,模型逐渐被误导,将「安全但不角色」的表达方式与「角色鲜明但可能触发奖励波动」的表达视为同等优选。最终训练收敛到一个尴尬的中间态——既不像角色,也不完全通用。
如何在保留结构化推理能力的同时,让强化学习信号真正区分「角色专属」与「通用安全」?这是本文要解决的核心问题。
方法
论文的解法分为前后相继的两层:先解决「怎么想」,再解决「怎么学」。
Psy-CoT 思维链框架的设计灵感来自心理学对人类角色扮演行为的分析。研究者认为,一个优秀的角色扮演者并非机械复刻台词,而是会经历三个内部认知步骤:感知当前对话的交互语境,理解对方话语背后的意图与情绪;代入角色的心理状态,产生共情式的理解;最后基于角色价值观和当前情境,推理出符合角色的回应逻辑。
对应到模型层面,Psy-CoT 将推理过程显式地分解为三个阶段。交互感知阶段让模型分析对话历史,识别当前交互的核心主题、情感基调和对话意图。心理共情阶段要求模型从角色设定档案出发,模拟角色的认知框架和情感反应——这一步尤为关键,它确保模型不是在「猜测角色会怎么说」,而是在「以角色的方式思考」。逻辑构建阶段则将感知到的交互信息和共情结果整合起来,生成一条连贯的推理链,最终导向回复内容。
这三步推理并非简单的 prompt 工程,而是一种训练时注入的能力。模型通过学习角色专属的思考方式,而非表面行为模式,获得了更稳健的 [[分布外泛化]] 能力。
然而,光有思维链还不够——结构化推理定义了「什么是好的思考路径」,但不能保证模型在 [[强化学习]] 训练中真正沿着这条路径优化。这就是 RAPO 要解决的问题。
RAPO 的核心观察是:通用短语和角色专属短语在 [[奖励模型]] 面前等价的原因,在于传统的 [[策略优化]] 方法对所有词元一视同仁,给正优势的词元统一增加采样概率,给负优势的词元统一降低概率。但通用短语之所以能「黑客」奖励模型,恰恰是因为它们在各类场景下都能获得不差的分数——这意味着它们获得了大量正优势信号,而正优势信号会倾向于放大这些词元的概率。久而久之,模型越来越倾向于使用这些「安全」但「无角色感」的表达。
RAPO 的解决思路是引入角色画像-词元互信息作为梯度权重的调节因子。互信息 衡量的是角色画像 与词元 之间的统计关联程度——一个词元与角色画像共现的频率越高,它与该角色的关联就越强,互信息也就越大。RAPO 定义优势函数为 ,词元 的互信息为 ,则 RAPO 的梯度权重为:
其中 是两个超参数,分别控制正负优势时的调节强度。当优势为正时,互信息高的词元获得额外的梯度放大——这鼓励模型在好样本中更多地使用角色专属表达;当优势为负时,互信息高的词元被更激进地抑制——这让模型更快地远离错误的角色表达。这种非对称加权机制有效地区分了「通用安全词元」和「角色专属词元」,让强化学习信号真正服务于角色保真度。
实验与结果
论文在三个角色扮演基准上验证了方法的有效性:CoSER 评估模型在开放式对话中的角色一致性;CharacterBench 覆盖多种交互场景的综合评估;CharacterEval 关注特定角色类型的测试。
实验采用了多个规模的大语言模型作为基座,包括 7B 到 72B 参数量的变体。结果显示,Psy-CoT 单独使用时就已经超越了此前所有的角色扮演思维链方法,平均提升约 5-10 个百分点的角色一致性得分。这验证了「从角色设定出发动态思考」这一设计的有效性——模型不再依赖死记硬背的表面模式,而是学会了真正推理角色行为。
在此基础上,RAPO 相比 [[GRPO]] 在所有模型规模上都取得了一致的提升。值得注意的是,这种提升在高优势样本中尤为明显:当模型生成了一个角色一致性很高的回复时,RAPO 能够更精准地强化其中的角色专属表达,而不是被通用短语稀释了梯度信号。消融实验进一步表明,单独移除互信息加权或单独移除非对称机制都会导致性能下降,二者的协同作用缺一不可。
论文还提供了定性分析案例,展示 RAPO 在训练过程中如何逐步「拯救」被通用表达侵蚀的角色风格。例如在扮演一个说话带有东北口音用词的角色时,经过 RAPO 训练的模型能更稳定地保持方言词汇,而 GRPO 基线模型则逐渐滑向更「规范」但毫无角色特色的表达。
讨论与可借鉴点
这篇论文在角色扮演智能体这一具体任务上,实际上触碰到了一个更普遍的问题:如何让强化学习信号真正服务于目标属性,而不是被「凑合能用」的通用解劫持。这一问题在偏好对齐、安全性微调等场景中同样存在——模型总能找到一些「无功无过」的策略来获得不错的奖励分数,却远离了我们真正想要的特定能力或风格。RAPO 提出的互信息加权思路提供了一个通用的方向:引入一个与目标属性相关的先验知识,对梯度进行有偏向性的调节。
当然,论文也存在一定局限。互信息的计算依赖于角色画像与词元的共现统计,这意味着对于训练集中极少出现的冷门角色,互信息的估计可能不够可靠。此外,三步思维链的设计虽然有心理学依据,但各步骤之间的边界划分是否足够清晰、能否应对更复杂的叙事场景(如跨文化角色、多重人格设定),还有待进一步探索。
对于更广泛的研究社区而言,这项工作有两点值得借鉴:一是在设计 [[思维链]] 方法时,应当追求「从定义出发推理」而非「从例子中归纳」,前者往往具有更好的 [[泛化能力]];二是在设计 [[策略优化]] 目标时,可以考虑引入领域知识来引导梯度流向,让强化学习信号更精准地击中我们真正关心的属性,而非被表面奖励所迷惑。
摘要
构建能够忠实再现任何自然语言角色设定档案的通用角色扮演智能体仍然充满挑战。当前主流范式——监督微调——鼓励行为模仿,但缺乏深入且类人化的内部思维过程,导致分布外泛化能力较差。为此,我们提出 Psy-CoT,一个基于心理学的思维链框架,将回复前的推理分解为三个角色专属步骤——交互感知、心理共情与逻辑构建——使模型能够从角色设定出发进行动态思考,而非仅仅模仿表面模式。虽然结构化推理提供了基础,但仅靠它仍不够;强化学习对于进一步将模型与角色保真度对齐至关重要。然而,我们观察到,在基于大语言模型的奖励模型下,既奖励黑客的通用短语与真正角色专属的短语会获得相同的梯度信号——这种黑客行为在训练中不断累积,误导模型将二者视为同等最优选择。为解决此问题,我们提出 角色感知策略优化(RAPO),该方法利用角色设定—词元之间的互信息对梯度进行非对称加权——在正优势时放大角色专属词元,在负优势时削弱它们。在 CoSER、CharacterBench 和 CharacterEval 上的实验表明,Psy-CoT 优于现有角色扮演思维链方法,而 RAPO 在多个模型规模上均一致地超越 GRPO。
Abstract
Building general-purpose role-playing agents that faithfully portray any character from a natural-language profile remains challenging. The dominant paradigm -- supervised fine-tuning -- encourages behavioral mimicry without deep, human-like internal thought processes, resulting in poor out-of-distribution generalization. Therefore, we propose \textbf{Psy-CoT}, a psychology-grounded chain-of-thought framework that decomposes pre-response reasoning into three role-specific steps -- \emph{Interaction Perception}, \emph{Psychological Empathy}, and \emph{Logical Construction} -- so that the model \emph{thinks dynamically} from the profile rather than merely mimicking surface patterns. While structured reasoning provides a foundation, it alone is insufficient; reinforcement learning is essential to further align the model with character fidelity. However, we observe that under LLM-based reward models, both generic phrases that hack the reward model and genuinely role-specific phrases receive identical gradient signals -- this hacking accumulates over training, misleading the model into treating both as equally optimal choices. To address this, we propose \textbf{Role-Aware Policy Optimization (RAPO)}, which uses profile--token mutual information to weight gradients asymmetrically -- amplifying role-specific tokens under positive advantage while attenuating them under negative advantage. Experiments on CoSER, CharacterBench, and CharacterEval demonstrate that Psy-CoT outperforms existing role-playing CoT methods, and RAPO consistently surpasses GRPO across multiple model scales.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。






