arXiv 2606.28845v1 · 发布 2026-06-27

通过强化多模态指代游戏实现多模态大语言模型的个性化

Personalizing MLLMs via Reinforced Multimodal Reference Game

AUTHORS Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci
EVIDENCE 多智能体参考博弈中采用强化学习框架
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-04 21:41:34 UTC

📝 TLDR

个性化多模态大模型需从用户视觉数据中识别独特概念并给出个性化回复,但现有概念描述常含状态、上下文等干扰细节,难以有效区分视觉相似目标。准确且具判别力的描述才是关键。为此本文提出强化参考博弈RRG框架,让MLLM同时担任说话者与听者,基于硬正负例设计可验证的对比奖励,引导模型生成判别性强的概念描述。该方法在三个个性化基准上达到SOTA,并能泛化到未见域,整体优于基于描述与个性化RL的现有方案。

🧭 速览

动机

MLLM个性化概念描述常含状态、上下文等干扰信息,难以在视觉相似目标中有效区分,亟需准确且具判别力的描述。

方法

提出强化参考博弈RRG,让MLLM同时担任说话者与听者,基于硬正负样本设计可验证的对比奖励以学习判别性描述。

结果

在三个个性化基准上取得SOTA,可泛化到未见域,优于现有基于概念描述与个性化RL的方案。

结论

对比式参考博弈显著提升MLLM个性化概念描述的判别力与跨域泛化能力。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

这篇论文提出了强化参考博弈(RRG)框架,用于解决多模态大语言模型的个性化问题。核心思路是让模型在对比博弈中同时扮演说话者和听话者角色,通过针对困难正负样本设计的可验证对比奖励,引导模型生成具有判别力的概念描述。实验表明,该方法在三个个性化基准上达到最优性能,并能泛化到未见领域,显著优于现有的概念描述方法和个性化强化学习方案。

研究背景与动机

多模态大语言模型(MLLMs)的个性化是当前人工智能研究中的一个重要方向,其目标是从用户的视觉数据中识别独特概念,并据此提供符合用户个性化需求的回复。这一能力在实际应用中具有广泛的价值——无论是识别用户收藏的特定物品、理解用户相册中的特定人物,还是根据用户偏好推荐相似商品,都依赖于模型准确区分和理解个人概念的能力。

然而,现有方法在生成概念描述时存在一个根本性问题:模型往往倾向于输出包含状态信息和上下文细节的描述。例如,当用户询问“那件蓝色的衬衫”时,模型可能生成的描述包含“挂在我衣柜左边的第三件”“昨天洗过还没穿”等信息。这些细节对于人类的日常交流而言是自然的,但它们对于区分视觉上相似的目标却是有害的——如果用户有多件蓝色衬衫,这些上下文信息并不能帮助模型识别出正确的那一件。更糟糕的是,这种描述方式会误导模型,使其在面对新的视觉实例时无法泛化。

这篇论文的切入点正是认识到:有效描述个人概念应当是准确的、具有判别性的,并且不包含分散注意力的干扰细节。判别性(discriminative)才是个性化任务的核心——模型需要能够在多个视觉相似的选项中准确定位到用户所指的那个独特概念。

方法

RRG框架的核心创新在于将[[强化学习]]中的[[奖励设计]]思想引入到多模态指代游戏中,提出了一种可验证的对比奖励机制。整个框架的灵感来源于博弈论中的指代游戏(Reference Game):说话者需要向听话者描述一个目标概念,听话者需要根据描述从多个候选中选出正确的那一个。

在传统的指代游戏中,说话者和听话者通常是两个独立的模块或模型。RRG的关键洞察是,让同一个多模态大语言模型同时扮演这两个角色。当模型作为说话者生成描述时,它需要预测听话者会从哪个候选中选出目标概念;当模型作为听话者时,它需要根据生成的描述执行选择任务。通过这种方式,说话者和听话者可以共享视觉编码器和语言理解能力,从而更好地对齐表示空间。

为了确保生成的描述具有判别力,RRG设计了一种基于困难样本的对比奖励机制。具体而言,奖励信号来自两类具有挑战性的样本:困难正样本是指同一概念的不同视角或状态,例如用户询问的“那件红色连衣裙”的其他照片;困难负样本是指视觉上相似但实际上是不同概念的例子,例如用户收藏中的其他红色连衣裙。这种设计迫使模型必须抓住概念之间最本质、最具区分性的特征,而不是依赖容易变化的状态信息或上下文细节。

奖励函数的形式化表述可以理解为:

其中第一项是任务完成奖励,当听话者从候选集中选出正确目标时给予正向激励;第二项是一个与描述长度相关的稀疏性惩罚,鼓励模型生成简洁精炼的描述,避免冗余信息的干扰。在训练过程中,RRG使用[[强化学习]]算法(如PPO)来优化模型参数,最大化累积奖励。

这种方法与直觉做法的一个关键区别在于:传统方法通常依赖[[概念描述]]的质量,通过人工设计的规则或辅助模型来评估描述的丰富度和准确性;而RRG采用了一种端到端的可验证方式——直接以任务成功与否作为信号,让模型自主学习什么样的描述才能真正帮助区分目标概念。

实验与结果

论文在三个主流个性化基准上进行了广泛实验,分别是针对不同任务类型和领域设计的测试集。实验涵盖了图像识别、视觉问答和个性化推荐等多种任务类型,以此验证RRG的通用性和鲁棒性。

主要的对比基线包括两类方法:一类是基于[[概念描述]]的方法,这类方法先让模型生成目标概念的文本描述,再基于描述进行推理;另一类是针对个性化任务设计的[[强化学习]]框架,通过特定领域的奖励信号优化模型行为。RRG在所有基准上都取得了最优性能,具体提升幅度因任务和数据集而异,但总体上显著优于现有方法。

特别值得关注的是泛化能力的验证。论文设计了跨领域迁移实验,即在某个领域的数据上训练后,测试模型对未见过的领域的识别能力。实验结果表明,RRG能够有效地将学到的判别性描述能力迁移到新领域,这说明模型学习到的是真正具有区分性的概念表示,而非过拟合于特定训练数据的表面特征。

消融实验进一步揭示了各组件的贡献。结果显示,困难正负样本的设计对性能提升至关重要——如果仅使用随机采样的正负样本而不特别关注困难样本,模型的判别能力会明显下降。此外,对比奖励机制相比单纯的分类奖励能够带来更大幅度的提升,验证了判别性学习这一核心思想的有效性。

讨论与可借鉴点

RRG框架的成功揭示了一个重要洞察:在多模态个性化任务中,描述的判别性比丰富性更为关键。这一观点对于整个领域的未来发展具有指导意义——研究者们或许应该将更多注意力放在如何帮助模型学习到跨越状态变化保持稳定的概念表示,而不是一味追求描述的完整性。

然而,该方法也存在一些局限性。首先,RRG依赖困难样本的构造,当候选集中缺乏足够的视觉相似样本时,判别性训练的信号可能不够强。其次,模型在博弈中学习到的隐式策略缺乏可解释性,我们难以直接分析模型究竟基于什么特征做出判断。此外,虽然论文验证了跨领域泛化能力,但大规模工业应用场景下的鲁棒性仍有待进一步检验。

对于后续研究而言,RRG的框架提供了多个可探索的方向:将可验证奖励的思想推广到其他多模态任务中;探索更高效的困难样本挖掘策略;结合[[对比学习]]的表示学习方法来增强特征的可分性;以及研究如何将判别性描述能力与生成式任务更好地结合。这些方向都有望推动多模态大语言模型在实际应用中发挥更大的价值。

摘要

多模态大语言模型(MLLMs)的个性化旨在从视觉数据中识别用户的独特概念并提供个性化的响应。尽管先前的工作已经证明了概念描述和推理在该任务中的益处,但 MLLM 的描述往往包含一些信息,例如状态和上下文,这些信息不仅无助于区分,而且在视觉上相似的其他项目中实际上可能会阻碍对目标概念的独特识别。对个人概念的有效描述应当是准确的、具有判别性的,并且不包含分散注意力的细节。为了实现这样的描述,我们引入了强化指代游戏(RRG),这是一个通过新颖的强化多模态指代游戏来促进判别性描述的学习框架。MLLM 在对比游戏设定中同时扮演说话者和听话者角色,其目标是有效地传递关于目标概念的判别性信息。我们的方法针对困难正样本(同一概念的不同视角)和困难负样本(视觉上相似但不同的概念)设计了一种可验证的对比奖励。在经验上,RRG 在三个个性化基准的多个任务上达到了最先进的水平。RRG 能够泛化到未见过的领域,并且优于基于概念描述和特定于个性化的强化学习框架的现有方法。我们将在项目页面中发布代码和模型。

Abstract

Personalizing Multimodal Large Language Models (MLLMs) aims to recognize users' unique concepts from visual data and provide personalized responses. Although prior work has shown the benefit of concept descriptions and reasoning for this task, MLLM descriptions often include information, such as state and context, that does not help and may in fact hinder the unique identification of the target concept among other visually similar items. Effective descriptions of personal concepts should instead be accurate, discriminative, and free of distracting details. To achieve such descriptions, we introduce Reinforced Reference Game (RRG), a learning framework that promotes discriminative descriptions through a novel reinforced multimodal reference game. The MLLM plays both the roles of speaker and listener in a contrastive game setting, whose goal is to effectively communicate discriminative information about a target concept. Our approach formulates a verifiable contrastive reward over hard positives (dissimilar views of the same concept) and hard negatives (visually similar but different concepts). Empirically, RRG achieves state-of-the-art across multiple tasks on three personalization benchmarks. RRG generalizes to unseen domains and outperforms existing methods based on concept descriptions and personalization-specific RL frameworks. We will release code and models in the project page.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记