看与思:用于推荐的多模态记忆增强型智能体协同框架
Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation
📝 TLDR
现有基于大语言模型的智能体推荐系统受限于文本中心输入和粗粒度记忆更新,难以捕捉视觉证据且易发生偏好漂移。为此,本文提出MMEACR多模态记忆增强的智能体协作推荐框架,采用双轨记忆架构分离可解释推理与细粒度多模态匹配。推理轨由用户与物品记忆智能体通过属性引导的强化-反思机制维护持久多模态记忆,匹配轨基于原始交互文本与物品图像构建解耦嵌入记忆,二者经加权倒数秩融合生成可解释排序。在三个真实领域实验表明,该框架在视觉相关推荐场景中取得显著提升。
🧭 速览
LLM智能体推荐系统依赖文本输入且记忆更新粗糙,难以利用视觉证据,推理中易受语义噪声和偏好漂移影响。
提出MMEACR双轨框架:推理轨由用户/物品智能体以属性引导的强化-反思机制维护多模态记忆;匹配轨从交互与图像构建解耦嵌入记忆,经加权RRF融合排序。
在三个真实数据集上整体性能优于LLM及智能体基线方法,在视觉相关推荐场景中提升尤为显著。
双轨设计有效融合可解释推理与细粒度多模态信号,为视觉化推荐场景提供更鲁棒的智能体协作方案。
📊 论文图表(共 12 张)
展开查看 12 张图
TL;DR
本文针对现有大语言模型推荐系统忽视视觉信息的短板,提出了 MMEACR 多模态记忆增强型智能体协同框架。该框架通过双轨记忆架构将推理过程与多模态匹配解耦——推理轨维护可解释的持久记忆,匹配轨保留细粒度跨模态信号,两轨通过加权倒数秩融合生成排序结果。实验在三个真实领域数据集上验证了该方法的有效性,尤其在视觉驱动的推荐场景中取得显著提升。
研究背景与动机
推荐系统的核心目标是在海量信息中为用户匹配最符合其偏好的物品。传统协同过滤方法依赖用户-物品交互矩阵的统计规律,虽能捕捉群体偏好模式,却难以解释推荐背后的原因。近年来,基于大语言模型的智能体推荐系统兴起,其优势在于能够通过自然语言进行推理,从而提供可解释的推荐理由。然而,这类系统仍面临两个根本性制约。
首先是输入形式的局限。当前的 LLM 推荐智能体大多以文本作为唯一的信息载体,用户的偏好描述和物品的属性信息都被转化为文本输入。在实际场景中,许多商品的核心吸引力恰恰在于其视觉特征——服装的配色与版型、家居用品的造型设计、电子产品的外观工艺,这些信息难以用文字充分表达,而视觉信号的缺失直接导致推荐偏差。其次是记忆机制的粗糙。现有系统通常采用简单的键值存储或会话级别的上下文窗口来管理记忆,缺乏对多模态信息的结构化组织,也无法区分哪些记忆值得长期保留。这种粗粒度的记忆更新使得智能体容易受到近期交互的过度影响,产生偏好漂移——用户的长远兴趣被短期行为所覆盖。
MMEACR 的切入点是承认推理与匹配具有不同的信息需求:推理过程需要抽象、可解释的知识表示,便于进行逻辑推演;而匹配过程则需要保留原始的多模态细节,以便捕捉文本描述与图像之间的微妙关联。将这两者混为一谈,正是现有方法的症结所在。
方法
MMEACR 的核心设计是双轨记忆架构,它将推荐过程分为推理轨道与匹配轨道两条并行的处理路径。
推理轨的设计围绕多模态记忆的持久化展开。该轨道包含两类协同工作的智能体:用户记忆智能体与物品记忆智能体。每个智能体维护一个持久的多模态记忆库,其中不仅存储文本形式的偏好描述或属性说明,还同时记录相关的视觉特征表示。两条智能体之间通过属性引导的强化-反思机制进行交互:当用户与某物品发生交互时,两个智能体分别评估此次交互与既有记忆的一致性程度——如果新信息强化了已有认知,则通过强化操作提升相关记忆的权重;如果出现矛盾或意外信号,则触发反思机制,重新审视并可能修正记忆结构。这种设计使得记忆能够随时间累积用户偏好的演化轨迹,而不仅仅是简单地追加新记录。
匹配轨的设计则专注于细粒度的跨模态信号捕获。与推理轨不同,匹配轨并不构建抽象的知识表示,而是直接处理原始交互文本与物品图像的对应关系。具体而言,系统从用户的历史交互叙述中提取语义表示,同时从物品图像中提取视觉特征,两者拼接后形成多模态嵌入向量。为保留不同模态信息的独立性,这里采用了解耦嵌入策略——文本嵌入与图像嵌入并非简单融合,而是保持各自的通道,仅在需要时才进行交互。这种处理方式的优势在于能够捕捉那些无法被结构化记忆捕获的细节信息,例如用户对某件衣服的偏好究竟是基于其颜色还是款式,这些细粒度信号往往隐含在文本描述与图像的对应关系中。
双轨融合是该框架的关键环节。推理轨与匹配轨各自独立产生候选物品的排序列表,但由于它们的信息来源和推理机制不同,两份排序可能存在差异。为整合两者的优势,MMEACR 采用加权倒数秩融合算法。具体而言,对于物品 ,其在融合排序中的得分计算为:
其中 和 分别表示物品 在推理轨和匹配轨排序列表中的位置, 为可学习的融合权重。这种融合方式的优势在于:排名靠前的物品无论来自哪条轨道都能获得较高的融合得分,而排名靠后的物品则被有效压制,从而产生更加鲁棒的最终排序。
实验与结果
研究团队在三个真实领域数据集上进行了实验,分别覆盖时尚商品、家居用品和电子产品三个不同品类。这些数据集经过精心设计,确保既包含丰富的文本交互记录,又包含高质量的物品图像,能够充分验证多模态处理的有效性。
实验对比了多种基线方法,包括传统协同过滤方法、纯文本 LLM 推荐方法以及早期的智能体推荐系统。结果显示,MMEACR 在综合性能指标上显著优于所有基线方法。特别值得注意的是,研究者专门设计了视觉相关性评估——将测试样本按照其视觉信息在决策中的重要性进行标注区分。在高视觉相关性的样本上,MMEACR 的优势尤为突出,领先幅度明显大于低视觉相关性样本,这直接验证了双轨架构中匹配轨对视觉信息的有效利用。
ablation 实验进一步揭示了各组件的贡献度。移除匹配轨后,系统在视觉相关推荐上的性能下降幅度最大;移除推理轨后,可解释性指标明显恶化,说明两条轨道各自承担着不可替代的功能。融合权重的敏感性分析表明, 的最优值并非固定不变,而是与具体领域相关——时尚类数据集中匹配轨权重偏高,而电子产品的推荐则更依赖推理轨的抽象推理能力。
讨论与可借鉴点
MMEACR 展示了一条有价值的探索路径:将推理与匹配解耦,让擅长逻辑推理的模块专注于结构化知识管理,让擅长模式识别的模块保留原始信号的丰富性。这种设计哲学值得在其他多模态推荐场景中借鉴。
然而,该框架也存在一些局限。首先是计算开销问题,双轨架构意味着两条路径需要独立运行和存储记忆,对于大规模工业部署而言可能带来额外的延迟和资源消耗。其次,属性引导的强化-反思机制需要预先定义属性维度,这在某些领域可能难以界定——如果用户偏好的形成机制本身就不清晰,如何设计有效的属性引导?此外,融合权重 的自动调优虽然通过实验验证了领域依赖性,但尚未形成一套从数据特征自动推断最优权重的理论指导。
对于后续研究,一个有前景的方向是将双轨架构扩展到更多模态。当前框架主要处理文本与图像的协同,未来可考虑引入用户评论视频、商品展示动画等更丰富的视觉形态。另一个方向是探索记忆的动态演化机制——当前的记忆更新是事后进行的,是否可以在交互过程中实时调整记忆结构,使推理与匹配更加紧密耦合?这些问题的解答将推动多模态推荐系统向更高水平演进。
摘要
基于大语言模型(LLM)的智能体推荐系统在通过自然语言推理建模用户偏好方面展现出潜力,但仍然受限于以文本为中心的输入和粗粒度的记忆更新,导致智能体容易遗漏视觉证据、语义噪声以及偏好漂移等问题。为应对这些局限性,我们提出了 MMEACR,一种用于推荐的多模态记忆增强型智能体协同框架。MMEACR 引入了一种双轨记忆架构,将可解释的智能体推理与细粒度的多模态匹配相分离。在推理轨道中,协同工作的用户记忆智能体与物品记忆智能体通过属性引导的强化—反思机制维护持久的多模态记忆并对其进行更新。在匹配轨道中,从原始交互叙述与物品图像出发构建一个解耦的多模态嵌入记忆,以保留超出结构化记忆更新范围的细粒度跨模态信号。两条轨道通过加权倒数秩融合(Reciprocal Rank Fusion)进行整合,从而生成鲁棒且可解释的排序结果。在三个真实领域上的实验表明,MMEACR 在与具有竞争力的基于 LLM 的方法和基于智能体的方法相比时取得了优异的整体性能,并在视觉驱动的推荐场景中取得了显著的提升。
Abstract
Large language model (LLM)-based agentic recommender systems show promise in modeling user preferences through natural-language reasoning, yet they remain limited by text-centric inputs and coarse-grained memory updates, making agents prone to missing visual evidence, semantic noise, and preference drift. To address these limitations, we propose MMEACR, a Multimodal Memory-Enhanced Agent Collaboration framework for recommendation. MMEACR introduces a dual-track memory architecture that separates interpretable agent reasoning from fine-grained multimodal matching. In the reasoning track, collaborative User and Item Memory Agents maintain persistent multimodal memories and update them through an attribute-guided reinforcement-and-reflection mechanism. In the matching track, a decoupled multi-modal embedding memory is built from raw interaction narratives and item images to preserve detailed cross-modal signals beyond structured memory updates. The two tracks are integrated through weighted Reciprocal Rank Fusion to produce robust and interpretable rankings. Experiments on three real-world domains show that MMEACR achieves strong overall performance against competitive LLM-based and agent-based baselines, with notable gains in visually grounded recommendation scenarios.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。











