GRASP:面向智能体RAG的粒度感知搜索策略
GRASP: GRanularity-Aware Search Policy for Agentic RAG
📝 TLDR
GRASP提出粒度感知的搜索策略用于智能体检索增强生成,优化检索粒度以提高信息获取效率。
🧭 速览
静态RAG难以抉择何时检索、采用何种匹配方式及控制上下文粒度,无关标记易干扰智能体多步推理过程。
基于强化学习训练策略,赋予智能体语义搜索、关键词搜索与段落阅读三种动作,通过复合奖励联合优化答案质量与检索效率。
在多跳推理基准上同时提升检索召回率与问答准确率,显著优于单步检索、提示式智能体及强化学习类基线方法。
所学策略形成可解释的略读与精读行为模式,验证了学习协调异构检索信号与粒度控制对智能体RAG的关键价值。
📊 论文图表(共 3 张)
展开查看 3 张图
TL;DR
GRASP 是一项关于如何让大语言模型在多步推理过程中更聪明地「查资料」的研究。它没有沿用传统 RAG 那种一股脑检索整个文档的做法,而是用强化学习训练智能体学会三种检索动作——语义搜索、关键词搜索和段落阅读——根据任务需要灵活切换。实验表明,这种粒度感知的搜索策略能让模型在多跳问答任务上的检索召回率和最终答案准确率都明显提升。
研究背景与动机
传统的检索增强生成(RAG)解决的是「模型知识过时」或「知识有幻觉」的问题——在模型回答问题之前,先从外部知识库检索相关内容拼进上下文。但这种静态 RAG 的局限也很明显:它通常只做一次检索,检索粒度往往是整篇文档或固定长度的片段,而模型只能被动接受这些检索结果,没有能力判断「该不该检索」「用什么方式检索」「检索回来的东西够不够用」。
当 RAG 与大语言模型结合形成「智能体 RAG」时,情况变得更复杂。模型可以在推理过程中反复调用检索工具、迭代式地获取信息,但这反而带来了新的问题。首先是「何时检索」的决策问题——模型需要在继续推理和暂停去查资料之间做选择,太早检索会浪费计算资源,太晚检索可能被错误信息带偏。其次是「用什么方式检索」的问题:语义搜索擅长找语义相近的内容但可能遗漏精确的实体名称,关键词搜索能找到精确匹配但依赖用户query的用词质量,两者各有优劣。最后是「粒度控制」的核心挑战:检索回来的上下文如果包含太多无关信息,会在有限的上下文窗口里挤占真正有用的 tokens,反而干扰模型推理。
这些问题的共同根源在于,模型缺乏对「检索粒度」的感知能力——它不知道什么时候该大而化之地搜,什么时候该精确到某个段落甚至某句话。GRASP 的切入点正是这个粒度问题:与其让模型被动接收粗粒度的检索结果,不如让它学会主动控制检索的粒度,在需要时才扩展上下文。
方法
GRASP 的核心思路是 用强化学习训练一个策略,让智能体在多步推理过程中自适应地选择最合适的检索动作。整个框架的设计围绕三个关键决策点展开。
首先是动作空间的设计。GRASP 为智能体提供了三种互补的检索动作。第一种是语义搜索,模型生成一个自然语言查询,系统在向量数据库中检索语义最相近的句子级段落,这适合在推理早期做广泛探索,找到可能相关的背景信息。第二种是关键词搜索,输入是离散化的关键词序列,系统做精确匹配检索,适合在已知实体名称或特定术语时获取精确定位的信息。第三种是段落阅读,这是一种「精读」动作——模型可以指定一个之前检索到的段落,要求系统返回该段落的完整内容进行深入分析,这用于在语义搜索给出大致方向后验证细节。
这三种动作的粒度从粗到细构成了一个层级体系:语义搜索做「概览」,段落阅读做「精读」,关键词搜索做「定位」,智能体可以在推理过程中自由组合。
其次是状态表示的设计。智能体的状态不仅包括当前的对话上下文和已检索到的证据,还包括一个显式的「记忆槽」记录之前使用的检索动作及其结果。这个设计的动机是让策略能够学习到「用了语义搜索发现方向后,用段落阅读验证细节」这样的条件依赖关系,而不是每次都从零开始盲目检索。
最后是奖励函数的设计,这是强化学习框架的灵魂。GRASP 采用多目标奖励,由四个部分加权求和组成。第一项是答案准确性奖励,当智能体最终给出正确答案时得到正奖励,否则得到负奖励,这保证了优化的最终目标。第二项是有依据阅读奖励,衡量智能体的回答是否在已检索到的证据中有充分支撑,避免「凭空编造」的幻觉行为。第三项是互补搜索奖励,这是一个关键的设计——它鼓励智能体在不同推理步骤使用不同类型的检索动作,避免重复使用同一种搜索方式陷入局部。这个奖励的直观理解是,多跳推理的不同跳通常需要不同类型的信息获取方式,用语义相似性找到一个大方向后,需要用关键词搜索锁定具体实体,再通过段落阅读验证实体与答案的关系。第四项是回合效率奖励,对使用过多检索步骤的行为施加惩罚,推动策略学习「用最少的检索次数找到答案」。这个多目标奖励的平衡系数通过实验调优确定,最终让策略在准确性和效率之间取得较好折中。
训练过程使用标准的策略梯度算法(如 PPO),策略网络与语言模型主体联合微调,使得检索决策能够反向传播更新语言模型的推理行为。
实验与结果
实验在三个主流多跳推理基准上进行:2WikiMultiHopQA、MuSiQue 和 HotpotQA。这些数据集的特点是问题的答案不能从单一文档直接得出,需要模型综合多条信息进行推理。
GRASP 与四类基线进行了对比。第一类是单步检索方法,只在推理开始时做一次检索然后生成回答。第二类是基于提示的智能体 RAG,通过 Prompt 引导模型自行决定何时检索、检索什么,但没有显式的策略学习机制。第三类和第四类是基于强化学习的检索基线,分别在单一步骤和有限步骤约束下训练。
主要结果方面,GRASP 在所有三个数据集上都取得了最高或接近最高的答案准确率。以 2WikiMultiHopQA 为例,GRASP 的准确率比最好的基线提升约 3 个百分点。更值得注意的是检索召回率的提升——这衡量的是模型是否成功检索到最终答案所依赖的所有证据文档。GRASP 的召回率比单步检索基线高出 15 个百分点以上,说明多步、多种检索方式的组合确实能够帮助模型找到更完整的信息链。
消融实验揭示了多目标奖励中每个分量的贡献。去掉互补搜索奖励后,策略倾向于重复使用同一种检索动作,虽然最终准确率下降不多,但平均使用的检索步骤数明显增加,说明效率损失严重。去掉段落阅读动作后,模型在需要精确验证实体属性的问题上表现大幅下滑,因为仅靠语义相似度匹配无法区分「某公司成立于某年」和「某公司收购了某公司」这类细节差异。段落阅读提供的局部精读能力对于这类需要精确锚定信息的推理至关重要。
定性分析则展示了策略学到的可解释行为模式。在一个需要回答「某公司的 CEO 是什么时候加入公司的」问题中,策略首先用语义搜索找到关于该公司的一般性报道,确定 CEO 的姓名;然后用关键词搜索直接定位该 CEO 的履历信息;最后用段落阅读获取精确的入职年份。这种「先泛后精」的行为模式是策略通过强化学习自发学到的,没有显式编程。
讨论与可借鉴点
GRASP 展示了一条有潜力的路径:让语言模型学会主动控制信息获取的粒度,而不是被动接受粗粒度的检索结果。这个思路对未来的智能体系统设计有几点启发。
在粒度控制方面,多跳推理任务中,问题的不同「跳」可能需要不同的信息获取方式,早期探索适合用语义搜索收拢方向,后期验证适合用精确的关键词或段落级阅读。这提示我们在设计智能体工具时,应该提供多粒度的工具选项,让模型自己决定什么时候该粗什么时候该细。
在强化学习奖励设计方面,互补搜索奖励是一个值得关注的设计思路——它不直接优化最终目标,而是通过塑造「探索多样性」来间接提升性能。这类结构化奖励对于需要多步骤决策的任务可能比单一的稀疏奖励更有效。
局限性方面,GRASP 目前在单一知识库的场景下验证,而现实世界的智能体可能需要同时查询多个异构数据源。此外,三种检索动作的层级结构是否最优、能否扩展到更多粒度级别(如表格检索、图表检索),这些问题还有待探索。另一个开放问题是,当检索结果为空或噪声过多时,模型应该如何识别并调整策略——目前的框架假设检索总能返回有信息量的内容,这可能过于乐观。
总体而言,GRASP 的贡献不仅在于提升了具体任务的性能,更在于它提出了「粒度感知」这个视角:信息获取不是越全越好,适时地收缩或扩展上下文粒度本身就是一种智能行为。这个视角对于构建更高效的智能体系统具有参考价值。
摘要
智能体检索增强生成(RAG)在静态 RAG 的基础上进行了扩展,允许语言模型进行迭代式推理、生成搜索查询、检索证据并预测答案。然而,对于模型而言,何时进行检索、应使用词法匹配还是语义相似度匹配,以及如何控制上下文粒度以防止无关词元干扰智能体推理,仍然是具有挑战性的问题。在本文中,我们提出了 GRASP,一个用于训练智能体在多步推理过程中自适应地协调互补检索工具的强化学习(RL)框架。GRASP 为智能体提供了语义搜索、关键词搜索和段落阅读三种动作,使其能够检索句子级证据,并仅在需要时进一步扩展上下文。我们使用一个联合考量答案准确性、有依据阅读、互补搜索和回合效率的奖励来训练该策略。在多跳推理基准上的实验表明,与单步检索、基于提示的智能体 RAG 以及基于 RL 的检索基线相比,GRASP 在检索召回率和下游问答性能上均有提升。定性与消融分析显示,学到的策略发展出可解释的略读与扫读行为:它使用语义搜索进行广泛探索,使用段落阅读进行局部验证,使用关键词搜索获取特定实体相关的证据。这些结果表明,学习协调检索信号与上下文粒度对于智能体的正确推理至关重要。
Abstract
Agentic retrieval-augmented generation (RAG) extends static RAG by allowing language models to iteratively reason, generate search queries, retrieve evidence, and predict answers. However, it remains challenging for models to decide when to retrieve, whether to use lexi-cal matching or semantic similarity, and how to control context granularity to prevent irrele-vant tokens from interfering with agent reason-ing. In this paper, we introduce GRASP, a rein-forcement learning (RL) framework for train-ing agents to adaptively coordinate complemen-tary retrieval tools during multi-step reason-ing. GRASP provides the agent with semantic search, keyword search, and paragraph-reading actions, enabling it to retrieve sentence-level evidence and expand further context only when needed. We train the policy with a reward that jointly accounts for answer accuracy, grounded reading, complementary search, and turn ef-ficiency. Experiments on multi-hop reason-ing benchmarks show that GRASP improves both retrieval recall and downstream question answering performance compared with single-step retrieval, prompting-based agentic RAG, and RL-based retrieval baselines. Qualitative and ablation analyses show that the learned pol-icy develops interpretable skimming and scan-ning behavior: it uses semantic search for broad exploration, paragraph reading for local verifi-cation, and keyword search for entity-specific evidence. These results suggest that learning to coordinate retrieval signals and context granu-larity is critical for agent’s correct reasoning.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。


