arXiv 2607.13501v2 · 发布 2026-07-15

LOTAPO:面向多轮搜索推理的自生成过程奖励的留一回合归因方法

LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning

AUTHORS Qiang Zhu, Jiajun Wu, Longyi Wang
EVIDENCE 提出一种多轮推理的过程监督强化学习算法
SCORE 0.8
GENERATED 2026-07-20 12:18:55 UTC

📝 TLDR

多轮搜索推理的强化学习通常仅依赖最终结果奖励,难以区分有效、冗余甚至有害的中间交互。LOTAPO提出基于逆向留一转折贡献归因的自生成过程监督方法,将某一搜索轮及其检索结果替换为[DELETE]占位符后度量策略对金标答案对数似然的变化,并结合符号一致性门控筛选过程优势。该方法无需额外奖励模型、评判器或教师,在7个知识密集问答基准上平均精确匹配0.326,超越最强基线IGPO 0.053。

🧭 速览

动机

多轮搜索推理中仅依赖最终结果奖励,无法辨别每轮交互是有用、冗余还是有害的。

方法

对每轮检索交互用[DELETE]占位符替换后,测量策略对金标答案对数似然的变化作为该轮贡献度,并以符号一致性门控过滤过程优势。

结果

在7个知识密集问答数据集上平均精确匹配0.326,较最强逐步奖励基线IGPO提升0.053。

结论

消融验证逆向归因与符号门控互补,证明策略回溯式归因可为多轮搜索智能体提供有效过程监督。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

多轮搜索推理中的强化学习长期面临过程监督缺失的困境——仅有最终答案的正负奖励无法区分哪一步真正有价值。LOTAPO 提出了一种完全自监督的思路:对每个搜索轮进行「逆向留一」操作,将该轮及其检索结果替换为占位符后观察策略对标准答案的似然变化,以此量化该轮的真实贡献。在无需任何外部奖励模型或评判器的前提下,LOTAPO 在七个知识密集问答数据集上达到平均精确匹配 0.326,超越最强基线 IGPO 达 0.053 个百分点。

研究背景与动机

大型语言模型在开放式问答场景中需要反复调用检索工具来获取外部知识,这一过程形成了典型的多轮搜索-推理交织架构。当模型生成一段检索查询、收到搜索结果后,再基于新证据继续推理,如此迭代直至给出最终答案。然而,在强化学习框架下训练这类智能体时,如何为中间步骤提供有效的学习信号长期困扰着研究者。

主流方法大多依赖最终结果奖励(outcome reward)——仅根据最终答案是否正确给予正负反馈。这种粗粒度的监督信号存在根本性缺陷:假设模型在五轮搜索中输出了答案,正确时所有步骤共享荣誉,错误时所有步骤共同受罚,但它们对最终结果的贡献可能截然不同。第一轮检索可能精准命中关键证据,而第三轮却可能引入无关信息造成干扰。更重要的是,当最终答案碰巧正确时(即使推理路径有缺陷),模型会错误地强化所有中间行为。

针对这一问题的已有探索包括训练独立的[[过程奖励模型]](Process Reward Model, PRM)来逐轮打分,或引入[[LLM即评判]](LLM-as-a-Judge)架构提供细粒度反馈。然而这些方案都需要额外训练判别器或依赖强大的教师模型,不仅增加了系统复杂度,还可能引入自身的偏差。核心问题在于:能否让策略模型自身从已有轨迹中挖掘每个搜索轮的真实价值?

方法

LOTAPO 的核心洞察来自一个直观但此前未被系统利用的观察:在多轮交互的推理链中,如果某一步确实贡献了关键信息,那么删除它后模型对正确答案的置信度应当下降。基于这一直觉,LOTAPO 设计了「逆向留一回合归因」(backward leave-one-turn attribution)机制。

具体而言,给定一条包含 轮搜索的完整轨迹 ,其中 是第 轮的查询, 是检索返回的结果, 是模型基于此前所有上下文生成的回复,LOTAPO 对每一轮 计算其答案似然增益(Answer-Likelihood Gain):

这里 表示将第 轮的搜索交互 替换为统一的 [DELETE] 占位符后重建的上下文。直觉上,如果第 轮检索提供了不可或缺的信息,移除它会导致策略对标准答案 的对数似然下降, 应为正值;若该轮冗余或有害, 可能为负或接近零。

这种方法的设计巧妙之处在于它完全保留了后续推理的完整性。与其用前向遮蔽(forward masking)逐段遮住未来上下文来孤立某步的独立贡献,LOTAPO 保留所有下游交互,只移除当前轮的输入信号。这更符合实际推理过程——后续推理步骤本身已包含了它们对早期信息的依赖关系,强行切断会破坏推理的连贯性。

然而,单纯的答案似然增益作为优势函数存在噪声问题:不同轮的归因分数可能量级差异很大,直接使用会导致训练不稳定。LOTAPO 进一步引入符号一致性门控(sign-consistency gating)来过滤信号。具体做法是先对所有轮的归因分数进行归一化得到标准化的过程优势 ,再与原始归因分数的符号进行逐元素乘积:

这一操作的含义是:只有当某轮的归一化优势方向与其原始贡献方向一致时才予以保留。若原始归因显示某轮对答案有害(),即使其归一化优势为正也会被过滤,反之亦然。这种门控机制有效平衡了幅度信息与方向信息,避免了归一化操作可能引入的符号翻转问题。

整个方法完全自包含:不需要训练单独的奖励网络,不需要调用外部教师模型,也不依赖任何[[大语言模型]]作为评判器。归因信号完全从当前策略的似然变化中派生,实现了真正意义上的自监督过程监督。

实验与结果

LOTAPO 的评估在七个知识密集型问答数据集上进行,涵盖自然话题问答、多跳推理、对话式问答等不同任务类型。所有数据集均使用本地检索环境,确保实验的可复现性。

实验采用精确匹配(Exact Match, EM)作为主要指标。在与多种基线方法的对比中,LOTAPO 的平均 EM 达到 0.326,显著超越了此前最强的逐步奖励方法 IGPO(提升 0.053)。值得注意的是,IGPO 本身已采用过程奖励机制,而 LOTAPO 在不引入任何额外模型的前提下实现了超越,说明自生成的回顾性归因能够比显式训练的逐步奖励模型更有效地捕捉各轮的真实贡献。

消融实验进一步揭示了两大核心组件的互补价值。移除逆向归因机制后(即随机分配各轮奖励),模型性能明显下降,说明对各轮贡献的准确量化至关重要。单独移除符号一致性门控同样导致性能衰减,而同时使用两者时效果最佳。这表明归因分数的幅度信息与方向信息各有其价值,门控机制能够有效整合二者。

定性分析也印证了方法的合理性。在成功案例中,关键证据轮通常获得最高的答案似然增益,而引入噪声或重复信息的轮次则被赋予负值或极低的归因分数。这种细粒度的奖励分配使模型能够更精确地学习哪些搜索策略真正有助于回答问题。

讨论与可借鉴点

LOTAPO 展示了从策略自身行为中提取过程监督信号的可行路径,为[[强化学习]]中长期存在的过程-结果奖励鸿沟问题提供了一种轻量级解决方案。其核心思想——通过干预性删除来度量信息贡献——具有较好的通用性,原则上可推广至其他多步骤推理场景,如代码生成中的工具调用链或对话系统中的上下文管理。

然而,该方法也存在若干局限。首先,[DELETE] 占位符的选择可能影响归因准确性——论文未深入探讨占位符设计对结果敏感性的影响。其次,答案似然增益隐含假设策略对标准答案的偏好变化能够反映该轮的真实价值,但对于存在多个等价正确答案的问题,这一假设可能需要更审慎的考量。最后,该方法计算成本较高,每次归因计算需要对每个搜索轮重新计算一次策略似然,在训练过程中可能带来不可忽视的额外开销。

对于后续研究而言,LOTAPO 的框架提供了若干值得探索的方向:能否将逆向归因扩展至前向视角,形成双向的过程评估?在归因计算中引入因果推断方法是否能够进一步提升准确性?以及在训练过程中动态调整 [DELETE] 占位符的语义,是否能让归因更加鲁棒?这些问题为细粒度过程监督的研究开辟了富有前景的道路。

摘要

面向多轮搜索推理的强化学习通常依赖最终结果奖励,无法区分有用、冗余和有害的中间交互。我们提出 LOTAPO,一种基于反向留一回合归因的自生成过程监督方法。对于每一轮搜索,LOTAPO 将该轮及其检索观测替换为固定的 [DELETE] 占位符,并衡量当前策略对标准答案的平均对数似然所发生的变化。这种答案似然增益在保留所有下游交互的前提下估计该轮的贡献,从而能够在完整推理上下文中评估早期证据。LOTAPO 还进一步应用符号一致性门控,仅保留方向与其原始归因分数一致的正则化过程优势。该方法无需额外的奖励模型、教师模型、验证器或大语言模型评判器。在七个采用本地检索的知识密集型问答数据集上,LOTAPO 取得了 0.326 的平均精确匹配分数,较最强的逐步奖励基线 IGPO 提升 0.053。消融实验表明反向归因与符号一致性门控具有互补优势,证明由策略推导的回顾性归因能够为多轮搜索智能体提供有效的过程监督。

Abstract

Reinforcement learning for multi-turn search reasoning typically relies on terminal outcome rewards, which cannot distinguish useful, redundant, and harmful intermediate interactions. We propose LOTAPO , a self-generated process-supervision method based on backward leave-one-turn attribution. For each search turn, LOTAPO replaces the turn and its retrieval observation with a fixed [DELETE] placeholder and measures the resulting change in the current policy's mean log-likelihood of the gold answer. This Answer-Likelihood Gain estimates the turn's contribution while preserving all downstream interactions, allowing early evidence to be evaluated in the complete reasoning context. LOTAPO further applies sign-consistency gating, retaining only normalized process advantages whose directions agree with their raw attribution scores. The method requires no additional reward model, teacher, verifier, or LLM-as-a-Judge. Across seven knowledge-intensive question-answering datasets with local retrieval, LOTAPO achieves an average exact-match score of 0.326, outperforming the strongest step-reward baseline, IGPO, by 0.053. Ablations show complementary benefits from backward attribution and sign-consistency gating, demonstrating that policy-derived retrospective attribution can provide effective process supervision for multi-turn search agents.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记