arXiv 2607.10555v1 · 发布 2026-07-12

工具自适应的 LLM 重排序器

Tool-Adaptive LLM Reranker

AUTHORS Zichuan Liu, Ruijin Hua
EVIDENCE 将重排序建模为MDP并采用强化学习训练
SCORE 0.9
GENERATED 2026-07-20 21:46:20 UTC

📝 TLDR

生成式大语言模型在信息检索重排序中常因参数化局限产生事实幻觉,而对每个文档都调用外部检索工具又会带来过高延迟。针对这一精度与效率难以兼顾的难题,本文提出TALRanker,将逐点相关性评分建模为智能体马尔可夫决策过程,并采用两阶段训练:先用语言保持的混合损失防止灾难性遗忘,再通过非对称代价感知强化学习让模型在自信时跳过工具、在不确定时主动检索外部证据。实验表明该方法在标准及推理密集型检索基准上达到最先进水平,吞吐量与轻量逐点重排器相当,且优于参数规模庞大的推理模型。

🧭 速览

动机

生成式LLM重排序存在严重事实幻觉,而逐文档调用检索工具又带来难以承受的延迟开销,形成精度与效率的两难困境。

方法

将逐点相关性评分建模为智能体马尔可夫决策过程,采用语言保持混合损失预热加非对称代价感知强化学习的两阶段训练。

结果

在标准及推理密集型检索基准上取得最先进性能,吞吐量与轻量逐点重排器持平,并优于参数庞大的推理模型。

结论

TALRanker通过自适应工具调用机制有效缓解LLM重排序中的幻觉与延迟矛盾,为高效可靠的检索增强重排提供新范式。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

TALRanker 针对大语言模型在文档重排序中「高精度必高延迟」的两难困境,将重排序建模为智能体马尔可夫决策过程,使模型能够自主判断何时该调用外部工具、何时可以跳过。在标准检索和推理密集型任务上的实验表明,它在保持轻量级逐点重排器效率的同时,有效规避了事实幻觉问题,性能优于参数量庞大的推理模型。

研究背景与动机

信息检索系统的核心流程通常遵循「召回-重排」的两阶段范式:召回阶段从海量文档中快速筛选出候选集合,重排阶段则由更强大的模型对候选文档进行精细的相关性评估并给出排序。生成式大语言模型的崛起为重排序任务带来了新的可能性——凭借其强大的语义理解能力,LLM 理论上能够捕捉文档与查询之间细微的相关性特征。然而,这种能力是有代价的。当面对超出模型知识边界的复杂查询时,LLM 倾向于「捏造」事实信息来填补认知空白,在相关性评分中产生严重的幻觉偏差。这种幻觉在需要精确事实判断的检索场景中尤为致命。

一个直观的解决思路是引入外部检索工具,让模型在需要时查阅真实文档内容来锚定判断。但这又引入了新的问题:重排序阶段需要对大量文档逐一评分,如果对每个文档都触发一次工具调用,累积的延迟将远超实际应用所能承受的范围。这种精度与效率之间的张力,构成了本研究的出发点和核心挑战。

方法

TALRanker 的核心洞察在于:文档与查询之间的关系并非同质的——有些文档的相关性判断对模型而言轻而易举,无需外部干预;另一些文档则涉及模型认知边界之外的知识,此时工具调用就是规避幻觉的必要手段。关键在于让模型学会区分这两类情况,并自主做出最优决策。

基于这一认识,TALRanker 将传统的逐点相关性评分重新建模为智能体马尔可夫决策过程(Agentic Markov Decision Process)。在这个框架下,重排序模型不再是一个被动的评分函数,而是一个能够感知状态、采取行动、接收反馈的智能体。具体而言,模型在每个文档上需要做出一个二元决策——调用工具检索外部证据,或者直接输出评分。这个决策过程受到当前文档内容、查询语义以及模型内在置信度的共同驱动。通过将决策序列建模为马尔可夫过程,系统能够学习到在不同情境下应该采取何种策略。

为了训练这样一个策略,TALRanker 采用了两阶段训练范式。第一阶段是预热期,目标是让模型在掌握工具使用能力的同时,不丢失其原有的语言生成质量。研究者采用了一种语言保持的混合损失函数,将标准语言建模目标与工具相关的新技能学习目标加权融合,从而有效防止灾难性遗忘(Catastrophic Forgetting)——即模型在学习新任务时将已掌握能力丢失的现象。第二阶段进入强化学习环节,引入非对称的代价感知奖励机制。这一设计的精妙之处在于其不对称性:当模型自信地跳过工具并给出正确评分时,会获得效率奖励;当模型自信跳过但实际判断错误时,会受到幻觉惩罚;当模型在不确定时主动检索外部证据并据此给出正确判断时,同样获得奖励,但奖励幅度与直接跳过的效率奖励形成对比。这种非对称设计鼓励策略在置信时追求最大效率,在不确定时审慎调用工具。

实验与结果

研究者在标准检索基准和推理密集型检索基准两个维度上评估了 TALRanker 的性能。标准基准考察模型在常规相关性判断上的能力,推理密集型基准则专门设计了需要外部知识锚定和多步推理的困难查询,以检验模型在复杂场景下的表现。

实验结果揭示了几个值得关注的发现。首先,在端到端排序质量指标上,TALRanker 显著优于直接使用原始 LLM 的基线方法,有效证明了工具自适应机制在规避幻觉方面的实际效果。其次,在与参数量远大于自身的推理模型对比时,TALRanker 仍能保持优势,这说明通过智能策略调度工具所获得的效率优势,足以弥补单纯依靠模型参数规模带来的能力差距。第三,也是最关键的吞吐率对比:TALRanker 的处理速度与轻量级逐点重排器基本持平,这意味着在不影响线上延迟约束的前提下,系统获得了更强的推理能力。这些结果表明,工具自适应并非以牺牲效率换取精度,而是通过精准决策实现了效率与精度的协同提升。

讨论与可借鉴点

TALRanker 的局限值得客观审视。将重排序建模为决策过程虽然赋予了模型灵活性,但马尔可夫决策过程的建模本身引入了一定复杂度,策略的收敛性和稳定性需要更充分的验证。此外,对于那些模型恰好处于「不确定」边界的模糊案例,工具调用的阈值设定仍依赖超参数调优,缺乏理论层面的最优性保证。

从更宏观的视角来看,这项工作为 LLM 应用中的效率-精度权衡提供了一种新范式:不是简单地选择「用不用工具」,而是让模型学会「何时用工具」。这种思想可以迁移到问答、摘要、代码生成等多个存在类似两难困境的场景中。智能体马尔可夫决策过程这一建模方式将决策权交还给模型本身,而非依赖人工规则预设阈值,代表了 LLM 与工具交互研究的一个重要方向。

摘要

生成式大语言模型(LLMs)已经彻底改变了信息检索领域,然而其严格的参数化特性在面对超出其认知边界的复杂查询时,常常导致严重的事实性幻觉。虽然外部工具调用能够缓解这一问题,但在重排序阶段对每个文档不加区分地调用搜索工具会带来难以承受的延迟开销,从而造成难以调和的精度–效率两难困境。为应对这一挑战,我们提出了 TALRanker,一个将逐点相关性评分形式化为智能体马尔可夫决策过程的新颖框架。我们通过两阶段训练范式对其进行优化:初始的预热阶段采用保持语言能力的混合损失函数,以防止灾难性遗忘其原生生成能力;随后,在强化学习中引入不对称的成本感知奖励,迫使策略在置信时自主跳过工具调用以追求最大效率,而在不确定时则选择性地检索外部证据以规避严重的幻觉惩罚。大量评估实验表明,TALRanker 在标准检索基准和推理密集型检索基准上均取得了当前最优性能,其吞吐率与逐点重排序器相当,同时优于参数规模庞大的推理模型。

Abstract

Generative Large Language Models (LLMs) have revolutionized information retrieval, yet their strictly parametric nature frequently leads to severe factual hallucinations when confronted with complex queries beyond their epistemic boundaries. While external tool-calling can mitigate this, indiscriminately invoking search tools for every document during reranking incurs prohibitive latency overheads, creating an intractable accuracy-efficiency dilemma. To address this challenge, we propose TALRanker, a novel framework that formalizes pointwise relevance scoring as an agentic Markov decision process. We optimize it via a two-stage training paradigm. An initial warm-up utilizes a language-preserving hybrid loss to prevent the catastrophic forgetting of native generative capacities. Subsequently, an asymmetric cost-aware reward equipped in reinforcement learning forces the policy to autonomously bypass tools for maximum efficiency when confident, while selectively retrieving external evidence to avert severe hallucination penalties when uncertain. Extensive evaluations demonstrate that TALRanker achieves state-of-the-art performance across standard and reasoning-intensive retrieval benchmarks, matching throughput with pointwise rerankers while outperforming parameter-heavy reasoning models.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记