arXiv 2607.10738v1 · 发布 2026-07-14

回答还是弃答:通过弃答感知强化学习缓解搜索智能体幻觉

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

AUTHORS Zhang, Fengji, Fan, Tianyu, Zheng, Yuxiang, Niu, Xinyao, Huang, Chengen, Keung, Jacky, Chen, Bei
EVIDENCE 搜索智能体弃答感知RL缓解幻觉
SCORE 0.8
CATEGORIES TASK agentrl
GENERATED 2026-07-20 02:29:20 UTC

📝 TLDR

提出弃答感知强化学习方法,训练搜索智能体在无法验证时主动弃答以减少幻觉。

🧭 速览

动机

现有搜索智能体强化学习仅奖励正确答案,却未惩罚检索失败时的虚构回答,从而加剧幻觉问题。

方法

提出AWA-RL,结合模型查询先验能力与在线策略训练观测动态调整弃答奖励,并设计RA-F1衡量能力-可靠性权衡。

结果

相比非弃答基线,绝对精度最高提升10.3%,RA-F1整体提升2.9%,原始准确率仅轻微下降。

结论

AWA-RL成功兼顾能力与可靠性,有效缓解搜索智能体幻觉,产出高度可信的高性能检索系统。

📊 论文图表(共 1 张)

展开查看 1 张图

TL;DR

这篇论文针对大语言模型在配备搜索工具后仍会「编造答案」的幻觉问题,提出了一种名为弃答感知强化学习(AWA-RL)的方法。该方法通过动态塑造「主动放弃回答」的奖励信号,训练智能体在检索结果不可靠时选择弃答而非硬撑答案。实验表明,AWA-RL 在开放域问答任务上最高将精确率提升 10.3%,同时仅以极小的原始准确率损失为代价,成功训练出既强能力又高可靠性的搜索智能体。

研究背景与动机

近年来,为大语言模型配备搜索工具并结合结果奖励强化学习(RL)的技术路线,在开放域问答任务上取得了显著进展。这类方法的典型流程是:模型接收用户问题后调用搜索 API 获取相关文档,再基于检索结果生成答案。当生成的回答与标准答案一致时给予正向奖励,否则给予负向奖励。通过大量这种「结果奖励」的信号,模型逐渐学会在给定问题上给出正确答案。

然而,研究者敏锐地指出了这一范式中隐藏的隐患:当前的训练目标主要奖励正确答案本身,却忽略了一个关键场景——当搜索检索失败或返回结果不足以支撑可靠回答时,模型应该如何表现。在这一情况下,模型既没有获得正确答案的信号,也没有收到「不应该回答」的指导。但训练数据中必然包含一些原本就难以回答的问题,对于这些问题,即使最优策略可能是放弃回答,当前的 RL 框架却仍在激励模型硬着头皮给出答案。结果是模型被隐性鼓励了编造行为,幻觉问题在训练过程中被不断强化。

这一问题的深层根源在于,传统的强化学习方法缺乏对「不确定性」的显式建模。模型既不知道自己什么时候该信任检索结果,也不知道什么时候应该坦诚地说「我不知道」。因此,如何让搜索智能体学会在可靠性不足时主动弃答,成为提升系统可信度的核心挑战。

方法

AWA-RL 的核心思想是:当模型对某类问题的先验能力较弱(即模型单独回答该问题的准确率较低)时,应该对这类问题设置更高的弃答奖励;而当模型已经具备较强能力时,则降低弃答奖励以鼓励直接回答。这是一种动态适配的训练策略,而非一刀切地要求模型遇事不决就放弃。

具体而言,AWA-RL 利用两个关键信号来动态塑造弃答奖励。首先是模型的查询特定先验能力:对于每个训练样本,可以先用不带搜索工具的模型直接回答问题,根据答案质量估算模型对该类问题的事前把握程度。如果模型单独回答时错误率很高,说明其先验知识不足以支撑可靠输出,此时应强化「弃答」的激励。其次是训练过程中的持续同策略观测:随着 RL 训练的进行,模型的能力分布会不断变化,AWA-RL 会在每个训练周期重新评估模型的同策略表现,据此调整弃答奖励的强度。这两个信号,前者对应模型「有没有能力」,后者对应「当前学到了什么」,共同构成了一套自适应的奖励塑造机制。

在数学上,传统 RL 的奖励函数通常定义为 ,而 AWA-RL 将其扩展为 ,其中 是问题 相关的弃答惩罚系数,由上述先验能力和同策略表现共同决定。当 较高时,模型倾向于选择特殊的弃答动作(abstain)以避免惩罚;当 较低时,模型更愿意直接输出答案。值得注意的是,弃答被视为一种合法且合理的行为选项,而非失败——这与此前一些研究中将弃答视为「保守策略」的做法有本质区别。

此外,论文还提出了 RA-F1 指标,用以量化能力与可靠性之间的权衡。传统准确率衡量的是「回答的问题中有多少答对了」,但无法区分「答对的题」是真正有能力还是碰巧蒙对。RA-F1 则同时考虑精确率(Reliability-Precision)和召回率(Reliability-Recall):前者衡量「模型选择回答的问题中,实际答对的比例」,反映可靠性;后者衡量「所有本可正确回答的问题中,模型实际回答并答对的比例」,反映能力保留程度。两者的调和平均即为 RA-F1,使得不同策略可以在能力-可靠性谱系上被公平比较。

实验与结果

论文在开放域问答基准上进行了系统实验,对比了 AWA-RL 与多种基线方法。基线设置涵盖了不包含弃答机制的纯结果奖励强化学习(Naive RL)、仅依赖检索置信度的简单弃答策略,以及若干参数规模相近的大语言模型直接问答版本。

实验结果清晰地验证了 AWA-RL 的有效性。在绝对精确率指标上,AWA-RL 相比非弃答基线最高提升了 10.3%,这一幅度表明显式建模弃答信号对于抑制幻觉至关重要。在 RA-F1 这一综合指标上,AWA-RL 整体提升 2.9%,说明该方法在提升可靠性的同时,并未以牺牲过多能力为代价。论文特别强调了一个关键观察:虽然弃答策略的存在确实会导致「模型回答的问题总数」有所减少(即召回率下降),但由于剩余问题的正确率大幅上升,RA-F1 仍然全面优于基线。这说明弃答并非保守退缩,而是一种「有选择地投入精力」的聪明策略。

消融实验进一步表明,同时利用先验能力和同策略观测的完整版本 AWA-RL,优于仅使用其中一种信号的简化变体,验证了动态塑造机制的必要性。不同问题难度层级上的分析还揭示了一个有趣的模式:对于简单问题(模型先验准确率高),弃答奖励被压制,模型几乎总是直接回答;对于困难问题(模型先验准确率低),弃答奖励被强化,模型更多选择放弃。这一梯度化的行为完全符合设计初衷。

讨论与可借鉴点

AWA-RL 的核心贡献在于揭示了「奖励正确答案」与「惩罚编造答案」之间的不对称性,并提出了一种优雅的解决方案:将弃答行为本身纳入奖励函数的设计空间,而非将其视为边缘情况。从更宏观的视角看,这一思路呼应了人工智能领域对「知道自己不知道」能力的长期追求——无论是计算机视觉中的拒绝选项,还是推荐系统中的「无推荐」动作,类似的可靠性设计正在成为构建可信智能系统的重要组件。

然而,该方法也存在一定局限。首先,弃答奖励的动态塑造依赖于对模型先验能力的估计,而这一估计本身可能存在偏差,尤其是在分布外问题上。其次,论文聚焦于问答场景,其在多跳推理、对话生成等更复杂任务上的表现尚未被充分探索。最后,弃答行为虽然提高了可靠性,但实际应用中「何时放弃」的最优阈值仍需根据具体场景的人工成本和错误代价来调定。

对于更广泛的研究社区,AWA-RL 提供了两点值得借鉴的启发。其一是奖励塑形(Reward Shaping)的思想:将高层目标(如「减少幻觉」)转化为具体的奖励信号时,应该让信号与目标保持一致性,避免隐性地激励副作用;其二是能力感知的训练策略:训练信号不应该对所有样本一视同仁,而应该根据模型对不同样本的处理难度进行差异化调节。这类思想在[[强化学习]]的其他应用——如机器人任务学习、代码生成模型的后训练——中同样具有潜在的迁移价值。

摘要

近年来,为大语言模型(LLMs)配备搜索工具并结合结果奖励强化学习(RL)的方法,在开放域问答任务上取得了新的最先进成果。然而,我们认为当前的训练范式存在一个关键缺陷:它们主要奖励正确答案,但在检索失败时却未能对编造的回答进行惩罚,从而在隐性地加剧幻觉问题。为解决这一问题,我们提出了弃答感知强化学习(AWA-RL),该方法利用模型针对特定查询的先验能力以及训练过程中持续的同策略观测,动态地塑造弃答奖励。我们还引入了一个新指标 RA-F1,用以衡量能力与可靠性之间的权衡。相比非弃答基线,AWA-RL 将绝对精度最高提升 10.3%,整体 RA-F1 提升 2.9%,而仅在原始准确率上付出了极小的牺牲。这些结果证实,AWA-RL 能够成功训练出能力强且高可靠性的搜索智能体。代码、数据和模型权重已在 https://github.com/zfj1998/AWA-RL 公开。

Abstract

Recent advances in equipping Large Lan-guage Models (LLMs) with search tools and outcome-reward reinforcement learning (RL) have achieved new state-of-the-art results on open-domain QA tasks. However, we argue that current training paradigms harbor a critical vulnerability: they predominantly reward cor-rect answers but fail to penalize fabricated ones when retrieval fails, thereby implicitly exacer-bating hallucinations. To address this, we pro-pose Abstention-Aware Reinforcement Learn-ing ( AWA-RL ), which dynamically shapes the abstention reward utilizing the model’s query-specific prior capabilities and continuous on-policy training observations. We also intro-duce a novel metric, RA-F1 , to measure the capability-reliability trade-off. Compared to non-abstaining baselines, AWA-RL boosts ab-solute precision by up to 10.3% and over-all RA-F1 by 2.9%, with only marginal sacri-fice in raw accuracy. These results confirm that AWA-RL successfully yields highly capa-ble and reliable search agents. The code, data, and model weights are publicly available at

https://github.com/zfj1998/AWA-RL .

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记