arXiv 2606.29654v1 · 发布 2026-06-28

带局部可靠性界的预算约束"行动或延后"多智能体 LLM 商议

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

AUTHORS Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo
EVIDENCE 多智能体审议中的预算化行动或推迟决策
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-07 06:16:45 UTC

📝 TLDR

多智能体LLM协作能提升推理质量,但部署时需要判断当前回答是否足够可靠以执行,还是应升级到人工审核。研究将该决策形式化为预算化执行或延迟问题:把多智能体辩论前缀映射到低维状态,用k近邻方法基于校准数据计算状态条件正确率的下置信界,仅当其超过用户设定的可靠性阈值时自动执行。通过β=δ+α+ε_act分解将校准失败、残余执行风险与表示差距分离,预算按各任务终轮错误相对设定而非绝对固定。在六个基准对九个基线仅使用预算的9-12%,自动化率最高达84%,已执行准确率最高96%,压力集则倾向延迟。该方法将用户声明的错误执行预算前瞻转换为可审计运行点。

🧭 速览

动机

多智能体LLM协作可提升推理质量,但实际部署缺乏可靠机制判断何时自动执行、何时转人工,难以兼顾自动化率与安全性。

方法

将辩论前缀映射为低维状态,用k近邻基于校准数据计算状态条件正确率的下置信界,仅当超过用户设定阈值才自动执行,否则延迟至人工审核,并以β=δ+α+ε_act分解分离校准失败、残余执行风险与表示差距。

结果

六个基准上对九个基线仅消耗预声明预算的9-12%,激活数据集自动化率最高84%、已执行准确率最高96%,压力测试集则倾向于延迟而非强行自动化。

结论

提出将用户声明的错误执行预算前瞻转换为可审计运行点的方法,各假设配以可证伪诊断,避免逐任务后验阈值搜索。

📊 论文图表(共 4 张)

展开查看 4 张图

TL;DR

多智能体大语言模型通过相互辩论能提升推理质量,但何时该信任系统给出的答案、何时该转交人工审核,始终是个悬而未决的部署难题。这篇论文将这一问题形式化为预算约束下的行动或延迟决策:系统在每轮将辩论过程映射为低维状态,用 近邻方法计算状态条件正确率的下置信界,仅当该界超过用户设定的可靠性阈值时才执行。在六个基准数据集上,该方法仅消耗预声明错误预算的 9%–12%,就实现了最高 84% 的自动化率和 96% 的执行准确率。

研究背景与动机

多智能体 [[大语言模型]] 协作是当前提升推理能力的重要范式。两个或多个模型相互辩论、相互质疑,能够比单模型生成更可靠的回答。然而,这种协作系统在实际部署中面临一个根本性的信任问题:辩论过程可能在某个节点已经达到很高的可信度,也可能仍在产生不可靠的结论。如何自动判断"当前答案是否足够可靠,可以直接执行"还是"应当升级到人工审核",成为制约这类系统落地的核心瓶颈。

此前的研究大多聚焦于如何提升模型生成的正确性,却忽略了决策层面的可靠性保障。一些系统采用固定阈值或启发式规则来判断是否执行,但这些方法缺乏理论保证——它们无法告诉用户:"我选择执行时,正确率至少是 。" 换句话说,缺少一种可审计的机制,将用户能接受的错误率显式地映射到系统的行动策略上。

这篇论文的切入点是:把可解释性/可审计性放在与准确率同等重要的位置。作者不追求在所有情况下都最大化自动化率,而是承诺在用户声明的错误预算内安全行动。这意味着系统需要一种原则性的方法来估计"当前状态下答案正确的概率",并据此做出行动或延迟的决策。

方法

核心思想是将多智能体辩论的动态过程抽象为一个状态空间,然后在每个状态下估计答案的正确概率。

状态表示是第一步。系统将辩论前缀映射到一个低维状态向量。这个映射的设计很关键:它需要捕获与"答案是否可靠"相关的语义信息,同时保持足够的几何结构,使得基于近邻的统计推断有意义。作者没有详细展开状态表示的具体架构,但强调了它必须与后续的校准过程兼容。

概率下界的计算是方法的核心。给定当前状态,系统利用已有的校准数据(这些数据包含状态和对应的真实标签),用 近邻方法计算状态条件正确率的一个下置信界。具体来说,对于当前状态 ,找出校准集中与 最近的 个样本,计算这些近邻中正确答案的频率,然后对有限样本误差做置信区间的修正,得到一个保守的下界 。这个下界满足这样的统计意义:在一定概率下,真实正确率不会低于这个界。

行动决策则非常直接:当且仅当 (用户指定的可靠性阈值)时,系统才执行当前答案;否则推迟。

错误预算的分解与控制是这篇论文最精巧的理论贡献。作者将总体错误预算 分解为三个可解释的分量:

其中 对应校准失效的风险——校准数据和测试数据分布不一致时,近邻估计会失效; 对应残余行动风险——即使下置信界满足阈值,答案仍可能错误; 对应表示差距——当前状态的表示与校准数据的表示之间存在差距,导致近邻估计不可靠。通过将这三个误差源显式分离,用户可以诊断"如果系统出错,最可能出在哪一环"。

值得注意的是,该方法的保证是条件性的,而非分布无关的。它依赖于两个关键假设:局部偏差包络的有效性,以及行动区域的表示差距界。每个假设都配有可证伪式的诊断工具——如果诊断检测到假设违背,系统可以主动报警或切换到更保守的策略。这种设计体现了对实践部署的深入考量:任何理论保证都需要与现实数据吻合才有意义。

预算的自适应设定也值得单独讨论。传统的做法是对所有任务使用统一的绝对错误预算,但这忽略了任务难度的差异——在简单任务上浪费预算显得过于保守,在困难任务上预算又可能不足。作者的解法是仅使用训练数据,根据每项任务最后一轮的误差来归一化预算。具体而言,系统将每个任务的错误预算设为该任务训练集末轮错误率的一个比例,这样既保留了跨任务的公平性比较基准,又让预算真正反映"在该任务上可接受的错误"。

实验与结果

实验在六个基准数据集上进行,涵盖了不同的推理类型和难度分布,对比了九个基线方法。这些基线涵盖了从简单阈值规则到更复杂的置信度估计方法,目的是展示该方法相对于现有实践的改进。

最关键的指标是预算使用率自动化率/执行准确率的权衡。实验结果表明,该方法在已激活数据集(即系统选择执行的数据)上,仅消耗了预声明错误预算的 9%–12%,这意味着剩余 88%–91% 的预算被保留作为安全缓冲。在消耗如此少预算的情况下,系统仍能达到 84% 的自动化率(仍有 16% 的查询被推迟)和 96% 的执行准确率(已执行答案的正确率)。这组数字的含义是:系统高度自律,它没有为了追求高自动化率而把预算花光,而是精确地只在高置信场景下行动。

在压力测试数据集(故意设计的困难样本或对抗性场景)上,结果呈现了有趣的对比:许多基线方法仍然选择执行,导致执行准确率显著下降;而该方法在这些场景下选择推迟而非强制推进不可靠的自动化。这验证了方法的"知情延迟"特性——它不会为了好看的自动化率数字而冒险。

消融实验进一步揭示了 分解的有效性。当人为引入分布偏移时,诊断工具能检测到 分量的上升;当表示差距增大时, 分量相应增长。这些诊断信号帮助研究者理解系统的行为边界。

讨论与可借鉴点

这篇论文的核心贡献不在于刷新某个任务的准确率数字,而在于引入了一种可审计的决策框架。在 [[大语言模型]] 部署越来越广泛的背景下,"系统能否在部署前告诉用户它会在什么条件下行动"这个问题变得越来越重要。该方法将用户声明的错误预算前瞻性地转换为可验证的运行点,而非依赖事后调参,这为高风险场景(如医疗、法律、金融)的 AI 辅助决策提供了参考。

几个局限性值得注意。首先,方法依赖有效的校准数据,而高质量校准数据的获取本身就需要成本。其次, 近邻方法在高维空间可能面临维度灾难,虽然作者用低维状态表示来规避,但这对状态表示的设计提出了更高要求。第三,条件保证依赖于假设的有效性,假设违背时诊断工具会报警,但如何从报警恢复、是否需要重新校准,这些工程问题还有待探索。

对后续研究而言,将错误预算分解为可解释分量的思路值得借鉴——它让系统行为变得透明。此外,"知情延迟优于不可靠自动化"的哲学也很重要:在某些场景下,"我不知道"比"我猜一个"更有价值。

摘要

大语言模型间的多智能体审议能够提升推理能力,但部署时需要判断当前答案是否足够可靠以执行,还是应升级到人工审核。我们将此形式化为预算约束下的行动-推迟决策问题。在每一轮中,系统将辩论前缀映射到低维状态,利用校准数据计算状态条件正确性的 近邻下置信界,且仅在该界超过用户指定的可靠性阈值时才执行行动。该证书通过分解 来控制错误行动,区分校准失效、残余行动风险和表示差距。该保证是条件性的,而非分布无关的:它依赖于有效的局部偏差包络和行动区域的表示差距界,并且每条假设都配有可证伪式诊断。由于相同的绝对错误行动预算在不同难度任务中含义不同,我们仅使用训练数据,根据每项任务最后一轮的误差来设定预算,并通过归一化预算使用率 评估安全性。在六个基准上与九个基线方法对比,该方法在已激活数据集上使用了预声明预算的 9--12%,实现了高达 84% 的自动化率和 96% 的已执行准确率;在压力测试数据集上,它选择推迟而非强制进行不可靠的自动化。该方法并非依赖每项任务的事后阈值搜索,而是在明确陈述的假设下,前瞻性地将用户声明的错误行动预算转换为部署前可审计的行动-推迟运行点。

Abstract

Multi-agent deliberation among LLMs can improve reasoning, but deployment requires deciding when the current answer is reliable enough to act on and when it should be escalated to human review. We formulate this as budgeted act-or-defer decision making. At each round, the system maps the debate prefix to a low-dimensional state, computes a -nearest-neighbor lower confidence bound on state-conditional correctness using calibration data, and acts only when the bound exceeds a user-specified reliability threshold. The certificate controls wrong actions through the decomposition , separating calibration failure, residual action risk, and representation gap. The guarantee is conditional, not distribution-free: it relies on a valid local bias envelope and an action-region representation-gap bound, and each assumption is paired with falsification-style diagnostics. Because the same absolute wrong-action budget has different meanings across tasks of different difficulty, we set budgets relative to each task's final-round error using training data only, and evaluate safety by normalized budget usage . On six benchmarks against nine baselines, the method uses 9--12% of the pre-declared budget on activated datasets, reaching up to 84% automation and 96% acted-on accuracy; on stress-test datasets, it defers rather than forcing unreliable automation. Rather than relying on per-task post-hoc threshold search, the method prospectively converts a user-declared wrong-action budget into an auditable act-or-defer operating point before deployment, under explicitly stated assumptions.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记