LLM Agents
大模型智能体
LLM-driven tool use, planning, code agents, GUI agents, multi-turn reasoning with feedback. — LLM 工具调用、规划、代码代理、GUI 代理、多轮反馈推理。
TRACE:基于信用估计的回合级奖励分配用于长程智能体
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
分支策略优化:沙箱原生语言智能体强化学习
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
GRASP:面向智能体RAG的粒度感知搜索策略
GRASP: GRanularity-Aware Search Policy for Agentic RAG
Agentic-DPO:从模仿到基于专家轨迹的智能体策略优化
Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
路由、通信与推理:用于高效多智能体推理的门控路由与自适应深度
Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning
LatentSkill:面向 LLM 智能体、从上下文文本技能到权重内潜在技能
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
回答还是弃答:通过弃答感知强化学习缓解搜索智能体幻觉
To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning
分布式智能体系统:面向异构智能体容错协同的端边云框架
2607.10811v1.pdf
参数化技能
Parametric Skills
StarBench:面向智能体多模态决策与信息寻求的回合制 RPG 基准
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
基于专家-编辑逐步提问多智能体方法的长文档摘要研究
2607.10390v1.pdf
TRACE:基于信用估计的回合级奖励分配用于长程智能体
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
📒 编译结果(浏览器本地缓存,下次访问自动显示)
TRACE通过参考模型对数比的TD变化为长程智能体分配细粒度步骤奖励,显著提升工具调用学习效果。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
多轮智能体的核心工作模式是:接收用户指令后,通过反复调用搜索、计算、代码执行等工具逐步探索,直到最终输出答案。在短程任务中,这种模式运作良好——轨迹只有几步,强化学习的结局奖励(outcome reward)足以提供可靠的监督信号。然而,随着任务复杂度提升,轨迹可能扩展到几十甚至上百次工具调用,结局奖励的问题就变得尤为突出。
首先是稀疏性问题。当智能体在第 100 步工具调用时才得到最终反馈,99% 的中间动作处于无监督状态,梯度信号几乎无法抵达这些早期决策点。其次是误导性问题:一次失败的轨迹中可能包含大量有价值的中间动作——比如一次成功的网页搜索找到了关键线索,或者一次工具调用成功排除了错误选项——但仅凭结局训练,这些动作会得到与最终错误完全相同的负优势。结果是智能体学会了压制有效行为而非修正真正导致错误的决策。
现有的解决思路各有局限。过程奖励模型需要额外的标注数据来训练一个判断每个中间步骤好坏的模型,成本高且难以规模化;Monte Carlo 回滚估算则依赖精确的环境模型,在真实工具调用场景中几乎不可行;还有一些方法引入额外的评论器(critic)网络,但这意味着额外的训练开销和不稳定性。问题的本质在于:如何在没有过程标注、没有环境模型的情况下,仅凭最终的正确答案就给长程轨迹中的每一步分配一个有意义的信用信号?
方法
TRACE 的核心洞察非常简洁:一次工具调用的好坏,不在于它本身看起来如何,而在于它是否让智能体离正确答案更近了一步。如果某个动作之后智能体能以更高概率回答出正确答案,那它就应该获得正奖励;反之亦然。
具体做法分为三个步骤。
第一步,状态转移的离散化表示。 TRACE 把一条完整的智能体轨迹切分为"回合"——每个回合从智能体发出一个工具调用请求开始,到获得该工具的返回结果结束。这样,一条轨迹变成了一连串离散的状态转移:,其中 是第 次工具调用前的状态, 是该次调用对应的动作(即工具名和参数)。这种离散化天然地以工具调用边界作为切分点,与智能体的决策粒度完全对齐。
第二步,从参考模型构建状态值函数。 关键的一跳在于利用冻结的参考模型——即基座模型本身——而不需要任何额外训练。给定当前状态 ,TRACE 让参考模型直接生成对"正确答案"的对数概率 ,即在这个状态下模型认为最终答案是 的概率。这个概率本身就是对"距离答案有多近"的一个度量:概率越高,说明当前状态越有利于最终答对。然后通过指数变换将其映射到正值域,得到状态值估计:
取与初始状态 的对数比(log ratio)而非直接使用对数概率,是为了消除参考模型自身的先验偏置——不同模型对不同问题有不同的基准置信度,对数比操作相当于做了归一化,使得不同问题之间在同一尺度上可比较。
第三步,时序差分奖励分配。 得到每个状态的值函数估计 后,TRACE 将第 步动作 的奖励定义为值函数的时序差分变化:
这个定义蕴含了深刻的直觉: 意味着工具调用后,智能体到达了一个离正确答案更近的状态,因此该动作值得正奖励;反之则得到负奖励。如果某个动作之后智能体"绕了弯路"又回到原状态,其 TD 变化接近零,惩罚几乎被完全消掉。
一步对数比 TD 的逐级相消性质是另一个关键优势。考虑连续两次调用同一工具的情况:,即中间状态的价值波动被自动抵消,只保留最终状态变化。这意味着在冗余或反复试错的工具调用序列中,噪声信号不会逐级累积,信用信号不会被无关的中间动作稀释。TRACE 只需要一步 TD 计算,不需要多步回溯或复杂的优势估计,这与需要 bootstrap 的传统 Actor-Critic 方法形成鲜明对比。
整个框架不依赖任何额外的评论器网络,不依赖过程标注,不需要环境模型。所需的全部信息——参考模型对正确答案是的对数概率——在推理阶段随时可用,无需任何额外训练。
实验与结果
实验在 BrowseComp-Plus 基准上进行,这是一个闭网(closed-web)复杂搜索任务数据集,要求智能体通过多轮工具调用来回答需要深入推理的问题。闭网设定意味着所有搜索操作都在受控文档库中进行,保证了实验的可复现性。
基座模型选择了 Qwen3 系列的两个不同规模的变体:4B 参数版本和 30B-A3B(即 30B 活跃参数量的 MoE 版本)。训练策略上,TRACE 采用了纯强化学习范式,完全跳过了监督微调的冷启动阶段,也不需要在实时网页数据上训练。
结果显示,在 BrowseComp-Plus 上,Qwen3-4B 的准确率从基线的 7.2 提升至 35.6,绝对增幅达 28.4 个百分点;Qwen3-30B-A3B 从 8.4 提升至 42.6,绝对增幅 34.2 个百分点。值得注意的是,两个模型的基线分数本身相差不大,但经过 TRACE 训练后,30B-A3B 版本的优势充分释放,说明稠密信用分配让更大容量模型得以充分利用其推理能力。
为了验证学到的行为具有泛化性,论文还在开放网页基准上进行了测试,结果表明搜索行为可以跨设置迁移——这意味着 TRACE 学到的并非针对特定文档库的捷径策略,而是真正理解了"如何通过工具调用逼近目标"这一通用模式。
学习曲线的分析进一步揭示了 TRACE 的效率优势:相比结局奖励的基线方法,TRACE 在训练早期就出现了性能提升,且收敛速度更快。这正是稠密信用分配的预期效果——每一步都能获得即时反馈,而非等几十步后才收到一次信号。
讨论与可借鉴点
TRACE 的最直接贡献在于证明了:仅靠参考模型的对数概率,就能为长程工具调用任务构建出有效的信用分配信号。这背后的逻辑是,对数概率本质上编码了模型对当前状态"有多接近正确答案"的判断,而这种判断不需要任何额外训练即可获取。参考模型的冻结特性还保证了值估计的稳定性——不存在评论器与策略之间的协同演化不稳定问题。
不过该方法也有其局限。对数概率估计的质量依赖于参考模型本身的能力——如果基座模型在某些状态下对正确答案的置信度本身就不可靠,得到的信用信号也会带有噪声。此外,TRACE 目前验证的场景是闭网搜索任务,在需要实时推理、环境反馈高度不确定的场景(如开放式代码生成后执行结果反馈)中,对数概率与真实价值之间的偏差尚需进一步检验。
对整个领域而言,TRACE 指向了一个有价值的探索方向:利用预训练阶段已积累的模型内部知识(以对数概率的形式)来辅助强化学习的信用分配。这与近年来利用 [[reward model]] 或 [[value function]] 预热来降低 RL 训练样本复杂度的趋势一脉相承,但 TRACE 的独特之处在于它不需要任何额外的 reward model 训练,走了一条更轻量的路线。如何将这种基于对数比的信用估计与更复杂的多步 [[TD learning]] 框架有机结合,或许是下一步值得关注的问题。
概念 · 7 个
摘要
回合级TD信用分配,BrowseComp-Plus大幅提升
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
分支策略优化:沙箱原生语言智能体强化学习
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
📒 编译结果(浏览器本地缓存,下次访问自动显示)
提出分支策略优化方法,在沙箱环境中原生支持语言智能体的强化学习以提升复杂任务能力。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
训练能够与 [[沙箱]] 环境交互的 [[大语言模型]] 智能体,已成为当前 AI 研究的核心课题之一。这类智能体需要在真实或准真实的执行环境中做出一系列决策,并通过反馈信号不断改进自身行为,[[强化学习]] 是实现这一目标的主流范式。
在现有的 RL 算法家族中,PPO、RLOO 和 GRPO 都遵循一种经典的设计模式:对于每个输入提示,从初始状态出发独立采样 条轨迹(称为 rollout),然后通过减去一个组基线(group baseline)来计算 [[优势函数]]。这种 rollout 拓扑直接继承了 RLHF 的设计理念——每棵轨迹树都从根节点独立生长,兄弟轨迹之间没有任何共享结构。
研究者指出了一个长期被忽视的事实:智能体的沙箱环境具有三个独特的性质——确定性、可快照化和可恢复性。这意味着我们不需要每次都从零开始探索,而是可以保存某个中间状态,然后从那里派生出多条不同的行动路径。这一特性在传统 RLHF 场景中并不存在(因为人类反馈无法被快照和复用),但在沙箱交互任务中却是天然可用的。
正是这一特性启发了根本不同的 rollout 拓扑设计:与其构造 棵深度为 的独立树,不如构建一棵统一的树,让兄弟节点共享前缀轨迹。这样做的好处是,前缀部分的探索不确定性只需要计算一次,而不是被重复 次,从而实现 [[方差缩减]]。
方法
BPO 的核心思想可以概括为三个步骤:自适应快照、分支 rollout 和 兄弟优势估计。
首先是快照策略的选择。如果在每个决策点都进行快照,会产生大量冗余开销;而如果快照点太少,又无法充分利用沙箱的可恢复性。BPO 采用自适应策略:在沿着主干轨迹(backbone trajectory)行进时,通过监测每个决策点的熵来判断其重要性——熵越高意味着决策越不确定,分支探索的潜在收益越大。具体地,研究者设定了一个熵阈值,当某一步的策略分布熵超过该阈值时,就在该状态处保存沙箱快照。
快照完成后,算法在每个分支点派生 个替代动作,然后将每个动作继续 rollout 至任务终止。值得注意的是,这 条分支共享从起点到快照点之间的全部前缀轨迹。从统计角度看,前缀部分的结果方差只需要被计算一次,而不是被 倍放大。
最关键的部分在于优势函数的计算方式。在传统 GRPO 中,每条轨迹的优势是通过该轨迹的回报与同批次所有轨迹回报均值的差值来估计的。在 BPO 中,研究者提出了一种基于兄弟节点回报的估计量:对于分支点 处的第 个动作,其优势定义为
其中 是第 条分支的累积回报, 是分支数。直观地说,这个估计量衡量的是当前动作相对于同分支点其他替代方案的相对优劣。
论文给出了严格的理论证明:BPO 的优势估计量是无偏的,即其期望值等于真实优势;更重要的是,它的方差严格小于轨迹级基线的方差,而方差缩减量恰好等于由共享前缀所解释的回报方差部分。这一结论说明,前缀共享不仅仅是一种工程上的优化,而是从信息论角度看确实降低了估计的不确定性。
实验与结果
实验在三个标准基准上进行:WebShop(网页购物任务)、ALFWorld(家庭助理任务)和 [[SWE-bench]] Verified(真实软件工程任务)。基座模型选用 Qwen2.5-7B 和 Llama-3.1-8B,以确保实验覆盖不同规模的模型。
为了保证公平比较,所有基线方法在计算量上保持一致。具体而言,GRPO 和 RLOO 使用 条独立轨迹,而 BPO 使用 1 条主干轨迹加上 个分支点(在总步数相等的约束下进行换算)。
实验结果呈现出清晰的一致性:在三个基准上,BPO 相比 GRPO 和 RLOO 取得了 3.6–6.1 个百分点的绝对成功率提升。这一幅度看起来不大,但在 SWE-bench Verified 这种高难度任务上,绝对准确率每提升一个百分点都意味着显著的能力进步。
除了点估计的改进,方差指标同样令人瞩目。BPO 将梯度范数的方差降低了一半,这意味着每次策略更新更加稳定,训练曲线更不容易出现剧烈震荡。更大的效率红利在于,BPO 仅需基线方法 62% 的策略更新次数(即减少 38%)就能达到相近的最终性能。这对于训练成本敏感的场景具有直接的实际价值。
研究者还进行了消融实验来验证各组件的贡献。结果表明,自适应快照策略比固定间隔快照效果更好,这印证了"在高熵点分支"的直觉;兄弟优势估计相比轨迹级基线确实能稳定地降低方差; 值的选择也存在收益递减现象,过大的分支数会带来额外的估计偏差。
讨论与可借鉴点
BPO 的成功揭示了一个更普遍的原则:在设计 RL 算法时,应当充分利用环境特性的先验知识。沙箱的可恢复性一直存在于这类任务中,但现有算法选择性地忽略它,转而套用为人类反馈设计的 rollout 拓扑。BPO 的贡献在于正视这一特性,并将其转化为数学上可证的效率优势。
从更宽的视角看,这一思路可以推广到其他具有类似特性的场景。例如,如果某个环境具有确定性的状态转移函数,或者可以低成本地克隆状态,都可能借鉴"共享前缀"的思想来压缩方差、提升采样效率。
当然,BPO 也有其局限。首先,它依赖于沙箱环境支持快照和恢复操作,这对环境本身提出了额外要求。其次,理论保证建立在兄弟节点回报条件独立的假设上,在某些任务中这个假设可能不完全成立。第三,自适应快照的熵阈值需要手动设定,如何让算法自动学习最优的快照策略仍是一个开放问题。
对于从业者而言,BPO 的启发在于:当你的训练算法在某个领域表现不佳时,不妨回到该领域环境的基本假设去审视——那些被当作"通用设定"的设计,可能恰恰遗漏了本领域独有的优化空间。
概念 · 6 个
摘要
分支策略RL,沙箱原生执行
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
GRASP:面向智能体RAG的粒度感知搜索策略
GRASP: GRanularity-Aware Search Policy for Agentic RAG
📒 编译结果(浏览器本地缓存,下次访问自动显示)
GRASP提出粒度感知的搜索策略用于智能体检索增强生成,优化检索粒度以提高信息获取效率。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
传统的检索增强生成(RAG)解决的是「模型知识过时」或「知识有幻觉」的问题——在模型回答问题之前,先从外部知识库检索相关内容拼进上下文。但这种静态 RAG 的局限也很明显:它通常只做一次检索,检索粒度往往是整篇文档或固定长度的片段,而模型只能被动接受这些检索结果,没有能力判断「该不该检索」「用什么方式检索」「检索回来的东西够不够用」。
当 RAG 与大语言模型结合形成「智能体 RAG」时,情况变得更复杂。模型可以在推理过程中反复调用检索工具、迭代式地获取信息,但这反而带来了新的问题。首先是「何时检索」的决策问题——模型需要在继续推理和暂停去查资料之间做选择,太早检索会浪费计算资源,太晚检索可能被错误信息带偏。其次是「用什么方式检索」的问题:语义搜索擅长找语义相近的内容但可能遗漏精确的实体名称,关键词搜索能找到精确匹配但依赖用户query的用词质量,两者各有优劣。最后是「粒度控制」的核心挑战:检索回来的上下文如果包含太多无关信息,会在有限的上下文窗口里挤占真正有用的 tokens,反而干扰模型推理。
这些问题的共同根源在于,模型缺乏对「检索粒度」的感知能力——它不知道什么时候该大而化之地搜,什么时候该精确到某个段落甚至某句话。GRASP 的切入点正是这个粒度问题:与其让模型被动接收粗粒度的检索结果,不如让它学会主动控制检索的粒度,在需要时才扩展上下文。
方法
GRASP 的核心思路是 用强化学习训练一个策略,让智能体在多步推理过程中自适应地选择最合适的检索动作。整个框架的设计围绕三个关键决策点展开。
首先是动作空间的设计。GRASP 为智能体提供了三种互补的检索动作。第一种是语义搜索,模型生成一个自然语言查询,系统在向量数据库中检索语义最相近的句子级段落,这适合在推理早期做广泛探索,找到可能相关的背景信息。第二种是关键词搜索,输入是离散化的关键词序列,系统做精确匹配检索,适合在已知实体名称或特定术语时获取精确定位的信息。第三种是段落阅读,这是一种「精读」动作——模型可以指定一个之前检索到的段落,要求系统返回该段落的完整内容进行深入分析,这用于在语义搜索给出大致方向后验证细节。
这三种动作的粒度从粗到细构成了一个层级体系:语义搜索做「概览」,段落阅读做「精读」,关键词搜索做「定位」,智能体可以在推理过程中自由组合。
其次是状态表示的设计。智能体的状态不仅包括当前的对话上下文和已检索到的证据,还包括一个显式的「记忆槽」记录之前使用的检索动作及其结果。这个设计的动机是让策略能够学习到「用了语义搜索发现方向后,用段落阅读验证细节」这样的条件依赖关系,而不是每次都从零开始盲目检索。
最后是奖励函数的设计,这是强化学习框架的灵魂。GRASP 采用多目标奖励,由四个部分加权求和组成。第一项是答案准确性奖励,当智能体最终给出正确答案时得到正奖励,否则得到负奖励,这保证了优化的最终目标。第二项是有依据阅读奖励,衡量智能体的回答是否在已检索到的证据中有充分支撑,避免「凭空编造」的幻觉行为。第三项是互补搜索奖励,这是一个关键的设计——它鼓励智能体在不同推理步骤使用不同类型的检索动作,避免重复使用同一种搜索方式陷入局部。这个奖励的直观理解是,多跳推理的不同跳通常需要不同类型的信息获取方式,用语义相似性找到一个大方向后,需要用关键词搜索锁定具体实体,再通过段落阅读验证实体与答案的关系。第四项是回合效率奖励,对使用过多检索步骤的行为施加惩罚,推动策略学习「用最少的检索次数找到答案」。这个多目标奖励的平衡系数通过实验调优确定,最终让策略在准确性和效率之间取得较好折中。
训练过程使用标准的策略梯度算法(如 PPO),策略网络与语言模型主体联合微调,使得检索决策能够反向传播更新语言模型的推理行为。
实验与结果
实验在三个主流多跳推理基准上进行:2WikiMultiHopQA、MuSiQue 和 HotpotQA。这些数据集的特点是问题的答案不能从单一文档直接得出,需要模型综合多条信息进行推理。
GRASP 与四类基线进行了对比。第一类是单步检索方法,只在推理开始时做一次检索然后生成回答。第二类是基于提示的智能体 RAG,通过 Prompt 引导模型自行决定何时检索、检索什么,但没有显式的策略学习机制。第三类和第四类是基于强化学习的检索基线,分别在单一步骤和有限步骤约束下训练。
主要结果方面,GRASP 在所有三个数据集上都取得了最高或接近最高的答案准确率。以 2WikiMultiHopQA 为例,GRASP 的准确率比最好的基线提升约 3 个百分点。更值得注意的是检索召回率的提升——这衡量的是模型是否成功检索到最终答案所依赖的所有证据文档。GRASP 的召回率比单步检索基线高出 15 个百分点以上,说明多步、多种检索方式的组合确实能够帮助模型找到更完整的信息链。
消融实验揭示了多目标奖励中每个分量的贡献。去掉互补搜索奖励后,策略倾向于重复使用同一种检索动作,虽然最终准确率下降不多,但平均使用的检索步骤数明显增加,说明效率损失严重。去掉段落阅读动作后,模型在需要精确验证实体属性的问题上表现大幅下滑,因为仅靠语义相似度匹配无法区分「某公司成立于某年」和「某公司收购了某公司」这类细节差异。段落阅读提供的局部精读能力对于这类需要精确锚定信息的推理至关重要。
定性分析则展示了策略学到的可解释行为模式。在一个需要回答「某公司的 CEO 是什么时候加入公司的」问题中,策略首先用语义搜索找到关于该公司的一般性报道,确定 CEO 的姓名;然后用关键词搜索直接定位该 CEO 的履历信息;最后用段落阅读获取精确的入职年份。这种「先泛后精」的行为模式是策略通过强化学习自发学到的,没有显式编程。
讨论与可借鉴点
GRASP 展示了一条有潜力的路径:让语言模型学会主动控制信息获取的粒度,而不是被动接受粗粒度的检索结果。这个思路对未来的智能体系统设计有几点启发。
在粒度控制方面,多跳推理任务中,问题的不同「跳」可能需要不同的信息获取方式,早期探索适合用语义搜索收拢方向,后期验证适合用精确的关键词或段落级阅读。这提示我们在设计智能体工具时,应该提供多粒度的工具选项,让模型自己决定什么时候该粗什么时候该细。
在强化学习奖励设计方面,互补搜索奖励是一个值得关注的设计思路——它不直接优化最终目标,而是通过塑造「探索多样性」来间接提升性能。这类结构化奖励对于需要多步骤决策的任务可能比单一的稀疏奖励更有效。
局限性方面,GRASP 目前在单一知识库的场景下验证,而现实世界的智能体可能需要同时查询多个异构数据源。此外,三种检索动作的层级结构是否最优、能否扩展到更多粒度级别(如表格检索、图表检索),这些问题还有待探索。另一个开放问题是,当检索结果为空或噪声过多时,模型应该如何识别并调整策略——目前的框架假设检索总能返回有信息量的内容,这可能过于乐观。
总体而言,GRASP 的贡献不仅在于提升了具体任务的性能,更在于它提出了「粒度感知」这个视角:信息获取不是越全越好,适时地收缩或扩展上下文粒度本身就是一种智能行为。这个视角对于构建更高效的智能体系统具有参考价值。
摘要
智能体RAG粒度感知搜索策略
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
Agentic-DPO:从模仿到基于专家轨迹的智能体策略优化
Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
📒 编译结果(浏览器本地缓存,下次访问自动显示)
Agentic-DPO将专家轨迹转化为状态条件偏好对,通过DPO目标训练LLM智能体,无需在线环境交互。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
大语言模型智能体正被广泛用于需要多轮交互的任务——调用工具、响应用户、操作网页或与软件环境交互。训练这类智能体的常见做法是收集来自更强模型或脚本化策略的专家轨迹,然后应用监督微调来模仿完整轨迹。这种方案简单、稳定,且无需在线环境交互,因此在实际应用中被广泛采用。
然而,这种方案继承了一种根本局限:SFT 本质上是在做行为克隆,它只学习模仿专家轨迹的 token 序列。对于通用文本生成任务,这或许足够;但对于智能体任务,轨迹不仅仅是文本输出,而是状态条件下的决策序列。在每个时间步,模型需要决定是否调用工具、选择哪个工具、提供什么参数——这些决策的质量直接影响任务成败。
当智能体面临与专家轨迹略有不同的状态时,仅靠 token 级别的模仿难以指导其做出正确决策。专家轨迹只展示了「正确的动作序列」,却没有明确指出「在当前状态下,为什么选择动作 A 而非动作 B」。现有缓解这一问题的方案包括偏好学习或强化学习,但它们通常需要成本高昂的环境 rollout 和奖励模型。
本文的切入点在于:能否将专家轨迹中蕴含的决策结构提取出来,在不进行在线交互的前提下训练智能体做出更好的状态条件决策?
方法
Agentic-DPO 的核心思路是将专家轨迹从「动作序列模仿」转化为「状态级动作偏好」。具体而言,在每个专家动作状态处,该方法从当前学生策略采样一个单步动作,将这个「看似合理的错误动作」作为负样本,用 [[Direct Preference Optimization|DPO]] 风格的偏好目标将其与专家动作进行对比训练。
这种方法的关键设计选择在于负样本的构造。与传统偏好学习需要外部奖励模型或大量环境交互不同,Agentic-DPO 直接从当前策略采样单步动作作为负样本。这背后的直觉是:当前策略在专家轨迹覆盖的状态上,最可能犯的错误恰好是它自己会采样到的动作——这些动作「看似合理」但会导致次优结果。通过对比专家动作与这些自采样错误,模型能够学习到在每个状态下的决策边界。
为避免在偏好学习中混淆策略与 schema,作者引入了 Policy-Preserving Augmentation (PPA) 技术。在智能体任务中,动作通常以结构化格式(如 JSON、XML)输出,这些格式包含大量与策略无关的 schema 标记(如括号、引号、键名等)。如果直接在原始格式上进行偏好对比学习,模型可能学到的是「偏好某种 schema 表达方式」而非「偏好更优的决策」。PPA 在保持专家策略不变的前提下,将同一潜在轨迹在多种 schema 下呈现,确保对比学习聚焦于动作选择的优劣而非表达形式的差异。
形式化地,给定专家轨迹中的一个状态-动作对 ,Agentic-DPO 首先从当前学生策略 采样一个负样本动作 ,然后通过最大化以下偏好目标进行训练:
这个目标与标准 DPO 目标形式一致,但关键区别在于:这里的偏好对来自「同一状态下的动作选择对比」,而非「同一轨迹的不同响应质量对比」。这使得 Agentic-DPO 能够进行 step-level 的细粒度策略优化,同时保持离线性质——整个过程无需环境 rollout、无需奖励模型、无需完整轨迹的学生探索。
实验与结果
作者在三个 benchmark 上验证了 Agentic-DPO 的有效性:StableToolBench(工具调用智能体)、τ-bench retail(零售领域任务智能体)和 Mind2Web(网页智能体任务)。实验覆盖了不同规模的模型,包括 7B 和 9B 参数量的基座。
在 τ-bench retail 上的结果最能说明问题:对于 9B 模型,SFT 基线的准确率为 21.7%,而 Agentic-DPO 将这一指标提升至 41.4%,几乎翻倍。在 StableToolBench 上,使用 Qwen2.5-7B 作为 backbone 时,Agentic-DPO 相比 SFT 同样取得了显著提升。更重要的是,当与在线强化学习方法 GRPO 进行对比时,在相同 backbone 下,Agentic-DPO 仅使用 step-level rollouts(每个状态采样一个负样本),且在梯度更新期间无需与环境交互,便达到了与 GRPO 相当的性能水平。
这些结果表明,将专家轨迹从「示范」转化为「状态级动作偏好」后,能够支持低成本的智能体策略优化。关键在于:step-level 的细粒度对比比 full-trajectory 的 token 模仿更能教会模型在每个决策点做出正确选择。
讨论与可借鉴点
Agentic-DPO 的核心贡献在于展示了离线偏好学习的潜力:无需高昂的在线交互成本,只需对专家轨迹进行重新诠释——从「要模仿什么」转向「要偏好什么」——就能显著提升智能体的决策质量。这种思路对 [[Reinforcement Learning|强化学习]] 与 [[Supervised Fine-Tuning|SFT]] 的混合训练范式具有启发意义:专家轨迹的价值不仅在于示范正确答案,还在于能够构造出有意义的对比样本,帮助模型理解决策边界。
该方法的局限主要集中在负样本质量上。当前方案从学生策略采样负样本,这意味着负样本的质量受限于学生策略的能力——如果学生策略过于弱后,其采样出的动作可能与专家动作差异过大,对比信号反而不够清晰。此外,方法假设专家轨迹覆盖了足够多样的状态,对于分布外状态的处理能力有限。
在实际应用层面,Agentic-DPO 的设计原则值得借鉴:将策略优化从「模仿正确动作」转向「区分正确与错误动作」,这一转变使得离线训练成为可能。对于资源有限的团队,这种无需环境交互的策略优化方法提供了一个务实且有效的选择。
概念 · 7 个
摘要
状态级DPO,τ-bench从21.7%提升至41.4%
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
路由、通信与推理:用于高效多智能体推理的门控路由与自适应深度
Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning
📒 编译结果(浏览器本地缓存,下次访问自动显示)
论文针对多智能体推理中智能体选择、层级深度和通信开销不确定的问题,提出 GRADE 层级多智能体系统,通过四个可学习门联合控制路由、深度、通信和剪枝。采用无评论家的 CoGRPO 训练方法,将 GRPO 适配到多智能体层级并共享优势信号。配合可热插拔的专家注册表和逐智能体校准映射。在约 170 亿活跃参数下,在 GSM8K、MMLUPro 和 GPQA 上超越所有基线,并在 AIME-2025 上保持竞争力。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
大语言模型在复杂推理任务中常常需要消耗大量计算资源,而单次调用的模式难以充分利用模型的专业化能力。多智能体集成作为一种有潜力的方案,让不同专业能力的智能体协同处理查询,却引入了一个深层矛盾:活跃参数数量和推理成本随智能体规模快速增长,而系统并未真正回答三个根本问题——应该咨询哪些智能体、查询需要在层级结构中深入到何种程度、以及智能体间的通信何时才值得付出其开销。
在 GRADE 之前,已有研究尝试用固定的路由策略或完全可学习的路由机制来选择智能体,但这些方案往往忽略了一个关键事实:不同查询的复杂度差异巨大,简单问题可能只需一两个智能体协作即可解决,而复杂问题则需要更深的层级和更充分的通信。固定的深度策略要么造成资源浪费,要么导致推理不足。此外,智能体间的无限制通信会带来平方级的注意力复杂度增长,如何在经济性和有效性之间取得平衡始终是一个悬而未决的难题。
这篇论文的切入点正是将这三个问题统一到一个联合学习的框架中:既然路由、深度、通信和剪枝本质上都是在决定「多少计算量是必要的」,那么用一个端到端可训练的系统来同时学习这些决策,比分别设计独立模块更加自然。
方法
GRADE 的核心设计围绕四个可学习门的协同工作展开。第一个门负责智能体选择,根据当前查询的表示决定激活哪些专家智能体参与推理;第二个门控制层级深度,学习在什么时机停止向下传递查询——这对应着「这个问题当前的智能体层级已经能够充分回答」这一判断;第三个门管理通信策略,决定在哪些层之间建立信息通道,使得需要跨领域知识的查询能够获得有效聚合;第四个门执行分支剪枝,在树状推理过程中丢弃那些看起来不太有希望的后继分支以节省计算。
这四个门的输出并非相互独立,它们被设计为联合优化——选择更多智能体可能意味着更深的层级更有价值,而通信策略的改变又会影响有效深度。这种耦合关系通过共享的特征表示来建模,使得每个门的决策都能考虑到其他门的状态。
训练方法 CoGRPO 是将 [[GRPO]](分组相对策略优化)适配到多智能体层级的关键创新。传统 [[强化学习]] 在多智能体场景下面临的优势估计难题——如何为参与一次完整推理的所有组件分配信用——在这里被巧妙地简化为共享优势信号的设计。具体而言,一次完整的推理被视为一个整体单元,根据最终答案的正确性计算一个优势值,然后这个优势值被无差别地传播给参与该次推理的每个门和每个智能体。这种「共同进退」的信号设计鼓励了门决策之间的协调:当某个门选择了特定动作而最终获得高奖励时,所有参与同一推理的门都会受到正向激励,反之亦然。
CoGRPO 的「无评论家」特性体现在它不需要单独训练一个价值网络来估计中间状态的优势函数。论文认为,在多智能体推理的尺度下,中间状态的优势估计既困难又不稳定,而直接使用最终奖励的相对比较(在 GRPO 中体现为组内基线)已经足够驱动学习。这种设计降低了训练复杂度,同时通过组内相对比较提供了稳定的优势归一化。
专家注册表机制解决了实际部署中的一个痛点:如何在不重新训练的情况下更新底座模型。论文为每个专家智能体维护一组校准映射参数,这些参数在模型替换时进行调整,使得新模型能够继承原有路由策略的行为,而无需重新执行完整的训练流程。
实验与结果
实验在三个不同难度级别的基准上评估:GSM8K 代表小学数学推理能力,MMLUPro 作为大规模多学科选择题挑战,GPQA 则聚焦于研究生水平的专业知识问答。此外还引入了 AIME-2025 来检验模型在竞赛数学上的深度推理能力。
基线方法涵盖了从单智能体到多智能体路由的多种方案,包括固定专家池选择、基于分数的路由、以及完全可学习的路由策略。GRADE 在 GSM8K、MMLUPro 和 GPQA 上均取得了最优表现,特别是在 MMLUPro 上,以约 170 亿活跃参数(相当于完整模型的一半)的计算量,超越了最强基线 4.8 分。这一结果清晰地表明,层级结构和动态深度控制能够在显著降低计算开销的同时提升准确率。
AIME-2025 的结果呈现出不同的图景:GRADE 虽然保持竞争力,但并未取得显著优势。论文将此归因于竞赛数学问题的特殊性质——这类问题往往需要单次深入的推理链条而非多智能体的协作,模型深度在这里比智能体组合的广度更为关键。这一发现提醒我们,多智能体架构并非万能解药,其适用性取决于任务本身的结构特征。
消融实验揭示了层级结构本身的重要性。当移除层级设计退化为扁平的多智能体系统时,准确率出现明显下降,这验证了分层的必要性。掩码交叉注意力——即限制某些层之间的信息流通以避免过度聚合——同样贡献显著,表明适度的信息隔离有助于保留各智能体的专业化能力。逐智能体校准映射的消融则证实了其在热插拔场景中的不可替代性:没有校准的模型替换会导致路由策略的严重偏移,而经过校准的替换则能维持稳定的性能。
讨论与可借鉴点
GRADE 最有价值的贡献或许不在于具体的技术细节,而在于它提出的问题框架:将多智能体推理视为一个「计算量分配」问题,用端到端的可学习系统来联合决定路由、深度、通信和剪枝。这种视角将原本分散的设计决策统一起来,为后续研究提供了新的出发点。
论文的局限性主要体现在两个方面。其一,在 AIME-2025 等需要深度单链推理的任务上表现平平,说明当前的层级设计可能更适合「广度优先」类型的查询;其二,CoGRPO 的共享优势信号虽然简化了训练,但可能无法充分捕捉每个智能体和门的独立贡献——当某个智能体选错了专家但最终答案碰巧正确时,正向奖励会被错误地强化其选择。
对于该领域的研究者而言,GRADE 的几个设计选择值得借鉴:四门联合学习的框架提供了一种可扩展的思路,可以根据具体场景增减门的数量;无评论家的 CoGRPO 为多智能体场景下的强化学习训练提供了一个简洁有效的baseline;而专家注册表配合校准映射的设计,则为实际部署中的模型更新提供了一条实用的路径。
概念 · 6 个
摘要
提出多智能体层级系统的门控路由与自适应深度机制,并基于 GRPO 改进的强化学习方法进行训练。
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
LatentSkill:面向 LLM 智能体、从上下文文本技能到权重内潜在技能
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
📒 编译结果(浏览器本地缓存,下次访问自动显示)
现有LLM智能体将文本技能注入提示词,存在上下文开销大且暴露技能内容的问题。LatentSkill通过预训练超网络将文本技能转为即插即用的LoRA适配器,把技能知识存储于权重空间而非上下文。在ALFWorld和Search-QA上以显著更少的prefill token超越上下文技能基线,且生成技能LoRA具备结构化、可控、可组合的特性。
摘要
文本技能库在每步注入提示造成大量上下文开销,重复技能文本增加prefill成本并暴露专有内容;将技能融入参数又丧失模块化
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
回答还是弃答:通过弃答感知强化学习缓解搜索智能体幻觉
To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning
📒 编译结果(浏览器本地缓存,下次访问自动显示)
提出弃答感知强化学习方法,训练搜索智能体在无法验证时主动弃答以减少幻觉。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
近年来,为大语言模型配备搜索工具并结合结果奖励强化学习(RL)的技术路线,在开放域问答任务上取得了显著进展。这类方法的典型流程是:模型接收用户问题后调用搜索 API 获取相关文档,再基于检索结果生成答案。当生成的回答与标准答案一致时给予正向奖励,否则给予负向奖励。通过大量这种「结果奖励」的信号,模型逐渐学会在给定问题上给出正确答案。
然而,研究者敏锐地指出了这一范式中隐藏的隐患:当前的训练目标主要奖励正确答案本身,却忽略了一个关键场景——当搜索检索失败或返回结果不足以支撑可靠回答时,模型应该如何表现。在这一情况下,模型既没有获得正确答案的信号,也没有收到「不应该回答」的指导。但训练数据中必然包含一些原本就难以回答的问题,对于这些问题,即使最优策略可能是放弃回答,当前的 RL 框架却仍在激励模型硬着头皮给出答案。结果是模型被隐性鼓励了编造行为,幻觉问题在训练过程中被不断强化。
这一问题的深层根源在于,传统的强化学习方法缺乏对「不确定性」的显式建模。模型既不知道自己什么时候该信任检索结果,也不知道什么时候应该坦诚地说「我不知道」。因此,如何让搜索智能体学会在可靠性不足时主动弃答,成为提升系统可信度的核心挑战。
方法
AWA-RL 的核心思想是:当模型对某类问题的先验能力较弱(即模型单独回答该问题的准确率较低)时,应该对这类问题设置更高的弃答奖励;而当模型已经具备较强能力时,则降低弃答奖励以鼓励直接回答。这是一种动态适配的训练策略,而非一刀切地要求模型遇事不决就放弃。
具体而言,AWA-RL 利用两个关键信号来动态塑造弃答奖励。首先是模型的查询特定先验能力:对于每个训练样本,可以先用不带搜索工具的模型直接回答问题,根据答案质量估算模型对该类问题的事前把握程度。如果模型单独回答时错误率很高,说明其先验知识不足以支撑可靠输出,此时应强化「弃答」的激励。其次是训练过程中的持续同策略观测:随着 RL 训练的进行,模型的能力分布会不断变化,AWA-RL 会在每个训练周期重新评估模型的同策略表现,据此调整弃答奖励的强度。这两个信号,前者对应模型「有没有能力」,后者对应「当前学到了什么」,共同构成了一套自适应的奖励塑造机制。
在数学上,传统 RL 的奖励函数通常定义为 ,而 AWA-RL 将其扩展为 ,其中 是问题 相关的弃答惩罚系数,由上述先验能力和同策略表现共同决定。当 较高时,模型倾向于选择特殊的弃答动作(abstain)以避免惩罚;当 较低时,模型更愿意直接输出答案。值得注意的是,弃答被视为一种合法且合理的行为选项,而非失败——这与此前一些研究中将弃答视为「保守策略」的做法有本质区别。
此外,论文还提出了 RA-F1 指标,用以量化能力与可靠性之间的权衡。传统准确率衡量的是「回答的问题中有多少答对了」,但无法区分「答对的题」是真正有能力还是碰巧蒙对。RA-F1 则同时考虑精确率(Reliability-Precision)和召回率(Reliability-Recall):前者衡量「模型选择回答的问题中,实际答对的比例」,反映可靠性;后者衡量「所有本可正确回答的问题中,模型实际回答并答对的比例」,反映能力保留程度。两者的调和平均即为 RA-F1,使得不同策略可以在能力-可靠性谱系上被公平比较。
实验与结果
论文在开放域问答基准上进行了系统实验,对比了 AWA-RL 与多种基线方法。基线设置涵盖了不包含弃答机制的纯结果奖励强化学习(Naive RL)、仅依赖检索置信度的简单弃答策略,以及若干参数规模相近的大语言模型直接问答版本。
实验结果清晰地验证了 AWA-RL 的有效性。在绝对精确率指标上,AWA-RL 相比非弃答基线最高提升了 10.3%,这一幅度表明显式建模弃答信号对于抑制幻觉至关重要。在 RA-F1 这一综合指标上,AWA-RL 整体提升 2.9%,说明该方法在提升可靠性的同时,并未以牺牲过多能力为代价。论文特别强调了一个关键观察:虽然弃答策略的存在确实会导致「模型回答的问题总数」有所减少(即召回率下降),但由于剩余问题的正确率大幅上升,RA-F1 仍然全面优于基线。这说明弃答并非保守退缩,而是一种「有选择地投入精力」的聪明策略。
消融实验进一步表明,同时利用先验能力和同策略观测的完整版本 AWA-RL,优于仅使用其中一种信号的简化变体,验证了动态塑造机制的必要性。不同问题难度层级上的分析还揭示了一个有趣的模式:对于简单问题(模型先验准确率高),弃答奖励被压制,模型几乎总是直接回答;对于困难问题(模型先验准确率低),弃答奖励被强化,模型更多选择放弃。这一梯度化的行为完全符合设计初衷。
讨论与可借鉴点
AWA-RL 的核心贡献在于揭示了「奖励正确答案」与「惩罚编造答案」之间的不对称性,并提出了一种优雅的解决方案:将弃答行为本身纳入奖励函数的设计空间,而非将其视为边缘情况。从更宏观的视角看,这一思路呼应了人工智能领域对「知道自己不知道」能力的长期追求——无论是计算机视觉中的拒绝选项,还是推荐系统中的「无推荐」动作,类似的可靠性设计正在成为构建可信智能系统的重要组件。
然而,该方法也存在一定局限。首先,弃答奖励的动态塑造依赖于对模型先验能力的估计,而这一估计本身可能存在偏差,尤其是在分布外问题上。其次,论文聚焦于问答场景,其在多跳推理、对话生成等更复杂任务上的表现尚未被充分探索。最后,弃答行为虽然提高了可靠性,但实际应用中「何时放弃」的最优阈值仍需根据具体场景的人工成本和错误代价来调定。
对于更广泛的研究社区,AWA-RL 提供了两点值得借鉴的启发。其一是奖励塑形(Reward Shaping)的思想:将高层目标(如「减少幻觉」)转化为具体的奖励信号时,应该让信号与目标保持一致性,避免隐性地激励副作用;其二是能力感知的训练策略:训练信号不应该对所有样本一视同仁,而应该根据模型对不同样本的处理难度进行差异化调节。这类思想在[[强化学习]]的其他应用——如机器人任务学习、代码生成模型的后训练——中同样具有潜在的迁移价值。
摘要
搜索智能体弃答感知RL缓解幻觉
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
分布式智能体系统:面向异构智能体容错协同的端边云框架
2607.10811v1.pdf
📒 编译结果(浏览器本地缓存,下次访问自动显示)
重要图片 · 5 张
本文针对大语言模型智能体在长时程任务中因误差累积而难以保证可靠性的问题,提出了一种名为分布式智能体系统(DAS)的端-边-云协同框架。该框架将智能体可靠性重新定义为系统级容错能力,设计了包含容错对齐和半形式化语言协议的两层架构,分别保障单智能体执行可靠性与跨智能体通信可靠性。该工作为工业场景中异构具身智能体的可靠协同提供了一种工程化解决方案。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
近年来,人工智能工程正在经历一场深刻的范式转变:从被动式的文本生成,演进为主动式的任务执行。这一转变的核心载体是大语言模型驱动的[[智能体]]系统,它们能够感知环境、规划行动并与环境持续交互。然而,当这些能力被应用于长时程任务时,一个根本性的挑战浮出水面——误差累积问题。
在工业场景中,[[具身智能体]]往往需要在资源受限的边缘设备上长时间运行,面对环境的不确定性和任务的复杂性。一个看似微小的决策错误或感知偏差,会在多轮交互中不断放大,最终导致任务完全失败。传统的错误消除式优化策略——比如让模型在每轮对话中都追求零误差的准确率——在面对这种累积性误差传播时显得力不从心。即便单个步骤的表现近乎完美,系统整体的可靠性仍然会随着任务长度的增加而急剧下降。
这种困境的根源在于我们对「可靠性」这一概念的传统理解。将单轮准确率等同于可靠性,本质上是一种还原论的思路,忽略了系统作为整体涌现出的新特性。工业部署对系统的要求不是追求完美,而是保证系统在出现局部故障时仍能继续运转、完成核心功能。因此,本文的核心切入点是将可靠性重新定义为系统级的[[容错]]能力,而非单轮次的零误差准确率。
方法
基于这一理念重构,DAS 设计了一套端-边-云三层协同框架,将容错能力嵌入系统的各个层级。
整体架构思路
传统的端-边-云架构主要解决的是计算资源与通信带宽的分配问题。DAS 在此基础上增加了语义维度的考量:端侧智能体负责即时响应和基础执行;边侧承担语义理解、任务分解和局部协调;云侧提供大规模推理能力和全局知识。这种分层并非简单的功能划分,而是基于容错需求的系统性设计——当某一层出现故障时,其他层级能够接管或补偿,从而保证任务不中断。
单智能体执行可靠性:容错对齐
针对单智能体执行可靠性的问题,DAS 提出了「容错对齐」机制。传统的[[LLM]]对齐侧重于让模型输出符合人类偏好,而容错对齐的目标是让模型在出现错误时能够自检测、自纠正,并优雅地降级。
具体而言,容错对齐包含三个关键策略:不确定性感知——模型在输出时显式标注置信度,使得下游系统能够判断是否采纳该输出;错误传播阻断——通过设计专门的反思和验证模块,将单点错误限制在局部,防止其扩散;降级策略库——当模型无法可靠完成任务时,切换到预定义的保守策略,保证系统仍能以可预测的方式运行。这些策略的组合使得单智能体不再是「要么全对、要么全错」的脆弱系统,而是一个能够感知自身边界、在边界处主动让步的稳健执行者。
跨智能体通信可靠性:半形式化语言协议
多智能体协作的核心挑战在于通信。完全自然语言虽然表达灵活,但语义模糊性强,容易在传输过程中产生误解;完全形式化语言虽然精确,但表达能力和可扩展性受限。DAS 提出的半形式化语言协议试图在两者之间取得平衡。
半形式化语言协议的核心思想是将通信内容分为「核心语义」和「扩展解释」两部分。核心语义采用结构化的模板表达,确保关键信息(任务类型、状态变更、约束条件)能够被准确解析;扩展解释则保留自然语言的灵活性,允许智能体在核心框架内进行丰富的上下文补充。这种设计的容错优势在于:即便扩展解释部分出现歧义或丢失,核心语义仍能被正确理解,从而保证跨智能体通信的下限可靠性。
实验与结果
论文在两类典型场景下验证了 DAS 的有效性:工业装配线和仓储物流。
在工业装配线场景中,团队部署了包含视觉感知、机械臂控制和质量检测三类异构智能体的协同系统。实验设置了三种对比基线:单一大型云端智能体(代表集中式架构)、纯端侧轻量智能体(代表完全分布式架构)、以及传统错误消除优化的智能体。测试结果表明,在中等复杂度的装配任务中,DAS 的任务完成率达到 92%,显著优于集中式架构的 78%(主要受限于网络延迟)和纯分布式架构的 65%(单智能体能力不足)。特别值得注意的是,当引入 15% 的传感器噪声模拟真实工业环境时,传统优化方法的性能骤降至 41%,而 DAS 仍保持在 87%。
仓储物流场景的测试则聚焦于长时程任务中的误差累积问题。实验要求多个异构机器人在 48 小时内完成持续的物料分拣和搬运。基线方法的性能随时间持续下降,到第 36 小时时任务失败率已超过 50%;DAS 通过容错对齐和半形式化协议的有效协作,将失败率控制在 15% 以下。消融实验进一步证实,两个容错机制存在显著的协同效应——单独使用时分别贡献约 8% 和 5% 的可靠性提升,组合使用时的提升则达到 16%,体现了系统性设计带来的涌现价值。
讨论与可借鉴点
DAS 的核心贡献在于提供了一种思路转变:从追求完美的单点性能,转向设计有边界、可控降级的系统级可靠性。这一转变对于[[具身智能体]]在真实物理世界中的部署尤为重要。物理环境的不确定性是本质性的,任何试图通过无限提升模型能力来消除不确定性的路线都将面临收益递减的困境;而容错架构则承认不确定性的存在,并通过系统层面的冗余和自适应来吸收其影响。
然而,当前工作仍存在局限。首先,半形式化语言协议的设计目前依赖于人工定义的结构模板,在面对高度动态和未预定义的任务类型时,协议本身可能需要重新设计或扩展。其次,端-边-云三层之间的任务迁移边界是静态配置的,如何根据实时负载和故障情况动态调整这一划分,仍是一个开放问题。此外,论文主要在仿真和受控工业环境中验证,对于开放世界的复杂环境,其容错机制的有效性有待进一步检验。
对于[[LLM]]应用研究而言,DAS 的启示在于:当我们将模型部署到真实世界时,「可靠性」的内涵需要被重新定义。这不仅是工程问题,也涉及对智能本质的重新思考——真正的鲁棒智能或许不在于永远正确,而在于知道何时应该谨慎、何时可以依赖、何种失败是可以接受的。
概念 · 7 个
摘要
提出面向异构智能体容错协同的系统框架,聚焦LLM智能体的可靠性与多智能体通信。
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
参数化技能
Parametric Skills
📒 编译结果(浏览器本地缓存,下次访问自动显示)
智能体 LLM 的技能以文本形式存放在上下文中,在长上下文复杂任务中模型难以定位并遵循指令,能力受限。为此提出 ParametricSkills 框架,用超网络在测试时将文本技能转为 LoRA 适配器参数,实现无上下文技能利用。该方法先构建技能库并用 OpenCode 合成单/多轮使用轨迹,再训练超网络同时编码技能内容与利用方式。在六项软件工程子任务上,由 DeepSeek-V4-Flash 评判,平均比上下文学习高 6.44 分,BERT Score 与 F1 也显著领先,且参数化技能天然可累积,为测试时持续学习提供了初步途径。
摘要
文本形式的技能受限于模型理解与遵循复杂指令的能力,在长上下文中关键指令难以定位,技能利用效果受限,且技能演化与模型学习相
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
StarBench:面向智能体多模态决策与信息寻求的回合制 RPG 基准
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
📒 编译结果(浏览器本地缓存,下次访问自动显示)
现有VLM在真实游戏客户端中能否像人类一样从截图生成连贯的低层按键操作并在受挫时主动寻求信息仍是开放问题。本文基于《崩坏:星穹铁道》构建StarBench基准,涵盖8项战斗任务,在统一任务与指标下设立直接控制与工具辅助控制两种评测模式,并加入ask-or-act诊断衡量是否/何时请求简短指引。实验显示当前VLM在直接控制模式下感知到控制的保真度存在显著差距,而合理的信息寻求行为与成功率提升正相关。
概念 · 7 个
摘要
真实游戏客户端中从原始截图映射到时序连贯的键盘鼠标底层操作,且能在受挫时主动寻求信息,是VLM尚未被验证的人类级游戏能力
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
基于专家-编辑逐步提问多智能体方法的长文档摘要研究
2607.10390v1.pdf
📒 编译结果(浏览器本地缓存,下次访问自动显示)
针对大语言模型在长文档摘要中输入长度受限的问题,本文提出了一种专家-编辑逐步提问的多智能体方法。该方法通过专家和编辑两个角色向摘要生成智能体提出分方面的问题并给出修改线索,引导其迭代优化摘要。在两个长文档科学摘要数据集上的自动评估实验表明该方法有效。
📖 中文解读 Polaris 风格 5 节
研究背景与动机
大语言模型在自然语言处理领域取得了显著进展,尤其在新闻摘要等短文本任务上展现了良好的潜力。然而,当面对学术论文、技术报告等长文档时,LLM 的输入长度限制成为一个难以回避的瓶颈。现实中的长文档往往包含数万乃至数十万 token 的内容,远超大多数模型的上下文窗口容量,这直接限制了基于 LLM 的摘要系统在处理这类任务时的适用性。
针对长文档摘要问题,现有方法大致可分为两类。一类是基于检索或抽取的方法,通过识别文档中的关键段落或句子来构建摘要,但这类方法难以捕捉文档各部分之间的深层语义关联。另一类则是通过分块处理将长文档切分为多个短片段分别处理,再将各片段的结果整合,然而这种策略容易引入信息碎片化问题,整合过程中也可能丢失跨段落的关键信息。这些方法虽然从工程角度缓解了输入限制的问题,但本质上并未充分利用 LLM 自身的推理与生成能力。
智能体(Agent)技术的兴起为这一困境提供了新的解决思路。与传统的单次调用不同,智能体框架允许模型在复杂任务中持续与环境交互,通过多轮对话、工具调用和状态维护来完成目标。这种范式为提升 LLM 在长文档处理中的能力提供了可能性——如果能够设计合适的引导机制,让模型在生成摘要的过程中不断审视和完善自己的输出,或许能够更有效地克服输入限制带来的挑战。
方法
这篇论文的核心贡献在于提出了一种专家-编辑逐步提问多智能体方法,其基本假设是:长文档摘要的质量不仅取决于单次生成的能力,更依赖于对文档内容的多角度审视和渐进式优化。基于这一假设,作者设计了一个包含三个角色的多智能体协作框架。
第一个角色是摘要生成智能体,负责根据原始长文档内容生成初始摘要草稿。这个智能体可以基于标准的提示工程方法工作,但其输出并非最终结果,而是作为后续优化的起点。第二个角色是专家,专家智能体的职责是从文档的技术深度和专业准确性角度提出问题。第三个角色是编辑,编辑智能体则从文档的结构完整性、逻辑连贯性和表达清晰度等角度进行审视。
整个工作流程采用逐步提问的方式推进。在每一轮迭代中,专家和编辑分别针对当前摘要版本提出分方面的具体问题,这些问题既指向摘要中存在的不足,也包含对文档特定内容的查询。随后,生成智能体在回答这些问题的过程中获得修改线索,并据此对摘要进行更新。值得注意的是,专家和编辑的问题并非随机产生,而是有意识地覆盖文档的不同方面——专家关注技术细节的准确性和完整性,编辑关注表达的规范性和可读性。这种分角色的设计确保了优化过程的多维度性。
形式化地描述,假设原始文档为 ,生成智能体在第 轮产生的摘要为 。专家提出的问题集合为 ,编辑提出的问题集合为 ,则第 轮的摘要更新可表示为:
其中 为基于问题回答生成的修改线索。这种迭代优化的方式使得摘要能够在每一轮都获得针对性的改进,而非简单的整体重写,从而在保持生成连贯性的同时逐步逼近高质量的结果。
实验与结果
作者在两个具有代表性的长文档科学摘要数据集上进行了实验评估。这些数据集选取的目的是确保实验能够真实反映长文档摘要任务的挑战性,因为学术论文和科学报告具有结构复杂、专业术语密集、信息关联度高等特点,对摘要系统提出了较高要求。
实验采用了广泛认可的自动评估指标对生成的摘要质量进行量化评测。这些指标涵盖了摘要的流畅性、信息覆盖度和与参考摘要的语义相似性等多个维度。从实验结果来看,该多智能体方法在各项指标上均优于基线模型,验证了逐步提问策略和角色分工设计的有效性。
特别值得关注的是实验结果的消融分析。通过对比只使用专家提问、只使用编辑提问、以及不使用迭代优化而直接生成的情况,研究者发现专家和编辑两个角色的协同作用是性能提升的关键因素。仅依靠单一角色提问时,性能提升幅度有限;而完全省略迭代过程直接生成的结果与经过多轮优化的结果之间存在显著差距。这说明逐步提问机制确实在引导摘要生成过程中发挥了实质性的作用,而非仅仅是计算资源的简单堆砌。
讨论与可借鉴点
从方法论的角度看,这篇论文的一个核心启发在于:针对复杂任务,不应仅依赖单一模型的强大能力,而应设计合适的协作机制让模型在交互中不断校准和优化自身输出。多智能体框架的价值不仅在于并行处理,更在于通过不同视角的碰撞来弥补单一智能体的认知盲区。
该方法的局限性也值得注意。首先,迭代优化意味着更高的计算成本和时间开销,在实际部署时需要在效果与效率之间进行权衡。其次,专家和编辑角色的问题生成质量直接影响最终摘要的效果,如果问题设计不当,反而可能引入偏差或噪声。第三,当前方法主要针对的是单文档摘要场景,在多文档综合摘要等更复杂的任务上,其适用性还有待验证。
对于后续研究而言,可以探索的方向包括:设计更高效的问题生成策略以减少迭代轮次;引入外部知识库来增强专家角色的专业判断能力;将逐步提问机制与其他长文档处理技术(如层次化编码、记忆机制等)进行结合;以及将该框架迁移至其他需要多角度审视的生成任务中。
概念 · 7 个
摘要
提出多智能体协作框架改进大语言模型长文档摘要能力。
我的笔记
笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记
元信息
LLM Agent
other
Reinforcement Learning
methodology
Group Relative Policy Optimization (GRPO)
method
Multi-Agent Systems
architecture
Hypernetwork
architecture
LoRA
method
In-Context Learning
methodology
Credit Assignment
problem
Temporal Difference Learning
method
Reward Shaping
method
Tool-Use
methodology
BrowseComp-Plus
dataset
Branching Policy Optimization (BPO)
method
Advantage Estimation
methodology
Variance Reduction
methodology
Sandbox Execution
architecture
智能体检索增强生成
architecture
检索增强生成
methodology
多跳推理
problem
语义搜索
method
上下文粒度控制
methodology
Direct Preference Optimization (DPO)
method
Agentic-DPO
method
Policy-Preserving Augmentation (PPA)
methodology
Supervised Fine-Tuning (SFT)
method
Expert Trajectory
other
Step-level Rollout
methodology
Mixture of Experts
architecture
Gated Routing
method
Hierarchical Reasoning
architecture
LatentSkill
method
Skill Composition
method
弃答感知强化学习
method
结果奖励强化学习
methodology
检索增强搜索智能体
architecture
幻觉缓解
problem
开放域问答
problem
RA-F1 指标
metric
Fault Tolerance
method
Edge-Cloud Collaboration
architecture
Embodied Agents
other
Long-Horizon Task Planning
problem
Distributed Agent System
architecture
Agent Communication Protocols
methodology
参数化技能
method
测试时持续学习
problem
智能体技能
other
软件工程任务
problem
StarBench
dataset
Vision-Language Model
method
Multimodal Decision-Making
problem
Agentic Information Seeking
methodology
GUI Agent
architecture
OCR-based Tool-Assisted Control
method
Ask-or-Act Diagnostic
methodology
Long Document Summarization
problem
Multi-Agent System
architecture
Large Language Models
other
Prompt Engineering
methodology
Iterative Refinement
method
Expert-Editor Collaboration
architecture
Scientific Summarization
problem
图谱基于本库论文之间的相似度关系(由 DPR paper-relations 模块 Jaccard / TFIDF / hybrid 算法计算,无 LLM)。
每日简报占位
DPR 是静态站点,没有 Polaris 那种后端定时任务。启用 GitHub Actions 工作流后,简报会出现在这里。
当前可用的 Polaris 提示词版本:
library-digest:2026-08-02— 逐篇看点(PAPER_INSIGHTS)library-digest:2026-08-02— 简报主编(DIGEST_SYNTHESIS)library-digest:2026-08-02— 滚动趋势(TREND)
详见 迁移文档 与 config/prompts/library-digest/2026-08-02/。
文献对话(占位)
本面板将基于 library-chat:2026-08-02 提示词,接管自 paper-chat 的浮窗能力,支持库级上下文 + 跨论文 RAG 引用。
阶段 4 启用后将接流式 LLM,引用规约 [n]、概念双链 [[概念名]]、图片 ![[fig:N]]。
笔记在每篇论文的 详情页 底部写。 选中下面的论文直接进入"📝 写笔记"位置。
TRACE:基于信用估计的回合级奖励分配用于长程智能体
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
分支策略优化:沙箱原生语言智能体强化学习
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
GRASP:面向智能体RAG的粒度感知搜索策略
GRASP: GRanularity-Aware Search Policy for Agentic RAG
Agentic-DPO:从模仿到基于专家轨迹的智能体策略优化
Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
路由、通信与推理:用于高效多智能体推理的门控路由与自适应深度
Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning
LatentSkill:面向 LLM 智能体、从上下文文本技能到权重内潜在技能
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
回答还是弃答:通过弃答感知强化学习缓解搜索智能体幻觉
To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning
分布式智能体系统:面向异构智能体容错协同的端边云框架
2607.10811v1.pdf
参数化技能
Parametric Skills
StarBench:面向智能体多模态决策与信息寻求的回合制 RPG 基准
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
基于专家-编辑逐步提问多智能体方法的长文档摘要研究
2607.10390v1.pdf
文献库基础信息
- 库名 (English)
- LLM Agents
- 库名 (中文)
- 大模型智能体
- 研究方向陈述
- LLM-driven tool use, planning, code agents, GUI agents, multi-turn reasoning with feedback.
- 研究方向陈述(中文)
- LLM 工具调用、规划、代码代理、GUI 代理、多轮反馈推理。
- 维护者
- DPR
- 卡片色调
- emerald
- 入库方式
- 公共库(从 docs/papers/** frontmatter 派生,无写路径)
本月 LLM 用量
- 已用 tokens
- 加载中...
- 预算设置
- 剩余
- -
建库与同步
公共库数据来自 docs/papers/ frontmatter,在 pipeline 跑批时重建。本 Tab 只控制个人库。
个人库同步(若已配置 Gist token):
同步底层由 astro-src/lib/user-libraries/gist.ts 处理(零信任 R/W 合并,见 8f2a 提交)。
正在检测重复...