arXiv 2607.13988v1 · 发布 2026-07-16

TRACE:基于信用估计的回合级奖励分配用于长程智能体

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

AUTHORS Tao, Leitian, Peng, Baolin, Yao, Wenlin, Ge, Tao, Cheng, Hao, Wang, Mike Hang, Gao, Jianfeng, Li, Sharon
EVIDENCE 回合级TD信用分配,BrowseComp-Plus大幅提升
SCORE 0.9
CATEGORIES TASK agentrl
GENERATED 2026-07-20 02:29:20 UTC

📝 TLDR

TRACE通过参考模型对数比的TD变化为长程智能体分配细粒度步骤奖励,显著提升工具调用学习效果。

🧭 速览

动机

长程智能体依赖数十次工具调用,结果奖励既稀疏高方差,又错误地把失败轨迹中的有效步骤也归入负优势

方法

TRACE将rollout拆为工具边界状态序列,用冻结参考模型估计对数比状态值,一步TD差分即得每步奖励,无需critic即可跨冗余调用累加

结果

纯RL训练下,Qwen3-4B由7.2升至35.6,Qwen3-30B-A3B由8.4升至42.6,搜索策略可迁移至开放域

结论

TRACE证明TD式稠密信用分配可在无冷启动、无过程标注条件下有效提升长程智能体的工具使用能力

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

TRACE 是一种针对长程智能体强化学习的稠密信用分配方法,它利用冻结参考模型给出的答案对数概率来构建状态值函数,再通过时序差分变化将奖励精确分配到每一步工具调用动作。在闭网页搜索任务 BrowseComp-Plus 上,仅靠纯强化学习无需任何监督微调冷启动,TRACE 就将 Qwen3-4B 的表现从 7.2 提升到 35.6,Qwen3-30B-A3B 从 8.4 提升到 42.6,且学习曲线更早出现改进并更快收敛。

研究背景与动机

多轮智能体的核心工作模式是:接收用户指令后,通过反复调用搜索、计算、代码执行等工具逐步探索,直到最终输出答案。在短程任务中,这种模式运作良好——轨迹只有几步,强化学习的结局奖励(outcome reward)足以提供可靠的监督信号。然而,随着任务复杂度提升,轨迹可能扩展到几十甚至上百次工具调用,结局奖励的问题就变得尤为突出。

首先是稀疏性问题。当智能体在第 100 步工具调用时才得到最终反馈,99% 的中间动作处于无监督状态,梯度信号几乎无法抵达这些早期决策点。其次是误导性问题:一次失败的轨迹中可能包含大量有价值的中间动作——比如一次成功的网页搜索找到了关键线索,或者一次工具调用成功排除了错误选项——但仅凭结局训练,这些动作会得到与最终错误完全相同的负优势。结果是智能体学会了压制有效行为而非修正真正导致错误的决策。

现有的解决思路各有局限。过程奖励模型需要额外的标注数据来训练一个判断每个中间步骤好坏的模型,成本高且难以规模化;Monte Carlo 回滚估算则依赖精确的环境模型,在真实工具调用场景中几乎不可行;还有一些方法引入额外的评论器(critic)网络,但这意味着额外的训练开销和不稳定性。问题的本质在于:如何在没有过程标注、没有环境模型的情况下,仅凭最终的正确答案就给长程轨迹中的每一步分配一个有意义的信用信号?

方法

TRACE 的核心洞察非常简洁:一次工具调用的好坏,不在于它本身看起来如何,而在于它是否让智能体离正确答案更近了一步。如果某个动作之后智能体能以更高概率回答出正确答案,那它就应该获得正奖励;反之亦然。

具体做法分为三个步骤。

第一步,状态转移的离散化表示。 TRACE 把一条完整的智能体轨迹切分为"回合"——每个回合从智能体发出一个工具调用请求开始,到获得该工具的返回结果结束。这样,一条轨迹变成了一连串离散的状态转移:,其中 是第 次工具调用前的状态, 是该次调用对应的动作(即工具名和参数)。这种离散化天然地以工具调用边界作为切分点,与智能体的决策粒度完全对齐。

第二步,从参考模型构建状态值函数。 关键的一跳在于利用冻结的参考模型——即基座模型本身——而不需要任何额外训练。给定当前状态 ,TRACE 让参考模型直接生成对"正确答案"的对数概率 ,即在这个状态下模型认为最终答案是 的概率。这个概率本身就是对"距离答案有多近"的一个度量:概率越高,说明当前状态越有利于最终答对。然后通过指数变换将其映射到正值域,得到状态值估计:

取与初始状态 的对数比(log ratio)而非直接使用对数概率,是为了消除参考模型自身的先验偏置——不同模型对不同问题有不同的基准置信度,对数比操作相当于做了归一化,使得不同问题之间在同一尺度上可比较。

第三步,时序差分奖励分配。 得到每个状态的值函数估计 后,TRACE 将第 步动作 的奖励定义为值函数的时序差分变化:

这个定义蕴含了深刻的直觉: 意味着工具调用后,智能体到达了一个离正确答案更近的状态,因此该动作值得正奖励;反之则得到负奖励。如果某个动作之后智能体"绕了弯路"又回到原状态,其 TD 变化接近零,惩罚几乎被完全消掉。

一步对数比 TD 的逐级相消性质是另一个关键优势。考虑连续两次调用同一工具的情况:,即中间状态的价值波动被自动抵消,只保留最终状态变化。这意味着在冗余或反复试错的工具调用序列中,噪声信号不会逐级累积,信用信号不会被无关的中间动作稀释。TRACE 只需要一步 TD 计算,不需要多步回溯或复杂的优势估计,这与需要 bootstrap 的传统 Actor-Critic 方法形成鲜明对比。

整个框架不依赖任何额外的评论器网络,不依赖过程标注,不需要环境模型。所需的全部信息——参考模型对正确答案是的对数概率——在推理阶段随时可用,无需任何额外训练。

实验与结果

实验在 BrowseComp-Plus 基准上进行,这是一个闭网(closed-web)复杂搜索任务数据集,要求智能体通过多轮工具调用来回答需要深入推理的问题。闭网设定意味着所有搜索操作都在受控文档库中进行,保证了实验的可复现性。

基座模型选择了 Qwen3 系列的两个不同规模的变体:4B 参数版本和 30B-A3B(即 30B 活跃参数量的 MoE 版本)。训练策略上,TRACE 采用了纯强化学习范式,完全跳过了监督微调的冷启动阶段,也不需要在实时网页数据上训练。

结果显示,在 BrowseComp-Plus 上,Qwen3-4B 的准确率从基线的 7.2 提升至 35.6,绝对增幅达 28.4 个百分点;Qwen3-30B-A3B 从 8.4 提升至 42.6,绝对增幅 34.2 个百分点。值得注意的是,两个模型的基线分数本身相差不大,但经过 TRACE 训练后,30B-A3B 版本的优势充分释放,说明稠密信用分配让更大容量模型得以充分利用其推理能力。

为了验证学到的行为具有泛化性,论文还在开放网页基准上进行了测试,结果表明搜索行为可以跨设置迁移——这意味着 TRACE 学到的并非针对特定文档库的捷径策略,而是真正理解了"如何通过工具调用逼近目标"这一通用模式。

学习曲线的分析进一步揭示了 TRACE 的效率优势:相比结局奖励的基线方法,TRACE 在训练早期就出现了性能提升,且收敛速度更快。这正是稠密信用分配的预期效果——每一步都能获得即时反馈,而非等几十步后才收到一次信号。

讨论与可借鉴点

TRACE 的最直接贡献在于证明了:仅靠参考模型的对数概率,就能为长程工具调用任务构建出有效的信用分配信号。这背后的逻辑是,对数概率本质上编码了模型对当前状态"有多接近正确答案"的判断,而这种判断不需要任何额外训练即可获取。参考模型的冻结特性还保证了值估计的稳定性——不存在评论器与策略之间的协同演化不稳定问题。

不过该方法也有其局限。对数概率估计的质量依赖于参考模型本身的能力——如果基座模型在某些状态下对正确答案的置信度本身就不可靠,得到的信用信号也会带有噪声。此外,TRACE 目前验证的场景是闭网搜索任务,在需要实时推理、环境反馈高度不确定的场景(如开放式代码生成后执行结果反馈)中,对数概率与真实价值之间的偏差尚需进一步检验。

对整个领域而言,TRACE 指向了一个有价值的探索方向:利用预训练阶段已积累的模型内部知识(以对数概率的形式)来辅助强化学习的信用分配。这与近年来利用 [[reward model]] 或 [[value function]] 预热来降低 RL 训练样本复杂度的趋势一脉相承,但 TRACE 的独特之处在于它不需要任何额外的 reward model 训练,走了一条更轻量的路线。如何将这种基于对数比的信用估计与更复杂的多步 [[TD learning]] 框架有机结合,或许是下一步值得关注的问题。

摘要

多轮智能体通过延长的工具交互序列来解决复杂任务,然后才产出最终答案,这使得信用分配成为后训练阶段的一项根本性挑战。结局奖励能为短程推理提供可靠的监督,但随着轨迹扩展到几十甚至上百次工具调用,它会变得稀疏且高方差。结局奖励还可能具有误导性:一次失败的回放中可能包含许多有用的动作,使智能体更接近目标,但仅基于结局的训练却会把与最终错误相同的负优势分配给这些动作。我们提出 TRACE(Turn-level Reward Assignment via Credit Estimation,即基于信用估计的回合级奖励分配),这是一种面向智能体强化学习的稠密信用分配方法。TRACE 将回放表示为工具调用边界处的状态转移,从冻结的参考模型获取黄金答案的对数概率,将其变换为对数比状态值,并把每步动作的奖励推导为这些值的时序差分变化。该方法不需要额外的评论器或过程标签训练,其一步对数比 TD 分量可在冗余工具调用之间逐级相消。在长程复杂搜索任务上,TRACE 仅使用纯强化学习便显著提升了基座模型的工具使用能力,无需冷启动监督微调阶段、智能体中训练阶段,也无须在实时网页数据上训练。在闭网 BrowseComp-Plus 基准上,它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。所学习到的搜索行为也能迁移到开放网页基准,且学习曲线显示在强化学习训练过程中更早出现改进并更快收敛。

Abstract

Multi-turn agents solve complex tasks through extended sequences of tool inter-actions before producing a final answer, making credit assignment a fundamental challenge during post-training. Outcome rewards provide reliable supervision for short-horizon reasoning, but become sparse and high-variance as trajectories grow to tens or hundreds of tool calls. They can also be misleading: a failed rollout may contain many useful actions that move the agent closer to the goal, yet outcome-only training assigns them the same negative advantage as the even-tual mistake. We propose TRACE (Turn-level Reward Assignment via Credit Estimation), a dense credit-assignment method for agentic reinforcement learning. TRACE represents rollouts as state transitions at tool-call boundaries, obtains gold-answer log-probabilities from a frozen reference model, transforms them into log-ratio state values, and derives per-action rewards as Temporal-Difference changes in those values. This requires no additional critic or process-label training, and its one-step log-ratio TD component telescopes across redundant tool calls. On long-horizon complex search, TRACE substantially improves base-model tool-use ability using pure RL, without a cold-start supervised fine-tuning stage, an agentic mid-training stage, or training on live-web data. On the closed-web BrowseComp-Plus benchmark, it raises Qwen3-4B from 7.2 to 35 .6 and Qwen3-30B-A3B from 8.4 to 42 .6. The learned search behavior also transfers to open-web benchmarks, and the learning curves show earlier improvement and faster convergence during RL training.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记