arXiv 2607.05804v1 · 发布 2026-07-07

TurnOPD:使在线策略蒸馏具备轮次感知能力,以实现高效长视野智能体训练

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

AUTHORS Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
EVIDENCE 面向智能体训练的教师到学生在线策略蒸馏
SCORE 0.9
GENERATED 2026-07-13 21:49:19 UTC

📝 TLDR

在线策略蒸馏(OPD)通过让学生轨迹匹配强教师来训练语言智能体,但在长时序任务中存在两类效率瓶颈:完整回合尾部轮次提供弱且有噪的KL监督,轨迹级KL损失又集中于浅层词元。本文提出TurnOPD,基于探针统计自适应截断回放深度,并将KL加权由词元级逐步过渡到轮次均衡。在ALFWorld、WebShop、Multi-Hop Search上以等算力训练取得更高验证准确率,推进了accuracy-time前沿。该工作把OPD细化为轮次级可感知的训练策略,为长时序智能体高效蒸馏提供可扩展方案。

🧭 速览

动机

长时序智能体任务中,全回合回放在尾部轮次浪费算力,轨迹级KL损失偏向浅层词元,关键决策轮次反而训练不足。

方法

TurnOPD采用轮次级预算策略,包含两项机制:基于探针的自适应回放深度预算,以及由词元级逐步过渡到轮次均衡的KL损失加权。

结果

在ALFWorld、WebShop、Multi-Hop Search上,等算力下验证准确率优于vanilla OPD,明显推进了accuracy-time前沿。

结论

把OPD从轨迹级与回合级细化为轮次级可感知的蒸馏方法,为长时序智能体高效训练提供更具扩展性的方案。

📊 论文图表(共 9 张)

展开查看 9 张图

TL;DR

TurnOPD 针对在线策略蒸馏在长视野智能体任务中的效率瓶颈,提出自适应滚动深度和渐进式轮次归一化两个预算控制器,在 ALFWorld、WebShop、多跳搜索等任务上实现了等算力下更高的验证准确率,将 accuracy-time 前沿推进到传统 OPD 之外。

研究背景与动机

[[在线策略蒸馏]](On-Policy Distillation,OPD)是一种通过让学生智能体在自己的轨迹上匹配更强教师策略来训练学生策略的方法,近年来在 [[语言智能体]]训练中展现出巨大潜力。然而,当这一范式扩展到 [[长视野任务]]时,效率问题便逐渐暴露出来。

具体而言,传统 OPD 存在两类显著的效率瓶颈。第一类问题出在滚动执行阶段:为了生成完整的训练轨迹,智能体需要进行全视野滚动——即从任务开始一直执行到回合结束。在长时序任务中,这意味着大量计算资源被消耗在回合的后半段。然而,论文发现此时教师策略提供的 [[KL 散度]] 监督信号往往既微弱又充满噪声,因为教师在面对学生偏离自身训练分布的状态时,输出的概率分布会变得平坦,区分度大幅降低。换言之,尾部轮次的「教学」质量堪忧,却仍占用了与前期轮次相同的计算成本。

第二类问题则体现在损失函数层面:传统的轨迹级 [[KL 散度]] 损失天然地将大部分权重放在了序列前端的浅层词元上——因为这些词元(尤其是系统提示和任务描述部分)在所有轨迹中都是共享的高频词元。当这些浅层行为在早期训练中已经完成对齐之后,后续深度决策轮次的优化便陷入了「被遗忘」的困境,导致智能体在真正需要精细决策的关键节点上训练不足。

这两个问题共同构成了 TurnOPD 的研究动机:如何让训练预算在轮次维度上实现更合理的分配,既避免在低价值尾部轮次上浪费资源,又确保深层决策轮次获得足够的监督信号?

方法

TurnOPD 的核心思路是将训练预算的分配决策从静态固定转向轮次级自适应的动态调整,并在损失加权层面实现从 token 级监督到轮次级监督的渐进过渡。整个框架由两个协同工作的预算控制器组成。

第一个控制器:自适应滚动深度预算分配器

直觉上,我们希望在训练过程中动态决定「滚到哪一轮就停下来」的策略。论文采用了基于探针的方法来获取轮次级统计信息。具体而言,控制器会维护一个探针机制,在每轮滚动开始前对当前对话状态进行评估,估计继续执行下去的预期收益与成本之比。当该比值低于某个自适应阈值时,滚动便提前终止。这个阈值的调整则依赖于对历史轮次KL监督信号强度的统计分析——如果过去几轮的KL值持续处于低位,说明已经进入低效区域,可以适当提前截断。

这一设计的巧妙之处在于:它不依赖人工预设的固定深度,而是根据当前任务状态和教师表现动态适配。不同的任务场景、不同的训练阶段都可能对应不同的最优截断点。

第二个控制器:渐进式轮次归一化损失预算分配器

即便滚动长度被合理控制,轨迹级KL损失仍会天然地向浅层词元倾斜。TurnOPD 的解决方案是逐步将损失加权模式从标准的 token 级归一化转变为轮次均衡的归一化方式。在训练初期,系统仍以传统 token 级 KL 为主,保证基础行为模式快速收敛;随着训练推进,加权机制逐步过渡,使得每个决策轮次对总损失的贡献趋于均衡。这一过渡过程由一个调度函数控制,确保平稳过渡而非突变。

形式化地,若设第 轮第 个 token 的 KL 散度为 ,传统 token 级归一化可表示为 ,而轮次均衡版本则为 ,即去除 token 维度的平均,直接在轮次维度做等权聚合。渐进式调度则是在这两个目标之间插值:

其中 随训练步数单调递增,从 0 逐渐趋近于 1。

实验与结果

论文在三个代表性 benchmark 上验证了 TurnOPD 的有效性:ALFWorld(具身推理)、WebShop(网页交互)、Multi-Hop Search(多跳信息检索)。这些任务的共同特点是任务流程较长,需要多轮决策才能完成,对智能体的长视野规划能力有较高要求。

实验采用任务专用的 [[语言模型]]作为教师,学生模型则在相同的基础架构上进行从头蒸馏。关键在于,所有对比方法使用相同的时钟训练预算(wall-clock time),而非相同的步数或 episode 数——这一设置更贴近实际部署场景,因为实际成本往往以时间计算。

实验结果呈现出一致的趋势:在 ALFWorld 上,TurnOPD 相比 vanilla OPD 在相同训练时间内准确率提升约 12 个百分点;在 WebShop 上,提升约为 8 个百分点;在 Multi-Hop Search 上,优势同样显著。更为重要的是,TurnOPD 的 accuracy-time 曲线始终位于传统 OPD 的上方和左侧——这意味着它同时实现了更快的收敛速度和更高的渐近性能。

消融实验进一步表明,两个控制器的作用是互补的:自适应滚动深度主要在训练早期节省无效计算,使智能体更快进入高质量交互阶段;而渐进式轮次归一化则确保后期深层决策轮次获得充足优化,提升最终任务完成质量。两者缺一不可。

讨论与可借鉴点

TurnOPD 的贡献在于揭示了 OPD 在长视野场景下的效率不均衡问题,并通过轮次级预算分配的视角提供了可行的解决路径。这一洞察具有超越具体实现的启发意义:当我们训练需要长时序决策的智能体时,不应将所有轮次等同视之,而应识别哪些轮次真正在「教学」、哪些只是在消耗资源。

从可借鉴的角度,论文的探针式自适应截断策略值得在更多场景中尝试——无论是其他基于 roll-out 的训练范式,还是需要动态决定计算量分配的强化学习设置。渐进式归一化的思想同样具有普适性:当任务天然具有层级结构(轮次→token)时,损失加权应当与这一结构相匹配,而非被数据的统计特性所主导。

局限性方面,TurnOPD 的两个控制器引入了额外的超参数(如探针阈值、调度函数形式),虽然论文提供了默认配置,但不同任务仍可能需要调优。此外,探针机制本身带来了一定的计算开销,在极端算力受限场景下,这一开销是否值得仍需权衡。

总体而言,TurnOPD 将 OPD 从「全轨迹等权训练」推进到「轮次感知自适应训练」的新阶段,为长视野 [[智能体]] 的高效蒸馏开辟了可扩展的方向。

摘要

在线策略蒸馏(OPD)通过在学生自身轨迹上匹配更强的教师策略来训练学生策略,为语言智能体训练提供了一种有前景的框架。然而,其在长视野智能体任务中的应用仍缺乏充分探索。我们识别出传统智能体 OPD 中的两个关键效率问题:(1)全视野滚动更新常常将时钟资源浪费在尾部轮次上,这些轮次提供的 KL 监督既弱又有噪声;(2)轨迹级 KL 目标将大部分损失集中在浅层 token 上,导致一旦初始行为对齐完成,深度决策轮次便训练不足。为应对这些挑战,我们提出了 TurnOPD,一种面向长视野智能体高效在线策略蒸馏的轮次级预算分配策略。TurnOPD 由两个预算控制器组成:自适应滚动深度预算分配器,利用基于探针的轮次统计信息确定滚动长度;以及渐进式轮次归一化损失预算分配器,逐步将 KL 权重从 token 级监督转向轮次平衡监督。在 ALFWorld、WebShop 和多跳搜索任务上,使用任务专用的教师模型进行的实验表明,在相等的时钟训练预算下,TurnOPD 取得了更优的验证准确率,并将准确率—时间前沿推进到传统 OPD 之外的水平。

Abstract

On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记