arXiv 2606.27814v1 · 发布 2026-06-26

ATOD:用于多轮自主智能体的退火轮次感知在策略蒸馏算法

ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents

AUTHORS Qitai Tan, Zefang Zong, Yang Li, Peng Chen
EVIDENCE 结合强化学习的在策略蒸馏方法
SCORE 0.9
GENERATED 2026-07-04 21:41:13 UTC

🧭 速览

动机

方法

结果

结论

📊 论文图表(共 9 张)

展开查看 9 张图

TL;DR

这篇论文针对小模型智能体在长程交互任务中「学不快」与「学不高」的两难问题,提出一种将策略蒸馏与强化学习混合训练的 ATOD 算法。核心思路是通过退火式调度让训练早期以密集的教师模仿学习打基础,后期逐步转向奖励驱动的探索改进,并引入轮次级权重机制放大高价值步骤的监督信号。在 ALFWorld、WebShop、Search-QA 三个基准上的实验表明,ATOD 相比纯 OPD 提升 3.03 个百分点,相比 GRPO 提升 23.62 个百分点,甚至超越了对应的教师模型。

研究背景与动机

训练小型语言模型智能体完成复杂的长程交互任务是当前的重要研究方向。这类任务要求模型在多轮对话或序列决策中持续与环境交互——比如在虚拟家庭环境中寻找并操作物体、在电商网站中按指令筛选商品、或在搜索场景中逐步定位答案。任务的挑战在于,智能体必须同时具备两项能力:一是快速从示范数据中学习基本行为模式,即「快速模仿」能力;二是当遇到超出示范范围的场景时,能够通过环境反馈自我调整、探索更好的策略,即「基于奖励的改进」能力。

现有的后训练方法主要分为两大范式。[[策略蒸馏]]方法以教师模型(或更大规模的模型)的输出作为监督信号,提供密集且即时的指导,在训练初期能实现快速提升。但其根本局限在于,当学生模型的能力逐渐逼近教师水平后,额外的监督信号带来的增益趋于饱和,最终性能被教师模型的表现上限牢牢封住。[[强化学习]]方法则直接以环境奖励为优化目标,理论上能够突破教师上限、探索更优策略,但其早期学习效率极低——在稀疏且延迟的奖励信号下,智能体很难从漫无目的的探索中提取有效的学习信号。

这两种范式呈现出鲜明的互补性:策略蒸馏在早期高效但后期乏力,强化学习在后期有潜力但早期低效。一个自然的追问是:能否设计一种算法,让它兼取两者之长?ATOD 正是对这一问题的系统回答。

方法

ATOD 的设计围绕一个核心观察展开:策略蒸馏与强化学习在训练动态上具有天然的时序互补性。训练初期学生模型与教师差距巨大,此时密集的模仿信号能帮助学生快速建立基本能力;而当学生已经「学会」了教师的行为模式后,继续强化模仿只会陷入收益递减,此时转向奖励驱动的探索才能打开性能上限。

基于这一观察,ATOD 采用退火式的 OPD-RL 调度策略。在训练的前半段,策略蒸馏占据主导地位,学生模型以较大的概率从教师分布中采样进行学习,教师提供的每步监督信号如同密集的「拐杖」,引导模型快速收敛到接近教师的行为水平。随着训练的推进,系统逐步降低蒸馏信号的权重、增强强化学习奖励信号的权重。这一过程类似于物理中的退火——从高温(高探索、模仿为主)逐渐冷却到低温(低探索、奖励驱动为主),但这里「温度」控制的是两种学习信号的比例。

退火调度解决了「何时切换」的问题,但还有另一个关键挑战:如何在长轨迹中有效分配监督权重。在多轮交互任务中,并非每一个决策步骤都具有同等的重要性。某些轮次可能处于任务的关键转折点——做对则任务成功,做错则前功尽弃;而另一些轮次可能只是过渡性的辅助操作。传统的策略蒸馏对所有步骤一视同仁,导致关键步骤的监督被稀释。

为解决这一问题,ATOD 引入了轮次级分歧-不确定性重加权机制 T-DUR。这一机制的直觉来自于两个信号:一是「分歧」,即学生模型与教师模型在当前轮次上输出差异的程度——分歧越大,说明该轮次学生越不确定应该如何行动,理应获得更多监督权重;二是「不确定性」,即学生模型自身对该轮次输出的置信度——不确定性越高,意味着模型对该决策越缺乏把握,同样应该加大学习力度。

T-DUR 将这两个信号融合为一个加权系数,对损失函数中各轮次的贡献进行重加权。其效果是平滑地放大那些处于分歧区域或低置信度区域的高价值轮次,同时适当降低过渡性步骤的权重。这样一来,即使在很长的交互轨迹中,模型也能将学习注意力集中到真正重要的决策节点上。

形式化地,ATOD 的总体优化目标可以写作一个加权混合损失:

其中 是随训练轮次 退火的 OPD-RL 混合系数, 是第 轮通过 T-DUR 计算的权重, 分别是蒸馏损失和强化学习损失, 是第 轮的任务损失。

实验与结果

论文在三个广泛使用的多轮交互基准上验证 ATOD 的效果。ALFWorld 是一个基于文本的家庭环境任务集,智能体需要理解自然语言指令后在虚拟房间中导航、操作物体完成目标。WebShop 模拟真实电商网站场景,要求智能体根据用户需求搜索、筛选并点击商品。Search-QA 则是问答类任务,智能体需要通过多轮搜索和推理定位答案。

实验覆盖了三种不同规模的学生模型,结果的一致性非常强。在所有设置下,ATOD 均能稳定超越对比基线。平均而言,ATOD 相比纯 OPD 方法提升了 3.03 个百分点——这意味着在模仿学习已经收敛的基础上,ATOD 额外挖掘出了一部分超越教师的潜力。更显著的提升来自与强化学习基线的对比:ATOD 相比 GRPO 平均提升 23.62 个百分点,这说明 ATOD 的退火调度有效规避了纯 RL 在早期「盲目探索」的效率损失。最引人注目的是,ATOD 最终超越了对应的教师模型,平均超出 2.16 个百分点——这正是将蒸馏的快速启动与 RL 的上限突破相结合的预期收益。

消融实验进一步验证了两个设计模块的贡献。移除退火调度、保持纯 OPD 或纯 RL 时,性能均有明显下降;移除 T-DUR 权重机制后,长轨迹任务(如 ALFWorld)的性能衰减尤为显著。这些结果从反面证明了各模块的必要性。

讨论与可借鉴点

ATOD 展示了一种优雅的思路:在训练的时序维度上进行精细化调度,而非将不同的学习方法简单叠加。退火机制将「何时学什么」这一问题形式化,T-DUR 则解决了「在各部分如何分配注意力」的问题。这种分而治之的设计哲学值得借鉴。

从局限来看,ATOD 的退火调度引入了新的超参数——退火曲线的形状与节奏,这些参数在不同任务间可能需要调优。此外,T-DUR 机制假设教师模型在大多数步骤上可靠,当任务本身超出教师能力范围时,分歧信号可能产生误导。这一问题在更强的教师模型或更简单的任务上影响较小,但在开放域长程任务中值得进一步探索。

对于 [[语言模型智能体]] 的后训练实践,ATOD 的核心启示在于:单一学习方法很难同时兼顾效率与上限。快速起步与最终超越并非不可兼得,关键在于为不同训练阶段匹配最适合的学习信号。随着模型规模的缩减和任务复杂度的上升,这种动态调度的需求只会更加迫切。ATOD 为这一方向提供了一个坚实的基线。

摘要

针对长程交互任务训练小型语言模型智能体,需要同时具备快速模仿与基于奖励的改进能力。在策略蒸馏(OPD)能够提供密集的教师指导,并且通常在训练早期阶段获得快速提升,但当学生模型逐渐接近教师模型后,其增益趋于饱和,从而限制了最终性能上限。强化学习(RL)直接优化环境奖励,并鼓励朝向更高奖励所定义的上限进行探索性改进,但稀疏且延迟的反馈使得早期学习效率远低于 OPD。本文提出 ATOD(退火轮次感知在策略蒸馏,Annealed Turn-aware On-policy Distillation),一种显式利用上述互补性的混合式在线蒸馏算法。(1)ATOD 采用退火式的 OPD-RL 调度策略:训练早期以 OPD 为主,引导学生模型逼近教师模型的行为水平,随后逐步增强 RL 的作用,以驱动基于奖励的探索。(2)ATOD 引入轮次级分歧-不确定性重加权机制(T-DUR),该机制可平滑地放大高价值轮次,并提升长轨迹下的密集监督质量。在 ALFWorld、WebShop 和 Search-QA 上的实验表明,ATOD 在所有对比的后训练基线方法中均能稳定取得更优表现:在三种学生模型规模下,ATOD 相较 OPD 将平均成功率提升了 3.03 个百分点,相较 GRPO 提升了 23.62 个百分点,同时以 2.16 个百分点的优势超越了对应的教师模型。

Abstract

Training small language-model agents for long-horizon interactive tasks requires both fast imitation and reward-driven improvement. On-policy distillation (OPD) provides dense teacher guidance and typically improves rapidly in the early stage, but its gains saturate once the student approaches the teacher, limiting the final performance ceiling. Reinforcement learning (RL) directly optimizes environment rewards and encourages exploratory improvement toward a higher reward-defined ceiling, but sparse and delayed feedback makes early-stage learning much less efficient than OPD. In this paper, we propose ATOD (Annealed Turn-aware On-policy Distillation), a hybrid online distillation algorithm that explicitly exploits this complementarity. (1) ATOD uses an annealed OPD-RL schedule: OPD dominates early training to approach teacher-level behavior, while RL is gradually strengthened to drive reward-based exploration. (2) ATOD introduces Turn-level Disagreement-Uncertainty Reweighting (T-DUR), which softly amplifies high-utility turns and improves dense supervision in long trajectories. Experiments on ALFWorld, WebShop, and Search-QA show that ATOD consistently outperforms competing post-training baselines: across the three student sizes, ATOD improves average success rate by 3.03 points over OPD and 23.62 points over GRPO, while surpassing the corresponding teacher models by 2.16 points.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记