arXiv 2607.14777v1 · 发布 2026-07-16

SEED:面向智能体强化学习的自演化在线策略蒸馏

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

AUTHORS Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
EVIDENCE 将自蒸馏与基于结果的强化学习结合用于LLM智能体
SCORE 0.9
GENERATED 2026-07-24 21:57:17 UTC

📝 TLDR

随着大语言模型被训练为长程交互智能体,基于结果的强化学习因轨迹级奖励稀疏,难以对中间决策提供有效监督。SEED 提出自演化框架,将已完成的 on-policy 轨迹转化为 hindsight 技能,并以 token 级 on-policy 蒸馏信号与结果奖励联合优化。策略同时充当轨迹采样器与技能分析器,实现两者的协同进化。实验表明该方法在文本与视觉智能体任务上一致提升性能与采样效率,并对未见场景具备鲁棒泛化能力。

🧭 速览

动机

基于结果的强化学习奖励稀疏,难以在 episode 级回报与 token 级策略学习之间提供有效监督信号。

方法

策略既采样轨迹又充当技能分析器,将轨迹转为自然语言技能后重评分,转化为 token 级 on-policy 蒸馏信号并与结果奖励联合优化。

结果

在文本与视觉智能体任务上一致提升性能与采样效率,并对未见场景展现稳健的泛化能力。

结论

SEED 通过自演化技能蒸馏弥补了结果级 RL 的中间监督缺口,为智能体强化学习提供与当前分布对齐的密集辅助信号。

📊 论文图表(共 18 张)

展开查看 18 张图

TL;DR

SEED 提出了一个让事后监督信号随策略共同演化的框架,将已完成的在线策略轨迹转化为自然语言技能,并通过双分支重评分机制将技能引发的概率偏移转化为稠密的 token 级在线策略蒸馏信号。在 ALFWorld、WebShop、Search-based QA 等文本与视觉智能体任务上,该方法一致优于基线,并在样本效率和跨域泛化上表现突出。

研究背景与动机

将 [[大语言模型]] 训练为能够处理长程交互任务的智能体,已成为当前 AI 研究的核心议题之一。在多轮对话、工具调用、具身操作等场景中,智能体需要在部分可观测的环境下做出连续决策,最终才能获得一个标量化的结果奖励。这种基于结果的 [[强化学习]](Outcome-based RL)范式虽然实用,却存在一个根本性的监督粒度鸿沟:回合结束时给出的稀疏奖励,无法为中间每一步的观察、动作选择或工具调用提供细粒度的指导。

试想一个电商导航任务:智能体需要执行多步搜索才能找到目标商品,但奖励只在最终购买成功或失败时给出。中间哪一步的搜索关键词选错了,哪一次点击偏离了最优路径?标量奖励无法回答这些问题。更棘手的是,失败的轨迹中往往也包含有价值的局部行为——比如某一步的观察判断是正确的,只是后续执行出了问题。现有的事后学习(Hindsight Learning)方法虽然尝试从已完成轨迹中提取经验,但通常将其视为静态的上下文或一次性使用的技能,无法随策略能力的提升而自适应调整。

SEED 的核心切入点正在于此:与其让事后监督静止不变,不如让技能分析器与决策策略共用同一个模型,使两者在训练过程中协同进化。当策略变得更擅长某类任务时,它的技能分析能力也应该同步增强,从而能够从轨迹中提取出更精准、更细致的技能描述,并将其作为更有效的辅助监督信号。

方法

SEED 的设计围绕两个核心阶段展开,形成一个从离线技能学习到在线协同进化的完整 pipeline。

第一阶段是事后技能监督微调。研究者先用基础策略在 180 个任务上各采样 8 条轨迹,构建一个轨迹池。随后调用外部分析器(论文使用 GLM-5.2)从这些轨迹中提取自然语言技能:对成功的轨迹,提取可复用的工作流程或关键观察;对失败的轨迹,提取失败规避规则。形式上,技能提取可以写作 ,其中技能 是对轨迹 中蕴含的决策知识的自然语言表达。得到轨迹-技能配对数据后,SEED 用标准的负对数似然目标对策略进行微调,使其学会从完整轨迹中预测相应技能。这个阶段的本质是让策略模型具备"事后分析"的能力——给定一段交互历史,它能够用自然语言描述出其中的关键策略要点。

第二阶段是自演化在线策略蒸馏,这也是 SEED 最核心的创新所在。在 [[强化学习]] 训练过程中,当前策略同时扮演两个角色:它既是轨迹采样器(Actor),负责与环境交互收集轨迹;又是技能分析器(Analyzer),从刚收集到的轨迹中提取事后技能。这两个角色共用同一套参数,因此策略的每一次更新都会同时改善后续决策能力和技能分析能力——事后监督信号因此能够"演化"。

具体实现上,SEED 引入了一种双分支重评分机制。对于每条采样的轨迹,技能分析器会生成对应的技能描述 。随后,SEED 在两种上下文中对采样动作重新计算 token 级对数概率:一种是普通上下文 ,另一种是技能增强上下文 ,即在历史后面接上技能描述。两种对数概率的差值反映了技能信息对当前动作选择的"纠正"程度——如果技能认为某个动作更优,那么在技能增强上下文下该动作的概率会更高。

为了将这种概率偏移转化为可学习的监督信号,SEED 进一步设计了置信度门控机制。定义停止梯度的对数概率偏移 ,通过 sigmoid 函数将其映射为门控权重 。这个门控的作用是让 OPD 损失专注于那些技能"有信心"纠正的 token——如果两种上下文下概率差异不大,说明技能对此处没有明确偏好,则门控值接近 0.5,损失权重较低;如果技能强烈偏好某个动作,则门控值接近 1,损失权重更高。

最终的训练目标是在原有 GRPO 强化学习损失的基础上叠加 OPD 在线策略蒸馏损失:

其中 等价于门控加权的负对数似然,梯度方向指向在普通上下文中提升被技能看好的动作的概率。由于 OPD 教师是停止梯度的,梯度不会反向传播到技能生成环节,避免了自举问题。

论文在附录中给出了三个理论命题,论证了 SEED 满足 on-policy、dense、self-evolving 三大需求的理论依据。命题 1 通过 Pinsker 不等式给出了 OPD 梯度与真实技能目标之间的偏差上界;命题 2 证明了在组内轨迹结果相同时,RL 优势为 0 的情况下 OPD 仍能提供非零梯度,实现了稠密的信用分配;命题 3 量化了分析器过时对梯度的影响,说明同步更新的设计有效控制了staleness。

实验与结果

SEED 在三类长程智能体任务上进行了系统性的评测。ALFWorld 是基于文本的家庭具身任务,包含 140 个 seen 测试和 134 个 unseen 测试;WebShop 是交互式电商导航任务,有 128 个测试任务;Search-based QA 则涵盖 NQ、TriviaQA、MuSiQue 等 7 个数据集共 5 万余道问题。此外还有两个视觉智能体任务(Sokoban 和 EZPoints)用于验证多模态扩展能力。

主实验结果清晰地展示了 SEED 的优势。在 ALFWorld 上,使用 Qwen2.5-7B-Instruct 作为基座,SEED 相比 GRPO 基线在成功率上提升了约 15 个百分点,达到了 85% 以上;在 WebShop 上,归一化完成分数从 GRPO 的约 82 提升到 SEED 的 88 以上;在 Search-based QA 上,SEED 在大多数数据集上也显著优于基线。特别值得注意的是,SEED 不仅在 seen 任务上表现更好,在 ALFWorld unseen 任务上同样展现出更强的泛化能力,说明事后技能确实学到了可迁移的决策知识。

训练动力学的分析进一步揭示了 SEED 的样本效率优势。在相同的训练步数下,SEED 的成功率曲线始终位于 GRPO 上方,且收敛后的性能也更稳定。在数据比例消融实验中,即使只用 20% 的训练数据,SEED 仍能达到接近完整数据下 GRPO 的性能,表明事后技能的引入大幅提升了样本利用效率。

消融实验验证了三个核心组件的必要性。关闭事后技能 SFT(即让策略直接从轨迹学习而不经过技能中间表征),性能下降最明显,说明"分析-蒸馏"两阶段设计比直接模仿更有效;关闭自演化 OPD(即用固定的预提取技能而非当前策略生成),性能也有明显退化,验证了协同进化的价值;关闭 on-policy 技能生成(改用离线预标注的技能),性能同样下降,进一步确认了 on-policy 技能与当前策略分布对齐的重要性。

讨论与可借鉴点

SEED 的一个重要局限在于依赖自然语言作为技能表征。这种设计在文本智能体任务上自然契合,但可能面临技能表达能力上限的问题——并非所有隐式的决策知识都能被准确转化为自然语言描述。论文的定性分析也展示了一些失败的技能提取案例,比如过于笼统的泛化或遗漏关键决策细节。

从方法论层面看,SEED 提出的"策略即分析器"设计具有很强的启发性。传统的自蒸馏方法通常需要独立的教师模型或固定的数据集,而 SEED 让单一模型同时承担探索与提炼的角色,并通过 on-policy 更新保证两者的分布一致性。这种协同进化的思路或许可以推广到其他需要双角色配合的训练场景。

另一个值得思考的方向是技能粒度的选择。论文采用统一粒度的技能描述,但不同任务、不同时刻可能需要不同抽象层次的监督信号——有些场景需要高层次的策略指引,有些场景则需要细致的步骤纠正。如何让技能生成具备自适应粒度控制能力,或许是后续研究的一个切入点。

总体而言,SEED 为解决长程智能体任务中的稀疏奖励监督问题提供了一个优雅的方案。它没有引入额外的模型或复杂的对比学习结构,而是在[[强化学习]]框架内通过巧妙的双分支重评分和置信度门控,将事后技能转化为稠密的 token 级蒸馏信号。实验验证了这种方法在文本和视觉任务上的一致有效性,以及对未见场景的鲁棒泛化能力。

摘要

大语言模型正日益被训练为交互式智能体,以处理涉及多轮交互、工具使用和环境反馈的长时程任务。基于结果的强化学习(RL)提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,在回合级结果与词元级策略学习之间留下了监督空白。我们提出了 SEED(SElf-Evolving On-Policy Distillation),一个自演化框架,它将已完成的在线策略轨迹转化为训练阶段的事后技能,并将其行为效应蒸馏回策略模型。SEED 首先微调策略以分析已完成的轨迹,并生成捕捉可复用工作流程、关键观察或失败规避规则的自然语言技能。在 RL 过程中,当前策略既负责收集轨迹,也充当分析器从中提取事后技能。因此,策略更新同时改进了后续决策与技能分析,使事后监督能够随策略共同演化。随后,SEED 在普通上下文和技能增强上下文下对采样动作重新打分,将技能引发的概率偏移转化为稠密的词元级在线策略蒸馏信号。该信号与基于结果的 RL 联合优化,使辅助监督与当前轨迹分布保持对齐。在基于文本和基于视觉的智能体任务上的大量实验表明,SEED 持续提升了性能与样本效率,并对未见场景展现出稳健的泛化能力。代码已开源于 https://github.com/jinyangwu/SEED。

Abstract

Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.


论文详细总结(自动生成)

SEED 论文总结:面向智能体强化学习的自演化在线策略蒸馏

1. 核心问题与研究动机

随着大语言模型(LLM)被训练为长程交互智能体,基于结果的强化学习(Outcome-based RL)成为主流的后训练范式。然而,该范式存在一个根本性的监督粒度鸿沟(Supervision Gap)

  • 轨迹级稀疏奖励:在长程任务中,奖励往往只在回合结束时给出(如二元成功标志或最终得分),无法指明哪些中间观察、动作或工具调用应当被强化或修正。
  • 缺乏细粒度信用分配:失败的轨迹可能包含有用的部分行为,而成功的轨迹可能包含可复用的策略,但标量奖励无法识别这些局部价值。
  • 静态事后信息的局限:已有的事后学习(Hindsight Learning)方法(如 Reflexion、Reflexion、经验总结)通常将事后信息视为静态经验或推理时上下文,未能随策略的进化而调整。
  • 现有自蒸馏方法的不足:固定教师、静态技能数据集和一次性蒸馏无法持续适应策略进化的能力与轨迹分布。

SEED 的核心目标是:让事后监督(hindsight supervision)能够与策略共同演化,从而把回合级稀疏奖励转化为与当前轨迹分布对齐的稠密 token 级监督信号。


2. 方法论

2.1 整体框架

SEED 包含两个训练阶段:

  • 阶段一:事后技能监督微调(Hindsight Skill SFT):让策略模型学会分析完整轨迹并生成自然语言技能。
  • 阶段二:自演化在线策略蒸馏(Self-Evolving On-Policy Distillation):在 RL 训练中,由当前策略同时充当轨迹采样器(Actor)与技能分析器(Analyzer),实现两者的协同进化。

2.2 问题形式化

将长程智能体任务建模为部分可观测马尔可夫决策过程(POMDP):

在时刻 ,智能体接收观察 ,并维护交互历史:

策略生成下一动作 。完整轨迹记为 ,回合级结果 通常稀疏。RL 目标为:

2.3 阶段一:事后技能 SFT

  • 离线轨迹收集:使用基础策略 个任务上各采样 条轨迹,得到轨迹池
  • 事后技能标注:调用外部分析器(GLM-5.2)从已完成轨迹 中提取自然语言技能:

并对成功轨迹提取可复用工作流,对失败轨迹提取失败规避规则。

  • SFT 训练:通过标准的负对数似然目标优化策略,使其能从轨迹预测技能:

2.4 阶段二:自演化在线策略蒸馏

(1)On-policy 事后技能生成:在每次更新开始时冻结当前策略 ,对每个任务 采样 条轨迹构成组 ,并由同一模型作为分析器提取技能:

(2)双分支重评分(Paired Contextual Re-scoring):保持采样动作不变,在普通上下文和技能增强上下文下分别计算 token 级对数概率:

  • 技能增强分支(教师,detached):

其中

  • 普通分支(学生,参与梯度计算):

(3)置信度门控(Confidence Gate):定义停止梯度的对数概率偏移 ,并通过 sigmoid 映射为门控权重:

(4)OPD 损失

其中 为有效 token 掩码。由于教师项被 detach,OPD 损失的梯度等价于门控加权的负对数似然:

(5)联合训练目标:在 GRPO 基础上叠加 OPD 信号:

其中 使用组相对优势 ,并采用 PPO 裁剪目标 + KL 正则

2.5 理论性质(Appendix A)

论文给出了三个关键命题,分别对应 on-policy、dense、self-evolving 三大需求:

  • 命题 1(Occupancy-matched Hindsight Target):证明 OPD 梯度等价于对当前策略自身 token-context 占用 上向技能重加权目标 的 KL 蒸馏,并用 Pinsker 不等式给出跨分布数据失配的上界。
  • 命题 2(Dense Skill Credit under Tied Rewards):当组内所有轨迹结果相同时,,但 OPD 梯度仍为非零,其大小等于 下的方差:
  • 命题 3(Analyzer-Staleness Bound):使用旧分析器 与当前同步分析器 引起的梯度差异以 的 Lipschitz 常数受限于技能诱导的 log-prob 偏移差距。

3. 实验设计

3.1 数据集 / Benchmark

SEED 在三大类长程智能体任务上进行了评测,覆盖文本与视觉模态:

  • ALFWorld(Shridhar et al., 2021):基于文本的家庭具身任务,包括 Pick / Look / Clean / Heat / Cool / Pick2 六类;140 个 seen 测试 + 134 个 unseen 测试。
  • WebShop(Yao et al., 2022):交互式电商导航,128 个测试任务,报告归一化完成分数与成功率。
  • Search-based QA(Search-R1 协议):包含 NQ、TriviaQA、PopQA、HotpotQA、2WikiMultiHopQA、MuSiQue、Bamboogle 七个数据集,共 51,713 题。
  • 视觉智能体任务(多模态扩展):Sokoban(6×6 视觉网格推箱子)+ EZPoints(视觉算术推理)。

3.2 对比基线

覆盖三大类基线:

  • 提示类:Vanilla(无后训练)、Skill-Prompt(评估时附加技能)。
  • 基于结果的 RL:GRPO、Skill-GRPO(在 RL 训练时引入技能)、Skill-GRPO*(训练 + 测试均引入技能)。
  • 自蒸馏 / 技能蒸馏:OPSD、GRPO+OPSD、Skill-SD、RLSD、SDAR。

3.3 实现细节

  • 基座模型:Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct、Qwen3-1.7B-Instruct,以及多模态版 Qwen2.5-VL-3B-Instruct。
  • 训练配置:150 个 policy 更新步;ALFWorld/WebShop 批量 16,Search-based QA 批量 128;rollout 组大小 ;学习率 ;PPO clip ;最大交互步 30(ALFWorld)/15(WebShop)/4(Search)。
  • SFT 数据:每任务 8 条轨迹 × 180 任务 = 1,440 条轨迹-技能对,微调 3 轮。

4. 资源与算力

论文在附录 B.4 中明确给出了计算资源:

  • GPU:8 块 NVIDIA A800 80G。
  • 训练步数:RL 阶段 150 步;SFT 阶段 3 轮。
  • 未明确:单次实验总训练时长(小时/天数)、跨任务累计时间、超参数搜索成本等具体数字未披露,仅以"8×A800 80G"作为训练平台信息。

5. 实验数量与充分性

实验规模较大且较为充分,主要包括:

  • 主结果:3 个基座模型 × 3 个文本 benchmark = 9 套主结果(Table 1)。
  • 训练动力学:3 个模型 × 3 个域 = 9 条成功率曲线(Figure 8/9);ALFWorld 上的回合长度变化(Figure 3)。
  • 样本效率:ALFWorld 与 WebShop 上 5 个数据比例(20%/40%/60%/80%/100%)的对比(Table 6)。
  • 跨域泛化:ALFWorld Unseen 上 6 个任务族的对比(Figure 5 / Table 7)。
  • 消融实验:3 项核心组件(Hindsight Skill SFT、Self-Evolving OPD、On-Policy Skill)逐一关闭(Table 2)。
  • 多模态扩展:Sokoban + EZPoints 两个视觉任务上的对比(Table 8)。
  • 定性分析:ALFWorld 上 GRPO 与 SEED 的行为对比、若干搜索 QA 与 WebShop 的完整轨迹示例。
  • 理论分析:附录 A 中 3 个命题及其证明。

公平性方面,论文使用了相同的 backbone、相同的 rollout 预算和训练调度对所有复现基线进行对齐比较,并提供了详细的超参数表,整体设计较为透明。但仍存在以下可改进之处:单个种子结果(未提供多种子方差)、SFT 阶段依赖外部大模型(GLM-5.2)标注技能可能引入额外噪声。


6. 主要结论与发现

  • 稠密监督明显优于仅基于结果的 RL:相对 GRPO,SEED 在 ALFWorld 上提升 14.9–45.9 分、Search-based QA 提升 1.4–9.3 分、WebShop 成功率提升 5.5–39.0 分。
  • 内部化技能显著优于提示式技能:SEED 在 11/12 项聚合指标上超过 Skill-GRPO*,且在推理时不使用任何技能提示。
  • 自演化优于静态蒸馏:SEED 在 10/12 项聚合指标上取得最佳或并列最佳,ALFWorld 上相对最强静态基线提升 7.4–38.1 分。
  • 样本效率优越:仅使用 60% 训练数据即可达到 80.7 分,超过全量 GRPO 的 75.0 分。
  • 泛化能力稳健:ALFWorld Unseen 上从 70.9 提升至 86.2(+15.3),其中 Heat 提升 +35.0、Look 提升 +18.3、Pick 提升 +16.5。
  • 训练动力学更快收敛:在训练步 40 时 SEED 已达 ~57% 成功率(GRPO 约 35%);回合长度更快收敛到约 13 步(GRPO 约 16 步)。
  • 多模态可扩展:在 Sokoban 与 EZPoints 上相对 GRPO 分别提升 +14.9 与 +13.1 分,平均成功率从 77.0% 提升至 91.0%。

7. 优点与亮点

  • 自演化闭环设计:Actor 与 Analyzer 共享同一策略快照,使得"决策能力"与"事后分析能力"协同进化,避免了固定教师/静态技能库与策略分布失配的问题。
  • 训练时使用、推理时不增加开销:所有技能仅作为训练阶段的特权上下文,部署时无需额外检索模块或提示工程。
  • 稠密 token 级信号弥补稀疏奖励:通过重评分采样动作并转化为门控加权蒸馏损失,为 GRPO 提供了非退化的细粒度信用分配(在组内奖励全相等时仍有效)。
  • 理论支撑完整:3 个命题从占用匹配、稠密信用、分析器时效性三方面刻画了 SEED 的优势,并给出失配上界。
  • 跨域、跨模态验证充分:在文本具身、网页导航、检索 QA、视觉空间规划、视觉算术等多种长程任务上均一致提升。
  • 样本效率突出:在 40–60% 数据下即可匹配或超过 GRPO 全量训练。
  • 细致的行为分析:提供了完整的成功/失败轨迹对比,揭示 SEED 具备更连贯的目标导向行为。

8. 不足与局限

  • 依赖外部大模型标注技能:SFT 阶段依赖 GLM-5.2 生成高质量自然语言技能,可能引入标注偏差与成本开销,且 SEED 的内部化效果与外部标注质量存在依赖关系。
  • 自演化闭环的偏差风险:Actor 与 Analyzer 共享参数虽然使两者同步进化,但也意味着两者的"盲点"可能被共同放大;论文在 Additional Discussion 中也承认这一点,提到模型可能将内部错误固化为"可复用规则"。
  • 推理时无法利用技能:尽管训练时使用了技能,部署阶段完全抛弃了分析器,这意味着技能无法在推理时动态复用,对需要现场反思或工具调用的场景支持有限。
  • 超长链推理可扩展性待验证:附录 E 中指出,更长的工作流(如 DeepPlanning、Long-Horizon-Terminal-Bench)尚未测试,技能生成的稳定性与计算开销(轨迹分析 + 双分支重评分)会随交互长度显著增长。
  • 训练开销较高:需要额外进行轨迹分析与配对打分,autoregressive 成本随上下文长度增加;论文提到未来可借助 speculative decoding 加速,但当前未优化。
  • 实验多样性仍有提升空间:未提供多种子方差报告,Search-based QA 上 7 个数据集是简单拼接而非专门平衡设计;视觉任务仅覆盖两个 benchmark。
  • 缺乏与人类反馈或外部验证的对齐:技能是否真正反映"正确的可复用行为"仅由最终任务成功率间接验证,缺乏对技能质量的独立评估。
  • 超参数敏感性 等关键超参数仅给出固定值,未做系统的敏感性分析或消融。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记