arXiv 2606.29502v1 · 发布 2026-06-28

UCOB:通过信用感知的在线策略双向自蒸馏学习利用与演化智能体技能

UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation

AUTHORS Songjun Tu, Chengdong Xu, Qichao Zhang, Yiwen Ma, Yaocheng Zhang, Linjing Li, Dong Li, Xiangyuan Lan, Dongbin Zhao
EVIDENCE 智能体强化学习的在线双向自蒸馏
SCORE 0.9
GENERATED 2026-07-04 21:36:04 UTC

📝 TLDR

智能体强化学习中,技能记忆可复用经验但检索结果并非总是有效,同一策略在不同状态下可能受益或被误导,使将带技能提示视为固定教师的假设变得脆弱。UCOB将带技能与无技能提示视为同一模型的两个在线上下文视角,在同任务同锚点状态下对比return-to-go,以高回报视角充当局部教师进行信用感知自蒸馏。在ALFWorld、WebShop和Search-QA上全面超越免技能RL与自蒸馏基线,ALFWorld和WebShop上分别提升23.5和18.0分。

🧭 速览

动机

检索技能并非神谕式正确,可能在某些状态下误导策略,使固定教师假设脆弱。

方法

将带技能与无技能提示视为同模型双视角,以同状态高return-to-go为局部教师进行在线双向自蒸馏。

结果

在ALFWorld、WebShop、Search-QA上超越免技能RL与自蒸馏基线,ALFWorld和WebShop分别提升23.5和18.0分。

结论

信用感知在线双向自蒸馏有效内化技能、纠正误用,并驱动技能记忆持续演化更新。

📊 论文图表(共 15 张)

展开查看 15 张图

TL;DR

UCOB 针对智能体强化学习中技能记忆"并非全知全能"这一关键挑战,提出将带技能提示与无技能提示视为同一模型的两种在线视角,通过比较同一锚定状态下的回报来动态选取局部教师进行双向自蒸馏。实验表明,该方法在 ALFWorld 和 WebShop 上相较最先进基线最高提升 23.5 和 18.0 分,且在小模型上收益尤为显著。

研究背景与动机

在长视野、多回合的智能体任务中,如何高效利用过往经验一直是核心难题。技能记忆(skill memory)通过将历史轨迹提炼为文本指导,可以在相似的状态出现时为策略提供有价值的上下文提示,从而加速探索并提升样本效率。然而,这种看似优雅的范式暗含一个脆弱假设:检索到的技能总能为当前决策提供正确指引。

论文作者通过系统的诊断实验揭示了这一假设的问题所在。在 ALFWorld 和 WebShop 环境中,他们考察了三种情形:固定特权教师是否始终优于无技能视图、将技能分支转为 on-policy 后能否消除教师歧义、以及当两视图在同一锚点状态产生分歧时应如何选择蒸馏方向。结果表明,技能提示并非可靠的固定教师——同一技能在某些状态下能够引导策略走向成功,在另一些状态下却会将策略引入失败。更值得注意的是,同一轨迹内部的优势分支可能在不同决策步之间反复切换,这意味着无论选择哪一方作为固定教师,都可能在某些关键时刻引入错误的引导。

这种"特权教师"假设的脆弱性促使作者思考:与其将技能记忆定位为预先固定的教师,不如让它成为可被评估和演化的在线资源。核心问题转化为:如何在同一任务上下文中客观判断某一技能提示是否真正有用,并据此调整知识的传递方向。

方法

UCOB 的核心洞察在于重新定义带技能提示与无技能提示之间的关系。传统方法将前者视为后者的特权教师,而 UCOB 将 视为同一在线策略 的两个上下文视图,在同一任务 和同一锚定状态 下比较它们的 return-to-go ,将回报更高的视图作为局部教师。

为了实现这一目标,框架首先构建了双层技能记忆系统,包含任务级技能池和状态级技能池。检索时采用上置信界(UCB)打分的混合机制,结合语义相似度与效用不确定性:

其中 是技能 的效用估计, 是使用计数,后者为探索不确定性项。

在 rollout 阶段,每个任务组一半轨迹使用带技能提示 ,另一半使用无技能提示 ,两分支均接收在线强化学习损失。为了支持后续的信用比较,轨迹按锚定状态进行分组,形成集合 ,记录每条轨迹的决策上下文、目标分支及其回报。

CBSD(信用感知双向自蒸馏)是最关键的设计组件。在每个锚定状态组内,算法首先选出回报最高的分支作为教师:

仅当两分支的回报差 超过阈值 时,才接受该蒸馏对。如果高回报分支恰好是带技能视图,则技能分支教无技能分支,实现有用的技能诱导行为的内化;如果高回报分支是无技能视图,则反向蒸馏纠正误导性的技能使用。这种双向机制打破了传统师生关系的固定指向,使得无论哪一方在当前状态下更有价值,都能指导另一方学习。

为了确保蒸馏的质量与效率,UCOB 还引入了两项关键机制。置信门控 通过比较目标分支与引用分支对教师 token 的预测概率,决定是否接受该 token 的蒸馏信号:

回报差加权 则根据两分支的优势差距动态调整蒸馏强度。Top-K Token-Support Matching 通过在教师分支的高概率 token 上构建支撑集并在上面重新归一化,缓解了自蒸馏中教师和学生分布高度重叠导致的梯度稀释问题。

除了蒸馏机制,UCOB 还设计了技能记忆的演化策略。状态级技能通过对比同一锚定状态下的高回报和低回报轨迹来刻画"何时该用、什么时候不该用"。效用更新采用指数移动平均:

其中 反映使用技能 的 rollout 相对无技能基线的成功率提升。反思写作器则利用效用优势作为优势估计进行自训练,使其生成的反思内容能够更精准地指导未来的决策。

实验与结果

实验在 ALFWorld、WebShop 和 Search-QA 三个基准上进行,使用 Qwen2.5-7B-Instruct、Qwen2.5-3B-Instruct 和 Qwen3-1.7B 三个规模的模型作为骨干。基线覆盖无技能强化学习方法(GRPO、GiGPO)、技能记忆方法(SkillRL、D2Skill、SkillC、SAPO、Skill1)以及自蒸馏方法(RLSD、Skill-SD、SDAR、StepOPSD)。

主实验结果展现了 UCOB 的全面优势。在 ALFWorld 上,Qwen2.5-7B 达到 93.0% 整体成功率,Qwen2.5-3B 为 92.2%,即便是最小的 Qwen3-1.7B 也达到 89.1%,三者均为各自规模的最优。WebShop 上的成功率分别为 85.9%、78.1% 和 79.7%,同样全面领先。更引人注目的是小模型上的提升幅度:Qwen3-1.7B 在 ALFWorld 上相较 Skill1 和 SDAR 分别提升 23.5 和 35.2 分,在 WebShop 上分别提升 18.0 和 21.1 分,这表明 UCOB 的信用感知机制对于资源受限场景具有特殊价值。Search-QA 上的表现具有竞争力但并非全面优势,与最佳基线的平均准确率差距控制在 0.8 分以内。

消融实验进一步揭示了各组件的贡献。移除锚定状态分组、反思自训练、状态级技能、混合 rollout 和 CBSD 中的任何一项都会导致性能下降,其中 CBSD 的移除影响最为显著。CBSD 内部的三种变体(gap-gated 单向、固定教师方向、无 top-K 支撑集)均不如完整 CBSD,验证了双向路由、动态阈值和 token 级匹配的重要性。超参敏感性分析表明 和使用自训练反思后端是较优的配置。

一个有趣的发现是,在 ALFWorld 和 WebShop 上,"无技能→技能"的蒸馏路由反而出现得更频繁。这一反直觉的结果表明,无技能视图经常是更优的局部教师——当技能提示误导策略时,无技能分支产生的决策反而更可靠。如果没有 CBSD 的反向蒸馏机制,这些误导性的技能使用将无法被纠正,技能记忆的演化也会偏离正确方向。

讨论与可借鉴点

UCOB 的核心贡献在于挑战了技能记忆研究中长期默认的"特权教师"假设,将师生关系从静态固定转为动态信用感知。这一转变带来的启示是:在设计依赖外部知识的智能体系统时,应当承认知识并非全知全能,而应建立评估机制判断当前上下文下知识的有效性。

从方法论角度看,CBSD 的双向自蒸馏框架具有超越具体任务的通用性。任何存在多个策略视图(如不同提示模板、不同工具选择)且需要选择性知识传递的场景,都可以借鉴"按锚点状态分组、按回报选教师、置信门控过滤"这一范式。效用感知的检索与技能记忆的演化机制也值得在更广泛的经验复用研究中参考。

局限方面,Search-QA 上未能全面超越基线,暗示该方法在检索型 QA 任务中的优势可能不如交互式环境显著。框架依赖锚定状态分组和 UCB 检索的设计增加了实现复杂度,对超参(如 )的敏感性也意味着实际部署时需要一定的调优。此外,论文未提供完整的算力账单,使得方法的计算成本难以与其他工作进行公平比较。

未来的研究方向可以探索:将 CBSD 与其他策略多样性机制结合、将其扩展到多智能体协作场景、以及在更大规模的开放世界任务中验证其有效性。

摘要

技能记忆可以通过将过去经验复用为文本指导来提升智能体强化学习,但检索到的技能并非全知全能:它们可能在某一状态中有所帮助,却在同一策略的另一状态中产生误导。这使得常见的"特权教师"假设变得脆弱,即假设技能条件提示可以充当无技能提示的固定教师。我们提出 UCOB,一个通过信用感知的在线策略双向自蒸馏来学习利用与演化智能体技能的框架。UCOB 将技能条件提示与无技能提示视为同一模型的两种在线策略上下文视图,在同一任务与锚定状态下比较它们的预期回报,并将回报更高的视图作为局部教师。该局部信用信号能够将有用的技能条件行为内化、纠正误导性的技能使用,并指导任务/状态级技能记忆更新、效用感知检索与反思式自训练。在 ALFWorld、WebShop 和 Search-QA 等智能体任务上的实验表明,UCOB 在不同模型规模下均优于无技能强化学习、技能记忆基线以及自蒸馏方法,在 ALFWorld 和 WebShop 上相较最先进基线最高可分别取得 23.5 分与 18.0 分的提升。消融实验与分析进一步验证了其核心机制与效率。

速览

TLDR:智能体强化学习中,技能记忆常作为文本引导复用过往经验,但检索到的技能并非万能——某些状态下有用,另一些状态却会误导同一策略。针对特权教师假设脆弱的问题,本文提出UCOB框架,将带技能与无技能提示视为同一模型的两种在线上下文视角,基于同任务同锚点状态比较回报,以回报更高的视角作为局部教师进行自蒸馏。该方法在ALFWorld、WebShop和Search-QA任务上跨模型规模均优于现有基线,ALFWorld与WebShop上较SOTA分别提升达23.5和18.0分。 \

Motivation:技能记忆作为文本引导并非万能,易误导策略;特权教师假设脆弱,难以稳定蒸馏。 \

Method:将带技能与无技能提示视为同模型两种在线视角,按回报选优者作局部教师进行双向自蒸馏。 \

Result:在ALFWorld、WebShop、Search-QA跨规模全面超越基线,ALFWorld与WebShop较SOTA分别提升23.5、18.0分。 \

Conclusion:信用感知在线双向自蒸馏可有效利用并演进技能记忆,为智能体技能学习提供新范式。


Abstract

Skill memories can improve agentic reinforcement learning by reusing past experience as textual guidance, but retrieved skills are not oracular: they may help in one state while misleading the same policy in another. This makes the common privileged-teacher assumption fragile, namely that a skill-conditioned prompt can be treated as a fixed teacher for the no-skill prompt. We introduce UCOB, a framework for learning to utilize and evolve agentic skills via credit-aware on-policy bidirectional self-distillation. UCOB treats skill-conditioned and no-skill prompts as two on-policy context views of the same model, compares their return-to-go within the same task and anchor state, and uses the higher-return view as the local teacher. This local credit signal internalizes useful skill-conditioned behavior, corrects misleading skill usage, and guides task/state skill memory updates, utility-aware retrieval, and reflection self-training. Experiments on agentic tasks, including ALFWorld, WebShop, and Search-QA, show that UCOB outperforms skill-free RL, skill-memory baselines, and self-distillation methods across model scales, with up to 23.5 and 18.0 point gains over SOTA baselines on ALFWorld and WebShop. Ablations and analyses further validate its core mechanisms and efficiency.


论文详细总结(自动生成)

UCOB 论文总结

1. 核心问题与研究动机

  • 背景:在长视野、多回合的智能体强化学习(Agentic RL)中,技能记忆(skill memory)通过将过往经验抽取为可复用的文本指导,可提升探索效率与样本利用率(Shinn et al., 2023; Wang et al., 2023)。
  • 关键观察:检索到的技能并非"神谕式正确"(oracular)。同一技能提示可能在某一状态下帮助策略,在另一状态下却误导策略;因此把"带技能提示(skill-conditioned prompt)"视作对"无技能提示(no-skill prompt)"的固定特权教师(privileged teacher)这一隐含假设是脆弱的。
  • 诊断实验:作者在 ALFWorld、WebShop 上对 SDAR 等代表性方法做了三类诊断——(i)固定特权教师是否一致优于无技能视图;(ii)将技能分支变 on-policy 能否消除教师歧义;(iii)当两视图在同一锚定状态分歧时,应如何选取蒸馏方向。结果显示教师质量并非单边,且同一轨迹内的优势分支可能在不同决策步之间切换。
  • 研究目标:构建一个能够"利用并演化"技能的统一框架,使智能体既能内化有用的技能诱导行为,也能纠错误导性的技能使用。

2. 方法论

2.1 整体思想

  • (带技能提示)与 (无技能提示)视作同一在线策略 的两个上下文视图,而非预先固定的教师—学生关系。
  • 在同一任务 、同一锚定状态 下比较两视图的 return-to-go ,将高回报视图作为局部教师。

2.2 双层技能记忆与混合 rollout

  • UCB 检索打分

其中 为效用, 为使用计数。

  • 混合 rollout:每个 task 组一半轨迹用 ,另一半用 ,两分支均接收在线 RL 损失。
  • 锚定状态分组(沿用 GiGPO 的设计):构造

记录元组

2.3 信用感知双向自蒸馏(CBSD)

  • 教师方向选择:在每个 内选

仅当 时才接受 pair 。若 ,技能视图教无技能视图;若 ,则反向蒸馏。

  • Top-K Token-Support Matching:在引用分支前缀 上取 ,并在支撑集上重新归一化得到 (教师)与 (学生),定义
  • 置信门控与回报差加权
  • CBSD 总目标

2.4 技能记忆演化与训练目标

  • 状态级技能生成:在同一锚定状态下用高—低回报记录做对比,刻画"何时该做、什么时候不该做"。
  • 效用更新(EMA)

其中 是使用技能 的 rollout 相对任务组无技能基线的成功率提升。

  • 反思写作器的自训练:以池内归一化的效用优势 ,对反思响应做 PPO 风格的裁剪目标:
  • 联合损失

2.5 理论保证(局部一阶改进)

  • 在同一上下文 下:
  • 命题 1:若 分别为高/低值分支,,将低值分支沿 移动,则局部优势代理改善量为

并在信任域条件下得到

  • 时固定技能→无技能方向会产生负向更新;CBSD 反向蒸馏可获得 的改进。

3. 实验设计

  • 基准数据集
  • ALFWorld:6 类任务(Pick、Look、Clean、Heat、Cool、Pick2)的成功率。
  • WebShop:128 任务评估集,报告分数(Score)与成功率(Succ)。
  • Search-QA:NQ、TriviaQA、PopQA、HotpotQA、2Wiki、MuSiQue、Bamboogle 七个检索 QA 数据集上的准确率。
  • 模型骨干:Qwen2.5-7B-Instruct、Qwen2.5-3B-Instruct、Qwen3-1.7B。
  • 对比方法(覆盖三类基线)
  • 无技能 RL:GRPO、GiGPO。
  • 技能记忆方法:SkillRL、D2Skill、SkillC、SAPO、Skill1。
  • 自蒸馏方法:GRPO+OPSD、RLSD、Skill-SD、SDAR、StepOPSD。
  • 训练超参(部分):rollout group size = 8,训练批大小 16,验证批大小 128,折扣 ,actor 学习率 ,PPO mini-batch 64,KL 系数 0.01,prompt/response 上限 8192/512。

4. 资源与算力

  • 主要 ALFWorld 与 WebShop 实验使用 8 块 NVIDIA A800 GPU
  • 训练规模:150 个 epoch,每 5 步验证一次,最多保留 5 个 checkpoint。
  • Search-QA 实验使用 4 块 GPU,训练 150 步。
  • 论文通过 Figure 10 给出了 wall-clock 训练时间对比(ALFWorld 0–8 h、WebShop 0–8 h),并分解每步开销(rollout、检索、生成、old-log-prob、reference logits、policy update 等)。
  • 论文未声明总训练 GPU-hours 或完整算力账单。

5. 实验数量与充分性

  • 主表 Table 2:3 个骨干 × 3 个基准 = 9 组主结果,每组与约 9–11 个基线对比;同时引用 SDAR 等论文数据并标记(† / ∗)以与原文献对齐。
  • 消融
  • 主要组件消融(图 7 左):去掉 anchor-state grouping、reflection self-training、state skills、mixed rollouts、CBSD 共 5 个 "w/o" 变体,在 ALFWorld、WebShop 两个环境、Qwen3-1.7B 下同时报告成功率与回合长度。
  • CBSD 内部消融(图 7 右):gap-gated 单向、force-directed(固定教师)、w/o top-K support 三种变体。
  • 表 3: 三档,反思后端 {fixed bank, GPT-5.4, self-trained} 三档。
  • 机制与效率分析:CBSD 路由比例、技能池增长曲线、检索效用随训练变化、wall-clock 与每步开销分解、两视图评估对比(图 9)、两个 ALFWorld 案例(图 11)。
  • 客观性说明:所有消融均共享同一骨干、同一训练预算;主表引用的基线数据多来源于已发表论文,作者在表格中明确标注(† / ∗)来源;Search-QA 上 UCOB 没有全面领先,作者如实报告了"竞争力而非全面优势"。

6. 主要结论与发现

  • 数值表现
  • ALFWorld 整体成功率:Qwen2.5-7B 93.0 / Qwen2.5-3B 92.2 / Qwen3-1.7B 89.1,三者均为最优。
  • WebShop 成功率:85.9 / 78.1 / 79.7,同样全面领先。
  • 小模型(Qwen3-1.7B)相对 Skill1/SDAR 的提升最显著:ALFWorld +23.5、+35.2,WebShop +18.0、+21.1。
  • Search-QA:与最佳基线平均准确率相差 ≤0.8/0.9/0.2 分。
  • 机制结论
  • 检索到的技能不是可靠的固定教师;同一锚定状态下两视图的回报差呈混合符号。
  • 在 ALFWorld 与 WebShop 上,"无技能→技能"路由反而出现得更频繁(图 8a),说明无技能视图经常是更优的局部教师。
  • UCOB 使技能视图与无技能视图在评估时同时提升(图 9)。
  • 技能池规模持续增长但检索效用保持正值、Useful-Skill Ratio 不为零(图 8b/c)。
  • 效率结论:相对 SDAR、Skill1 等基线,UCOB 取得更高验证成功率所花 wall-clock 相当或更少;额外开销主要集中在 old-log-prob、reference logits 与 policy update 阶段。

7. 优点

  • 范式转变:把"何时信任技能"形式化为同任务同锚定状态的信用分配问题,突破了"特权教师"假设。
  • 闭环设计:CBSD 产生的 credit signal 同时驱动技能效用更新、检索排序与反思写作器自训练,使策略学习与技能演化耦合而非解耦。
  • 理论支撑:给出局部一阶改进命题、KL 近似解释以及混合符号差距下反向蒸馏必要性的命题 4,论证较严谨。
  • 实验充分:跨 3 个骨干、3 个基准、3 类基线,多角度消融与机制分析配合案例研究。
  • 效率可控:每步额外计算定位明确,对 wall-clock 影响有限。
  • 状态级技能:相对 D2Skill 等先前"轨迹/片段级总结",用同状态 high-vs-low 回报对比作为状态技能的写作依据更具局部证据。

8. 不足与局限

  • Search-QA 上增益有限:作者坦承 UCOB 在 Search-QA 上"竞争力而非全面领先",说明基于锚定状态—回报差的信用信号在检索密集、短视野的 QA 任务中可能不直接适用。
  • 观察—方法耦合紧密:CBSD 的教师切换依赖高质量的 return gap 估计;当环境奖励极稀疏或 group size 偏小时,同一锚定状态分组可能样本不足,clip 阈 的敏感性需进一步扫描(表 3 仅做了三档)。
  • 小模型提升幅度远大于大模型:在 Qwen3-1.7B 上相对 SDAR 提升 35 分,但在 Qwen2.5-7B 上仅 0.8/3.1 分的提升,规模收益递减的现象未在文中给出系统解释。
  • 依赖外部计算:rollout 仍占训练主体时长(图 10b),混合 rollout 与 top-K 监督使每步 token 计算加倍,对超大模型扩展的代价需进一步评估。
  • 检索与写作器的可解释性:UCB 检索融合相似度与效用,可能引入状态级检索 query 设计的偏差;反思写作器由策略自我训练,与闭源强外部写作器(GPT-5.4)效果相近但仍低于自训练版本,存在训练不稳定的潜在风险。
  • 未公开超参搜索细节:主要超参在 Appendix B 给出,但训练步数(150 epoch)与最大保留 checkpoint(5 个)可能掩盖了部分方法的潜在上限;与 SDAR 等"copy from paper"的基线对比并非全部在同一算力下重新复现。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记