arXiv 2606.29476v1 · 发布 2026-06-28

CRAFT:基于自由兄弟回滚的反事实信用分配用于自蒸馏智能体强化学习

CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning

AUTHORS Zibin Meng, Kani Chen
EVIDENCE 自蒸馏智能体强化学习,使用同策略特权上下文作教师
SCORE 0.9
GENERATED 2026-07-04 21:35:24 UTC

📝 TLDR

自蒸馏智能体强化学习以教师-学生log概率差标量门控token级蒸馏损失,但该信号仅回顾已发生轨迹且符号盲,无法识别教师偏好动作是否真正有利。CRAFT提出三支柱信用分配方案:复用GRPO兄弟轨迹估计逐token反事实优势增量,引入非对称蒸馏与KL权重控制器,并按信用符号在逐token层面切换模式寻求与覆盖KL惩罚,在三类智能体环境、四个模型规模与五种端到端方法上一致超越基线。

🧭 速览

动机

现有自蒸馏方法仅以单标量log概率差门控蒸馏损失,存在回顾性与符号盲双重局限,无法评估教师偏好动作是否真正有利。

方法

三支柱:复用GRPO兄弟轨迹并按log概率差加权估计逐token反事实优势增量;非对称控制器调整蒸馏与KL权重;按信用符号逐token极化KL方向。

结果

在三类智能体环境、四种模型规模与五种端到端方法上均获一致增益;证明估计量一致性与方差界,并提供逐比特可复现保证。

结论

CRAFT以近零额外算力将单标量门控升级为带符号的逐token信用分配,为自蒸馏智能体强化学习提供了更精确的信用归因。

📊 论文图表(共 6 张)

展开查看 6 张图

TL;DR

CRAFT 提出了一种针对自蒸馏智能体强化学习的反事实信用分配方案,通过复用 GRPO 已采样的兄弟回滚来估计逐 token 的反事实优势变化,从而突破传统方法"只回顾已实现轨迹、符号盲"的双重局限。该方法在三个智能体环境、四种模型规模和五种端到端方法上一致超越基线,且每个支柱可独立开关、关闭时与基线逐字节等价,确保增益归因明确。

研究背景与动机

自蒸馏智能体强化学习(Self-Distilled Agentic RL)是近年来大模型智能体训练的重要范式。其核心思想是:同一策略 既作为学生产生实际执行的动作,又作为教师在"特权上下文"(privileged context)条件下——比如添加技能标注、验证器提示或检索到的参考轨迹——生成期望的改进动作。蒸馏损失通过惩罚学生偏离教师log概率的程度,引导策略向教师偏好方向收敛。

然而,主流实现(如 SDAR)用单一标量来门控 token 级蒸馏损失:这个标量是教师与学生的对数概率差 ,经过 sigmoid 函数压缩到 区间后作为门控权重 。论文精准地指出了这一设计的双重局限。

首先是回顾性(retrospective)问题: 只对已实现的轨迹打分——它看到的是"教师在这个状态给这个动作打了多少分",却从不回答"如果在这里采用教师偏好的另一个动作,整条轨迹的最终回报会怎样变化"。换言之,这是一种静态的、局部的评分,而非对替代动作价值的真实估计。其次是符号盲(sign-blind)问题:由于 的单调函数,它永远是正向的——即教师偏好某个动作时,门控权重增加;但当教师偏好某个动作而这个动作实际上会损害轨迹时,门控权重仍然增加。换句话说,这种机制无法区分"教师偏好且有益"与"教师偏好但有害"两种截然不同的情形。

这种双重局限导致信用分配(credit assignment)质量低下:策略可能过度信任教师的某些偏好动作,即使这些动作在反事实情况下会降低轨迹优势。CRAFT 的核心切入点是:GRPO(Group Relative Policy Optimization)本身就要求采样 条并行回滚,这些回滚天然构成了一个"兄弟轨迹"的集合,可以被复用为近乎免费的反事实样本池。

方法

CRAFT 构建了一个三支柱(three-pillar)的信用分配方案,每个支柱由一个独立的主开关控制——这是一个精巧的工程设计:当开关关闭时,损失函数和梯度在 IEEE-754 算术下与基线逐字节完全相同,使得任何测得的增益都能明确归因于算法变化而非实现偏差。

支柱一:反事实 Token 重要性(Counterfactual Token Importance, CTI)

这一支柱回答的核心问题是:假设我在第 步采用了教师偏好的动作,轨迹的优势会如何变化?理想的目标量定义为:

即第 条轨迹在第 步采用教师采样的期望优势增量。然而,我们无法直接计算这个期望——因为我们只有一个观测到的轨迹 ,不知道"如果采用其他动作会怎样"。但 GRPO 的兄弟轨迹提供了关键的解决思路:对于第 条轨迹,我们可以利用另外 条兄弟轨迹 的优势 作为反事实采样的代理。

具体地,CTI 使用自归一化重要性采样(Self-Normalised Importance Sampling, SNIS)构建估计量:

当温度参数 时,权重简化为教师/学生概率比率 ,这是标准的 SNIS 形式。直觉上,这个估计量在问:"对于所有兄弟轨迹,如果它们在第 步的动作与当前轨迹在该步的教师偏好相似(log-prob 差距大),那么这些轨迹的最终优势是多少?"通过对相似动作的轨迹优势加权平均,我们得到了反事实优势变化的估计。

为了产生带符号的信用(signed credit),论文引入了中心化非对称 sigmoid 变换:

这个设计的精妙之处在于: 时表示"教师偏好动作确实有益", 时表示"教师偏好动作反而有害"——这正是传统方法缺失的符号信息。

最终,CTI 损失形式为:

这使得正向信用驱动策略朝教师动作移动,负向信用则抑制这一趋势。

支柱二:阶段感知自适应控制器(Asymmetric Controller)

即使有了带符号的逐 token 信用,整个训练过程仍需在"探索"与"利用"之间平衡。传统方法使用固定权重控制蒸馏损失与 [[KL散度]] 惩罚的相对强度,但这种静态设置忽视了训练动态的多阶段性。

控制器维持门控活动率的指数移动平均(EMA):

并据此反向调节蒸馏权重 与 KL 权重 :当门控活跃度高时(教师有丰富的未吸收信号),提升 降低 ;当门控饱和时,反向操作。这种非对称设计确保了训练在不同阶段自动适应信用分配的需求强度。

支柱三:方向极化 KL 惩罚(Directional KL Polarisation)

基于支柱一产生的符号信用 ,KL 惩罚在逐 token 层面被极化为三种模式:

  • (正向信用强):使用反向 KL(reverse KL),即 ,这倾向于模式寻求(mode-seeking)——强制策略严格贴合参考分布的单一峰值。
  • (负向信用强):使用前向 KL 启发式(forward KL heuristic),即 ,这倾向于模式覆盖(mode-covering)——鼓励策略在参考分布的支撑集上均匀分布。
  • (信用微弱):使用标准中性 KL 惩罚。

这种设计的动机在于:正信用意味着"教师偏好动作是好的,策略应该更自信地向其靠拢",反向 KL 的 mode-seeking 特性恰好满足这一需求;负信用意味着"教师偏好动作有害,策略应该主动避开",而前向 KL 的 mode-covering 特性有助于策略探索替代方案。

总损失与理论保证

完整损失函数为:

论文给出了 CTI 估计量的一致性证明(命题1):当 时, 依概率收敛于真实 ,有限样本偏差为 。同时证明了方差上界(命题2):,其中 是优势函数的界, 是平均重要性权重的期望。

实验与结果

实验覆盖了三个代表性智能体环境——ALFWorld(基于文本的具身探索)、Search-QA(直接检索问答)和 WebShop(编程验证器购物场景),以及四个模型规模(Qwen3-1.7B、Qwen2.5-3B、Qwen2.5-7B、Qwen3-8B),采用 5 种端到端方法加 2 种先前工作基线进行对比。

主网格实验(84个单元)显示,CRAFT-Full 在每个(环境,模型)组合上均达到最优。更细致的消融实验揭示了各支柱的独立贡献:单独启用支柱一(+P1)在 ALFWorld 上即带来 +1.9 个百分点的提升,Search-QA 上 +2.0,WebShop 上 +1.5——这表明反事实信息本身就是实质性贡献。

为了精确隔离支柱的贡献,论文设计了 Adaptive-CRINGE 作为对照方法:它与 CRAFT 共享支柱二,因此"CRAFT-Full 减 Adaptive-CRINGE"的差值即代表支柱一和三的纯贡献。实验结果显示这一差值在所有单元均为正,进一步确认了反事实信用分配的价值。

有趣的是,最小模型(Qwen3-1.7B)的收益反而最大:ALFWorld 上 +3.4、WebShop 上 +5.5,且这一优势随模型规模增大而缩小但始终为正。这可能反映了较小模型从精细信用分配中受益更多,因为它们的基线信用分配能力更弱。

论文还进行了两项关键的反证检验:A6 移除反事实机制(),发现增益坍缩至 SDAR 基线;A7 交换 KL 方向,发现性能低于 SDAR。这两项实验分别验证了"反事实信息不可或缺"和"方向选择正确性"两个核心假设。

在分布外(OOD)评估中,CRAFT-Full 展现出更小的泛化差距:ALFWorld 上 6.2 vs SDAR 的 9.5。随机检索压力测试下,CRAFT 保持 78.5 分而 SDAR 降至 72.0,表明其对检索噪声的鲁棒性更强。

讨论与可借鉴点

CRAFT 最具启发性的贡献在于方法论层面的洞察:GRPO 采样的兄弟轨迹并非训练副产品,而是一个"近乎免费的反事实样本池"。这一观察将 [[重要性采样]] 估计器与自蒸馏框架优雅地嫁接在一起,同时保持了极低的计算开销(仅需在 torch.no_grad() 下做组级 softmax 与加权求和)。

论文的工程设计也值得借鉴。每个支柱配备独立开关、关闭时逐字节等价于基线——这不是过度工程化,而是科研诚实性的体现:它确保了任何测得的增益都是算法的真实贡献,而非实现细节或数值精度的偶然结果。87 个回归测试用例覆盖数学正确性、工程契约和位精确性,这种工程严谨性在学术论文中难得一见。

然而,方法也存在局限。首先,CTI 估计量依赖于"兄弟轨迹的优势可以迁移"的交换性假设,这在轨迹间差异较大时可能引入偏差。其次,当 较小时(如 ),SNIS 估计量的方差可能较大,尽管论文给出的方差界在理论上保证了好行为的趋势。第三,支柱三的 KL 方向极化虽然直觉清晰,但前向 KL 的实际实现仍是启发式的,并非真正的对称前向 KL 散度。

对于更广泛的研究社区,CRAFT 的设计模式提供了有益的启发:在 [[策略梯度]] 方法中引入反事实评估时,不必额外采样——复用现有训练流程产生的并行轨迹即可。对于 [[自蒸馏]] 方法,符号感知的信用分配可能比单一标量门控更有效,尤其是当教师模型与学生模型存在分布偏移时。此外,将 KL 惩罚从全局静态权重升级为逐 token 自适应路由,可能成为未来信用分配研究的一个有前景的方向。

摘要

自蒸馏智能体强化学习通过 token 级蒸馏损失来增广轨迹级奖励,其教师模型为同一策略但以特权上下文为条件。主流方法通过单一标量——教师-学生对数概率差——来门控该损失。该信号存在双重局限:它是回顾性的,仅对已实现的回滚进行打分而从不评估反事实情况;且对符号不敏感,从不指示教师偏好的动作何时会损害轨迹。我们引入 CRAFT,一种三支柱信用分配方案,以同时解决上述两个局限。支柱 1 即反事实 token 重要性,复用 GRPO 已采样的 G-1 个兄弟回滚,并通过对数概率差进行重要性加权,以形成在每步上对教师偏好动作加权的群体级优势反事实变化的自归一化估计;这以近乎零的额外计算产生了带符号的逐 token 信用。支柱 2 是一个非对称控制器,沿着门控活动的指数移动平均,在提升蒸馏权重的同时降低参考 KL 权重,反之亦然。支柱 3 将 KL 惩罚逐 token 极化,根据信用符号在模式寻求和模式覆盖更新之间切换。每个支柱都有一个独立开关,当禁用时,使损失和梯度在 IEEE-754 算术下与基线逐字节相同,因此任何测得的增益均可归因于算法变化而非实现偏差。我们证明了估计器的一致性和方差界,给出了结构性与逐比特精确的可复现性保证,并在三个智能体环境、四种模型规模和五种端到端方法上对 CRAFT 进行了评估,外加两个以表格形式列出的先前工作基线。其中包括 Adaptive-CRINGE,一个与 CRAFT 共享支柱 2 的对照方法,用于隔离反事实贡献。

速览

TLDR:自蒸馏智能体强化学习当前以教师-学生对数概率差作为蒸馏门控信号,但该信号仅回顾已实现轨迹且无方向感知,信用分配受限。CRAFT提出三支柱信用分配方案:复用GRPO的G-1兄弟轨迹并按log-prob差距重要性加权,估计逐token的反事实优势变化;构建联动蒸馏与KL权重的非对称控制器;按信用符号逐token切换mode-seeking与mode-covering的KL更新。方法在3个智能体环境、4个模型规模、5种端到端方法上验证增益,各支柱可独立开关并在关闭时比特级退化为基线,归因明确。 \

Motivation:现有自蒸馏以单一标量log-prob差异门控token级蒸馏损失,缺乏反事实信息且不区分正负方向,难以有效分配信用。 \

Method:三支柱方案:复用GRPO兄弟轨迹重要性加权估计反事实token重要性;非对称控制器调节蒸馏权重与KL权重;按信用符号逐token极化KL惩罚。 \

Result:在3个智能体环境、4个模型规模、5种方法上验证增益,并对比仅共享Pillar 2的Adaptive-CRINGE以隔离反事实贡献。 \

Conclusion:给出估计器一致性、方差界与比特级可复现证明,每支柱关闭时梯度与基线完全一致,确保收益归因于算法本身。


Abstract

Self-distilled agentic reinforcement learning augments trajectory-level reward with a token-level distillation loss, using as its teacher the same policy conditioned on privileged context. The prevailing recipe gates this loss by a single scalar, the teacher-student log-probability gap. This signal is doubly limited: it is retrospective, scoring only the realised rollout and never the counterfactual ones, and it is sign-blind, never signalling when a teacher-preferred action would have harmed the trajectory. We introduce CRAFT, a three-pillar credit-assignment scheme that addresses both limitations. Pillar 1, Counterfactual Token Importance, reuses the G-1 sibling rollouts that GRPO already samples and importance-weights them by the log-probability gap to form a self-normalised estimate of the group-level counterfactual change in advantage from up-weighting teacher-preferred actions at each step; this yields a signed per-token credit at near-zero extra compute. Pillar 2 is an asymmetric controller that raises the distillation weight as it lowers the reference-KL weight along an exponential moving average of gate activity, and conversely. Pillar 3 polarises the KL penalty token by token, switching between a mode-seeking and a mode-covering update according to the sign of the credit. Each pillar has an independent switch that, when disabled, renders the loss and gradient byte-identical to the baseline in IEEE-754 arithmetic, so any measured gain is attributable to algorithmic change rather than implementation drift. We prove the estimator's consistency and a variance bound, give structural and bit-exact reproducibility guarantees, and evaluate CRAFT across three agentic environments, four model scales, and five end-to-end methods, plus two tabulated prior-work baselines. Among these is Adaptive-CRINGE, a comparator sharing Pillar 2 with CRAFT, isolating the counterfactual contribution.


论文详细总结(自动生成)

CRAFT 论文总结

1. 核心问题与研究动机

背景:自蒸馏智能体强化学习(Self-Distilled Agentic RL)通过在同一策略上附加"特权上下文"(如技能标注、验证器提示、检索轨迹)构建教师 ,并叠加一个 token 级蒸馏损失以补充 GRPO 的轨迹级奖励。

现行方案的缺陷:主流方法(如 SDAR)使用单一标量门控:

该信号存在双重局限:

  • 回顾性(Retrospective):仅对已实现的轨迹打分,不评估"如果在该步采用教师动作会发生什么"。
  • 符号盲(Sign-blind) 单调于 ,永远不会告诉策略"教师偏好动作反而会伤害轨迹"。

2. 方法论

CRAFT 是一个三支柱信用分配方案,每个支柱由独立主开关控制:

2.1 支柱 1:反事实 Token 重要性(CTI)

理想目标:在轨迹 的第 步,估算若采用教师采样所带来的序列优势变化:

群体级估计量:复用 GRPO 的 个兄弟回滚进行自归一化重要性采样:

时权重即教师/学生比率 ,是标准的 SNIS 估计量。

带符号信用:通过中心化非对称 sigmoid 将信用压缩到

CTI 损失

边际算力开销:仅在 torch.no_grad() 下做组级 softmax 与加权求和, 逐点运算,相对基线可忽略。

2.2 支柱 2:阶段感知自适应控制器

控制器维持门控活动率的 EMA:

并以相反方向调整蒸馏权重 与 KL 权重

教师有未吸收信号时 上升、 下降(吸收阶段);饱和时反向。

2.3 支柱 3:方向极化 KL

根据 符号在三种 KL 分支间路由:

其中:

  • (反向 KL,模式寻求, 时使用)
  • (前向 KL 启发式,模式覆盖, 时使用)
  • :标准 中性 KL 惩罚

2.4 总损失

3. 实验设计

3.1 环境与基准

  • ALFWorld:基于文本的具身环境
  • Search-QA(源自 Search-R1):直接检索变体
  • WebShop:编程验证器

3.2 模型规模

四个开放权重 LLM(Qwen3-1.7B、Qwen2.5-3B、Qwen2.5-7B、Qwen3-8B)。

3.3 对比方法

5 种端到端方法 + 2 种先前工作基线:

  • GRPO、RLSD、SDAR(先前单门控)、Adaptive-CRINGE(与 CRAFT 共享支柱 2 的对照)、CRAFT-Full
  • 表格列出:GRPO+OPSD、Skill-SD

Adaptive-CRINGE 是关键设计:与 CRAFT 共享 Pillar 2,因此"CRAFT-Full vs Adaptive-CRINGE"的差可隔离支柱 1+3 的贡献。

4. 资源与算力

  • 小模型:8 × 24 GB GPU
  • 大模型:4 × 48 GB GPU
  • GRPO 设置:,每单元 150 步
  • 87 个测试组成的回归套件在 CPU 上约 4 秒运行
  • 训练时长未在正文中明确给出

5. 实验数量与充分性

论文设计了 8 个实验族

编号内容
E1主网格(3 环境 × 4 模型 × 7 方法 = 84 单元)
E2逐支柱消融(A1-A3:+P1、+P1+P2、+P1+P3)
E3超参数消融(A4-A5:扫
E4反事实消融(A6:,隔离支柱 1)
E5KL 方向交换(A7:支柱 3 的反证检验)
E6快速预扫描
E7分布外评估(30% 切片按任务模板哈希划分)
E8随机检索压力测试

客观性与公平性

  • 每个支柱独立开关(P7):所有开关关闭时损失与梯度在 IEEE-754 下与基线逐字节相同,用 torch.equal 验证
  • Adaptive-CRINGE 对照方法隔离了支柱 2 的贡献
  • 默认超参数不针对环境调优
  • 87 个测试覆盖数学正确性、工程契约、位精确回归

6. 主要结论

1. CRAFT-Full 在每个(环境,模型)单元均最优(表 2)。

2. 隔离贡献:"CRAFT-Full vs Adaptive-CRINGE"差(即 P1+P3 的纯贡献)在所有单元为正:Qwen3-1.7B 上 ALFWorld +2.6、WebShop +2.3;Qwen2.5-3B 上 Search-QA +1.2。

3. vs SDAR 的总体提升:约 +2-3 个绝对百分点,最小模型收益最大(Qwen3-1.7B:ALFWorld +3.4、Search-QA +2.6、WebShop +5.5),随模型增大而缩小但仍为正(7B/8B 上 +1.6 到 +2.1)。

4. Pillar 1 是实质性贡献:+P1 单独(A1)即捕获大部分增益(ALFWorld +1.9、Search-QA +2.0、WebShop +1.5)。

5. 反证检验

  • A6( 移除反事实机制):增益坍缩至 SDAR 基线
  • A7(KL 方向交换):低于 SDAR 基线,证实方向选择

6. OOD 与鲁棒性:CRAFT-Full 在分布外差距最小(ALFWorld 上 6.2 vs SDAR 9.5),随机检索下中度而非灾难性退化(78.5 vs SDAR 72.0)。

7. 理论保证

  • 一致性(命题 1):),有限样本偏差
  • 方差界(命题 2):

7. 优点

  • 方法论新颖性:识别出 GRPO 的并行回滚作为"几乎免费的反事实样本池",这是将重要性采样估计器嫁接到自蒸馏中的关键洞察。
  • 理论严谨性:明确证明 SNIS 估计量的一致性与方差界,识别并解释"组级 vs 单轨迹"近似所需的交换性假设 (E)。
  • 位精确可复现性(P7):通过 torch.equal 回归套件证实开关关闭时与基线逐字节等价,使任何增益均可归因于算法变化而非实现漂移。
  • 精巧的对照设计:Adaptive-CRINGE 共享支柱 2,有效隔离反事实贡献,化解"CRAFT 只是自适应 KL 控制器"和"CRAFT 只是 CRINGE"两种批评。
  • 算力经济:CTI 估计器在 torch.no_grad() 下仅做组级 softmax,几乎零边际开销。
  • 结构清晰:四象限分析(表 5)直观展示 联合条件下的信用分布。

8. 不足与局限

  • L1:依赖组回滚。需要 的 GRPO 组结构,非组基骨干(如 DPO 风格)下的合成兄弟是未来工作。
  • L2:超参数膨胀。引入 9 个新超参数(),虽有默认值但调优空间扩大。
  • L3:支柱 3 独立增益小。是"完备性贡献"而非"量级贡献",单独存在仅为使支柱 1 的带符号信用自洽。
  • L4:领域覆盖窄。所有基准为基于文本的智能体任务,OOD 分析也是同领域内的;多模态与跨领域泛化未涉及。
  • L5:支柱 3 负分支非无偏 KL 估计量 是启发式策略更新规则,其 IS 加权真前向 KL 变体存在无界方差,论文明确不声称 KL 估计无偏性。
  • 方差界的紧度(IS/Horvitz-Thompson 帽值)在弱覆盖下可大,方差界偏松。
  • 未做任务级超参数调优:所有单元格采用同一组默认超参数,可能低估环境特异性能。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记