将 RL 诱导的工具使用定位到单个 Crosscoder 特征
Localizing RL-Induced Tool Use to a Single Crosscoder Feature
📝 TLDR
强化学习微调使语言模型获得工具调用能力,但其内部表征变化的机制尚不清楚。本文提出专用特征跨编码器(DFC),在 Qwen2.5-3B 上定位出一组紧凑的 RL 特异特征。通过 48 组超参数实验,证明仅操控这些特征即可将工具调用正确率提升约 31 个百分点,并能将能力溢出至冻结基座模型,为推理时控制智能体行为提供了可行路径。
🧭 速览
RL 微调虽显著提升了结构化工具调用能力,但引入或保留的内部特征不清晰,且能否用于免训练的运行时行为控制未知。
提出专用特征跨编码器(DFC),将 RL 引入的能力隔离到最小化特征集,在 Qwen2.5-3B 上开展 48 组超参数扫描验证可操控性。
编码-解码重建使 RL 模型工具调用正确率提升 +31.1±9.7 pp,并以 +6.8±5.0 pp 将能力被动迁移至冻结基座模型。
DFC 成功将 RL 能力集中在少量可操控特征中,实现了无需重训的智能体大模型运行时行为控制。
📊 论文图表(共 6 张)
展开查看 6 张图
TL;DR
这篇论文探究了强化学习微调(RL Fine-tuning)如何重塑语言模型的内部表征,从而赋予模型调用工具的能力。研究团队设计了一种名为"专用特征交叉编码器(Dedicated Feature Crosscoders, DFC)"的方法,从 Qwen2.5-3B 模型中定位出一组紧凑的、RL 专属的特征。实验表明,仅操控这些特征就能将工具调用正确率提升约 31 个百分点,更有趣的是,这些特征还能"溢出"到冻结的基座模型,使其也具备原本不具备的工具调用能力。
研究背景与动机
近年来,通过 [[强化学习微调]] 让语言模型获得 [[工具调用]] 能力已成为构建 [[智能体语言模型]] 的核心技术路线。这类模型能够根据用户指令自动调用外部工具(如搜索 API、计算器、数据库查询等),在自动化工作流中展现出巨大潜力。然而,一个根本性的问题始终悬而未决:RL 微调究竟在模型的内部表征中做了什么?这些表征变化的机制基础是什么?
在传统的理解中,我们往往将 RL 微调视为一个"黑箱"过程:喂给它大量演示数据和奖励信号,模型就学会了新技能。但从 [[表征工程]] 的角度来看,这种理解远远不够精细。研究者们关心的是:哪些特征在微调后涌现出来了?哪些原本有用的特征被保留了?更重要的是,如果我们能精确定位这些关键特征,是否可以在不重新训练的情况下直接操控模型行为?
这些问题的答案不仅具有理论价值,更具有实践意义。如果能搞清楚 RL 微调的"生效机制",我们就有可能在推理时直接干预模型的表征,实现行为控制,而无需昂贵的再训练过程。这正是本文想要回答的核心问题。
方法
要理解这篇论文的方法,需要先了解 [[交叉编码器]](Crosscoder)这一概念。交叉编码器本质上是一种稀疏自编码器(SAE)的变体架构,它的作用是从神经网络的激活中分离出独立的、语义上有意义的特征。当我们把一个经过 RL 微调的模型和一个未微调的基座模型的激活分别输入交叉编码器时,编码器会学习找出"哪些特征是 RL 过程新引入的"。
研究团队在此基础上提出了专用特征交叉编码器(DFC)的设计。与标准的交叉编码器不同,DFC 的关键创新在于"专用"二字:它不是试图一次性分解所有特征,而是专注于隔离出一组紧凑的、与 RL 工具调用能力直接相关的特征子集。这种设计选择背后的直觉是,RL 微调可能只在模型表征空间中引入了极少数的"活性成分",而大量其他特征保持不变。
具体而言,DFC 采用编码器-解码器的重建架构。编码器将 RL 模型和基座模型的激活投影到一个高维稀疏空间,解码器则尝试从这个稀疏表征重建原始激活。训练目标是同时最小化重建误差和稀疏性惩罚,确保学到的特征既有表达力又足够独立。
在 48 组超参数实验中,研究团队系统地探索了编码器维度、稀疏性系数、学习率等关键超参数对特征分离效果的影响。他们设计了一套巧妙的评估协议:先用 DFC 从 RL 模型中提取特征,然后仅对这些特征进行操控(比如放大或抑制),最后测量工具调用的正确率。这种方法能够直接验证"我们是否真的找到了正确的特征"。
一个特别值得关注的设计亮点是对"能力溢出"现象的刻意探索。研究团队不仅在 RL 模型上测试,还尝试将这些隔离出来的特征"移植"到冻结的基座模型上,观察是否能产生工具调用能力。这种跨模型的迁移测试,为特征的有效性提供了比内部测试更严格的验证。
实验与结果
实验在 Qwen2.5-3B 模型上进行,使用了标准的工具调用评测基准。主要结果分为两个维度:
在 RL 模型上的直接操控效果: 当研究团队通过 DFC 定位到 RL 专属特征后,仅通过放大这些特征的激活值,工具调用的正确率就从基线水平跃升了 个百分点。这个提升幅度相当显著,说明 DFC 确实捕捉到了 RL 微调的核心生效机制。换句话说,工具调用能力并不弥散在整个模型的参数空间中,而是集中在一组相对紧凑的特征集合里。
能力溢出效应: 更加出人意料的是,当团队把这套特征操控机制应用到冻结的基座模型(完全不做微调)时,基座模型也展现出了工具调用能力,正确率提升了 个百分点。这被论文称为"能力溢出"(capability spillover)。这意味着 RL 微调所引入的表征变化具有某种可迁移的结构——它不需要依赖模型参数的其他适配,就能对行为产生可测量的影响。
超参数扫描的结果进一步揭示了一些有趣的模式。编码器维度过低会导致特征分离不彻底,许多 RL 相关特征混杂在一起;维度过高则可能引入过多噪声,降低稀疏性带来的可解释性优势。最佳的折中点出现在一个相对适中的维度范围内,此时特征既保持独立可分离,又能产生最强的行为操控效果。
这些结果共同指向一个结论:RL 微调对工具调用能力的学习,并非是一个全局性的参数调整过程,而是集中在少数关键特征的操控上。这为表征层面的干预提供了坚实的实证基础。
讨论与可借鉴点
这项研究的理论贡献在于提供了一种理解 [[强化学习微调]] 机制的新视角。它不是从行为输出的角度描述 RL"做了什么",而是从表征空间的角度回答了 RL"在哪里生效"。这种表征层面的定位,为未来的 [[可解释性研究]] 提供了可操作的切入点。
从实践角度看,DFC 展示的"推理时行为控制"范式具有重要价值。传统的模型微调需要消耗大量的计算资源和时间,而基于特征的表征干预提供了一种轻量级的替代方案。尤其是能力溢出效应的发现,暗示某些能力或许可以跨模型迁移——这对于模型压缩、领域适配等应用场景都有潜在的启发意义。
然而,这项研究也存在若干局限。首先,实验仅在 Qwen2.5-3B 这一单个模型规模上验证,更大规模的模型是否适用相同的机制尚未可知。其次,工具调用是一个相对结构化的任务,对于更复杂的 [[智能体]] 行为(如多步规划、社交推理),DFC 的方法是否能同样有效地定位关键特征,还需要进一步探索。第三,能力溢出的幅度(+6.8 pp)与直接在 RL 模型上的效果(+31.1 pp)存在明显差距,这说明特征迁移并非无损的,基座模型可能缺乏某些必要的"基础设施"来完全承接这些特征。
总的来看,这篇论文为表征工程领域提供了一个有价值的案例研究:复杂行为能力的获得,可能只需要集中操控少数关键特征。这一发现既深化了我们对语言模型学习机制的理解,也为更可控、更高效的模型编辑技术开辟了新方向。
摘要
通过强化学习(RL)进行微调会重塑语言模型的内部表征,从而实现工具调用等智能体行为,但这些变化的机制基础仍未被充分理解。尽管强化学习显著提升了结构化工具调用的生成能力,但仍不清楚哪些特征会涌现、哪些特征得以保留,以及已识别的特征是否可用于无需重新训练的行为控制。本研究中,我们表明 能够隔离出一组紧凑的、强化学习专属的特征,这些特征在 中中介了工具调用能力。在涵盖 个交叉编码器的超参数扫描中,编码-解码重建使强化学习模型的工具正确率提升了 个百分点,并使工具调用能力被动迁移到冻结的基座模型,提升了 个百分点,我们将这一现象称为 。我们的研究结果表明,DFC 划分将强化学习所引入的能力集中到一个最小的、可操控的特征集合中,从而实现对智能体语言模型运行时行为的控制。
Abstract
Fine-tuning through RL reshapes the internal representations of language models to enable agentic behaviors such as tool use, yet the mechanistic basis of these changes remains poorly understood. While RL substantially improves structured tool-call generation, it is unclear which features emerge, which are preserved, and whether identified features can be leveraged for retraining-free behavioral control. In this work, we show that isolate a compact set of RL-specific features that mediate tool-calling capability in . Across a -crosscoder hyperparameter sweep, encode-decode reconstruction improves the RL model's tool correctness by pp and passively transfers tool-calling ability to the frozen base model by pp which we call a . Our findings show that DFC partitioning concentrates RL-introduced capability into a minimal, steerable feature set that enables runtime behavioral control of agentic LLMs.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





