arXiv 2607.05615v1 · 发布 2026-07-06

每次 Token 一次抛硬币:大语言模型的伯努利稀疏引导

A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

AUTHORS Nima Eshraghi, Lovedeep Gondara, Yuqing Huang, Sagarika Suresh, Leizer Teran, Jithin Pradeep, Xiaotong Xu, Fanny Chevalier
EVIDENCE 在token级别对LLM行为进行稀疏激活引导
SCORE 0.8
GENERATED 2026-07-08 21:41:11 UTC

📝 TLDR

传统基于稀疏自编码器的激活引导对每个token施加干预,虽能改变模型行为却损害生成流畅性。本文提出随机token引导与随机块引导两种轻量策略,无需奖励模型即可概率性门控干预。在两个模型族与两类行为任务上,仅对50%token引导即可恢复密集干预的大部分效果且保持流畅度,30%便超越prompt控制,表明SAE介导的行为控制本质上是速率受限的,行为结果取决于序列上的累积信号剂量。

🧭 速览

动机

SAE激活引导在每个生成token上都施加扰动,虽能调控模型行为却持续损害流畅性,密集逐token干预并非必要。

方法

提出STS按概率p独立门控每token引导向量,SBS仅对序列前导窗口施加一次引导,二者均无需奖励模型或学习门控策略。

结果

在两模型族两行为任务上,50%token引导即恢复密集效果并保持流畅度,30%即可超越prompt控制,最优引导幅度与干预比例呈反比。

结论

SAE行为控制是速率受限的,行为结果由序列累积信号剂量决定,而非逐token强制干预所决定。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

这篇论文针对大语言模型激活引导中"是否需要对每个 token 都施加干预"这一基础问题,提出用抛硬币(伯努利随机抽样)来决定是否干预每个 token 的轻量策略。实验表明,仅引导 50% 的 token 就能恢复密集干预绝大部分效果,同时保持生成流畅性;引导 30% 的 token 就能超越精心设计的提示工程。更重要的是,作者发现行为控制效果遵循"速率受限"规律——最优引导强度与干预比率成反比,行为结果由序列上的累积信号剂量决定。

研究背景与动机

大语言模型的行为控制是部署应用中的核心议题:从降低输出毒性、塑造特定人格(persona)、到抑制幻觉、调整拒绝行为,这些需求贯穿模型开发与落地的全流程。在众多控制手段中,最直觉的方式是修改系统提示词(system prompt),但这种方法天然脆弱——词法上的微小扰动就能显著改变输出分布,对齐先验可以被精心构造的攻击性后缀绕过,而且提示引导在多行为维度上往往不对称且存在效果上限。

近年来,一类称为激活引导(activation steering)的技术引起了研究者的广泛关注。这类方法的核心思路是:不通过提示或微调,而是直接在模型的激活空间中注入方向信号来改变行为。代表性工作包括基于加法向量的 ActAdd、基于内部表征工程的 Representation Engineering,以及通过稀疏自编码器(SAE)发现的可解释特征方向来实现精准控制。其中,SAE 方法因其能从不带标签的激活中自动分解出单义特征而备受青睐——给定体现目标行为的正例文本和匹配的中性文本,计算两者在 SAE 隐空间中的平均激活差,就能提取出"行为方向向量",在生成时注入到模型残差流中即可改变输出。

然而,现有的 SAE 引导方法都默认采用密集干预策略:在每一个生成 token 的前向传播中,都向残差流施加固定方向的引导信号。这种做法会带来两个显著的副作用。其一是持续的扰动问题——引导信号每步都在将激活推向模型原本没有见过的方向,可能破坏生成的自然流畅性。其二是在多目标场景下的相互干扰——当需要同时控制多个相互冲突的属性时,持续的逐 token 信号会相互过度校正,导致与目标无关的行为退化。

这篇论文的研究者由此提出一个根本性的问题:密集、逐 token 的干预是否真的必要? 能否用更少的干预代价获得等效甚至更优的行为控制效果?如果干预不是每步都必需的,那么行为引导的本质约束究竟是什么?

方法

回答上述问题的关键在于设计一种可控的稀疏干预机制。研究者没有选择复杂的学习型门控网络或需要额外信号的奖励模型,而是回到最朴素的形式——抛硬币。他们提出了三种干预策略,形成从密集到稀疏的完整光谱。

全引导(Full Steering, FS) 是现有方法的基线实现。在第 层残差流上,每一步生成都向激活向量叠加引导信号:

其中 是引导强度标量, 是从 SAE 特征空间中提取的行为方向向量。这个方向向量的获取过程是:对行为正例集合 和匹配中性集合 分别通过 SAE 编码器获取隐激活,取平均后取差,然后选择差异最大的 Top-K 特征,将其对应的解码矩阵行归一化为单位向量。这种方向发现方法利用了 SAE 过完备字典的单义性假设——每个特征方向对应一种相对独立的行为属性。

随机 Token 引导(Stochastic Token Steering, STS) 用伯努利随机变量替代了确定性门控。干预信号变为:

其中 是干预概率, 在每个 token 位置独立抽样。这意味着模型在生成过程中以概率 接受引导、以概率 保持原生激活,设计上不假设任何 token 位置具有特殊重要性——"抛硬币"在序列各处是公平且独立的。

随机块引导(Stochastic Block Steering, SBS) 则是将干预窗口视为原子单元,只在序列开头抽样一次:

其中 是干预窗口长度, 只在序列级别抽样一次。这个设计背后有一个实证发现:早位置 token 对最终输出有更大的影响力,将干预"打包"到一个前缀窗口可能更高效。

在信号注入的技术细节上,研究者采用了三重流畅性保护机制。范数保持(norm preservation)将引导后的激活缩放回原始范数,确保引导是朝向 方向的旋转而非幅度膨胀。激活钳制(activation clamping)将激活在 方向上的标量投影限制在 区间内,既抑制原生残差中可能干扰目标的特征,也防止引导信号过度放大。重复惩罚(repetition penalty)则在解码阶段对已生成 token 的概率施加折扣,以应对高概率延续被抑制时可能出现的重复问题。

实验与结果

实验在两个模型家族和两类行为任务上进行。模型方面使用了 LLaMA 3.1-8B(搭配 EleutherAI 的 SAE)和 Gemma-2 2B(搭配 Gemma Scope 项目提供的 SAE),两者均在第 16 层(高层语义概念层)注入引导信号。任务方面涵盖毒性抑制(使用 RealToxicityPrompts 数据集中毒性值 ≥ 0.6 的高风险 prompts)和情感引导(从 GoEmotions 数据集中选择 fear 与 sadness 两种情感方向),前者要求降低目标行为、后者要求增强目标情感。评价采用外部预训练分类器(RoBERTa 毒性分类器、DistilRoBERTa 情感分类器)打分的概率变化,同时用 GPT-2 困惑度和 Rep-3/Rep-4 n-gram 重复率监控生成质量。

引导强度 的全干预条件下针对每个 (模型, 任务) 三元组分别校准,选定流畅性约束下的最优工作点,然后在所有稀疏条件下沿用该值以保证公平对照。

实验结果揭示了几个关键发现。首先,稀疏干预的效果远好于预期。LLaMA 3.1-8B 上, 的 STS 能够恢复全引导下超过 95% 的毒性减少效果;即使在情感引导任务上, 也能恢复 80% 以上的概率增益。这说明密集干预中绝大多数逐 token 干预是冗余的——模型在残差流中的表征传递具有足够的鲁棒性,可以容忍引导信号的随机缺失。

其次,STS 稳定优于 SBS 和提示工程。在相同的干预比率下,STS 的效果始终好于将干预打包到前缀窗口的 SBS,尤其在情感引导任务上差距显著(LLaMA-fear 任务上 时 STS 的概率增益约为 SBS 的 2 倍)。这表明引导信号的作用机制是"累积式"的,模型在整个序列生成过程中整合引导信息,而非依赖特权早位置的信号传递。更进一步,STS 在低至 时就已经超越精心设计的提示工程 baseline,说明即使稀疏的激活引导也比词法层面的提示控制更有效。

最重要的发现是"速率受限"规律。研究者观察到,最优引导强度 随着干预比率 的下降而单调上升——Gemma 从 时的 30 上升到 时的 35,LLaMA 从 2.5 上升到 5。但这种上升是亚线性的,意味着有效剂量 实际上随 减小而下降。稀疏引导并非在"重新分配固定的扰动预算",而是真正降低了对总信号量的需求。行为结果由序列上的累积信号剂量决定,但这个剂量并非线性可加的——存在着某种最优的信号密度与强度的配比关系。

讨论与可借鉴点

这项研究的理论价值在于它对激活引导机理的重新诠释。传统上,研究者将引导视为对每个 token 激活空间的直接修改,期待在每一步都施加"力"来推动生成轨迹转向目标方向。这篇论文的发现暗示,行为控制更像是一种"信号注入"机制——模型通过残差流的累积传递来整合引导信息,关键约束在于信号到达足够神经元、触发足够响应的"剂量",而非每 token 层面的精确干预。这种视角将行为控制从逐 token 的细粒度操作提升为序列级别的信号工程问题。

从实践角度,研究者给出了清晰的工程建议:当需要降低干预覆盖率时,应同步提升引导强度 通常是一个兼顾效果与效率的平衡点;相比前缀窗口式干预,均匀分布的稀疏干预在大多数场景下是更鲁棒的选择。

研究也存在明显的局限。实验仅覆盖两种任务类型(毒性抑制与情感引导),在更复杂的行为控制场景(如多属性协同、对抗鲁棒性、幻觉抑制)中的泛化性有待验证。方法依赖预训练 SAE 的可用性与质量,且目前只探索了单层单方向的干预,多特征联合或多层协同的效果尚不清晰。此外,研究者在主实验中沿用了在 下校准的 值,而后续分析表明稀疏条件下应当使用更高的 ——这意味着稀疏方法的最优效果可能仍未被充分挖掘。

对于该方向的后续研究,一个值得探索的问题是:最优的 组合是否存在理论依据?当前仍依赖经验性的网格搜索。另一个方向是"速率受限"规律是否适用于其他类型的干预方法(如基于强化学习的微调、基于对比学习的表征工程),以及这一规律是否与神经网络的某些理论性质(如表示的稀疏性、信息传递的拓扑结构)有更深的联系。

摘要

通过稀疏自编码器(SAEs)进行的激活引导能够在无需任务特定微调的情况下实现对大语言模型的行为控制,但标准方法在每个生成 token 上都施加引导信号,由此产生持续的逐 token 扰动,有损害流畅性的风险。我们提出的问题是:密集干预是否必要?我们引入了随机 Token 引导(Stochastic Token Steering, STS),以概率 独立地对每个 token 进行门控;以及随机块引导(Stochastic Block Steering, SBS),对每个序列的前导窗口仅门控一次;两者都不需要奖励模型或学习得到的门控策略。在两个模型家族和两个行为任务上的实验表明,仅引导 50% 的 token 即可恢复密集引导的大部分效果,同时保持流畅性;而引导低至 30% 的 token 即超越基于提示的控制。最优引导强度与干预比率成反比,揭示出 SAE 介导的控制是速率受限的:行为结果取决于整个序列上的累积信号剂量。

Abstract

Activation steering via sparse autoencoders (SAEs) enables behavioral control of large language models without task-specific fine-tuning, but standard methods apply the steering signal at every generated token, incurring constant per-token perturbation that risks degrading fluency. We ask: is dense intervention necessary? We introduce Stochastic Token Steering (STS), which gates each token independently with probability , and Stochastic Block Steering (SBS), which gates a leading window once per sequence; neither requires a reward model or learned gating policy. Across two model families and two behavioral tasks, steering only 50% of the tokens recovers most of the dense-steering effect while preserving fluency, and steering as few as 30% surpasses prompt-based control. The optimal steering magnitude scales inversely with the intervention ratio, revealing that SAE-mediated control is rate-limited: the behavioral outcome depends on cumulative signal dosage across a sequence.


论文详细总结(自动生成)

论文总结:A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

一、核心问题与研究动机

1.1 现实背景

大语言模型(LLM)的行为控制是部署中的关键议题,涵盖降低毒性、强制 persona、抑制幻觉、调整拒绝行为等。系统提示(system prompt)虽然是最常用的手段,但天然脆弱:词法扰动即改变输出分布,对齐先验可被攻击性后缀绕过,且提示引导在多行为维度上不对称且有界。

1.2 现有方法的共同缺陷

激活级干预方法(ActAdd、ITI、CAA、Representation Engineering、基于 SAE 的特征引导)的共同假设是逐 token 统一干预:在每一次前向传播中均向残差流注入固定方向的引导信号。这类"密集干预"会产生两个副作用:

  • 持续扰动:将生成推离模型原生激活流形,损害流畅性;
  • 多属性冲突:在多目标场景下相互冲突的信号相互过度校正,导致与目标无关的行为退化。

1.3 核心问题

作者提出关键疑问:密集、逐 token 的干预是否必要? 是否存在一种更轻量的稀疏干预机制,以更低代价获得等效甚至更优的行为调控效果?

二、提出的方法

2.1 总体框架

方法聚焦于 基于 SAE 的激活引导,核心思想是用随机伯努利门控替代确定性、每 token 的干预,将干预决策简化为单一标量参数

层 decoder-only Transformer ,在第 层残差流上注入引导信号:

其中 为引导信号。单层干预遵循 Labonne (2024) 的结论,已经足够有效;同时选择残差流而非 logit 层面,是因为 logit 介入过晚,无法让模型传播一致的表示(Zou et al., 2023a)。

2.2 引导方向发现(SAE 方向)

  • 使用在第 层残差流激活上训练得到的稀疏自编码器(SAE),其解码矩阵 提供过完备的单义特征字典。
  • 对行为正集 (体现目标行为)和匹配中性集 编码后,取平均特征激活差
  • 选择 最大的 Top- 个特征,并将其解码方向归一化为单位向量

2.3 三种引导机制

机制公式特点
全引导(FS)现有方法基线,每 token 强制干预
随机 Token 引导(STS)每个位置独立抽样 ,位置无关
随机块引导(SBS),否则不变;每序列单次抽样,对前导窗口统一干预
  • STS 的设计体现"位置无关",不假设哪些 token 行为上更关键;
  • SBS 利用早 token 影响力过大的实证发现(Xiao et al., 2024; Qi et al., 2025a,b),将窗口视为原子干预单元;
  • 从 0 到 1 平滑插值"无干预"与"全干预"。

2.4 流畅性保持正则化

1. 范数保持(Turner et al., 2024):将引导后激活缩放回原范数,约束为朝 的旋转而非幅度膨胀;

2. 激活钳制(Labonne, 2024):把 上的标量投影钳制在 ,并加上残差修正,抑制原生残差特征激活并防止过度放大;

3. 重复惩罚(Keskar et al., 2019):解码阶段折扣已生成 token,以缓解高概率延续被抑制引发的重复。

三、实验设计

3.1 数据集与任务

  • 毒性抑制:RealToxicityPrompts(Gehman et al., 2020),抽取 600 条高毒性 prompt(toxicity ≥ 0.6),其中 300 条用于方向发现、300 条用于评测。
  • 情感引导:GoEmotions(Demszky et al., 2020),按 Ekman (1992) 映射为 6 种基本情绪+中性,选择 fearsadness 作为目标。1k 中性 prompt + 600 情绪样本用于发现;剩余用于评测;评测时将 prompt 截短至原 token 长度的 50%。

3.2 模型

  • LLaMA 3.1-8B(使用 eleutherai/sae-llama-3.1-8b-32x
  • Gemma-2 2B(使用 google/gemma-scope-2b,字典宽度 65K)
  • SAE 均注入在第 16 层 Transformer(高层语义概念层);SBS 窗口

3.3 基线对比

  • 无引导(No Steering):原始生成;
  • 全引导(Full Steering): 下校准到流畅性约束下最大化效果;
  • 提示工程(Prompting):通过迭代工程化得到的针对性指令 prompt(详见 Appendix B)。

3.4 评价指标

  • 效果指标:毒性减少均值(RoBERTa 毒性分类器 s-nlp/roberta_toxicity_classifier)、目标情感概率增益(DistilRoBERTa 情感分类器 j-hartmann/emotion-english-distilroberta);
  • 质量指标:GPT-2 困惑度 + Rep-3/Rep-4 n-gram 重复率;
  • 补充:Top-3 命中率和定性样例。

3.5 引导幅度校准

下对每个 (模型, 任务) 进行 扫描,选定流畅性约束下的最优工作点:LLaMA 分别为 ;Gemma 分别为 主实验在 STS 与 SBS 上沿用相同 ,以保证不同干预比率间的公平对比。

3.6 与相关工作对比

  • 唯一最相近的同期工作 SIA(Hu et al., 2026)操作于 logit 空间、需要奖励蒸馏的 value model、最佳 选样,且报告 reward-model 评分;本文使用单样本分类器指标,不与之直接对比。作者在 Appendix A 中详细论证了 SIA 的"随机门控表现不如 entropy 门控"这一结论属于机制依赖——SIA 的嘈杂价值估计在低信号位置引入方差,而固定 SAE 方向本身无逐 token 估计噪声,故随机放置不引入等价损失。

四、算力资源

论文未明确说明所用的 GPU 型号、数量和训练时长。考虑到 SAE 是直接使用公开的预训练权重(eleutherai/sae-llama-3.1-8b-32xgemma-scope-2b),且本文方法不需要额外的模型训练,整体计算量集中在推理阶段(生成最多 128 token 续文,温度 0.1),但具体硬件配置论文未披露。

五、实验数量与充分性

5.1 实验组数

  • 2 模型 × 3 任务(毒性、fear、sadness)× 5 干预比率 × 至少 4 方法 = 主实验约 120 个条件点;外加 SBS 两种窗口大小()。
  • 每个 (模型, 任务) 的 扫描曲线(Figures 3、4)覆盖 steering 效果、困惑度、Rep-3、Rep-4 共 4 指标 × 15–20 个 值;
  • Appendix G 提供 Top-3 命中率以补充概率增益度量;
  • Figure 2 提供最优 关于 的曲线;
  • Appendix C 提供定性样例。

5.2 公平性与客观性

  • 在所有方法、所有 下保持一致(仅在 Figure 2 中重新校准),这是主要对照设计的关键;
  • 所有评估由外部独立分类器打分,避免自评偏差;
  • 评估样本量(600 毒性 prompt、1k 情感 prompt)相对数据集规模(100K、58K)适中,主要用于跨方法横向对比,统计显著性可能未充分检验;
  • 测试任务仅 2 类:毒性抑制与两种情感引导,领域覆盖有限,作者明确承认这一局限;
  • 未做人类评估;
  • 解码策略(温度 0.1、长度 128 token)单一,未涵盖 nucleus sampling、beam search 等多样化策略。

六、主要结论与发现

6.1 稀疏足以恢复行为效果

  • LLaMA 3.1-8B: 的 STS 恢复全引导下超过 95% 的毒性减少;fear 与 sadness 在 时恢复全引导 80% 以上的概率增益。
  • 全引导中绝大多数逐 token 干预冗余

6.2 STS 优于 SBS 与提示工程

  • STS 在匹配干预比率下稳定优于 SBS(尤其在情感引导上明显,如 LLaMA-fear: 时 STS 概率增益约为 SBS() 的 2 倍);
  • STS 在低干预比率即超越精心设计的提示 baseline(毒性、fear 上 即可);
  • 残差流累积式整合引导信号,而非依赖特权早位置。

6.3 速率受限规律(Rate-Limited)

  • 最优 下降单调上升:Gemma 由 时的 30 升至 时的 35;LLaMA 由 2.5 升至 5;
  • 该上升亚线性于 ,故有效剂量 减小而下降;
  • 稀疏引导并非"再分配固定扰动预算",而是真正降低所需总信号量
  • 实践启示:降低 时应同步升高

6.4 理论意义

SAE 介导的行为控制本质是"速率受限"的——行为结果由序列累积信号剂量决定,而非由每 token 干预本身决定。

七、优点

1. 极简设计:单一标量 ,无需奖励模型、无需训练门控策略、无需 best-of- 采样,新增开销仅为"每个 token 一次伯努利抽样",延迟可忽略;

2. 跨模型跨任务一致性:在 LLaMA 3.1-8B 与 Gemma-2 2B 两个不同家族、不同尺度的模型上,以及毒性抑制与情感引导两个方向相反的任务上均观察到相同规律(稀疏化可行、STS > SBS > 提示),提升结论可信度;

3. 公平对照 在所有方法与所有 之间锁定,保证方法间差异不是由幅度变化导致;

4. 理论洞察清晰:提出"速率受限"这一统一视角,把稀疏引导效果与信号剂量联系起来,并明确给出剂量 减小而下降的实证证据;

5. 流畅性三重防御:范数保持 + 激活钳制 + 重复惩罚组合,针对主问题(密集干预降流畅性)做了完整补救;

6. 与并发工作的细致区分:Appendix A 详细解释了与 SIA 的方法论差异与为何随机门控结论不冲突,理论推演(SIA 价值估计噪声机制)支持了本文立场;

7. 细致的伦理审视:在论文与附录开头均设置内容警告,附录正文样例排除了身份攻击性词汇。

八、不足与局限

8.1 实验覆盖

  • 仅 2 类任务(毒性抑制、2 种情感引导)× 2 模型,与行为控制的广阔场景(幻觉抑制、persona 强化、多属性联合、对抗鲁棒性等)相比覆盖有限;
  • 未在更大模型或闭源模型上验证;
  • 未进行人类评估,分类器指标可能无法捕捉所有行为维度,且 RoBERTa 毒性分类器对身份相关术语存在已知偏见(Sap et al., 2019; Dixon et al., 2018)。

8.2 方法论继承局限

  • 依赖预训练 SAE 的可用性与词典质量;
  • 依赖对比语料构造的对比集质量;
  • 单层单方向干预,未探索多特征联合或多层协同;
  • 解码策略受限(单一温度 0.1、单一长度 128 token),未测试 nucleus/beam search 交互;
  • 下校准的 时只是"原样延用",Figure 2 才显示重新校准情况下应当提升 ——主实验未采纳这一补偿,因此主实验中稀疏方法的最优 可能是低估的,潜在的稀疏-引导幅度协变效应未被充分利用。

8.3 统计与再现性

  • 实验单元(prompt)数量中等,未见显著性检验;
  • 未报告随机种子数与方差;
  • 未给出 GPU 型号/训练时长,无法评估复现成本。

8.4 双重用途风险

  • 虽然机制需要白盒访问与 SAE,作者仍承认同一技术可被反向利用以放大有害行为;
  • 在对抗性场景下,攻击者若掌握 SAE,理论上的稀疏噪声注入也可能用于绕过对齐检测——这一风险在 Ethics Statement 中未深入讨论。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记