arXiv 2607.10296v1 · 发布 2026-07-14

SPARK:大语言模型潜在推理状态的敏感性引导剖析与控制

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

AUTHORS Zhang, Dongxu, Sun, Yiding, Guo, Zihao, Yang, Xiangyang, Tang, Kai, Chen, Lin, Tan, Cheng, Zhu, Jihua
EVIDENCE 潜状态敏感性分析与控制
SCORE 0.8
CATEGORIES TASK reasoning
GENERATED 2026-07-20 02:29:20 UTC

📝 TLDR

SPARK通过敏感性引导剖析LLM推理过程中的潜在状态,并对其进行方向性操控以引导推理行为。

🧭 速览

动机

现有推理评估仅看最终输出,无法区分能力缺失、轨迹不稳定或潜在状态未激活;通用激活引导缺乏针对性诊断。

方法

SPARK 用长度受控的隐状态敏感性剥离输入长度干扰,结合跨层协同定位推理活跃锚点与未充分激活样本,施加测试时轻量引导。

结果

构建 FRONTIER-4.5K 程序化推理评测套件,在 Qwen3 系列上一致提升性能,MATH-500 上准确率明显上升。

结论

把潜在推理诊断信号转化为针对性测试时干预,为冻结模型可解释能力挖掘提供新机制。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

SPARK 提出通过分析大语言模型内部隐状态的敏感性来诊断推理失败的根本原因——区分模型是真正缺乏能力,还是没有激活已具备的推理状态。其核心方法是「长度受控的敏感性」,将输入规模效应与残差推理激活分离开来,结合跨层协同信号定位需要干预的样本,从而在测试时对激活不足的困难样本进行针对性方向引导。在 Qwen3-4B 和 Qwen3-8B 上,SPARK-Steering 将 MATH-500 准确率分别从 82.0% 提升至 84.6%、从 82.4% 提升至 85.6%。

研究背景与动机

大语言模型在复杂推理任务上表现出的失败,长期以来只能通过最终答案的对错来评判。这种输出层面的评估固然能告诉我们模型「做错了」,却无法回答「为什么做错」。一个看似相同的错误答案背后,可能对应着截然不同的内部原因:模型可能确实缺乏解决该问题所需的知识与能力,也可能具备潜在的能力但推理轨迹不稳定导致最终输出崩塌,还有可能模型内部其实已经进入了有效的推理状态,却在最后一步或某个中间环节出现偏差。

这种诊断能力的缺失,限制了干预手段的精准性。现有的提示工程方法(如 Chain-of-Thought 引导、Few-shot 示例)作用于输出层面,试图通过改变输入格式来「教会」模型如何思考,但无法区分模型是否真正需要这种引导。基于基准的评估方法同样停留在最终指标层面,无法揭示模型在推理过程中哪个阶段出了问题。

[[激活引导(Activation Steering)]] 是近年来兴起的一种干预范式,其核心思想是在模型前向传播过程中,对特定层的隐状态施加方向性偏移,从而引导模型的生成行为。这种方法的优势在于不需要修改模型权重,可以在测试时灵活部署。然而,通用激活引导方法通常施加全局统一的方向——换言之,它们对所有样本一视同仁地施加同样的干预,忽视了不同样本的内部状态可能存在巨大差异这一事实。某些样本可能已经处于良好的推理状态,外加干预反而画蛇添足;另一些样本可能需要较强的干预才能激活潜在能力;还有些样本可能根本不具备所需能力,任何干预都无济于事。

正是这种样本间异质性的存在,促使研究者思考:能否利用隐状态本身的响应特性,来诊断每个样本是否真正需要干预,以及需要何种程度的干预?

方法

SPARK 的核心洞察建立在一个看似简单却至关重要的观察之上:原始的隐状态敏感性受到提示长度的强烈干扰。在程序式推理和算法推理任务中,更困难的实例往往对应着更长的序列化输入——这是因为复杂问题通常需要更详细的描述、更长的条件链条或更多的中间步骤。当我们直接测量隐状态对输入的敏感性时,这种敏感性会同时反映两方面的贡献:一是输入本身规模扩大带来的效应,二是模型为应对困难问题而额外激活的推理机制。

这两种贡献的混淆严重影响了我们对真实推理状态的判断。SPARK 采用了「长度受控的敏感性」来解决这一问题。其基本思路是:将每个样本与一个「长度配对」的对照组进行对比,对照组使用相同长度的输入但内容无关或问题不同,从而将输入尺度效应从残差推理激活中分离出来。用数学语言描述,敏感性可以分解为:

其中 表示输入长度, 表示推理相关特征。通过配对比较,SPARK 能够更准确地识别哪些样本真正进入了有效的推理状态,哪些样本的隐状态响应仅仅反映了输入规模的增长。

在此基础上,SPARK 进一步引入了跨层协同(Cross-layer Coordination) 信号。深度神经网络中,不同层的隐状态承担着不同的功能:浅层倾向于捕捉表层的词汇和语法信息,深层则更多地编码语义和推理相关的高层特征。SPARK 通过分析多层隐状态的协同响应模式,来判断模型是否在多个层次上形成了一致的推理状态。当浅层和深层的响应模式相互协调时,通常意味着模型正在进行连贯的推理活动;而各层响应分散、不一致时,则可能表明推理过程尚未稳定建立。

综合这两个维度的信息,SPARK 构建了一个两阶段的样本选择策略。首先,它在大量样本上计算长度受控的敏感性和跨层协同指标,识别出「推理激活锚点样本」——这些样本的隐状态响应模式清晰、稳定,代表着模型能够正确推理的典型路径。其次,它找出「激活不足的困难样本」——这些样本虽然输入困难,但隐状态响应模式混乱或微弱,表明模型可能具备潜在能力但未能有效激活。

最终,SPARK 的测试时引导(Steering)机制专注于对激活不足的困难样本施加干预。引导的方向由推理激活锚点样本的隐状态模式决定:通过插值或方向偏移,将锚点样本的「良好推理状态」传递给激活不足的样本。这种针对性干预相比全局引导更加高效,因为它避免了对外加干预反应已经良好的样本施加冗余操作。

实验与结果

研究团队构建了 FRONTIER-4.5K 作为受控的程序式推理评测套件,专门用于潜在状态剖析和难度感知分析。该套件的特点是问题复杂度与输入长度之间具有良好的对应关系,便于验证长度受控敏感性方法的有效性。在 GSM8K(小学数学应用题)和 MATH-500(高中数学竞赛题)上,研究者采用仅前向的基准剖析方式对 SPARK-Steering 进行评估,即在不执行反向传播的情况下,仅通过隐状态分析来指导干预。

实验在 Qwen3 系列模型上进行,结果显示出 SPARK 的一致性提升效果。在 MATH-500 上,Qwen3-4B 的准确率从 82.0% 提升至 84.6%(相对提升约 3.2%),Qwen3-8B 的准确率从 82.4% 提升至 85.6%(相对提升约 3.9%)。这些提升在数学推理这种高难度、推理链较长的任务上是相当显著的。研究者还发现,经过 SPARK 诊断后筛选出的「需要干预样本」仅占测试集的一部分(约 40%-60%),而对这些样本施加针对性引导就足以带来整体准确率的提升,印证了样本异质性假设的合理性。

消融实验进一步验证了各组件的贡献。移除长度受控机制后,敏感性信号与输入长度的相关性显著增强,但与最终推理正确性的对应关系反而下降,说明不加控制的长度干扰确实会掩盖真正的推理相关信号。移除跨层协同指标后,锚点样本的选择准确性下降,引导效果也随之削弱。此外,研究者还发现不同模型层级对引导的响应程度存在差异:深层隐状态的敏感性通常更高,但过度干预深层可能导致语义偏移;浅层的轻微调整则可能在保持语义完整性的同时优化推理路径。

讨论与可借鉴点

SPARK 的方法揭示了一个重要的观察:模型的推理失败并非铁板一块,其背后可能对应着能力缺失、推理轨迹不稳定或激活不足等截然不同的原因。传统的评估方法将这些异质性原因压缩为单一的「对/错」标签,而 SPARK 通过隐状态敏感性分析提供了一种诊断工具,能够在事前识别哪些样本真正需要干预、干预的强度应当如何设定。

这一思路对于 [[测试时扩展(Test-time Scaling)]] 研究具有直接的启发意义。当前许多关于测试时计算扩展的工作(如让模型在推理时进行更多思考、多次采样后选择等)假设更多的计算资源能够帮助所有样本,但 SPARK 的结果表明这种假设可能过于乐观。更合理的策略可能是差异化分配测试时资源:对于已经处于良好推理状态的样本,简单的前向传播可能就足够;对于激活不足的样本,则需要更多的引导或计算投入。

SPARK 的局限同样值得关注。首先,其依赖的敏感性分析需要访问模型的中间隐状态,这在某些部署场景中可能不可行。其次,长度受控机制本身假设存在合适的「长度配对」样本,当测试集的多样性不足时可能难以找到理想的对照组。第三,跨层协同的度量方式相对启发式,更系统化的层间关系建模可能带来进一步提升。最后,SPARK 目前专注于程序式和算法式推理,对于开放式生成、对话等任务类型,其敏感性分析框架是否同样适用尚待验证。

总的来看,SPARK 的核心贡献不在于提出了又一个「准确率提升 X%」的技巧,而在于提供了一种诊断视角——将推理失败从输出层的标签转化为内部状态的信号。这种从「评估」到「诊断」的范式转换,可能为后续的大模型优化和干预研究开辟新的方向。

摘要

大语言模型(LLM)的推理失败通常通过最终答案来评估,但一个错误的答案并不能揭示模型失败的原因。同一错误输出可能反映出能力的缺失、不稳定的推理轨迹,或未能激活在已冻结模型中本已具备的推理状态。现有的提示工程和基于基准的评估方法大多作用于输出层面,而通用的激活引导(activation-steering)方法则通常施加全局方向,并不诊断哪些样本真正需要干预。本文提出 SPARK,利用隐状态响应来诊断模型是否在内部进入有效的推理状态,并据此指导轻量级的测试时引导。一个关键观察是:原始的隐状态敏感性受到提示长度的强烈干扰,在程序式和算法式推理中尤为明显,因为更难的序列化实例天然会更长。因此,SPARK 使用长度受控的敏感性,将输入尺度效应与残差推理激活分离开来,并将该信号与跨层协同(cross-layer coordination)相结合,从而挑选出推理激活的锚点样本以及激活不足的困难样本。我们使用 FRONTIER-4.5K 作为受控的程序式推理套件,用于潜在状态剖析与难度感知分析,并在 GSM8K 和 MATH-500 上采用仅前向的基准剖析方式对 SPARK-Steering 进行评估。我们的方法在 Qwen3 系列模型上取得了一致的提升:在 MATH-500 上,Qwen3-4B 的准确率从 82.0% 提升至 84.6%,Qwen3-8B 的准确率从 82.4% 提升至 85.6%。这些结果表明,敏感性不仅能够作为诊断推理失败的信号,也能作为针对性测试时干预的实用指南。

Abstract

Reasoning failures in large language models (LLMs) are usually evaluated from final answers, but a wrong answer does not reveal why the model failed. The same incorrect output may reflect missing capability, an unstable reasoning trajectory, or a failure to activate a reasoning state that is already available in the frozen model. Existing prompting and benchmark-based evaluation methods mostly operate at the output level, while generic activation-steering methods typically apply global directions without diagnosing which examples require intervention. In this paper, we introduce SPARK, which uses hidden-state response to diagnose whether a model internally enters an effective reasoning state and to guide lightweight test-time steering. The key observation is that raw hidden-state susceptibility is strongly confounded by prompt length, especially in programmatic and algorithmic reasoning where harder serialized instances naturally become longer. SPARK therefore uses length-controlled susceptibility to separate input-scale effects from residual reasoning activation, and combines this signal with cross-layer coordination to select reasoning-active anchors and under-activated hard examples. We use FRONTIER-4.5K as a controlled programmatic reasoning suite for latent profiling and difficulty-aware analysis, and evaluate SPARK-Steering on GSM8K and MATH-500 with forward-only benchmark profiling. Our method improves Qwen3 series models consistently; on MATH-500, accuracy rises from 82.0% to 84.6% for Qwen3-4B and from 82.4% to 85.6% for Qwen3-8B. These results suggest that susceptibility can serve not only as a diagnostic signal for reasoning failures, but also as a practical guide for targeted test-time intervention.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记