Reasoning & Alignment

推理与对齐

Chain-of-thought, RLHF, sycophancy mitigation, mechanistic interpretability, activation steering. — 思维链、RLHF、阿谀抑制、机制可解释性、激活引导。

4 篇论文 25 个高频概念 维护 · DPR
已纳入 ✨ wiki 📄 PDF

RL后训练算力应投向何处:模型规模、搜索、学习与反馈

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

Wilhelm, Patrick, Kao, Odej

arXiv:2607.13389v1 2026-07-16
0.95 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

rlreasoning
重要图片 · 4 张
TL;DR

系统研究RL后训练中模型规模、搜索、学习与反馈间的算力分配权衡规律。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

大模型的后训练阶段正变得越来越重要。无论是让模型学会复杂推理、解决规划问题,还是在机器人学习中实现反馈驱动的策略优化,强化学习都成了标配工具。但在实际研究中,一个尴尬的现实是:受限的后训练资源往往被简化为一个笼统的「总算力预算」——比如「我们用了 FLOPs」。这个数字看起来直观,实际上却掩盖了一个关键决策问题:在相同的预算下,到底把钱花在哪里最划算?

这个问题之所以长期没有被认真对待,部分原因是 RL 后训练的算力消耗本身就很难拆解。一个训练周期可能涉及策略模型生成大量 [[Rollout|rollout]] 样本、计算奖励信号、执行策略更新——每一环节都消耗算力,而且这些环节之间还存在微妙的权衡:更大的模型每一步更新耗电更多,但表达能力更强;更多的 rollout 能覆盖更多探索空间,但每条轨迹的标注成本也随之上升。

研究者敏锐地捕捉到了这个空白。他们把这个问题形式化为「固定预算决策问题」:在相同的后训练 FLOP 预算下,策略选择涉及四个维度的分配——用多大的策略模型、将较小的模型训练更久、生成更多 rollout 搜索、还是投资更强的奖励反馈。这四个维度并非独立,而是相互耦合:比如选一个更大的模型,就意味着在同等 FLOP 预算下,用于训练迭代或 rollout 生成的份额会相应缩水。

方法

要回答「钱该怎么花」这个问题,首先得搞清楚「钱花在了哪里」。研究者针对 GRPO 后训练提出了一个 FLOP 核算框架,将总算力消耗明确分解为三个核心组成部分:

第一项是 rollout/搜索阶段消耗的算力,即策略模型生成 [[Rollout|rollout]] 样本的开销。第二项是策略更新/学习阶段的算力,对应反向传播和参数更新。这里研究者使用 [[LoRA]] 进行高效适配,因此更新阶段的 FLOPs 主要来自低秩矩阵而非全量参数。第三项是奖励或反馈模型评估的算力——当使用基于规则的手工奖励时这项基本可以忽略,但若采用 [[PRM|过程奖励模型]] 来提供更细粒度的反馈,这部分的消耗就会变得相当可观。

这个分解框架的价值不仅在于提供了统一的计量口径,更重要的是揭示了各部分之间的约束关系。研究者特别强调了模型规模与训练分配之间的耦合效应:较大的策略模型每处理一个 token 需要消耗更多 FLOPs,这意味着在固定的训练预算下,大模型能够购买的更新步数或 rollout 数量会比小模型少得多。直觉上「用大模型」似乎总是更好,但当考虑到同等预算下大模型只能训练更少的迭代时,这个结论就需要打上问号。

基于这个框架,研究者进一步设计了 RACE 诊断流程。RACE 是一种 pilot-grid 式的系统搜索方法,通过在不同分配维度上进行网格采样和消融实验,快速定位当前配置所处的「制度区间」——即算力瓶颈主要卡在哪个环节,从而指导后续应该往哪个方向投入更多资源。

实验与结果

研究团队在多种规模的 [[LoRA]] 适配 Qwen2.5 策略上开展了系统实验,覆盖了从 tiny 到不同参数量的模型规模。实验围绕几个关键维度展开:模型大小与训练时长的权衡、规则奖励与 [[PRM|过程奖励模型]] 的对比、以及不同评估任务的迁移效果。

实验最核心的发现是「条件性分配前沿」现象的存在。在不同的实验设置下,使模型表现最优的算力分配方案差异显著。例如,在某些任务上,较小的模型配合更长时间的训练能够超越较大模型的最终表现——这正是因为大模型的单步算力开销太大,导致在同等预算下无法积累足够的更新步数来发挥潜力。而在另一些任务上,增加 rollout 数量带来的收益则更为明显。

奖励系统的选择同样深刻影响着最优分配策略。当使用基于规则的奖励时,几乎所有非更新算力都被导向策略模型的 rollout 生成,因为这类奖励的计算开销极低。而切换到 [[PRM|过程奖励模型]] 形式的细粒度反馈后,奖励模型自身的推理消耗变得不可忽视:相当一部分预算被分配给了反馈模型的前向传播,而非策略的探索。这说明奖励系统的设计不仅仅是算法选择问题,也是一个算力分配决策。

此外,RACE 流程在实验中展现出了实际价值。通过系统性地探索分配空间,研究者能够提前判断当前瓶颈所在——是策略表达力不足(应该换大模型)、探索样本不够(应该多 rollout)、还是奖励信号不够精细(应该引入 PRM)。这种诊断能力对于资源受限的研究团队尤为重要,可以避免在错误的优化方向上浪费宝贵的算力。

讨论与可借鉴点

这项研究的意义首先在于打破了一个常见的认知误区:总 FLOPs 并不是衡量 RL 后训练资源的充分指标。研究者明确指出,报告总算力的同时必须说明算力在模型规模、搜索、学习和反馈之间的分配比例,否则同行很难判断这个预算是否真正用在了刀刃上。

从方法论角度看,RACE 流程提供了一种务实的工程思路:不追求理论上的最优解,而是通过系统性的诊断快速定位当前配置所处的制度区间。这对于资源有限的团队尤其有价值——与其盲目尝试各种配置,不如先搞清楚自己的瓶颈在哪里,再做针对性的投入。当然研究者也坦诚,RACE 只是诊断工具而非改进保证,找到的分配方案最终仍需在留出集上验证。

研究的局限同样值得关注。实验主要基于 Qwen2.5 和 [[LoRA]] 适配设置,结论在不同模型架构和训练范式下的迁移性还需要进一步验证。此外,RACE 的网格搜索在维度较高时可能面临组合爆炸问题,如何高效地探索高维分配空间仍是开放问题。

对于 RL 后训练研究的实践者,这篇论文的最大启发或许在于:资源规划应该更精细化。在设计实验时,不妨先用 RACE 或类似方法做一次诊断,摸清不同分配方案的边际收益曲线;论文投稿时,也应养成交代算力分配细节的习惯——这不仅有助于同行复现,更能推动整个社区对 RL 后训练算法规律的深入理解。

概念 · 6 个
摘要

RL后训练算力分配研究

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.13389v1
发布日期
2026-07-16
PDF
https://arxiv.org/pdf/2607.13389v1
相关度
0.950
已纳入 ✨ wiki 📄 PDF

带可验证物理的强化学习:用连续奖励对LLM进行后训练

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

Cai, Pengfei, Utkarsh, Utkarsh, Edelman, Alan, Rackauckas, Christopher Vincent, Gomez-Bombarelli, Rafael

arXiv:2607.10474v1 2026-07-14
0.90 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

rlreasoning
重要图片 · 29 张
TL;DR

提出基于物理仿真可验证奖励的LLM强化学习后训练方法,以连续奖励信号提升物理推理能力。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

偏微分方程是科学与工程建模的基石,从流体力学到电磁场、从金融衍生品定价到生物化学反应,PDE 无处不在。然而,构建可靠的数值求解器长期依赖专家知识:需要精心选择离散化格式、满足稳定性条件、设计恰当的边界处理方案。这一过程既耗时又费力,制约了科学计算的效率。

近年来,大型语言模型在代码生成和推理任务上展现出惊人能力,研究者开始尝试将 PDE 求解视为代码生成任务——让 LLM 编写求解器代码来获得数值解。这条路子的主流做法是在推理阶段做文章:通过精心设计的提示、调试、自优化或测试时缩放来提升生成质量。但这些方法都停留在"用好已有模型"层面,没有真正让模型自身去适应 PDE 求解这个特定领域。

与此同时,带可验证奖励的强化学习(RLVR)已成为代码生成和数学推理领域强大的后训练范式。典型做法是:验证器给出二值信号——代码能编译运行就算正确、测试通过就算正确。这种范式在代码修复或形式化证明场景很有效,但应用到科学计算时遇到一个根本性问题:科学正确性天然具有层级结构。两个求解器可能都能正常执行,但在解的精度上可能相差数个数量级。二值验证器把这些差异全部丢弃了,只关心"对不对",而忽视"有多对"。

这正是 RLVP 的切入点:设计一种连续奖励信号,既能处理程序合法性这类离散约束,又能捕捉 PDE 解的质量这类连续指标,让强化学习真正适配科学计算场景。

方法

RLVP 的核心创新在于其混合验证器设计。整体框架可以形式化为:给定一个 PDE 问题和一个 LLM 策略 ,策略生成一段求解器代码 ,验证器计算奖励 ,然后通过策略梯度更新策略。

混合验证器由两个互补的组件构成。第一组件是硬性程序合法性检查(hard program-validity checks),对应二值奖励 :代码必须能通过语法检查、成功编译(或被解释器接受)、并且运行时不出错。这一组件对应 PDE 求解的"可行性"——一个连运行都通不过的求解器毫无意义。

第二组件是连续物理奖励(continuous physics rewards),对应连续奖励 。这一组件才是 RLVP 的精髓所在。论文采用两个维度的物理指标:一是函数空间精度(function-space accuracy),即生成的数值解与参考解(或解析解)在离散范数下的接近程度;二是PDE 残差一致性(PDE-residual consistency),即数值解代入原方程后的残差大小。函数空间精度衡量"解得好不好",残差一致性衡量"是否真正满足方程约束",两者结合能全面刻画求解器质量。

最终奖励为两者的组合:。这里用乘法而非加法,隐含的语义是:物理奖励只在程序有效的前提下才有意义——一个物理上看起来完美但根本无法运行的代码应该得零分。

在训练数据上,RLVP 采用了多样化的 PDE 族进行统一后训练,包括双曲型方程(如交通流模型)、抛物型方程(如热传导方程)、椭圆型方程(如泊松方程和拉普拉斯方程)以及不可压缩流动系统(如纳维-斯托克斯方程的低雷诺数情形)。这种多样化训练的设计意图是让策略学习到可组合的数值原语——格式模板、时间步进策略、边界处理方法——以便在面对新的 PDE 时能灵活重组。

实验与结果

论文在多个维度上验证了 RLVP 的有效性。首先是与基线的对比:在涵盖多种 PDE 族的基准测试上,RLVP 后训练模型同时超越了预训练基线(未经后训练的原始 LLM)和监督微调基线(仅用标准有标签数据训练)。这是一个关键结果,说明强化学习信号确实能捕捉监督数据难以表达的物理约束。

其次是零样本迁移能力:将在部分 PDE 上训练得到的策略,直接应用于完全未见过的 PDE 类型,生成质量仍有显著提升。这说明模型学到的不是针对特定方程的记忆,而是跨 PDE 共享的数值方法知识。

最具说服力的实验是对比"小模型加 RLVP"与"大模型加提示工程"。论文报告,经 RLVP 后训练的较小规模 LLM,在分布内 PDE 求解任务上能够优于直接对前沿模型施加精心设计提示的结果。这一发现具有实际意义:提示工程的上限受限于基础模型能力,而 RLVP 后训练能让小模型通过专项适应来弥补规模差距。

更值得关注的是组合性证据(compositionality)。作者分析了生成代码的结构,发现训练好的策略并非机械地记忆训练集方程的求解器模板,而是将学到的模板、时间步进格式和边界处理原语打散重组,用于生成新 PDE 的求解器。例如,一个在 1D 对流方程上训练的策略,可能将其中学到的迎风格式和 Neumann 边界处理迁移到 2D 不可压缩流的生成代码中。这种组合能力是 RLVP 学到抽象数值知识而非过拟合训练集的直接体现。

讨论与可借鉴点

RLVP 展示了两个重要的方法论启示。第一,连续奖励信号在科学计算场景的重要性。二值验证器在代码修复这类"对/错"分明的任务上很有效,但科学推理的精髓在于精度——同样的方程、相似的代码,数值误差可能相差几个数量级。连续物理奖励能够保留这种精度差异,让策略有更细粒度的学习信号。

第二,跨问题族的统一后训练策略。与其分别为每种 PDE 类型训练专用模型,不如在多样化的 PDE 族上联合训练。多样化的训练数据促使模型学习到可迁移的数值原语,而非针对单一方程的特化记忆。

当前 RLVP 仍存在局限。首先,连续物理奖励的计算依赖参考解或解析解,对于没有ground truth的复杂实际问题,奖励信号本身可能难以获取。其次,论文聚焦于相对规范的 PDE 族,真实科学计算中的病态条件、非结构网格、自适应算法等场景尚未覆盖。再次,组合性证据目前还是观察性的,缺乏系统性的定量刻画。

这些局限也指向了未来研究方向:如何为无参考解的场景设计合适的奖励塑造(reward shaping)策略;如何处理更复杂的工程 PDE 系统;以及如何从机制上理解和促进模型对数值方法知识的组合泛化。RLVP 开辟了一条将强化学习真正适配科学计算场景的道路,其核心思路——连续奖励 + 多样化训练——值得在更广泛的科学 AI 后训练任务中借鉴。

概念 · 6 个
摘要

物理可验证连续奖励RL后训练

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.10474v1
发布日期
2026-07-14
PDF
https://arxiv.org/pdf/2607.10474v1
相关度
0.900
已纳入 ✨ wiki 📄 PDF

路由、通信与推理:用于高效多智能体推理的门控路由与自适应深度

Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

Sudipto Ghosh, Tanmoy Chakraborty

arXiv:2607.10836v1 2026-07-14
0.90 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

agentreasoningmoemethod-paper
重要图片 · 1 张
TL;DR

论文针对多智能体推理中智能体选择、层级深度和通信开销不确定的问题,提出 GRADE 层级多智能体系统,通过四个可学习门联合控制路由、深度、通信和剪枝。采用无评论家的 CoGRPO 训练方法,将 GRPO 适配到多智能体层级并共享优势信号。配合可热插拔的专家注册表和逐智能体校准映射。在约 170 亿活跃参数下,在 GSM8K、MMLUPro 和 GPQA 上超越所有基线,并在 AIME-2025 上保持竞争力。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

大语言模型在复杂推理任务中常常需要消耗大量计算资源,而单次调用的模式难以充分利用模型的专业化能力。多智能体集成作为一种有潜力的方案,让不同专业能力的智能体协同处理查询,却引入了一个深层矛盾:活跃参数数量和推理成本随智能体规模快速增长,而系统并未真正回答三个根本问题——应该咨询哪些智能体、查询需要在层级结构中深入到何种程度、以及智能体间的通信何时才值得付出其开销。

在 GRADE 之前,已有研究尝试用固定的路由策略或完全可学习的路由机制来选择智能体,但这些方案往往忽略了一个关键事实:不同查询的复杂度差异巨大,简单问题可能只需一两个智能体协作即可解决,而复杂问题则需要更深的层级和更充分的通信。固定的深度策略要么造成资源浪费,要么导致推理不足。此外,智能体间的无限制通信会带来平方级的注意力复杂度增长,如何在经济性和有效性之间取得平衡始终是一个悬而未决的难题。

这篇论文的切入点正是将这三个问题统一到一个联合学习的框架中:既然路由、深度、通信和剪枝本质上都是在决定「多少计算量是必要的」,那么用一个端到端可训练的系统来同时学习这些决策,比分别设计独立模块更加自然。

方法

GRADE 的核心设计围绕四个可学习门的协同工作展开。第一个门负责智能体选择,根据当前查询的表示决定激活哪些专家智能体参与推理;第二个门控制层级深度,学习在什么时机停止向下传递查询——这对应着「这个问题当前的智能体层级已经能够充分回答」这一判断;第三个门管理通信策略,决定在哪些层之间建立信息通道,使得需要跨领域知识的查询能够获得有效聚合;第四个门执行分支剪枝,在树状推理过程中丢弃那些看起来不太有希望的后继分支以节省计算。

这四个门的输出并非相互独立,它们被设计为联合优化——选择更多智能体可能意味着更深的层级更有价值,而通信策略的改变又会影响有效深度。这种耦合关系通过共享的特征表示来建模,使得每个门的决策都能考虑到其他门的状态。

训练方法 CoGRPO 是将 [[GRPO]](分组相对策略优化)适配到多智能体层级的关键创新。传统 [[强化学习]] 在多智能体场景下面临的优势估计难题——如何为参与一次完整推理的所有组件分配信用——在这里被巧妙地简化为共享优势信号的设计。具体而言,一次完整的推理被视为一个整体单元,根据最终答案的正确性计算一个优势值,然后这个优势值被无差别地传播给参与该次推理的每个门和每个智能体。这种「共同进退」的信号设计鼓励了门决策之间的协调:当某个门选择了特定动作而最终获得高奖励时,所有参与同一推理的门都会受到正向激励,反之亦然。

CoGRPO 的「无评论家」特性体现在它不需要单独训练一个价值网络来估计中间状态的优势函数。论文认为,在多智能体推理的尺度下,中间状态的优势估计既困难又不稳定,而直接使用最终奖励的相对比较(在 GRPO 中体现为组内基线)已经足够驱动学习。这种设计降低了训练复杂度,同时通过组内相对比较提供了稳定的优势归一化。

专家注册表机制解决了实际部署中的一个痛点:如何在不重新训练的情况下更新底座模型。论文为每个专家智能体维护一组校准映射参数,这些参数在模型替换时进行调整,使得新模型能够继承原有路由策略的行为,而无需重新执行完整的训练流程。

实验与结果

实验在三个不同难度级别的基准上评估:GSM8K 代表小学数学推理能力,MMLUPro 作为大规模多学科选择题挑战,GPQA 则聚焦于研究生水平的专业知识问答。此外还引入了 AIME-2025 来检验模型在竞赛数学上的深度推理能力。

基线方法涵盖了从单智能体到多智能体路由的多种方案,包括固定专家池选择、基于分数的路由、以及完全可学习的路由策略。GRADE 在 GSM8K、MMLUPro 和 GPQA 上均取得了最优表现,特别是在 MMLUPro 上,以约 170 亿活跃参数(相当于完整模型的一半)的计算量,超越了最强基线 4.8 分。这一结果清晰地表明,层级结构和动态深度控制能够在显著降低计算开销的同时提升准确率。

AIME-2025 的结果呈现出不同的图景:GRADE 虽然保持竞争力,但并未取得显著优势。论文将此归因于竞赛数学问题的特殊性质——这类问题往往需要单次深入的推理链条而非多智能体的协作,模型深度在这里比智能体组合的广度更为关键。这一发现提醒我们,多智能体架构并非万能解药,其适用性取决于任务本身的结构特征。

消融实验揭示了层级结构本身的重要性。当移除层级设计退化为扁平的多智能体系统时,准确率出现明显下降,这验证了分层的必要性。掩码交叉注意力——即限制某些层之间的信息流通以避免过度聚合——同样贡献显著,表明适度的信息隔离有助于保留各智能体的专业化能力。逐智能体校准映射的消融则证实了其在热插拔场景中的不可替代性:没有校准的模型替换会导致路由策略的严重偏移,而经过校准的替换则能维持稳定的性能。

讨论与可借鉴点

GRADE 最有价值的贡献或许不在于具体的技术细节,而在于它提出的问题框架:将多智能体推理视为一个「计算量分配」问题,用端到端的可学习系统来联合决定路由、深度、通信和剪枝。这种视角将原本分散的设计决策统一起来,为后续研究提供了新的出发点。

论文的局限性主要体现在两个方面。其一,在 AIME-2025 等需要深度单链推理的任务上表现平平,说明当前的层级设计可能更适合「广度优先」类型的查询;其二,CoGRPO 的共享优势信号虽然简化了训练,但可能无法充分捕捉每个智能体和门的独立贡献——当某个智能体选错了专家但最终答案碰巧正确时,正向奖励会被错误地强化其选择。

对于该领域的研究者而言,GRADE 的几个设计选择值得借鉴:四门联合学习的框架提供了一种可扩展的思路,可以根据具体场景增减门的数量;无评论家的 CoGRPO 为多智能体场景下的强化学习训练提供了一个简洁有效的baseline;而专家注册表配合校准映射的设计,则为实际部署中的模型更新提供了一条实用的路径。

概念 · 6 个
摘要

提出多智能体层级系统的门控路由与自适应深度机制,并基于 GRPO 改进的强化学习方法进行训练。

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.10836v1
发布日期
2026-07-14
PDF
https://arxiv.org/pdf/2607.10836v1
相关度
0.900
已纳入 ✨ wiki 📄 PDF

SPARK:大语言模型潜在推理状态的敏感性引导剖析与控制

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

Zhang, Dongxu, Sun, Yiding, Guo, Zihao, Yang, Xiangyang, Tang, Kai, Chen, Lin, Tan, Cheng, Zhu, Jihua

arXiv:2607.10296v1 2026-07-14
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

reasoning
重要图片 · 7 张
TL;DR

SPARK通过敏感性引导剖析LLM推理过程中的潜在状态,并对其进行方向性操控以引导推理行为。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

大语言模型在复杂推理任务上表现出的失败,长期以来只能通过最终答案的对错来评判。这种输出层面的评估固然能告诉我们模型「做错了」,却无法回答「为什么做错」。一个看似相同的错误答案背后,可能对应着截然不同的内部原因:模型可能确实缺乏解决该问题所需的知识与能力,也可能具备潜在的能力但推理轨迹不稳定导致最终输出崩塌,还有可能模型内部其实已经进入了有效的推理状态,却在最后一步或某个中间环节出现偏差。

这种诊断能力的缺失,限制了干预手段的精准性。现有的提示工程方法(如 Chain-of-Thought 引导、Few-shot 示例)作用于输出层面,试图通过改变输入格式来「教会」模型如何思考,但无法区分模型是否真正需要这种引导。基于基准的评估方法同样停留在最终指标层面,无法揭示模型在推理过程中哪个阶段出了问题。

[[激活引导(Activation Steering)]] 是近年来兴起的一种干预范式,其核心思想是在模型前向传播过程中,对特定层的隐状态施加方向性偏移,从而引导模型的生成行为。这种方法的优势在于不需要修改模型权重,可以在测试时灵活部署。然而,通用激活引导方法通常施加全局统一的方向——换言之,它们对所有样本一视同仁地施加同样的干预,忽视了不同样本的内部状态可能存在巨大差异这一事实。某些样本可能已经处于良好的推理状态,外加干预反而画蛇添足;另一些样本可能需要较强的干预才能激活潜在能力;还有些样本可能根本不具备所需能力,任何干预都无济于事。

正是这种样本间异质性的存在,促使研究者思考:能否利用隐状态本身的响应特性,来诊断每个样本是否真正需要干预,以及需要何种程度的干预?

方法

SPARK 的核心洞察建立在一个看似简单却至关重要的观察之上:原始的隐状态敏感性受到提示长度的强烈干扰。在程序式推理和算法推理任务中,更困难的实例往往对应着更长的序列化输入——这是因为复杂问题通常需要更详细的描述、更长的条件链条或更多的中间步骤。当我们直接测量隐状态对输入的敏感性时,这种敏感性会同时反映两方面的贡献:一是输入本身规模扩大带来的效应,二是模型为应对困难问题而额外激活的推理机制。

这两种贡献的混淆严重影响了我们对真实推理状态的判断。SPARK 采用了「长度受控的敏感性」来解决这一问题。其基本思路是:将每个样本与一个「长度配对」的对照组进行对比,对照组使用相同长度的输入但内容无关或问题不同,从而将输入尺度效应从残差推理激活中分离出来。用数学语言描述,敏感性可以分解为:

其中 表示输入长度, 表示推理相关特征。通过配对比较,SPARK 能够更准确地识别哪些样本真正进入了有效的推理状态,哪些样本的隐状态响应仅仅反映了输入规模的增长。

在此基础上,SPARK 进一步引入了跨层协同(Cross-layer Coordination) 信号。深度神经网络中,不同层的隐状态承担着不同的功能:浅层倾向于捕捉表层的词汇和语法信息,深层则更多地编码语义和推理相关的高层特征。SPARK 通过分析多层隐状态的协同响应模式,来判断模型是否在多个层次上形成了一致的推理状态。当浅层和深层的响应模式相互协调时,通常意味着模型正在进行连贯的推理活动;而各层响应分散、不一致时,则可能表明推理过程尚未稳定建立。

综合这两个维度的信息,SPARK 构建了一个两阶段的样本选择策略。首先,它在大量样本上计算长度受控的敏感性和跨层协同指标,识别出「推理激活锚点样本」——这些样本的隐状态响应模式清晰、稳定,代表着模型能够正确推理的典型路径。其次,它找出「激活不足的困难样本」——这些样本虽然输入困难,但隐状态响应模式混乱或微弱,表明模型可能具备潜在能力但未能有效激活。

最终,SPARK 的测试时引导(Steering)机制专注于对激活不足的困难样本施加干预。引导的方向由推理激活锚点样本的隐状态模式决定:通过插值或方向偏移,将锚点样本的「良好推理状态」传递给激活不足的样本。这种针对性干预相比全局引导更加高效,因为它避免了对外加干预反应已经良好的样本施加冗余操作。

实验与结果

研究团队构建了 FRONTIER-4.5K 作为受控的程序式推理评测套件,专门用于潜在状态剖析和难度感知分析。该套件的特点是问题复杂度与输入长度之间具有良好的对应关系,便于验证长度受控敏感性方法的有效性。在 GSM8K(小学数学应用题)和 MATH-500(高中数学竞赛题)上,研究者采用仅前向的基准剖析方式对 SPARK-Steering 进行评估,即在不执行反向传播的情况下,仅通过隐状态分析来指导干预。

实验在 Qwen3 系列模型上进行,结果显示出 SPARK 的一致性提升效果。在 MATH-500 上,Qwen3-4B 的准确率从 82.0% 提升至 84.6%(相对提升约 3.2%),Qwen3-8B 的准确率从 82.4% 提升至 85.6%(相对提升约 3.9%)。这些提升在数学推理这种高难度、推理链较长的任务上是相当显著的。研究者还发现,经过 SPARK 诊断后筛选出的「需要干预样本」仅占测试集的一部分(约 40%-60%),而对这些样本施加针对性引导就足以带来整体准确率的提升,印证了样本异质性假设的合理性。

消融实验进一步验证了各组件的贡献。移除长度受控机制后,敏感性信号与输入长度的相关性显著增强,但与最终推理正确性的对应关系反而下降,说明不加控制的长度干扰确实会掩盖真正的推理相关信号。移除跨层协同指标后,锚点样本的选择准确性下降,引导效果也随之削弱。此外,研究者还发现不同模型层级对引导的响应程度存在差异:深层隐状态的敏感性通常更高,但过度干预深层可能导致语义偏移;浅层的轻微调整则可能在保持语义完整性的同时优化推理路径。

讨论与可借鉴点

SPARK 的方法揭示了一个重要的观察:模型的推理失败并非铁板一块,其背后可能对应着能力缺失、推理轨迹不稳定或激活不足等截然不同的原因。传统的评估方法将这些异质性原因压缩为单一的「对/错」标签,而 SPARK 通过隐状态敏感性分析提供了一种诊断工具,能够在事前识别哪些样本真正需要干预、干预的强度应当如何设定。

这一思路对于 [[测试时扩展(Test-time Scaling)]] 研究具有直接的启发意义。当前许多关于测试时计算扩展的工作(如让模型在推理时进行更多思考、多次采样后选择等)假设更多的计算资源能够帮助所有样本,但 SPARK 的结果表明这种假设可能过于乐观。更合理的策略可能是差异化分配测试时资源:对于已经处于良好推理状态的样本,简单的前向传播可能就足够;对于激活不足的样本,则需要更多的引导或计算投入。

SPARK 的局限同样值得关注。首先,其依赖的敏感性分析需要访问模型的中间隐状态,这在某些部署场景中可能不可行。其次,长度受控机制本身假设存在合适的「长度配对」样本,当测试集的多样性不足时可能难以找到理想的对照组。第三,跨层协同的度量方式相对启发式,更系统化的层间关系建模可能带来进一步提升。最后,SPARK 目前专注于程序式和算法式推理,对于开放式生成、对话等任务类型,其敏感性分析框架是否同样适用尚待验证。

总的来看,SPARK 的核心贡献不在于提出了又一个「准确率提升 X%」的技巧,而在于提供了一种诊断视角——将推理失败从输出层的标签转化为内部状态的信号。这种从「评估」到「诊断」的范式转换,可能为后续的大模型优化和干预研究开辟新的方向。

概念 · 7 个
摘要

潜状态敏感性分析与控制

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.10296v1
发布日期
2026-07-14
PDF
https://arxiv.org/pdf/2607.10296v1
相关度
0.850

图谱基于本库论文之间的相似度关系(由 DPR paper-relations 模块 Jaccard / TFIDF / hybrid 算法计算,无 LLM)。

论文(按相关度上色) 概念(节点之间为共同概念边)

每日简报占位

DPR 是静态站点,没有 Polaris 那种后端定时任务。启用 GitHub Actions 工作流后,简报会出现在这里。

当前可用的 Polaris 提示词版本:

  • library-digest:2026-08-02 — 逐篇看点(PAPER_INSIGHTS)
  • library-digest:2026-08-02 — 简报主编(DIGEST_SYNTHESIS)
  • library-digest:2026-08-02 — 滚动趋势(TREND)

详见 迁移文档config/prompts/library-digest/2026-08-02/

文献对话(占位)

本面板将基于 library-chat:2026-08-02 提示词,接管自 paper-chat 的浮窗能力,支持库级上下文 + 跨论文 RAG 引用。

阶段 4 启用后将接流式 LLM,引用规约 [n]、概念双链 [[概念名]]、图片 ![[fig:N]]

文献库基础信息

库名 (English)
Reasoning & Alignment
库名 (中文)
推理与对齐
研究方向陈述
Chain-of-thought, RLHF, sycophancy mitigation, mechanistic interpretability, activation steering.
研究方向陈述(中文)
思维链、RLHF、阿谀抑制、机制可解释性、激活引导。
维护者
DPR
卡片色调
amber
入库方式
公共库(从 docs/papers/** frontmatter 派生,无写路径)

本月 LLM 用量

已用 tokens
加载中...
预算设置
剩余
-

建库与同步

公共库数据来自 docs/papers/ frontmatter,在 pipeline 跑批时重建。本 Tab 只控制个人库。

个人库同步(若已配置 Gist token):

同步底层由 astro-src/lib/user-libraries/gist.ts 处理(零信任 R/W 合并,见 8f2a 提交)。

正在检测重复...