面向免标注大语言模型自蒸馏的神经元感知数据选择
Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation
📝 TLDR
针对无人工标注场景下大语言模型后训练难题,现有自演化方法存在域外性能退化或校准误差膨胀等缺陷。本文提出Neuron-OPSD框架,利用模型内部神经元激活指导训练数据选择与教师上下文构建,并通过在策略蒸馏完成训练,全程无需真实标签。在专业领域基准上同时提升域内任务性能并保持跨域泛化能力,缓解校准崩溃,适用于在线交互与外部监督成本高昂的应用场景。
🧭 速览
无人工标注场景下LLM后训练困难,现有自演化方法存在域外性能退化或校准误差膨胀等问题。
利用神经元激活指导数据选择与教师上下文构建,通过在策略自蒸馏训练模型,全程无需真实标签。
在专业领域基准上提升域内性能,同时保持跨域泛化能力并缓解校准崩溃,优于现有无标注基线。
为在线交互或外部监督昂贵场景提供数据中心无标注自蒸馏方案,区别于依赖奖励标签的离线RL。
📊 论文图表(共 3 张)
展开查看 3 张图
TL;DR
大语言模型在缺乏人工标注的专业领域进行后训练时,现有免标注自演化方法要么导致域外性能退化,要么引发校准误差膨胀。Neuron-OPSD 框架另辟蹊径,通过分析模型内部神经元激活模式来筛选训练样本并构建教师上下文,在 SciKnowEval、Edu-Feedback 等专业领域基准上实现了显著的域内性能提升,同时保持了稳健的跨域泛化能力,并有效缓解了校准崩溃问题。
研究背景与动机
在医疗、法律、教育等专业领域部署大语言模型时,往往面临一个根本性的困境:这些领域需要专家知识进行标注,但专家标注成本高昂且难以大规模获取。然而,完全放弃监督信号又会使得模型难以适应特定领域的复杂推理需求。近年来,免标注自演化方法试图解决这一问题——它们让模型利用自身生成的内容作为监督信号,通过额外上下文构建“教师”模型,并用多数投票等方式聚合多次采样的预测结果来生成伪标签。
这些方法听起来很合理,但在实践中暴露出明显的缺陷。基于监督微调的方法容易导致灾难性遗忘,使模型在训练数据覆盖不到的领域表现急剧下降;而基于在线策略强化学习的方法则倾向于放大模型的校准误差,使模型变得过度自信但判断并不可靠。深入分析会发现,这些问题的根源在于两个被忽视的核心问题:应该选择哪些无标签样本用于训练,以及如何构建能够真正教会学生模型新知识的教师上下文。盲目地用模型自身的输出进行蒸馏,实际上是在强化已有的错误校准、虚假推理和幻觉模式。
Neuron-OPSD 的核心洞察是:模型处理不同样本时的内部激活模式蕴含着丰富的信息。当模型对一个样本的处理路径高度一致时,激活的神经元集合较小且集中,这通常意味着模型对该样本有较高的处理确定性;反之,当模型需要“猜测”或调用大量分散的神经元时,激活模式往往与幻觉高度相关。这种内部激活模式就像是模型思考过程的“指纹”,可以用来指导数据选择和教学内容的构建。
方法
Neuron-OPSD 采用完全免标注的在线策略自蒸馏框架,其核心思路是利用神经元激活模式同时解决数据选择和教师上下文构建两个问题。整个框架分为四个关键阶段。
在神经元激活提取阶段,框架对模型的每一层计算门控激活值。具体地,对于第 层的 MLP 输入 和上投影矩阵 ,门控激活被计算为 。随后,对每个生成的 token ,按其在反嵌入空间的投影进行打分:。每个 token 取跨所有层的 Top-K 激活神经元,整个响应的激活集取所有 token 的并集,得到样本 的稀疏激活集 。
基于这些激活集,框架定义了 Neuron Consensus(神经元一致性)用于样本选择。一致性得分 越小,表示网络对该样本的处理路径越集中、越可能正确;一致性得分越大,则表示激活模式弥散,与错误推理或幻觉相关。实验发现,在四个科学领域上,这一激活计数与零样本准确率呈显著负相关(Pearson 在 到 ),验证了激活模式作为质量信号的有效性。
对于教师上下文的构建,框架采用 Neuron Overlap(神经元重叠)策略,使用 Jaccard 距离衡量两个样本激活模式的相似度:
对每个查询样本,通过这一距离度量选取其 K 个最近邻作为 few-shot 演示集 。这种基于内部激活相似度的检索方法比传统的语义相似度或随机检索更能捕捉模型处理问题时的“思维模式”,从而构建出更有教学价值的上下文。
训练阶段采用在线策略自蒸馏,学生策略为零样本策略 ,教师策略为带上下文 的 EMA 教师 。通过最小化反向 KL 散度进行优化:
反向 KL 的选择至关重要——它强制学生的分布向教师分布集中,同时允许学生在教师分布为低概率的区域保持一定的概率质量,这有效避免了分布崩溃。教师参数通过指数移动平均更新(EMA,),确保训练稳定性。
实验与结果
实验在三个专业领域基准上进行:涵盖生物、材料、物理、化学四个学科的 SciKnowEval,用于教育反馈质量分类的 Edu-Feedback,以及更具挑战性的多领域多选题基准 MMLU-Pro。基础模型采用 Qwen3-4B-Thinking,训练配置为 4 张 GPU、batch size 16、150 步。
主要对比基线包括基于监督微调的 LMSI、基于 GRPO 和多数投票的 TTRL,以及采用自置信度奖励的免标注强化学习方法 Intuitor。评估指标涵盖 Avg@8(样本平均准确率)、Maj@8(多数投票准确率)和 ECE(期望校准误差)。
实验结果揭示了几个重要发现。在域内任务性能上,Neuron-OPSD 在多个领域取得显著提升,其中物理领域提升最为明显(+2.93 Maj@8),材料领域次之(+2.27),Edu-Feedback 分类任务提升达 +7.24。更关键的是跨域泛化能力的改善:LMSI 方法在跨域评估时平均性能下降 4.34 分,Intuitor 的跨域 ECE 上升 0.022,而 Neuron-OPSD 实现了平均 1.09 分的跨域提升和 0.002 的跨域 ECE 下降。
消融实验进一步验证了设计选择的合理性。神经元一致性得分的有效性在四个领域均得到确认(均 )。Top-20% 与 Bottom-20% 选择对比显示,激活计数虽不能作为唯一的数据选择规则,但能提供有价值的诊断信号。Neuron Overlap 检索在推理模式多样的领域(如 Chemistry)显著优于随机检索,但在推理模式均一的领域(如 Physics)中优势被压缩,这说明检索策略需要与领域特征相匹配。
值得注意的是,教师-学生 token 级熵差与性能增益存在强关联。在物理和材料领域,教师分布显著锐化(),对应取得最大增益;而在化学和生物领域,熵差接近零,增益也近乎为零。这表明 Neuron-OPSD 的收益来源于教师能够提供真正有价值的信息——当教师分布与学生分布足够不同且更加确信时,蒸馏训练才能带来有效提升。
讨论与可借鉴点
Neuron-OPSD 的一个重要贡献是揭示了内部激活模式作为训练信号来源的潜力。传统方法依赖外部反馈(人工标注、奖励模型、环境信号),而该方法证明了模型自身的“思考痕迹”足以支撑有意义的学习。这种数据中心化的视角回避了复杂的奖励设计问题,将注意力重新聚焦于“训练什么、给教师什么”这一本质问题。
然而,该方法也存在明显的局限性。首先,域内增益并不均衡——在生物和化学领域未能取得显著提升,这提示激活计数虽然能反映处理确定性,但并不能完全替代任务相关的质量信号。其次,检索策略在推理模式均一的领域容易失效,因为高相似度的神经元激活模式并不必然对应语义相关的问题。第三,仅在 4B 参数模型上验证,向更大规模模型的迁移能力尚未确认。
对于后续研究,一个有价值的探索方向是将神经元激活与其他信号(如推理长度、采样熵、问题复杂度)进行融合,构建更加鲁棒的数据选择机制。另一个方向是在更大规模的模型上验证该框架,观察神经元激活模式的可扩展性是否与性能提升呈正相关。此外,将 Neuron Overlap 与结构化知识检索(如知识图谱增强的 RAG)相结合,可能能够在保持跨域泛化能力的同时,进一步提升检索的语义相关性。
摘要
在没有真实交互反馈或人工标注监督的情况下对大语言模型(LLM)进行后训练仍然充满挑战,尤其是在专家标注成本高昂的专业领域。最近的免标注自演化方法通过将模型自身的输出作为监督信号来应对这一问题——借助额外上下文构建教师模型,并通过多数投票对多次采样的预测进行聚合以生成伪标签。然而,这类方法并非没有缺点:基于 SFT 和 GRPO 的变体存在域外性能退化的问题,而基于奖励的在线策略强化学习则会放大校准误差。本文提出了神经元在线策略自蒸馏(Neuron-OPSD),这是一个面向免标注自蒸馏的数据中心化框架,利用内部神经元激活来同时指导训练数据的选择和教师上下文的构建。随后通过教师分布的在线策略蒸馏对模型进行训练,整个过程无需任何真实标签。在多个专业领域基准测试上,Neuron-OPSD 在提升域内任务性能的同时,保持了跨域泛化能力,并缓解了相较先前免标注基线方法所出现的校准崩溃问题。该框架尤其适用于在线交互或外部监督代价高昂乃至不可行的场景,且在概念上区别于依赖已记录、带奖励标签轨迹的离线强化学习方法。
速览
TLDR:在缺乏真实交互反馈或人工标注的专业领域中,大语言模型的事后训练仍面临困难。现有无标注自演化方法存在域外性能下降或校准误差膨胀等问题。本文提出神经元感知的在线策略自蒸馏框架Neuron-OPSD,利用模型内部神经元激活指导训练数据选择与教师上下文构建,并通过策略内蒸馏完成训练,全程无需真实标签。实验表明该方法在提升域内任务性能的同时保持了跨域泛化能力,并有效缓解校准坍塌问题。 \
Motivation:专业领域大模型事后训练缺乏真实反馈与人工标注,现有无标注自演化方法存在域外性能下降或校准误差膨胀的局限。 \
Method:提出Neuron-OPSD数据为中心框架,利用内部神经元激活指导训练数据筛选与教师上下文构建,通过在线策略蒸馏训练,全程无需真实标签。 \
Result:在专业领域基准上,Neuron-OPSD提升域内任务性能,保持跨域泛化能力,并有效缓解校准坍塌,优于先前无标注基线。 \
Conclusion:为在线交互或外部监督成本高昂的场景提供无需标注的自蒸馏方案,概念上区别于依赖奖励标注轨迹的离线强化学习方法。
Abstract
Post-training large language models (LLMs) without real-world interaction feedback or human-labeled supervision remains challenging, particularly in specialized domains where expert annotations are costly to obtain. Recent annotation-free self-evolution methods address this by using the model's own outputs as supervision signals, constructing a teacher via additional context and aggregating predictions across multiple rollouts through majority voting to produce pseudo-labels. However, these approaches are not without drawbacks: SFT- and GRPO-based variants suffer out-of-domain performance degradation, while reward-based on-policy RL inflates calibration error. In this paper, we propose Neuron On-Policy Self-Distillation (Neuron-OPSD), a data-centric framework for annotation-free self-distillation that leverages internal neuron activations to guide both training-data selection and teacher context construction. The model is then trained via on-policy distillation from the teacher distribution, requiring no ground-truth labels at any stage. Across specialized-domain benchmarks, Neuron-OPSD improves in-domain task performance while preserving cross-domain generalization and mitigating calibration collapse over prior annotation-free baselines. This framework is particularly relevant to settings where online interaction or external supervision is costly or infeasible, and is conceptually distinct from offline RL approaches that rely on logged, reward-labeled trajectories.
论文详细总结(自动生成)
论文总结:面向免标注 LLM 自蒸馏的神经元感知数据选择(Neuron-OPSD)
一、核心问题与研究动机
在缺乏真实交互反馈与人工标注的专业领域(如教育、法律、STEM 等),对大语言模型进行后训练极为困难。现有免标注自演化方法可分为三类:
- SFT 类方法(如 LMSI):以模型自身生成的响应或推理链作为监督,易发生灾难性遗忘与域外性能退化;
- GRPO 类方法(如 TTRL、Intuitor):通过多数投票或自置信度构造标量奖励,但当组内奖励方差低时会出现梯度消失、熵崩溃等问题,且只能提供轨迹级监督;
- 基于奖励的在线策略 RL:易放大模型的校准误差(ECE 上升)。
本文指出,免标注自演化本质上有两个待解决的核心问题:(1)哪些无标签样本适合用于训练;(2)如何构造能引发有意义的"教师-学生"分布差异的上下文(即"教师分布从何而来")。若不加筛选地用自身输出蒸馏,会强化已有的错误校准、虚假推理与幻觉。因此需要 数据中心化的样本与上下文筛选机制,而传统基于多数投票或熵的表层信号被认为不足够。
二、方法论
2.1 整体框架
Neuron-OPSD 是一个 完全免标注 的在线策略自蒸馏(On-Policy Distillation, OPD)框架,由四个阶段组成:
1. 神经元激活提取(Neuron Activation Extraction)
2. 基于神经元一致性(Neuron Consensus)的样本选择
3. 基于神经元重叠(Neuron Overlap)的教师上下文构建
4. 在线策略自蒸馏训练
2.2 神经元激活提取
对每一层 的 MLP 输入 与上投影矩阵 ,计算门控激活:
对生成的 token ,按下游贡献在反嵌入空间的投影进行打分:
每个生成 token 取跨所有层的 Top-K(K=5000)得分为激活神经元;响应内所有 token 的激活集合取并集,得到样本 的稀疏激活集 。
2.3 Neuron Consensus:样本选择
定义一致性得分:
其中 越小表示网络对该样本的处理路径越一致、越可能正确; 越大表示激活弥散、与幻觉相关。最终选取 最小的 bottom-20% 作为训练子集 。
2.4 Neuron Overlap:教师上下文构建
使用 Jaccard 距离衡量两样本的激活模式相似度:
对每个查询 ,通过式 (6) 选取 个最近邻作为其 few-shot 演示集 。
2.5 在线策略自蒸馏目标
学生策略为零样本策略 ,教师策略为带上下文 的 EMA 教师 ,EMA 更新率 。训练时最小化反向 KL:
教师参数被视为固定目标,仅对 求梯度;教师参数按 滑动更新。
2.6 算法流程
完整伪代码见 Algorithm 1:先遍历无标注池 收集激活集与一致性得分 → 取 bottom-b 百分位得子集 → 预计算 Jaccard 距离矩阵并为每个 取 近邻作为教师上下文 → 反复采样学生 rollout 并对教师-学生分布做反向 KL 更新。
三、实验设计
3.1 数据集
- SciKnowEval:四个科学领域多选题(Biology、Material、Physics、Chemistry),按 80/20 划分训练/测试。
- Edu-Feedback:二元反馈质量分类(1799 训练 / 1000 测试)。
- MMLU-Pro:多领域多选题挑战基准,取 80% 用于自改善。
3.2 对比基线
- LMSI(SFT 类,Huang et al., 2023)
- TTRL(GRPO + 多数投票伪标签,Zuo et al., 2025)
- Intuitor(自置信度作为奖励的免标注 RL,Zhao et al., 2025b)
3.3 模型与指标
- 基础模型:Qwen3-4B-Thinking-2507(4B 参数推理模型)
- 评估:每题采样 8 次(温度 0.6)
- 指标:
- Avg@8:样本平均准确率
- Maj@8:多数投票准确率
- ECE(Expected Calibration Error):15 等宽 bin 的多数投票置信度误差,越低越好
3.4 分析实验
- 神经元一致性与准确率相关性分析(4 个 SciKnow 域,r≈0.369, p<1e-6)
- Top-20% vs. Bottom-20% 选择对比
- Neuron-Jaccard vs. 域内随机检索对比
- 教师-学生 token 级对数概率熵差 与性能增益关联分析
- Chemistry vs. Physics 检索案例研究
- 跨域泛化与跨域校准分析
四、资源与算力
文中明确给出了部分训练配置:
- 训练框架:veRL(基于 Ray 的 FSDP 分布式训练)
- GPU:4 张 GPU(型号未具体说明)
- 训练规模:batch size = 16,micro-batch size = 4,150 步
- TTRL 对照:同样 4 卡,1 个 epoch,actor 学习率 ,critic 学习率 ,KL 系数 0.0,rollout 温度 1.0,每 prompt 8 票
- 数据准备开销:神经元特征计算、距离矩阵与统计量一次性离线缓存,因此选择阶段额外开销可接受
未明确说明:GPU 具体型号、单次实验墙钟时间、总实验时长等。
五、实验数量与充分性
实验覆盖:
- 3 个数据集 / 6 个源域(SciKnowEval 4 域 + Edu-Feedback + MMLU-Pro)
- 4 个基线对比方法(含 LMSI、TTRL、Intuitor 的逐源训练结果,详见 Table 7 全量表)
- 跨域泛化:每个方法在每个源域训练,评估全部目标域(in-domain 与 cross-domain 两套指标)
- 消融/分析:一致性的 Pearson/Spearman 相关(4 域分图 Fig. 3)、Top vs. Bottom 选择消融(Tab. 1)、Jaccard vs. Random 检索消融(Tab. 2)、教师-学生熵差分析(Tab. 6)、领域多样性度量(4 域均值 Jaccard)、案例研究(Chem 与 Phys 的检索对比)
优点:
- 同时报告准确率与校准,避免单一指标偏差;
- 设置了一致性分析、检索对比、机制分析三层证据;
- 提供全量 6 源训练下的逐方法表,便于复核。
不足:
- 仅在一个 4B 模型(Qwen3-4B-Thinking)上验证,缺乏更大规模或不同模型族的验证;
- 仅与均匀域内随机检索做对照,未与 RAG 提示工程等其他教师上下文构造策略直接比较;
- 没有不同 (近邻数)或不同 bottom 百分位(除 20% 之外)的扫描;
- 对 SFT 类方法(如 LMSI)的多源训练结果全展开但 Neuron-OPSD 的化学/生物"无提升"现象没有针对性补充实验。
六、主要结论与发现
1. 神经元一致性与幻觉高度相关:在 4 个 SciKnow 域上,激活神经元数量与零样本准确率呈显著负相关(Pearson 在 到 ,均 )。
2. 一致性是有效但不足的选择信号:单独按 选择 Top-20% 或 Bottom-20% 训练均能取得一定提升,但二者差异不显著,说明激活计数只能作诊断信号,不能作为唯一数据选择规则。
3. Neuron Overlap 检索在推理模式多样时更有效:在 Chemistry(域内平均 Jaccard 距离 0.870)等高多样性域上优于随机检索;在 Bio(0.634)、Mat(0.628)等较均一域上增益被压缩。
4. 教师-学生 token 级熵差驱动 OPD 收益:在 Mat()与 Phys()上教师分布显著锐化,对应取得最大 in-domain 增益(+2.27 与 +2.93);而 Chem、Bio 的 对应无显著提升。
5. 跨域性能与校准更稳健:相较 LMSI(跨域 Avg@8 平均下降 4.34)与 Intuitor(跨域 ECE 平均上升 0.022),Neuron-OPSD 平均跨域 Avg@8 上升 1.09、跨域 ECE 下降 0.002,且在 Edu-Feedback 上同时获得最大准确率增益(+7.24)与最大校准改善(-0.056)。
6. 数据选择存在可靠性-学习效用权衡:低激活样本信号可靠但边际学习收益小;高激活样本学习价值高但监督噪声大;bottom-20% 在本实验中表现略稳定。
七、优点
1. 方法新颖性强:首次将神经元激活同时用于数据选择与教师上下文检索,统一在一个免标注 OPD 框架内。
2. 数据-中心化视角:不再纠结奖励设计,而是回到底层"训练什么、给教师什么"的本质问题。
3. 机制可解释:通过 token 级熵差把"教师-学生分布 gap"与具体增益域对应起来,超越经验性准确率对比。
4. 多指标评估:同时跟踪 in-domain 准确率、跨域泛化与 ECE,避免单一性能指标导致的偏差。
5. 算力开销可控:神经信号与距离矩阵可一次性离线缓存,推理时不依赖演示集。
6. 理论定位清晰:与离线 RL(依赖奖励标签轨迹)和在线 RLHF(需偏好查询)做了清晰切割。
八、不足与局限
1. 域内增益不均衡:Bio 与 Chem 上 teacher 在 token 级未提供锐化(),in-domain 增益近乎为 0,方法适用条件受限。
2. 单一信号不足:激活计数既不能单独确定选择规则,也无法解释"为什么有的域有效、有的无效",与其他幻觉信号(熵、推理长度、问题复杂度)的交互未深入。
3. 检索失效情形:在物理等推理模式均一的域中,Neuron-Jaccard 退化为"通用抓取",检索到的演示与查询主题相关性差(Appendix C.3 案例)。
4. 基线对比范围窄:仅与域内随机检索对照,缺少与 RAG、prompt engineering、其他结构化上下文构造方法的直接比较。
5. 模型规模单一:仅在 4B 参数的 Qwen3 模型上验证;向 7B/13B/70B 等更大模型的可迁移性未经验证。
6. 评估域数量有限:仅 3 个数据集 / 6 个源域,跨任务类型(生成式、长文本、代码)覆盖不足。
7. 算力披露不完整:未给出 GPU 型号、训练墙钟时间、完整实验周期,难以评估可复现成本。
8. 理论分析缺失:神经元一致性与 hallucination 的因果关系仍为相关性证据,缺乏机制层面(如电路级别)的解释。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。


