arXiv 2607.13643v1 · 发布 2026-07-15

将共识作为无标签自蒸馏的特权上下文

Consensus as Privileged Context for Label-Free Self-Distillation

AUTHORS John Gkountouras, Josip Jukić, Ivan Titov
EVIDENCE CANON将多数共识转化为无标签的逐词元自蒸馏监督信号
SCORE 0.8
GENERATED 2026-07-23 21:53:54 UTC

📝 TLDR

大语言模型在无标签推理任务中常借助多数投票提升准确率,但现有方法仅将共识用作筛选、偏好或标量奖励,丢失了大量信息。本文提出CANON方法,将达成共识的解作为条件输入冻结旧模型,从而生成逐token的密集监督信号。在数学与科学推理基准上,CANON将pass@1最多提升12个百分点,计算量仅为无标签强化学习的七分之一,并在未见过基准上与使用金标签训练的方法持平。

🧭 速览

动机

现有无标签训练方法仅将多数投票共识用作解的筛选、答案偏好或标量奖励,丢弃了共识解中蕴含的丰富轨迹与推理信息。

方法

CANON采样多个解,提取多数答案,以冻结快照模型在该共识解上作条件,逐token对当前模型自身的采样进行自蒸馏监督。

结果

在数学与科学推理基准上pass@1最多提升12点,优于无标签强化学习6点且计算量仅为其七分之一,在未见基准上与使用金标签训练的方法相当。

结论

提升并非单纯的分布锐化——训练后模型可解决此前32次采样均未解决的问题,且其自身多数投票的准确率也得到显著提升。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

CANON 提出将大语言模型的多数投票共识本身作为「特权上下文」,让一个冻结的旧模型在共识解上作条件,对学生模型的每个生成 token 提供稠密的监督信号。在数学与科学推理任务上,该方法将 pass@1 最多提升 12 个百分点,超越所有无标签强化学习基线的同时,计算量仅为后者的七分之一。

研究背景与动机

让大语言模型在推理时采样多个解并取多数答案,已被广泛证明是提升准确率最可靠的手段之一。这种做法通常被称为 [[自一致性]](self-consistency):即使单个采样可能出错,当多个独立生成轨迹汇聚到同一个答案时,这个共识往往就是正确解。这背后有一个朴素但有力的直觉——正确答案往往有更多「生成路径」可达,而错误答案容易在采样多样性面前分崩离析。

然而,如何把这种共识信号转化为训练监督,一直是个悬而未决的问题。研究者们已经尝试了几种思路:有的将共识解作为筛选器,只对达成一致的轨迹做[[监督微调]];有的将共识转化为偏好对,走[[偏好优化]]的路线;还有的干脆把多数投票的通过率当作[[强化学习]]中的标量奖励来训练策略。这些方法各有成效,但它们有一个共同的本质局限——它们都把共识压缩成了一个比特(通过/不通过)、一个标量(奖励值)或一组偏好标记,而丢弃了达成共识的解内部所包含的丰富推理信息。一条通往正确答案的完整思维链,其每一步的 token 分布能提供的信息量,远非一个浮点数可以概括。

与此同时,在有标签场景下,「特权上下文自蒸馏」已经证明是一种极为有效的稠密监督范式:用一个已经知道正确答案的教师模型在正确答案上作条件,为学生模型提供逐 token 的软监督。但这种方法的致命问题在于,它依赖外部标签——而在真实部署中,我们往往只有无标签的 prompts,没有标准答案。

CANON 的核心洞察正在于此:模型自身的共识能否替代外部标签,成为这种特权上下文? 也就是说,当多数投票选出正确答案后,这个正确答案的「身份」本身就构成了足够的条件信息,足以让一个冻结的教师模型为学生提供有意义的 token 级监督。

方法

CANON 的算法流程可以拆解为三个步骤,每一步都针对上述问题的某个具体环节。

第一步:提取共识。 给定一个无标签 prompt ,用当前模型 采样 个解 ,从每个解中提取最终答案 ,然后计算多数答案 。这一步与标准 self-consistency 完全相同。

第二步:构造教师。 关键问题来了:对于同一个 prompt,有多个解都达成了多数答案(即都推出了 ),应该选哪一个作为「共识解」?直觉上应该选择质量最高的那个——即最有可能被模型本身认为「正确」的解。CANON 的选择标准是平均 token 对数概率最高的那个解:。这个解 就是「共识锚定」的上下文。然后,取模型的一个冻结快照 (在单 epoch 设定下就是 本身),让它在条件 下作为教师使用。这个冻结操作至关重要——如果让教师与学生共享参数(即 live-teacher),两者会在几步内产生完美的共适应,loss 和梯度迅速归零,蒸馏效果彻底崩溃。

第三步:逐 token 蒸馏。 有了教师之后,对所有 个 rollout 的每个 token,CANON 计算学生的 next-token 分布 与教师的分布 之间的 [[Jensen-Shannon 散度]],然后最小化这个散度的期望:

这里用 JSD 而非 KL 散度是因为它天然对称,避免了 KL 的单向不稳定性。

三个关键设计值得特别强调。首先是稠密监督:与标量奖励只告诉模型「这个解对不对」不同,教师在每个 token 位置都提供了一个完整的词表分布,告诉模型「在当前 prefix 下,下一个 token 应该怎么分布」——包括模型偏离共识的位置在哪里、偏离了多少。这是任何标量奖励都无法提供的信息量。其次是冻结教师:防止了共适应崩溃,同时教师提供的条件()本身就是来自模型自身的推理轨迹,保证了教师与学生之间的语义对齐。第三是单次生成:整个流程只需要一次采样 个解,这些解既用于确定共识,又作为蒸馏的 rollout 基底,不需要额外的奖励模型或反复生成。

实验与结果

实验在两类设定下进行:transductive 设定下直接在测试集 prompts 上训练和评测,inductive 设定下则在留出的无标签数据池上训练后迁移到未见过的基准。

在 transductive 设定中,CANON 在 AMC 2023(66.0→76.5)、AIME 2024(32.5→44.6)等基准上展现出显著提升,最高达 12 个百分点的 pass@1 增益。相较于计算量最大的无标签强化学习方法 TTRL,CANON 以约七分之一的 GPU 小时数取得了 6 个百分点的优势。值得注意的是,当教师锚定到金标签解(oracle 上界)时,CANON 与该上界之间的差距在统计上不可区分——这意味着模型自身的共识已经捕获了金标签作为特权上下文所能提供价值的大部分。

在 inductive 设定中,用 339 道题的混合无标签池训练后,CANON 在留出的 AIME 2024、AIME 2025 和 GPQA-Diamond 上进行了评测。结果显示其性能与使用金标签训练的 GRPO 方法持平,证明了共识信号可以在分布外任务上有效替代真实标签。

论文还通过消融实验验证了各项设计的必要性。冻结教师相比 live-teacher 有决定性优势;rollout 数量 在 32 附近达到最优;即便对未达成共识的少数答案轨迹进行监督也能带来正向收益。分析进一步表明,收益并非来自纯粹的分布锐化——训练后模型能解决此前 32 次采样中从未解决过的问题,且模型的多数投票本身(maj@32)也变得更加准确。

讨论与可借鉴点

CANON 展示了一条优雅的路径:让模型自身的统计特性(多数投票)反过来为自身提供监督信号,而无需外部标签或复杂的强化学习基础设施。这种「共识即标签」的思路在概念上极为简洁,在实践中却带来了可观的收益。

从工程角度看,该方法的计算效率尤为突出。单次采样同时服务于共识提取与蒸馏 rollout,整个训练流程几乎只是自一致性解码的边际成本。这与当前大模型训练中「每一点性能提升都需要数量级算力投入」的常态形成了鲜明对比。

不过,该方法也有其适用范围。当 base 模型的自洽性已经很强(maj@32 与 pass@1 差距很小)时,提升空间有限;当多数样本集体押注错误答案时,方法会强化错误(但这种情况罕见于有意义的基准测试中)。此外,该方法目前依赖可抽取的答案格式(boxed 数学答案或选项字母),对于开放式生成任务尚需扩展。

一个值得深思的问题是:为什么模型自身的共识能如此有效地替代金标签?论文的分析暗示,共识解不仅「答案正确」,而且在 token 级别的分布上也更「集中」——这可能意味着共识机制本质上就是一种隐式的质量筛选。理解这一现象的深层机制,或许能为无监督学习开辟更广阔的空间。

摘要

采样多个解并返回多数答案,是无需标签即可提升大语言模型推理准确率的最可靠方法之一,且越来越多的方法将这种共识信号转化为训练监督信号。然而,现有方法仅以受限形式使用共识:作为筛选解以进行微调的过滤器、作为答案间的偏好,或作为强化学习的标量奖励,丢弃了达成共识的解所包含的大部分信息。我们提出 CANON(Consensus-ANchored self-distillatiON),一种将共识转化为稠密、词元级监督的无标签训练方法。对于每个无标签提示,CANON 采样多个解,提取多数答案,并让模型的一个冻结快照以得到该多数答案的某个解为条件;这个共识锚定的教师随后在每个词元上对模型自身的生成进行监督。在数学和科学推理基准上的实验表明,CANON 将 pass@1 提升最多 12 个百分点,在仅使用其七分之一算力的情况下,比无标签强化学习高出 6 个百分点,并逼近以标准答案(gold solutions)为条件的教师;在汇集的无标签数据上训练后,该方法可迁移到留出(held-out)的基准上,性能与使用标准答案标签的训练方法相当。分析表明,这些提升并非纯粹的分布锐化:训练后,模型能够解决此前在 32 次尝试中从未解决的问题,并且其多数投票本身也变得更加准确。

Abstract

Sampling multiple solutions and returning the majority answer is among the most reliable ways to improve the reasoning accuracy of large language models without labels, and a growing family of methods converts this consensus signal into training supervision. However, existing approaches use consensus only in restricted forms: as a filter that selects solutions for fine-tuning, as a preference between answers, or as a scalar reward for reinforcement learning, discarding most of the information that the agreeing solutions contain. We present CANON (Consensus-ANchored self-distillatiON), a label-free training method that turns consensus into dense, token-level supervision. For each unlabeled prompt, CANON samples multiple solutions, extracts the majority answer, and conditions a frozen snapshot of the model on a solution that reaches it; this consensus-anchored teacher then supervises the model on its own rollouts at every token. Experiments on mathematical and scientific reasoning benchmarks show that CANON improves pass@1 by up to 12 points, outperforming label-free reinforcement learning by 6 points at a seventh of its compute and approaching a teacher conditioned on gold solutions; trained on pooled unlabeled data, it transfers to held-out benchmarks, matching training methods that use gold labels. Analysis suggests that the improvements are not pure distribution sharpening: after training, the model solves problems it previously never solved in 32 attempts, and its majority vote itself becomes more accurate.


论文详细总结(自动生成)

CANON 论文总结

1. 核心问题与研究动机

  • 背景:在无标签条件下,大语言模型可通过"自一致性"(self-consistency)采样多个解并取多数投票,显著提升推理准确率。
  • 现有方法的局限:现有无标签训练方法仅以受限形式利用共识信号:
  • 作为筛选器,挑选共识解做监督微调(如 LMSI)
  • 作为偏好对,做偏好优化(如 ScPO)
  • 作为标量伪奖励,做无标签强化学习(如 TTRL、EMPO、SCRL)
  • 核心问题:上述方法都将共识压成单一比特或一个标量,丢弃了达成共识的解所包含的轨迹级与逐 token 的推理信息;此外强化学习方案需要数百步优化与重复生成,计算开销巨大。
  • 关键洞察:在有标签场景下,"特权上下文自蒸馏"已证明可提供稠密 token 级监督;但该特权信息依赖 gold 标签。本工作提出:模型自身的共识能否充当这种特权上下文,从而实现无标签的稠密自蒸馏?

2. 方法论

2.1 核心思想

将模型自身的多数投票共识作为"特权上下文",训练一个冻结的旧模型快照在该共识解上作条件,对当前模型自身的采样在每个 token 上做稠密自蒸馏。

2.2 算法流程(三步)

1. 提取共识:对每个无标签 prompt ,采样 个解 ,提取答案 ,取多数答案

2. 构造教师:从多数答案集合中选出平均 token 对数概率最高的解作为共识解 ;以冻结快照 (单 epoch 下即 )在上下文 下作为教师,对同一 个解的每个 token 计算 next-token 分布

3. 蒸馏学生:学生 在 prompt 单独条件下生成,对所有 rollout 的每个 token,最小化与教师的全词表 Jensen-Shannon 散度

2.3 关键公式

  • 多数答案
  • 共识解(按平均 token log-prob 选取):
  • 目标函数(逐 token JSD):
  • JSD 定义

2.4 三个关键设计

  • 稠密监督:相比标量奖励提供每个 token 全词表分布,涵盖全部 rollout(含与共识不一致的轨迹)。
  • 冻结教师:防止教师与学生共享参数时的退化共适应(live-teacher 在 5 步内 loss 与梯度降到 0)。
  • 单次生成:一次采样同时用作共识与蒸馏基底,不需奖励模型或重复生成。

3. 实验设计

3.1 数据集 / 基准

  • Transductive:AMC 2023(83 题)、AIME 2024/2025(各 30 题)、GPQA-Diamond MC(198 题)、MATH500(500 题)
  • Inductive:自建 339 题无标签数学池(AMC + MATH500 随机子集 + OmniMath 开发片),在 AIME 2024 / AIME 2025 / GPQA 上留出评估;并在 AIME 2026(n=29,post-cutoff 污染控制)上评估
  • 开发集:OmniMath 难度 2–3.5 切片,与所有评测集互不相交

3.2 对比方法

  • Label-free 基线:LMSI(共识过滤 SFT)、ScPO(自一致性偏好优化)、TTRL(多数投票伪奖励 RL)、EMPO(语义熵最小化 RL)、SCRL(严格共识正负样本 RL)、TTRL-Guard(稳定性加权 RL)
  • Label-full 基线:RFT(rejection 微调)、GRPO(金标签 RL)、Oracle-CANON(教师锚定到 deep-resampled 金验证解,是 CANON 的 oracle 上界)
  • 覆盖:Qwen3-4B-Instruct-2507、Qwen3.5-{2B, 4B, 9B}、SmolLM3-3B、LFM2.5-8B-A1B(MoE)、Gemma-4-E4B-it,共 7 个模型 / 4 个家族

3.3 评测指标

温度 0.6、top-p 0.95、 样本/题(固定种子),报告 avg@32、maj@32、pass@32;数学题用 math-verify 验证,选择题按字母提取。

4. 算力与资源

  • 训练硬件:4 块 RTX 6000 Ada(48 GB)的单节点,通过 FSDP(verl)训练;LoRA rank 64
  • 训练时长:单源 AMC(83 题)训练约 1.2 GPU-小时;339 题 pool 约 4.1 GPU-小时
  • 对比基线算力
  • TTRL:8.1 GPU-h(AMC)/ 34.5 GPU-h(pool)
  • SCRL:9.8 GPU-h;TTRL-Guard:9.4 GPU-h
  • GRPO-60:6.4 GPU-h;GRPO-180(最佳):19.2 GPU-h(AMC)
  • CANON 相对 TTRL/GRPO 的算力优势:约 1/7 至 1/16

5. 实验数量与充分性

  • 主实验表格:Table 1(10 方法 × 5 基准)、Table 2(7 模型 × 5 基准 = 35 cell,34 cell 提升)、Table 3(pool 实验 5 方法)、Table 6(条件阶梯 6 档)、Table 7(设计消融 5 档)
  • 消融维度:教师冻结 vs live、rollout 数量 、是否对少数答案 rollout 监督、共识解数量、SFT 替代、轮数
  • 统计检验:配对 bootstrap(B=10,000,95% CI),3 个训练种子 + 3 个评测种子
  • 污染审计:339 池与各留出集 13-gram 与句嵌入审计均为 0 匹配;引入 AIME 2026 作为 post-cutoff 控制
  • 公平性保障
  • 同一冻结 harness 评测所有方法
  • 学习率在 OmniMath 开发片上每模型选一次后冻结,不在评测基准上调参
  • label-free 方法任何时刻都不接触 gold 答案
  • 客观性:除显著不显著的对比外(如 GRPO-180 vs CANON 的 +3.1 分包含 0),多数差异通过配对 bootstrap 验证

实验设计总体较为充分,统计与污染控制严谨,但单 AIME 题数仅 30,使部分对比落入评估噪声区间。

6. 主要结论与发现

  • 核心结果:CANON 在无标签条件下显著优于所有对比方法
  • AMC transductive:66.0 → 76.5(+10.5),TTRL-60 仅 70.3
  • AIME 2024:32.5 → 44.6(+12.1),TTRL 最佳 39.3
  • 提升最大 12 点,对无标签 RL 优 6 点,算力仅 1/7
  • Oracle 恢复:在 AMC、AIME 2024 上,CANON 与以金解为条件的 oracle 教师差距 ≤0.4 分(统计上不可区分),即模型自身共识捕获了金解作为特权上下文的大部分价值
  • 归纳迁移:pool 训练后在留出 AIME 2024 上达 41.7 avg@32,超过 TTRL-pool(39.4)与 GRPO-pool(39.0),与 oracle-pool(42.4)相差 0.7
  • 收益非纯锐化
  • maj@32 在四个基准均上升(+2.4 ~ +3.3 分)
  • pass@32 在数学题大幅提升(AIME 2025 +16.7)
  • 在从未解决的题(32 次采样均错)上 pass@32 提升 +33.3 分
  • 适用条件(实证结论):当 base 模型 maj@32 显著高于 pass@1(共识正确但未充分表达)时收益最大;共识已饱和时几乎无收益;样本集体押错答案(confidence-colluded wrong)时收益为负(但罕见,1493 题中仅 41 题)

7. 优点

  • 方法创新性高:将"多数投票"从离散选择信号升格为稠密 token 级特权上下文,是理论层面的优雅重构
  • 计算极高效:单 epoch、无奖励模型、无偏好对、无重复生成,边际成本几乎为自一致性解码本身
  • 稠密覆盖所有 rollout:即便与共识不一致的轨迹也能从教师获得"偏离位置"的逐 token 信号,相比 SFT 强制统一目标更具信息量
  • 冻结快照教师消除了 live-teacher 的共适应崩溃
  • 实验设计严谨:控制 oracle 对照、contamination audit、post-cutoff(AIME 2026)评测、多种子、多模型家族(含 MoE)、配对 bootstrap
  • 诊断深入:分难度带、分投票份额带分析,给出"何时使用 CANON"的可操作规则
  • 覆盖范围广:跨 7 模型、4 家族、2B–9B 规模,34/35 cell 提升
  • 理论指导性:"base maj@32 − pass@1 即 headroom" 的判据具有实用价值

8. 不足与局限

  • 依赖可抽取答案:要求 boxed 数学答案或选项字母;不适用于自由生成(free-form)任务;future work 提到可换用 Minimum-Bayes-Risk 或 medoid 选择
  • 共识错误时失败模式:当样本集体押错答案时反而强化错误(1493 题中 41 题),虽罕见但存在
  • 饱和任务收益有限:在 MATH500(Qwen3-4B 已 89%)上仅 +1.8 分
  • 单轮自蒸馏:第二、第三轮收益递减甚至反转;多轮未稳定提升
  • Transductive 假设:默认评测时能拿到测试 prompt,不适用于严格交互式场景
  • 评测题量限制:AIME 类仅 30 题,单题波动 3.3 分,部分对比落入噪声
  • 未跨"非共识型"推理任务验证:暂未在开放式对话、代码生成等任务上测试
  • 模型规模局限:实验中以中小 instruct 模型为主;未验证在 >10B 强推理模型上的效果
  • 方法组件的关键依赖:完全依赖"self-consistency 在该任务上有效"这一前提

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记