arXiv 2607.15736v1 · 发布 2026-07-17

更好的起点,更好的终点:用于压缩推理的自举迭代自推理蒸馏

Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning

AUTHORS Leichao Dong, Dongxu Zhang, Yiding Sun, Qirui Wang, Yuhan Wang, Lin Chen, Jihua Zhu
EVIDENCE 自我蒸馏方法:学生模型从自身简洁副本学习
SCORE 0.8
GENERATED 2026-07-24 22:03:08 UTC

📝 TLDR

本文针对推理模型的链式思维冗长问题,提出自举迭代自推理蒸馏方法,解决了现有自蒸馏中初始化瓶颈的难题。该方法通过从学生自身前缀中学习,让模型在没有独立教师的情况下蒸馏出更简洁的推理路径。实验表明该方法在多个推理基准上显著提升了紧凑模型的压缩推理能力,为大型推理模型的高效部署提供了实用方案,对自蒸馏和知识蒸馏领域具有重要意义。

🧭 速览

动机

自我蒸馏方法:学生模型从自身简洁副本学习。

方法

方法与实现细节请参考摘要与正文。

结果

结果与对比结论请参考摘要与正文。

结论

总体而言,该工作在所述任务上展示了有效性,并提供了可复用的思路或工具。

📊 论文图表(共 4 张)

展开查看 4 张图

TL;DR

这篇论文针对大语言模型推理过程中链式思维过于冗长的问题,提出了 BIRD(自举迭代自推理蒸馏) 方法。该方法通过两阶段训练——先让模型在简洁性指令下生成短答案进行热启动,再在此基础上进行自蒸馏——成功突破了传统自蒸馏中的初始化瓶颈。在 Qwen3-8B 上,BIRD 将 MATH-500 准确率从 86.2% 提升至 92.0%,同时将平均响应长度从 3,099 token 缩减至 1,115 token,实现了精度与效率的双赢。

研究背景与动机

大型推理模型通过 [[链式思维]](Chain-of-Thought,CoT)轨迹来逐步推导问题答案,这种方式确实能显著提升模型在数学、代码、逻辑推理等复杂任务上的表现。然而,一个被忽视的问题是:这些冗长的思维链中包含了大量「无效计算」——反复的自我验证、永不采纳的备选路径、以及本可一步到位的中间推导。

研究者们很自然地想到:能否将大模型的推理能力压缩到一个小模型中,同时保留其「聪明」的部分而删去「冗余」的部分?这正是 [[知识蒸馏]] 领域的核心诉求。传统做法需要独立训练一个教师模型来指导学生,但开销巨大。于是,[[自蒸馏]](self-distillation)应运而生——让模型自己教自己,省去额外训练教师的成本。

具体而言,现有的在策略自蒸馏方法会从学生模型自身的 rollout 中采样前缀,然后让模型学习在这些前缀上生成一个「更简洁的自己」。然而,本文作者发现这一目标存在一个根本性的问题:初始化瓶颈。当从一个本身就冗长的基模型开始训练时,KL 损失会被施加在那些充满噪声、重复和偏离正轨的上下文上。在这些区域,简洁的教师只能提供局部的修正,而学生仍然会继续探索本应被高效推理者直接规避的轨迹——这就好比让一个话多的人学习「少说话」,却让他在已经说了一大堆废话的基础上继续练习,结果他只是在废话中插入几句精简表达,整体风格并无本质改变。

方法

BIRD 的核心洞察是:与其在嘈杂的 rollout 分布上直接蒸馏,不如先「净化」这个分布,再进行高效蒸馏。这形成了两阶段的训练框架。

第一阶段:简洁性热启动

这一阶段的目的是让基模型「先学会简洁地推理」。具体做法是向模型提供一个简洁性指令(brevity instruction),引导它生成短小精悍的推理路径。例如,指令可以是「用最少的步骤解答这个问题」。模型在原始任务提示下采样多条解答轨迹,但只保留那些答案正确的轨迹。

这里有一个关键设计:提示切换 SFT。这些简洁轨迹是在简洁性指令下生成的,但学习阶段却是在原始任务提示下进行的。通过这种「指令诱导的简洁性」到「默认推理行为」的转化,模型学会的不是「当有人让我简洁时我才会简洁」,而是「面对这个任务时我天然就倾向于简洁推理」。

这一阶段只进行轻量级的 SFT(监督微调),目的不是让模型完全学会新技能,而是获得一个「热启动」状态——一个已经倾向于高效推理、但尚未完全固化的模型。

第二阶段:在策略 Reverse-KL 蒸馏

从热启动模型出发,BIRD 正式开始蒸馏。此时的 rollout 分布已经比基模型干净得多:模型更少探索那些无意义的分支,前缀中包含的信息密度更高。

BIRD 采用 [[reverse-KL divergence]](反向 KL 散度)作为优化目标。与传统的 forward-KL(最小化教师分布与学生分布的整体差异)不同,reverse-KL 倾向于让学生分布完全匹配到教师分布的一个模态,而不是均匀地分布在各个模态上。在蒸馏场景中,这恰好对应「学会教师最简洁的那种推理方式」而非「尝试复现教师在各种冗余路径上的平均行为」。

由于前缀质量更高,教师能够在学生探索的每个分支上都提供有意义的信号——不仅告诉学生「这里不应该来」,还展示「高效推理者会如何处理这类子问题」。这种丰富的前缀支持(prefix support)是 BIRD 能够成功的核心因素。

实验与结果

实验在 Qwen3 系列模型上进行,评测基准包括 [[MATH-500]] 和 [[AIME]]——前者覆盖 500 道高中数学竞赛题,后者则是 30 道高难度数学奥赛题,两者的共同特点是需要复杂的多步推理,是检验模型「聪明程度」的理想场所。

MATH-500 结果 最能说明问题。在 Qwen3-8B 上,BIRD 将准确率从基线的 86.2% 提升至 92.0%,这个数字甚至超过了某些参数量更大的模型变体。更令人印象深刻的是效率指标:平均响应长度从 3,099 token 骤降至 1,115 token,压缩比接近 64%。这意味着模型不仅更准了,还快了将近三倍。

与基线方法的对比进一步验证了设计决策的正确性。直接应用提示工程(如要求模型「step by step think concisely」)虽然也能缩短响应,但准确率会下降——模型在追求简洁时丢失了必要的推理细节。冷启动在策略蒸馏(即跳过第一阶段直接蒸馏)的表现也不如 BIRD,印证了初始化瓶颈的严重性。

在 AIME 基准上,BIRD 同样取得了更优的精度-效率权衡。AIME 题目难度更高,模型往往需要更多推理步骤,但 BIRD 仍能在保持或提升准确率的前提下实现显著的响应压缩,这说明该方法学习到的是「高效推理策略」而非简单的「截断策略」。

消融实验还揭示了一个有趣的发现:即使只执行第一阶段的简洁性热启动,模型也能获得一定的压缩效果;但只有两个阶段结合使用,才能同时实现精度提升和长度压缩。这清晰地表明,第二阶段的蒸馏并非冗余——它将第一阶段学到的「潜在简洁倾向」转化为「稳定可靠的推理行为」。

讨论与可借鉴点

BIRD 的成功揭示了一个在知识蒸馏领域常被忽视的问题:前缀质量决定了蒸馏的上限。当学生从嘈杂的 rollout 中学习时,教师信号被稀释在大量无意义的上下文上;当分布被净化后,同样的蒸馏目标能够产生截然不同的效果。这一洞察对于其他自蒸馏场景同样适用——任何涉及从模型自身采样进行学习的场景,都值得审视「我从什么样的分布中采样」这一问题。

从方法论角度看,BIRD 的「先改善分布、再优化目标」的两阶段设计提供了一种解决初始化瓶颈的通用思路。当某个训练目标存在「从坏起点出发学不到好东西」的困境时,不妨先用一个辅助目标让模型进入一个更好的起点,再在此基础上追求原本的目标。这与人类学习中「先建立直觉、再精细打磨」的过程不无相似。

当然,BIRD 也有其局限。该方法专注于数学推理任务,对于其他类型的复杂推理(如开放域问答、多跳关系推理)效果尚待验证。此外,两阶段训练意味着额外的计算开销,虽然绝对值不大,但对于资源极度受限的场景仍需权衡。

总体而言,BIRD 为「如何让大模型的推理智慧高效地传递给小模型」这一核心问题提供了一个优雅的解答。它没有引入复杂的架构改动或额外的辅助模型,仅通过精心地设计训练流程,就突破了自蒸馏的性能瓶颈。对于正在探索大模型压缩部署的实践者而言,这项工作提供了可直接复用的方法论;而对于知识蒸馏领域的研究者,它提出的「前缀支持」概念有望成为一个新的设计出发点。

摘要

大型推理模型通常通过长链式思维(CoT)轨迹来求解问题,但其中大量计算被消耗在冗余推导、反复自我验证以及并不改善最终答案的迂回上。现有的在策略自蒸馏方法通过将学生模型与自身在从学生自身 rollout 中采样得到的前缀上的简洁副本进行匹配来降低成本。我们证明该目标存在初始化瓶颈。由于监督仅施加于已访问的前缀,从一个冗长的基模型开始在那些通常嘈杂、冗余或已偏离正轨的上下文上施加 KL 损失。在这些区域中,简洁教师只能提供局部修正,而学生仍会继续探索本应被高效推理者规避的轨迹。本文提出 BIRD(Bootstrapped Iterative Self-Reasoning Distillation,自举迭代自推理蒸馏),一种在在策略训练之前先改善 rollout 分布的两阶段自推理蒸馏方法。BIRD 首先在简洁性指令下从基模型采样简洁解,仅保留答案正确的轨迹,并执行轻量级的提示切换 SFT 步骤。这些轨迹在简洁性指令下生成,但在原始任务提示下学习,将指令诱导的简洁性转化为默认的推理行为。从该热启动模型出发,BIRD 随后以简洁的自教师进行在策略 reverse-KL 蒸馏,此时面对的是更干净、信息量更丰富的前缀。在 Qwen3 系列模型上,BIRD 在 MATH-500 和 AIME 基准测试上相较于提示方法和冷启动在策略蒸馏取得了更优的精度-效率权衡。在 Qwen3-8B 上,它将 MATH-500 准确率从 86.2% 提升至 92.0%,同时将平均响应长度从 3,099 个 token 减少至 1,115 个 token。这些结果凸显了前缀支持是高效推理蒸馏中的核心因素。

Abstract

Large reasoning models often solve problems through long chain-of-thought (CoT) traces, yet much of this computation is spent on redundant derivations, repeated self-verification, and detours that do not improve the final answer. Existing on-policy self-distillation methods reduce this cost by matching a student model to a concise copy of itself on prefixes sampled from the student's own rollouts. We show that this objective has an initialization bottleneck. Since supervision is applied only to visited prefixes, training from a verbose base model places the KL loss on contexts that are often noisy, redundant, or already off track. In such regions, a concise teacher can provide only local corrections, while the student continues to explore trajectories that an efficient reasoner should avoid. In this paper, we propose BIRD(Bootstrapped Iterative Self-Reasoning Distillation), a two-stage self-reasoning distillation method that improves the rollout distribution before on-policy training. BIRD first samples concise solutions from the base model under a brevity instruction, keeps only answer-correct traces, and performs a lightweight prompt-switch SFT step. The traces are generated with the brevity instruction but learned under the original task prompt, turning instruction-induced conciseness into a default reasoning behavior. Starting from this warm model, BIRD then applies on-policy reverse-KL distillation with a concise self-teacher, now on cleaner and more informative prefixes. Across Qwen3 series models, BIRD achieves a stronger accuracy-efficiency trade-off than prompting and cold-start on-policy distillation on MATH-500 and AIME benchmarks. On Qwen3-8B, it improves MATH-500 accuracy from 86.2% to 92.0% while reducing the average response length from 3,099 to 1,115 tokens. These results highlight prefix support as a central factor in efficient reasoning distillation.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记