DRIFT:基于难度路由自蒸馏、节奏门控探索与成功缓冲区训练的方法
DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training
📝 TLDR
大语言模型在无外部专家监督下的稳定自改进仍是复杂推理任务的核心难题。现有自蒸馏与强化学习方法缺乏问题级学习进度追踪机制,易对简单题过度优化、对难题监督不足、难以探索边界样本。本文提出DRIFT在线自进化策略优化框架,通过难度路由识别问题级学习状态并动态分配自蒸馏与强化学习信号,配合节奏门控在token级聚焦关键推理位置探索,并结合成功缓冲与两阶段课程学习。实验在五个基准三个模型规模上全面超越GRPO与SDPO,平均得分79.5%,ToolUse准确率达79.2%,刷新当前最优。
🧭 速览
现有自蒸馏与强化学习方法缺乏问题级学习进度追踪机制,导致简单题过优化、难题监督弱、边界样本探索不足。
DRIFT框架采用难度路由动态分配自蒸馏与RL信号,节奏门控在token级聚焦关键推理位置,并结合成功缓冲与两阶段课程学习。
在五个基准三个模型规模上全面超越GRPO与SDPO,平均得分79.5%,ToolUse准确率达79.2%,刷新SOTA。
DRIFT通过问题级难度路由与token级节奏门控实现LLM无监督下的稳定自进化,为复杂推理任务提供新方案。
📊 论文图表(共 8 张)
展开查看 8 张图
TL;DR
DRIFT 是一个让大语言模型在没有外部专家监督的情况下实现稳定自我提升的在线策略优化框架。它通过难度路由在问题级别识别模型的学习状态并动态分配训练信号,配合节奏门控在词元级别精确定位关键推理位置,将探索资源集中于最有价值的边界样本。在五个基准和三种模型规模上的实验表明,DRIFT 平均达到 79.5% 的准确率,较 GRPO 提升 9.5%、较 SDPO 提升 7.5%,并在 ToolUse 任务上创下 79.2% 的当前最优水平。
研究背景与动机
让大语言模型在复杂推理任务中实现稳定、可信的自我提升,长期以来是学术界与工业界共同关注的核心难题。与有外部标注数据或专家反馈的监督学习不同,无监督自我提升要求模型只能从自身产生的推理轨迹中学习——这意味着训练信号必须从模型的"内部经验"中提炼出来,而如何区分哪些经验值得保留、哪些需要修正,成为决定学习质量的关键。
现有方法主要沿两条路线探索:强化学习路径以 GRPO 为代表,通过组内相对优势估计来调整策略;自蒸馏路径以 SDPO 为代表,将成功样本作为"特权教师"来纠正错误推理。这两类方法各有局限。GRPO 的组内奖励机制在样本量有限时容易出现奖励信号不稳定,更重要的是,优势估计在序列级别共享,导致信用分配过于粗糙——模型只知道某次回答整体是好是坏,却无法得知具体哪个推理步骤决定了成败。SDPO 的问题在于,它将所有成功样本不加区分地用作教师信号:来自轻松解决的问题与来自艰难挣扎后侥幸答对的问题被一视同仁。这意味着模型可能反复被灌输已经掌握的知识,却对真正需要突破的能力边界缺乏有针对性的监督。
更深层的矛盾在于学习信号的动态适配问题。模型在不同训练阶段对不同问题的掌握程度是动态变化的:一个最初感到困难的问题可能在若干轮迭代后变得熟练,反之亦然。现有方法缺乏对这种问题级学习进度的显式追踪与响应机制,导致训练过程容易陷入两种失衡:对简单题过度优化造成计算浪费,对困难题监督不足使得模型始终无法跨越某些能力边界,而最有学习价值的中等难度边界样本也往往得不到充分探索。
方法
DRIFT 的核心设计思路是建立一套从宏观到微观的多层次信号分配机制:在问题级别通过难度路由识别模型当前对每个题目的掌握程度,据此决定应该从这道题中学习什么、以多大强度学习;在词元级别通过节奏门控进一步筛选出真正值得模型集中注意力的关键推理位置,避免在无关紧要的词汇上浪费探索资源。
难度路由是 DRIFT 实现问题级学习进度追踪的基础组件。它为每个问题维护一个历史通过率的指数移动平均值 ,其中 反映了模型近期在该问题上的表现。基于这个平滑后的通过率,问题被划分为三个难度区间:简单题()的路由权重 抑制了冗余更新,避免在已掌握内容上反复投入;困难题()的路由权重 完全关闭了自蒸馏信号,防止模型被某些"误打误撞"的偶然正确所误导;中难度题则保持 的正常学习强度,并将与节奏门控配合的机会留给最有价值的边界样本。这种设计使得训练信号能够根据模型的真实能力状态进行自适应分配:模型越擅长的领域越少干预,越需要突破的边界越精准用力。
节奏门控是 DRIFT 在词元级别实现精细化探索的核心机制。它包含两个互补的信号:局部超越奖励与结构性显著性检测。前者衡量的是学生在某个位置上相对于教师的表现差异。当学生在某个 token 上的损失显著低于教师时,表明该学生可能发现了教师未曾注意到的更好推理路径,此时给予正向奖励鼓励这种"青出于蓝"的探索。但奖励幅度需要上界约束,避免过度放大噪声。后者通过分析师生在滑动窗口内的熵值变化差异来定位"结构性关键 token"——那些预测分布从混乱走向确定、且这种确定性转变与教师存在差异的位置。这类位置往往对应着推理过程中的关键决策点,是最值得模型投入注意力的地方。最终的 token 权重 采用双重筛选机制:只有当样本本身属于中难度区间、且该 token 同时具备教师相对超越与高结构显著性时,才给予权重放大。这种设计将探索资源精准导向了"既有改进空间、又值得投入"的关键位置。
成功缓冲区解决了跨批次经验复用的问题。DRIFT 为每个问题维护一个容量有限的缓冲区,存储该问题历史上的成功轨迹及其奖励分数。当当前批次中某个问题没有产生成功样本时,可以从缓冲区中采样一条历史成功轨迹作为特权教师。与简单的经验回放不同,DRIFT 的缓冲区采用奖励优先的替换策略:缓冲区中始终保留得分最高的成功样本,使得特权教师的整体质量随训练进程持续提升,而非停留在早期能力水平。
两阶段课程学习协调了整体训练节奏。Stage 1(warm-up 阶段)以 SDPO 自蒸馏为主,配合高熵成功轨迹作为教师快速建立基础能力,同时积累成功缓冲区。此阶段模型主要学习"什么样的推理是正确的",而不急于探索多样解法。Stage 2(mixed 阶段)进入混合优化:负样本继续走 SDPO 路径用高奖励成功轨迹作为教师修正错误,正样本切换到 Rhythm-GRPO 路径在节奏门控引导下进行有针对性的策略探索。这种先打牢基础再拓展边界的课程设计,确保了训练过程的稳定性与最终能力的全面性。
实验与结果
DRIFT 的实验覆盖了科学推理与工具使用两大类任务。科学推理部分采用 SciKnowEval 基准的四个子领域——Biology、Chemistry、Materials 与 Physics,这些数据集涵盖本科层级的多领域知识推理,对模型的领域迁移能力有较高要求。工具使用部分采用 ToolUse 任务,基于真实工具调用场景评估模型在行动计划与工具选择上的准确性。
主实验在 Qwen3-8B 上进行,DRIFT 在五个基准的平均得分为 79.5%,显著优于 GRPO 的 70.0%(提升 9.5 个百分点)与 SDPO 的 72.0%(提升 7.5 个百分点)。与同领域的先前最优方法 SRPO 相比,DRIFT 同样实现了 2.1 个百分点的提升。最引人注目的是 ToolUse 任务上的表现:DRIFT 达到 79.2% 的准确率,较 GRPO 提升 13.5%、较 SDPO 提升 10.7%,较 SRPO 提升 8.0 个百分点。这一显著提升被认为源于工具调用任务的特性——正确与错误的工具选择泾渭分明,成功轨迹的监督信号清晰可复用,使得自蒸馏机制能够充分发挥其"从可靠示范中学习"的优势。
跨模型规模的泛化实验验证了方法的有效性与扩展性。Qwen3-4B 上 DRIFT 平均达到 74.6%,较 GRPO 提升 4.9 个百分点、较 SDPO 提升 7.9 个百分点。异家族模型 OLMo3-7B 上的结果更为显著:DRIFT 平均达到 72.8%,较 GRPO 提升 12.0 个百分点、较 SC-SDPO 提升 2.7 个百分点;值得注意的是,该模型的初始能力相对较弱,但 DRIFT 为其带来了最大幅度的提升(部分子任务上超过 42 个百分点),表明难度路由机制能够有效识别模型当前的能力边界并针对性补充。进一步分析还发现,DRIFT 相对于最强基线 SRPO 的领先幅度随模型规模扩大而扩大(4B: +0.4 → 8B: +2.1),这与"自教学能力随模型规模涌现"的研究发现一致,暗示更大规模模型可能从 DRIFT 的精细化信号分配中获得更显著收益。
消融实验逐一验证了三大核心组件的必要性。移除难度路由后,平均得分从 79.5% 下降至 71.7%,表明问题级学习状态追踪对整体性能至关重要——没有它,模型无法区分哪些问题需要持续投入、哪些问题可以减少干预。移除成功缓冲区后,平均得分下降至 72.3%,说明跨批次经验复用有效防止了"狗熊掰棒子"式的遗忘。移除 warm-up 阶段直接进入混合训练,平均得分下降至 74.9%,验证了两阶段课程设计在保证训练稳定性上的价值。这些组件相互依存:难度路由识别学习状态、成功缓冲区保障经验质量、课程学习协调训练节奏,三者共同支撑起 DRIFT 的完整学习流程。
训练动力学分析揭示了 DRIFT 优化过程的内在规律。策略熵在训练初期约 200 步内持续上升,随后稳定在较高水平,反映了模型在探索阶段的策略多样性逐渐建立。成功缓冲区的容量快速填充并趋于饱和,表明高质量历史经验在训练中持续被复用。问题难度分布的演化呈现预期模式:简单题占比逐渐上升、难题占比逐步下降,而中难度题始终保持主导地位——这正是 DRIFT 将主要训练资源投向边界样本的设计目标的体现。
讨论与可借鉴点
DRIFT 为大语言模型的无监督自我提升提供了一条从粗放到精细的进化路径。其核心贡献在于建立了问题级与词元级双层协同的信号分配机制:难度路由解决了"应该从哪些问题中学到什么强度"的问题,节奏门控进一步解决了"应该关注每个问题的哪些推理步骤"的问题。这种分层设计思想为后续研究提供了可借鉴的范式——当训练目标涉及多种能力维度且这些维度之间存在动态权衡时,引入相应的路由与门控机制可能是比单一目标优化更有效的策略。
节奏门控中"教师相对反叛奖励"的设计颇具启发性。传统自蒸馏隐含的假设是教师代表了学生应该追求的目标,但 DRIFT 认识到学生完全可能在某些局部位置超越教师,且这种超越值得被正向鼓励而非被忽视。这一思想突破了传统蒸馏框架中师生关系的单向性,为探索更平等、更鼓励创新的师生互动模式开辟了思路。
实验也揭示了若干值得关注的局限性。首先,难度路由涉及多个阈值参数(如 、),这些参数目前依赖人工设定而缺乏自适应调整机制,在不同任务或模型上的最优取值可能存在差异。其次,实验主要在中小规模模型(最大 8B)上进行,更大规模模型的表现与 Scaling 特性有待验证。最后,评估指标以 mean@16 为主,未深入探讨 pass@k 等更细粒度的能力画像,对模型在不同置信度水平下的表现差异缺乏系统分析。
对于该方向的后续研究,DRIFT 的框架结构提供了多个可探索的延伸点。难度路由的平滑参数 与阈值设定可以尝试基于模型能力自动调整;节奏门控的显著性检测目前依赖师生熵值差异,未来可能引入更丰富的推理结构分析(如思维链因果图);成功缓冲区的容量 与替换策略也值得进一步优化,以更好地平衡历史经验的保留与新知识的整合。
摘要
在复杂推理任务中,使大语言模型在没有外部专家监督的情况下实现稳定的自我提升,仍然是一个核心挑战。现有的自蒸馏与强化学习方法缺乏追踪问题层面学习进度并相应调整优化策略的显式机制。因此,训练过程可能对简单问题过度优化、难以从困难问题中获得有效监督,并且未能充分探索边界情形。为解决这些问题,我们提出了 DRIFT,一个面向大语言模型的在线自我演化策略优化框架。DRIFT 通过联合使用难度路由(Difficulty Routing)与节奏门控(Rhythm Gating)来调节模型的自我提升过程。前者在问题层面识别模型的学习状态,并动态分配自蒸馏与强化学习信号;后者在词元层面精炼策略更新,将探索集中于关键的推理位置。通过进一步引入成功缓冲区与两阶段课程学习策略,DRIFT 在保留高质量历史经验的同时,逐步引导模型从可靠行为的习得走向稳定的策略演化。在五个基准与三种模型规模上的评估表明,DRIFT 在所有评估指标上均超越了 GRPO 与 SDPO 的最佳性能。在五个基准的平均得分上,DRIFT 达到 79.5%,较 GRPO 提升 9.5%,较 SDPO 提升 7.5%,确立了新的最先进结果。值得注意的是,在 ToolUse 任务上,DRIFT 达到 79.2% 的准确率,较 GRPO 提升 13.5%,较 SDPO 提升 10.7%,刷新了最先进水平,并显著优于所有同期方法。
速览
TLDR:大语言模型在无外部专家监督下实现稳定自我提升仍是难题。现有自蒸馏与强化学习方法缺乏对问题级学习进度的显式追踪机制,易过度优化简单题、对难题监督不足。本文提出DRIFT框架,通过难度路由识别问题级学习状态并动态分配自蒸馏与强化学习信号,再以节奏门控在词元级精炼策略更新。配合成功缓冲池与两阶段课程学习,DRIFT在五个基准上全面超越GRPO与SDPO,五项平均79.5%创最优。 \
Motivation:现有自蒸馏与强化学习方法缺乏问题级学习进度追踪机制,易过度优化简单题、对难题监督不足。 \
Method:DRIFT采用难度路由动态分配自蒸馏与强化学习信号,节奏门控在词元级聚焦关键推理位置,并结合成功缓冲池与两阶段课程学习。 \
Result:在五个基准、三种模型规模上全面超越GRPO与SDPO,五项平均79.5%,ToolUse达79.2%创最优。 \
Conclusion:DRIFT为无外部监督下大语言模型自进化策略优化建立了新最优水平。
Abstract
Enabling large language models to achieve stable self-improvement without external expert supervision remains a central challenge in complex reasoning tasks. Existing self-distillation and reinforcement learning methods lack explicit mechanisms for tracking problem-level learning progress and adapting optimization strategies accordingly. Consequently, training may over-optimize easy problems, receive weak supervision from hard problems, and fail to sufficiently explore borderline cases. To resolve these issues, we propose DRIFT, an online self-evolution policy optimization framework for large language models. DRIFT regulates the model's self-improvement process through the joint use of Difficulty Routing and Rhythm Gating. The former identifies the model's learning state at the problem level and dynamically allocates self-distillation and reinforcement learning signals, while the latter refines policy updates at the token level, concentrating exploration on critical reasoning positions. By further incorporating a success buffer and a two-stage curriculum learning strategy, DRIFT preserves high-quality historical experience while progressively guiding the model from reliable behavior acquisition toward stable policy evolution. Evaluated across five benchmarks and three model scales, DRIFT surpasses the peak performance of both GRPO and SDPO across all evaluated metrics. On the average score over the five benchmarks, DRIFT achieves 79.5, outperforming GRPO by 9.5 and SDPO by 7.5, establishing a new state-of-the-art result. Notably, on ToolUse, DRIFT reaches an accuracy of 79.2, improving over GRPO by 13.5 and SDPO by 10.7, setting a new state-of-the-art and substantially outperforming all concurrent methods.
论文详细总结(自动生成)
DRIFT 论文总结
1. 核心问题与研究动机
- 背景:在大语言模型(LLM)的复杂推理任务(如数学、科学推理、工具使用)中,如何在无外部专家监督的情况下实现稳定的自我提升,仍是核心难题。强化学习(RL)与自蒸馏(self-distillation)方法被认为是从模型自身轨迹中学习的两条重要路径。
- 现有方法的局限:
- GRPO 类 RL 方法:组内奖励趋同导致相对优势 弱化,奖励分布不稳定;且优势在序列级别共享,无法定位决定结果的关键 token,信用分配过于粗糙。
- SDPO 类自蒸馏方法:把所有成功样本同等对待,未区分样本来自简单题、边界题还是难题,缺少对问题级学习进度的刻画。
- 组合/路由方法:多数仅依赖当前 batch 内的即时结果,缺乏对问题难度与学习进度的持久表征,导致:
- 已掌握题目反复接收冗余更新;
- 困难题目无法产生可靠监督;
- 高价值的边界样本探索不足。
- 核心矛盾:训练信号未能根据模型不断演化的能力进行问题级与token 级的自适应分配。
2. 方法论:DRIFT 框架
DRIFT 是一个在线自进化策略优化框架,围绕"问题级难度路由 + token 级节奏门控 + 跨 batch 成功缓冲 + 两阶段课程"四大组件展开。
2.1 整体目标函数(混合阶段)
其中 是问题级难度路由权重, 是特权自教师(成功兄弟轨迹), 是token 级节奏门控权重。
- SDPO 分支(针对错误样本,提供 token 级修正):
- Rhythm-GRPO 分支(针对正确样本,保持能力并探索):
其中 。
2.2 难度路由(Difficulty Routing,问题级)
- 使用历史通过率 EMA 平滑问题级难度:
- 按 将问题分为三档,分配不同 RL 权重 :
- 简单题 :(抑制冗余更新);
- 中等题 :(重点探索);
- 困难题 :(避免被误校准的"猜对"误导)。
- 实验默认设置 。
2.3 节奏门控结构化探索(Rhythm-Gated Exploration,token 级)
- 局部超越(教师相对的反叛奖励):
即仅当学生在某个位置上显著优于教师时给出有界奖励。
- 结构性显著性(锚点节奏门):用师生在窗口 内的熵塌陷差定位"结构性关键 token"。
- 经序列内 z-score 归一化与 soft-gate 映射得 ,最终 token 权重为双重筛选:
其中 是样本级"中难度"指示器:仅当样本属于中难度区、且该 token 同时具备教师相对超越与高结构显著性时,才给予放大。
2.4 成功缓冲区(Success Buffer,跨 batch 经验回放)
- 为每个问题 维护 ,(实验取 )。
- 前 个 epoch 仅积累不使用;从 起当 batch 中无成功样本时,从 随机采样 作为教师。
- 缓冲按奖励高低替换,使特权教师随训练进程持续变强。
2.5 两阶段课程学习
- Stage 1(warm-up):以 SDPO 为主,采用"奖励优先、熵次之"的教师选择策略(高熵成功轨迹作为教师),同时积累成功缓冲,实现快速能力启动。
- Stage 2(mixed):负样本走 SDPO(用最高奖励、且同分时最短的成功兄弟作为教师),正样本走 Rhythm-GRPO,组合优化走向稳定收敛。
3. 实验设计
3.1 数据集与基准
- 五个基准:Biology、Chemistry、Materials、Physics(来自 SciKnowEval 的科学推理子集,涵盖本科级多领域推理)+ Tool Use(基于 ToolAlpaca 的工具调用任务)。
- 每个基准按 SDPO 设置切分为训练集/测试集,用于衡量域内泛化。
3.2 模型规模
- Qwen3-8B(主模型,含消融与训练动力学分析);
- Qwen3-4B(同家族更小规模);
- OLMo3-7B(异家族模型)。
3.3 对比方法
- 自复现(统一框架下):GRPO、SDPO;
- 引用文献结果:SRPO、DistIL、SC-SDPO、PGPO。
3.4 评估指标
- 主要使用 mean@16 准确率;附录报告 best@16。
4. 资源与算力
- 硬件:8 张 NVIDIA H200 GPU。
- 训练:400+ 个优化步。
- 论文明确指出报告单位为训练步数而非 wall-clock time(参考 SC-SDPO 的设定),以保证跨硬件环境的可复现比较。
- 成功缓冲区内存开销约 0.2–0.3 GB,对模型权重与优化器状态而言可忽略。
- 算力细节(如每步耗时、总 GPU 小时数)未在文中明确报告。
5. 实验数量与充分性
- 主结果:3 个模型 × 5 个基准 = 至少 3 张主结果表(Table 1–2),覆盖 GRPO/SDPO 的自复现与多类同期方法对比。
- 训练动力学:训练熵、响应长度、成功缓冲增长、问题难度分桶演化(Figure 4–5)。
- 消融实验:Table 3 给出 4 组消融(去掉难度路由 / 成功缓冲 / warm-up),加 Figure 6 的轨迹对比,验证三大组件各自的贡献。
- 附录补充:Figure 7 的 STEM 验证曲线 + Table 4 的 best@16 结果。
- 充分性评价:
- 覆盖了多模型家族、多规模、多基准,且与同期 SOTA 对比充分;
- 消融结构清晰,每个核心组件都有单独移除实验;
- 但未提供超参数敏感性实验、未报告方差/置信区间(多次种子平均),统计显著性不明;
- 主要评估为 mean@16,未与 pass@k 等更精细指标深入对比;
- 与同期方法(SRPO/SC-SDPO/PGPO)的对比基于引用数字而非统一复现,存在复现偏差风险。
6. 主要结论与发现
- 整体性能:DRIFT 在 Qwen3-8B 上五个基准平均 79.5%,较 GRPO(70.0%)提升 9.5%,较 SDPO(72.0%)提升 7.5%;较先前最强基线 SRPO(77.4%)提升 2.1 点。
- Tool Use 提升最显著:79.2% 准确率,较 GRPO 提升 13.5%,较 SDPO 提升 10.7%,较 SRPO 提升 8.0 点;归因于工具调用正误信号清晰、成功演示标准化,自蒸馏可重复利用价值高。
- 跨模型泛化:
- Qwen3-4B:平均 74.6%(较 GRPO +4.9、SDPO +7.9、SRPO +0.4);
- OLMo3-7B:平均 72.8%(较 GRPO +12.0、SC-SDPO +2.7),起始能力越弱提升越大(+42.3 点)。
- 跨规模趋势:相对最强基线 SRPO 的领先随模型规模扩大而扩大(4B: +0.4 → 8B: +2.1),与"自教学能力随模型规模涌现"的现象一致。
- 组件必要性:难度路由、success buffer、warm-up 任一缺失均带来显著退化(平均 71.7%–74.9%)。
- 训练动力学:策略熵前 ~200 步上升后稳定;成功缓冲快速增长至饱和;简单题占比上升、难题占比下降、中等题保持主导。
7. 优点
- 机制层面:
- 问题级 + token 级双层信号精炼设计清晰:难度路由做宏观分配,节奏门控做微观定位;
- 引入"教师相对反叛奖励"避免把教师当作不可逾越上界,鼓励学生局部超越;
- 用师生熵塌陷差定义结构锚点,避免对格式化符号等低语义 token 的无差别放大;
- 成功缓冲提供持续增强的特权教师,缓解 batch 内正样本稀缺问题。
- 工程层面:
- 两阶段课程设计合理(先 SDPO 高效启动 → 混合 SDPO+GRPO 稳定收敛);
- 成功缓冲用 reward-based 替换 + 内存开销小(约 0.2–0.3 GB);
- 采用 EMA 平滑 pass rate,提升难度划分稳定性。
- 实验层面:
- 覆盖多模型、多规模、多领域基准;
- 报告了训练动力学曲线和完整消融,论证较为系统;
- 在 Tool Use、STEM 推理两类典型复杂任务上同时取得 SOTA。
8. 不足与局限
- 统计性不足:
- 未报告多次随机种子均值与置信区间,无法判断差异显著性;
- 评估主要基于 mean@16,未与 pass@k 演化曲线等更细粒度指标做系统对比。
- 对比公平性:
- 对 SRPO、DistIL、SC-SDPO、PGPO 直接引用其论文结果而非统一复现,复现偏差风险较高;
- GRPO/SDPO 自复现的绝对值与原论文存在差异(如 GRPO 在 Qwen3-8B 仅 63.0% vs. 报告值 70.0%),可能影响基线排序。
- 超参数与训练细节披露不充分:
- 、、、、窗口 、、、 等节奏门控关键超参未在正文中给出,复现成本较高;
- 未提供训练 token / 数据量级、wall-clock 时间、单卡吞吐等算力细节。
- 任务与场景覆盖有限:
- 仅在科学推理与工具调用两类任务上验证,未覆盖数学竞赛、代码生成、长文本对话等典型复杂推理场景;
- 仅在 4B/7B/8B 量级上验证,对更大模型(如 30B+)的可扩展性未知;
- 仅考察指令微调过的中等规模模型,未在预训练基模型上验证。
- 方法论局限:
- 难度划分依赖单一指标(pass rate),对开放式生成、答案格式不统一的任务可能不适用;
- 节奏门控的"结构性锚点"基于熵差,对低熵但关键的推理步骤(如最终结论 token)是否被充分覆盖未做深入分析;
- 成功缓冲采用随机采样而非优先级采样,可能未最大化高质量样本的利用;
- 仅当 batch 内完全无正样本时才使用缓冲,可能在部分成功场景下错失经验回放机会。
- 潜在偏差风险:
- 多选题类数据集上"猜对但 CoT 错"的情况被识别,但未量化该现象对训练信号污染的程度;
- 不同基准间训练/测试分布差异未做严格控制,域内泛化结论需谨慎外推。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。







