引用本概念的论文(1) 更密集≠更好:持续后训练中在线自蒸馏的局限性 Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training arXiv 2607.01763
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 Catastrophic Forgetting problem · 共现 1 GRPO (Group Relative Policy Optimization) method · 共现 1 On-Policy Self-Distillation method · 共现 1 Out-of-Distribution Generalization problem · 共现 1 Self-Distillation Policy Optimization (SDPO) method · 共现 1