引用本概念的论文(2)
- 强化学习也会遗忘!迈向持续策略优化 RL Forgets! Towards Continual Policy Optimization arXiv 2607.04364
- 更密集≠更好:持续后训练中在线自蒸馏的局限性 Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training arXiv 2607.01763
slug: catastrophic-forgetting
在引用本概念的论文中,与下列概念同时出现的次数(降序)。