引用本概念的论文(3)
- ARKD:面向文本生成的自适应强化学习引导双向 KL 散度蒸馏方法 ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation arXiv 2606.29869
- 通过自蒸馏增强基于评分标准的强化学习 Enhancing Rubric-based RL via Self-Distillation arXiv 2607.18082
- TurnOPD:使在线策略蒸馏具备轮次感知能力,以实现高效长视野智能体训练 TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training arXiv 2607.05804