引用本概念的论文(3)
- ORCAID:用于深度强化学习策略的基于斜向规则的连续动作解释 ORCAID: Oblique Rule-Based Continuous-Action Interpretation for Deep RL Policies arXiv 2607.07235
- 信任域策略蒸馏 Trust Region Policy Distillation arXiv 2607.04751
- 通过直接同策略蒸馏实现的由弱到强泛化 Weak-to-Strong Generalization via Direct On-Policy Distillation arXiv 2607.05394