引用本概念的论文(1) 通过直接同策略蒸馏实现的由弱到强泛化 Weak-to-Strong Generalization via Direct On-Policy Distillation arXiv 2607.05394
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 Direct On-Policy Distillation (Direct-OPD) method · 共现 1 On-Policy Learning methodology · 共现 1 Policy Distillation method · 共现 1 Weak-to-Strong Generalization problem · 共现 1 可验证奖励强化学习 method · 共现 1