引用本概念的论文(2)
- ARMOR:用离线策略锚定样本稳定在线LLM强化学习 ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples arXiv 2607.10481
- CRAFT:基于自由兄弟回滚的反事实信用分配用于自蒸馏智能体强化学习 CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning arXiv 2606.29476