引用本概念的论文(3)
- CRAFT:基于自由兄弟回滚的反事实信用分配用于自蒸馏智能体强化学习 CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning arXiv 2606.29476
- SafeExplorer:一种带恢复干预的无偏强化学习策略梯度 SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions arXiv 2607.08925
- 面向大语言模型推理的经验增强策略优化 Experience Augmented Policy Optimization for LLM Reasoning arXiv 2606.30420