引用本概念的论文(3)
- RSPO:面向多轮 LLM 智能体的奖励交换策略优化 RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents arXiv 2607.04713
- 面向高效多轮强化学习的过程奖励引导树状展开 Process Reward Informed Tree Rollout for Effective Multi-Turn RL arXiv 2607.15610
- RL后训练算力应投向何处:模型规模、搜索、学习与反馈 Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback arXiv 2607.13389