引用本概念的论文(5)
- AlphaZero 在稀疏奖励博弈中的研究:局限性与辅助监督 AlphaZero in Sparsely Rewarded Games: Limits and Auxiliary Supervision arXiv 2607.08984
- SEED:面向智能体强化学习的自演化在策略蒸馏方法 SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning arXiv 2607.14777
- 以少学多:基于事后回溯的强化学习 Learning More from Less: Reinforcement Learning from Hindsight arXiv 2607.09042
- SAGA:面向长视野 CivRealm 战略规划的场景感知、目标演进智能体 SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning arXiv 2606.29932
- 利用视觉语言模型引导实现基于势能的奖励塑造自动化 Automating Potential-based Reward Shaping with Vision Language Model Guidance arXiv 2606.27180