引用本概念的论文(2)
- 面向多任务智能体强化学习的熵调步策略优化 Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning arXiv 2607.07178
- 面向高效多轮强化学习的过程奖励引导树状展开 Process Reward Informed Tree Rollout for Effective Multi-Turn RL arXiv 2607.15610
slug: exploration-exploitation-tradeoff
在引用本概念的论文中,与下列概念同时出现的次数(降序)。