引用本概念的论文(2)
- 用于强化学习的阶段转换稠密奖励建模 Stage-Transition Dense Reward Modeling for Reinforcement Learning arXiv 2606.31377
- 用语义强化学习自适应通用机器人策略 Adapting Generalist Robot Policies with Semantic Reinforcement Learning arXiv 2606.31958
slug: long-horizon-manipulation
在引用本概念的论文中,与下列概念同时出现的次数(降序)。