引用本概念的论文(2)
- 无需 Bellman 完备性的拟合占据比评估 Fitted Occupancy-Ratio Evaluation without Bellman Completeness arXiv 2607.05375
- 主动式离线到在线强化学习 Active Offline-to-Online Reinforcement Learning arXiv 2607.11720
slug: off-policy-evaluation
在引用本概念的论文中,与下列概念同时出现的次数(降序)。