引用本概念的论文(4)
- 基于确定性策略的扩展均值场控制Actor-Critic学习 Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies arXiv 2607.11005
- 基于状态感知探索的双流强化学习 Dual-Flow Reinforcement Learning with State-Aware Exploration arXiv 2606.29820
- 强化学习中分类评论家的支撑集学习 Learning the Supports for Categorical Critic in Reinforcement Learning arXiv 2607.01880
- 通过平滑安全结构化策略组合实现安全在线学习 Safe Online Learning via Smooth Safety-Structured Policy Composition arXiv 2606.31320