← 返回概念图谱 引用本概念的论文(7)
- 强化学习的数学方法 Mathematical methods of reinforcement learning arXiv 2607.06935
- $\max$@$k$ 强化学习的理论基础 Theoretical Foundations of $\max$@$k$ Reinforcement Learning arXiv 2607.17823
- 为 Boltzmann 合理性提供理论基础:熵正则化策略的公理化表征 Rationalizing Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies arXiv 2607.17316
- 工具自适应的 LLM 重排序器 Tool-Adaptive LLM Reranker arXiv 2607.10555
- 基于多智能体深度强化学习与Petri网的柔性制造系统动态调度 Dynamic Scheduling for Flexible Manufacturing Systems Based on Multi-Agent Deep Reinforcement Learning and Petri Nets arXiv 2606.31737
- 面向黑盒节点注入攻击图神经网络的靶向感知交互引导强化学习方法 Target-Aware Interaction-Guided Reinforcement Learning for Black-Box Node Injection Attacks on Graph Neural Networks arXiv 2607.04091
- 决斗Q学习的谱分析 Spectral Analysis of Dueling Q-Learning arXiv 2607.08340
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。