← 返回概念图谱 引用本概念的论文(8)
- BV-Blend:基于不确定性加权历史基线的稳定无评论家可验证奖励强化学习 BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards arXiv 2606.28707
- 以少学多:基于事后回溯的强化学习 Learning More from Less: Reinforcement Learning from Hindsight arXiv 2607.09042
- 路由、通信与推理:用于高效多智能体推理的门控路由与自适应深度 Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning arXiv 2607.10836
- 面向多任务智能体强化学习的熵调步策略优化 Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning arXiv 2607.07178
- 分支策略优化:沙箱原生语言智能体强化学习 Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning arXiv 2607.14171
- 面向智能体强化学习的单次采样异步优化 Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning arXiv 2607.07508
- DemoPSD:基于分歧调制的策略自蒸馏 DemoPSD: Disagreement-Modulated Policy Self-Distillation arXiv 2607.02502
- 信任域策略蒸馏 Trust Region Policy Distillation arXiv 2607.04751
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。