引用本概念的论文(5)
- BV-Blend:基于不确定性加权历史基线的稳定无评论家可验证奖励强化学习 BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards arXiv 2606.28707
- Aggregate in the Advantage, Not the Ratio: A Canonical-Form Analysis of Cooperative Multi-Agent Policy Optimization arXiv 2607.17924
- 面向智能体强化学习的进度与可靠性导向分组策略优化 Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning arXiv 2607.04242
- 分支策略优化:沙箱原生语言智能体强化学习 Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning arXiv 2607.14171
- 通过自蒸馏增强基于评分标准的强化学习 Enhancing Rubric-based RL via Self-Distillation arXiv 2607.18082