引用本概念的论文(7)
- 策略优化在未知转移的马尔可夫决策过程中实现数据依赖的遗憾界 Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions arXiv 2606.31769
- 通过自蒸馏增强基于评分标准的强化学习 Enhancing Rubric-based RL via Self-Distillation arXiv 2607.18082
- ARMOR:用离线策略锚定样本稳定在线LLM强化学习 ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples arXiv 2607.10481
- 面向大语言模型推理的经验增强策略优化 Experience Augmented Policy Optimization for LLM Reasoning arXiv 2606.30420
- 扩散引导的不确定性感知延迟策略优化 Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization arXiv 2607.05064
- 通过心理学奠基的推理与角色感知策略优化改进通用角色扮演智能体 Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization arXiv 2606.27025
- LOTAPO:面向多轮搜索推理的自生成过程奖励的留一回合归因方法 LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning arXiv 2607.13501