引用本概念的论文(2)
- RLVR 中的奖励粒度:比较小语言模型数学推理的过程奖励与结果奖励结构 Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models arXiv 2607.02869
- LOTAPO:面向多轮搜索推理的自生成过程奖励的留一回合归因方法 LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning arXiv 2607.13501