引用本概念的论文(1) RLVR 中的奖励粒度:比较小语言模型数学推理的过程奖励与结果奖励结构 Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models arXiv 2607.02869
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 GRPO (Group Relative Policy Optimization) method · 共现 1 GSM8K dataset · 共现 1 Mathematical Reasoning problem · 共现 1 Process Reward method · 共现 1 可验证奖励强化学习 method · 共现 1