引用本概念的论文(3)
- RLVR 中的奖励粒度:比较小语言模型数学推理的过程奖励与结果奖励结构 Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models arXiv 2607.02869
- MADA-RL:面向紧凑模型参数高效推理的多智能体辩论感知强化学习 MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models arXiv 2607.18006
- 信任域策略蒸馏 Trust Region Policy Distillation arXiv 2607.04751