← 返回概念图谱 引用本概念的论文(5)
- RLVR 中的奖励粒度:比较小语言模型数学推理的过程奖励与结果奖励结构 Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models arXiv 2607.02869
- 超越熵:基于对比策略优化的正确性感知的优势塑形 Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization arXiv 2607.14614
- 面向大语言模型推理的经验增强策略优化 Experience Augmented Policy Optimization for LLM Reasoning arXiv 2606.30420
- 带可验证物理的强化学习:用连续奖励对LLM进行后训练 Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards arXiv 2607.10474
- 通过直接同策略蒸馏实现的由弱到强泛化 Weak-to-Strong Generalization via Direct On-Policy Distillation arXiv 2607.05394
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。