← 返回概念图谱 引用本概念的论文(10)
- RL后训练算力应投向何处:模型规模、搜索、学习与反馈 Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback arXiv 2607.13389
- CRAFT:基于自由兄弟回滚的反事实信用分配用于自蒸馏智能体强化学习 CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning arXiv 2606.29476
- RLVR 中的奖励粒度:比较小语言模型数学推理的过程奖励与结果奖励结构 Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models arXiv 2607.02869
- RSPO:面向多轮 LLM 智能体的奖励交换策略优化 RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents arXiv 2607.04713
- 更密集≠更好:持续后训练中在线自蒸馏的局限性 Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training arXiv 2607.01763
- 超越熵:基于对比策略优化的正确性感知的优势塑形 Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization arXiv 2607.14614
- ATOD:用于多轮自主智能体的退火轮次感知在策略蒸馏算法 ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents arXiv 2606.27814
- 多模态强化学习中的奖励黑客 Multimodal Reward Hacking in Reinforcement Learning arXiv 2607.09492
- ToolVerse:解锁大规模环境与长程任务以赋能智能体强化学习 ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning arXiv 2607.15660
- 面向高效多轮强化学习的过程奖励引导树状展开 Process Reward Informed Tree Rollout for Effective Multi-Turn RL arXiv 2607.15610
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。