引用本概念的论文(1) RL后训练算力应投向何处:模型规模、搜索、学习与反馈 Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback arXiv 2607.13389
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 Compute Allocation Frontiers methodology · 共现 1 FLOP Accounting Framework methodology · 共现 1 GRPO (Group Relative Policy Optimization) method · 共现 1 LoRA method · 共现 1 Process Reward Model method · 共现 1