引用本概念的论文(2)
- 面向大语言模型推理的经验增强策略优化 Experience Augmented Policy Optimization for LLM Reasoning arXiv 2606.30420
- ARMOR:用离线策略锚定样本稳定在线LLM强化学习 ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples arXiv 2607.10481
slug: llm-reasoning
在引用本概念的论文中,与下列概念同时出现的次数(降序)。