引用本概念的论文(1) ARMOR:用离线策略锚定样本稳定在线LLM强化学习 ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples arXiv 2607.10481
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 KL Regularization method · 共现 1 Policy Optimization method · 共现 1 Reinforcement Learning method · 共现 1 大语言模型推理 problem · 共现 1 过度优化 problem · 共现 1