引用本概念的论文(1) RSPO:面向多轮 LLM 智能体的奖励交换策略优化 RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents arXiv 2607.04713
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 GRPO (Group Relative Policy Optimization) method · 共现 1 Multi-turn LLM Agent other · 共现 1 Off-policy Importance Sampling methodology · 共现 1 Process Reward Model method · 共现 1 Reward Hacking problem · 共现 1 RSPO (Reward-Swap Policy Optimization) method · 共现 1