引用本概念的论文(1) 分支策略优化:沙箱原生语言智能体强化学习 Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning arXiv 2607.14171
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 LLM Agent problem · 共现 1 Sandbox Execution architecture · 共现 1 Variance Reduction methodology · 共现 1 优势估计 methodology · 共现 1 组相对策略优化 method · 共现 1