引用本概念的论文(9)
- LatentSkill:面向 LLM 智能体、从上下文文本技能到权重内潜在技能 LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents arXiv 2606.06087
- 下一代智能体强化学习系统赋能自进化智能体 Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents arXiv 2607.01120
- SAGA:面向长视野 CivRealm 战略规划的场景感知、目标演进智能体 SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning arXiv 2606.29932
- TRACE:基于信用估计的回合级奖励分配用于长程智能体 TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents arXiv 2607.13988
- 分支策略优化:沙箱原生语言智能体强化学习 Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning arXiv 2607.14171
- 虚构世界构建:分层上下文压缩与迭代审阅的多智能体LLM协作 Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review arXiv 2607.09403
- Agentic-DPO:从模仿到基于专家轨迹的智能体策略优化 Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories arXiv 2607.10601
- SEED:面向智能体强化学习的自我进化同策略蒸馏 SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning arXiv 2607.14777
- 回答还是弃答:通过弃答感知强化学习缓解搜索智能体幻觉 To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning arXiv 2607.10738