← 返回概念图谱 引用本概念的论文(8)
- SEED:面向智能体强化学习的自我进化同策略蒸馏 SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning arXiv 2607.14777
- ToolVerse:解锁大规模环境与长程任务以赋能智能体强化学习 ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning arXiv 2607.15660
- UCOB:通过信用感知的在线策略双向自蒸馏学习利用与演化智能体技能 UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation arXiv 2606.29502
- 感知工具链的自演化:模型权重、工具链与任务方案的协同演化 Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions arXiv 2607.03935
- 超越静态评估:为可扩展的智能体强化学习构建仿真环境 Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning arXiv 2607.05773
- SEED:面向智能体强化学习的自演化在策略蒸馏方法 SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning arXiv 2607.14777
- 面向智能体强化学习的单次采样异步优化 Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning arXiv 2607.07508
- 面向智能体强化学习的进度与可靠性导向分组策略优化 Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning arXiv 2607.04242
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。