引用本概念的论文(3)
- 将 RL 诱导的工具使用定位到单个 Crosscoder 特征 Localizing RL-Induced Tool Use to a Single Crosscoder Feature arXiv 2606.26474
- SPyCE:面向多模态智能体的技能-策略协同进化 SPyCE: Skill-Policy Co-evolution for Multimodal Agents arXiv 2607.13854
- TRACE:基于信用估计的回合级奖励分配用于长程智能体 TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents arXiv 2607.13988