← 返回概念图谱 引用本概念的论文(6)
- TRACE:基于信用估计的回合级奖励分配用于长程智能体 TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents arXiv 2607.13988
- 当不可信词元被强化时:面向大语言模型强化学习的尾部感知信用校准 When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning arXiv 2607.07976
- UCOB:通过信用感知的在线策略双向自蒸馏学习利用与演化智能体技能 UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation arXiv 2606.29502
- 面向智能体强化学习的进度与可靠性导向分组策略优化 Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning arXiv 2607.04242
- 基于关键步骤感知自反馈重试的智能体强化学习 Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry arXiv 2607.03702
- 面向多智能体系统的时延感知编排学习 Learning Latency-Aware Orchestration for Multi-Agent Systems arXiv 2607.13359
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。