← 返回概念图谱 引用本概念的论文(6)
- 多模态强化学习中的奖励黑客 Multimodal Reward Hacking in Reinforcement Learning arXiv 2607.09492
- 超越静态评估:为可扩展的智能体强化学习构建仿真环境 Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning arXiv 2607.05773
- RSPO:面向多轮 LLM 智能体的奖励交换策略优化 RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents arXiv 2607.04713
- 通过心理学奠基的推理与角色感知策略优化改进通用角色扮演智能体 Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization arXiv 2606.27025
- 利用视觉语言模型引导实现基于势能的奖励塑造自动化 Automating Potential-based Reward Shaping with Vision Language Model Guidance arXiv 2606.27180
- 用于强化学习的阶段转换稠密奖励建模 Stage-Transition Dense Reward Modeling for Reinforcement Learning arXiv 2606.31377
共现相关概念
在引用本概念的论文中,与下列概念同时出现的次数(降序)。