引用本概念的论文(4)
- Aggregate in the Advantage, Not the Ratio: A Canonical-Form Analysis of Cooperative Multi-Agent Policy Optimization arXiv 2607.17924
- 一项关于轻量级博弈智能体何以强大的金标准研究 A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong arXiv 2607.06854
- FootsiesGym:一种面向双人零和不完美信息博弈的格斗游戏基准 FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games arXiv 2607.06514
- GEOALIGN:用于鲁棒大语言模型强化学习的几何化轨迹筛选 GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning arXiv 2606.26917