Game AI

博弈 AI

Game-playing agents, online decision-making, opponent modeling, StarCraft / Honor of Kings / poker. — 博弈代理、在线决策、对手建模,涵盖 StarCraft / 王者荣耀 / 扑克等场景。

10 篇论文 56 个高频概念 维护 · DPR
2607.10309v1 07-14 2026 0.95

衡量仿真到现实的差距:为人工智能物联网系统中的强化学习设计经济实惠的真实世界基准平台

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

🕸 7 概念 📅 2026-07-14
2305.16291 05-25 2023 0.95

Voyager:基于大语言模型的开放式终身具身智能体

Voyager: An Open-Ended Embodied Agent with Large Language Models

📅 2023-05-25
2606.27025v1 06-25 2026 0.90

通过心理学奠基的推理与角色感知策略优化改进通用角色扮演智能体

Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization

🕸 7 概念 📅 2026-06-25
2607.06854v1 07-07 2026 0.85

一项关于轻量级博弈智能体何以强大的金标准研究

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

🕸 7 概念 📅 2026-07-07
2607.00642v1 07-01 2026 0.85

面向交互式游戏的可指导智能体

Coachable agents for interactive gameplay

🕸 7 概念 📅 2026-07-01
2606.29932v1 06-29 2026 0.85

SAGA:面向长视野 CivRealm 战略规划的场景感知、目标演进智能体

SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning

🕸 7 概念 📅 2026-06-29
2606.27909v1 06-26 2026 0.85

三元狼人杀:面向大语言模型多跳心智理论的弄臣角色

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

🕸 6 概念 📅 2026-06-26
2510.18483v1 10-21 2025 0.85

StarBench:面向智能体多模态决策与信息寻求的回合制 RPG 基准

StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking

🕸 7 概念 📅 2025-10-21
2607.06514v1 07-07 2026 0.80

FootsiesGym:一种面向双人零和不完美信息博弈的格斗游戏基准

FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

🕸 7 概念 📅 2026-07-07
2606.29511v1 06-28 2026 0.80

强化学习视角下的《超级马里奥兄弟》:1-1 关的课程设计、教学法与最优关卡设计

Reinforcement Learning in Super Mario Bros: Curriculum, Pedagogy, and Optimal Level Design in World 1-1

🕸 6 概念 📅 2026-06-28
已纳入 ✨ wiki 📄 PDF

衡量仿真到现实的差距:为人工智能物联网系统中的强化学习设计经济实惠的真实世界基准平台

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

arXiv:2607.10309v1 2026-07-14
0.95 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

rlgame-aibenchmark
重要图片 · 48 张
TL;DR

论文针对AIoT系统中强化学习缺乏通用仿真到现实基准平台的问题,利用低于400美元的市售组件构建了一个真实世界基准平台,其中边缘设备上的RL智能体通过硬件模拟键盘和视觉输入在主机上玩电子游戏,以游戏得分最大化为目标天然规避了安全风险。实验发现仿真训练的智能体部署到真实环境后性能下降高达1160%,证实了显著的仿真到现实差距。而直接在真实环境中使用DQN训练一千万步后,可达到约38%的人类水平性能,验证了真实世界RL的可行性。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

强化学习作为人工智能领域的核心技术之一,近年来在游戏、机器人控制、自动驾驶等场景中取得了令人瞩目的成就。在 AIoT 系统中,强化学习同样被寄予厚望——智能家居设备可以学习用户的作息习惯自动调节温控,工业传感器能够自主优化数据采集策略,自动驾驶车辆在边缘端实时做出决策。然而,[[强化学习]] 的本质是「试错学习」,智能体需要通过不断尝试、接收奖励反馈、调整策略来逐步提升性能。这种探索过程在真实环境中往往成本高昂甚至危险重重——试想一个正在学习行走的机器人如果每次摔倒都可能损坏昂贵的硬件,或者一辆自动驾驶汽车在真实道路上「探索」各种危险驾驶行为。

正因如此,绝大多数强化学习研究选择在仿真环境中进行。仿真环境提供了可控的、廉价的、可无限重置的实验条件,研究者可以在短时间内完成数百万步的训练迭代。然而,这种对仿真的依赖引入了一个根本性的挑战:[[仿真到现实]](Sim-to-Real)迁移问题。在仿真中表现优异的策略,部署到真实物理世界后常常出现性能急剧下降甚至完全失效的情况。这是因为仿真环境无论如何精细,都难以完美复现真实世界的物理特性、传感器噪声、延迟特性等细节。

为了应对这一挑战,机器人领域已经开发了多种同步仿真与物理平台(Sim-to-Real platforms),用于评估和缩小仿真与现实之间的差距。但在 AIoT 领域,这样一个通用的仿真到现实基准平台一直付诸阙如。研究者们往往各自搭建实验环境,导致实验结果难以复现、不同方法之间缺乏公平对比。针对这一空白,本文提出了一种专门面向 AIoT 系统的真实世界基准平台,旨在为强化学习在 AIoT 中的研究和应用提供可靠的评测基础。

方法

这篇论文的核心贡献是搭建了一个低成本、可复现的[[仿真到现实]]基准平台。整个系统的设计思路非常巧妙:用电子游戏作为实验载体,让强化学习智能体学习玩游戏,既保留了强化学习的核心挑战,又天然规避了真实世界 RL 部署的安全风险。

具体来说,系统由三个核心部分组成。第一部分是边缘设备,研究者将强化学习智能体部署在树莓派或其他低成本的边缘计算设备上,负责运行决策算法并生成控制指令。第二部分是主机,一台独立的普通计算机,运行 Atari 游戏模拟器(如 Pong、Breakout 等经典游戏)作为任务环境。第三部分是硬件模拟键盘,这是整个系统的关键创新点——边缘设备不通过软件 API 而是通过一块微控制器硬件模拟键盘输入信号,直接控制游戏中的角色动作。这种硬件层级的交互方式更接近真实世界的传感器-执行器闭环,更能反映真实部署场景中的信号传输延迟和噪声特性。

在输入端,系统使用视觉信息作为智能体的观测——边缘设备通过摄像头捕捉游戏的屏幕画面,经过预处理后作为神经网络的输入。这种基于视觉的输入方式与许多真实世界的 AIoT 应用场景(如视频监控、自动驾驶视觉感知)高度一致,增加了实验的实际参考价值。整个平台的硬件成本控制在 400 美元以内,使用的是市面上随时可购得的普通组件,确保了其他研究者能够轻松复现。

研究者采用 [[深度Q网络]](DQN)作为主要的强化学习算法。DQN 是深度强化学习领域的经典算法,使用卷积神经网络逼近状态-动作值函数(Q函数),通过经验回放和目标网络等技巧稳定训练过程。选择 DQN 的原因在于它具有良好的可复现性、相对成熟的技术栈,以及足够的代表性——如果 DQN 能在该平台上展现可接受的性能,说明该平台对于更复杂的强化学习算法同样具有适用性。

实验与结果

实验设计围绕两个核心问题展开:仿真训练的智能体在真实环境中表现如何,以及直接在真实环境中训练强化学习是否可行。

第一个实验考察了[[仿真到现实]]差距的严重程度。研究者首先在标准仿真环境中(Atari 游戏模拟器)用 DQN 训练了 Breakout 和 Pong 两个游戏,达到了约 100% 的人类水平性能——也就是说,在仿真中智能体已经能够与人类玩家相媲美。然而,当这些「仿真冠军」被部署到真实世界的基准平台上时,性能出现了灾难性的下降。以 Breakout 游戏为例,智能体在真实环境中的得分仅为仿真环境的十分之一左右,综合评估显示性能相对于人类基准下降了 1160%。这个数字背后的含义是:原本在仿真中与人类旗鼓相当的智能体,到了真实环境中连人类玩家的百分之一都不如。这种巨大的落差生动地说明了仿真与现实之间那条看似微小的鸿沟,实际上可能是多么难以逾越。

研究者分析了导致这一巨大差距的可能原因。仿真环境中的游戏帧率是恒定且精确的,而真实摄像头捕捉的画面存在帧率波动;仿真中的键盘输入响应时间是零延迟的,而硬件模拟键盘引入了真实的信号传输延迟;仿真环境中的视觉输入是完美的像素级复制,而摄像头捕捉的画面存在光照变化、视角畸变、噪点干扰等真实世界的「狼狈」。正是这些在仿真中被忽视或理想化的细节,在真实部署时逐一暴露出来,成为性能杀手。

第二个实验探索了真实世界强化学习的可行性。研究者直接在真实环境中启动 DQN 训练,让智能体从零开始学习玩游戏。这个过程耗时更长、成本更高——总共训练了一千万步。实验结果表明,经过充分训练后,智能体在 Breakout 游戏中达到了约 38% 的人类水平性能。虽然与仿真训练的「完美」表现相去甚远,但这个结果证明了一个重要的命题:在真实世界中直接训练强化学习是可行的,只是需要更长的训练时间和更鲁棒的方法。

两种训练方式的对比清晰地揭示了当前强化学习研究的一个核心困境:仿真环境提供了高效的训练条件但无法保证迁移能力,真实环境提供了真实的挑战但训练成本高昂。这恰恰凸显了可靠的仿真到现实基准平台的必要性——它为研究者提供了在受控环境中系统性地研究迁移问题的工具。

讨论与可借鉴点

这项研究的最直接贡献是提供了一个可复现、低成本、面向 AIoT 领域的仿真到现实基准平台。这填补了该领域的一个重要空白——此前研究者要评估 RL 方法的仿真到现实迁移能力,往往需要自行搭建昂贵的硬件平台,或者借用机器人领域不具代表性的环境。有了这个平台,研究者可以在标准化的条件下对比不同算法、不同网络架构、不同训练策略的迁移效果,加速该领域的知识积累。

从更宏观的角度看,这项研究揭示的问题——1160% 的性能落差——对整个强化学习社区都具有警示意义。我们常用「simulation-to-reality gap」来描述这个问题,但这篇论文用具体的数字让我们意识到这个 gap 可能比我们想象的更加严峻。这意味着,对于任何希望在真实世界中部署强化学习的应用——无论是智能制造、自动驾驶还是 AIoT——都需要认真对待仿真环境的建模精度问题,而不是简单地将仿真结果等同于真实性能。

论文也存在一定的局限性。首先,游戏任务的复杂度相对有限,真实世界的 AIoT 任务往往涉及更复杂的时序依赖、多智能体交互和安全性约束。其次,平台仅使用了视觉输入,在一些依赖其他传感器模态的 AIoT 场景中代表性有限。第三,38% 的人类水平性能虽然证明了可行性,但距离实用仍有差距,说明更先进的真实世界 RL 算法值得进一步探索。

对于后续研究而言,这个平台可以作为一个良好的起点。例如,可以在此基础上研究如何减小仿真到现实的差距(如 Domain Randomization、World Models、对抗训练等方法);也可以探索更高效的边缘端在线学习算法,降低真实世界训练的计算成本;还可以将平台扩展到更多类型的任务,如多智能体协作、时间敏感控制等。

概念 · 7 个
摘要

构建真实世界RL基准平台并量化仿真到现实差距,属于强化学习与智能体部署研究。

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.10309v1
发布日期
2026-07-14
PDF
https://arxiv.org/pdf/2607.10309v1
相关度
0.950
已纳入 ✨ wiki 📄 PDF

Voyager:基于大语言模型的开放式终身具身智能体

Voyager: An Open-Ended Embodied Agent with Large Language Models

Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar

arXiv:2305.16291 2023-05-25
0.95 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

rlgame-ai
重要图片 · 2 张
TL;DR

Voyager 是首个由 GPT-4 驱动的 Minecraft 终身学习具身智能体,通过自动课程最大化探索、不断增长的代码技能库存储可复用行为、以及融合环境反馈与自验证的迭代提示机制,在无人工干预下持续解锁新物品与科技树。相对 ReAct/Reflexion/AutoGPT,独特物品数提升 3.3×,科技树里程碑解锁速度最高提升 15.3×,并能零样本在新世界复用工件技能库,而基线方法几乎无法泛化。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

Minecraft 之所以被视为检验人工智能持续学习能力的"试金石",在于它同时具备三个独特属性。首先,程序生成的无尽地图意味着每次开局面对的 3D 地形、生物群系和地下结构都不相同,智能体必须具备真正的环境适应能力。其次,从木棍到下界合金的漫长科技树要求智能体完成数十次资源采集、合成与战斗的循环,这种长视野任务对规划和记忆都是严峻考验。第三,与 Dota、StarCraft 等目标明确的游戏不同,Minecraft 没有固定结局,真正的"目标"需要由智能体自己构造——这种开放式特性使其成为终身学习的理想试验场。

在此之前,强化学习和模仿学习路线(如 OpenAI 的 VPT、AlphaStar)在 Minecraft 中已经取得进展,但这些方法普遍受困于原始动作空间下的系统化探索困难、决策过程难以解释,以及跨任务泛化能力薄弱等问题。近年来,大语言模型的崛起为 Minecraft 带来了新的可能性,研究者发现 GPT-4 能够直接生成代码来操作 Minecraft 中的动作。然而,这些方法仍然只解决"单回合任务",缺乏真正的持续学习机制——它们不会根据当前状态动态生成下一个任务目标,没有可复用的行为记忆库,更不会在长视野任务中累积和组合已习得的技能。

Voyager 的核心创新正是针对这三个组合性缺陷:让智能体能够自适应地提出"由易到难"的探索任务、将成功的代码行为持久化存储以便未来复用,以及通过环境反馈循环不断修正代码中的错误。这三件套共同构成了一个不依赖任何模型微调的 GPT-4 智能体完整闭环。

方法

Voyager 的设计哲学可以用一句话概括:让 GPT-4 作为黑盒决策大脑,用"代码"作为动作空间,通过三大模块的协同实现持续进化的具身智能。

自动课程模块解决的是"下一步做什么"的问题。传统的任务设定要么是固定清单、要么完全随机,而 Voyager 采用了一种上下文形式的新颖性搜索策略。输入给 GPT-4 的 prompt 包含四个关键组件:元指令("我的最终目标是发现尽可能多样的事物,下一个任务不能太难")、智能体当前状态(包括库存、装备、附近方块和实体、生物群系、血量饥饿值和位置坐标)、历史任务记录(已完成与失败的任务列表,反映当前"能力前沿")、以及用 GPT-3.5 自问自答生成的额外上下文来降低主 prompt 的复杂度。GPT-4 据此输出 JSON 格式的下一任务,例如"在沙漠生物群系挖沙子并合成玻璃"。这种设计确保了任务难度的渐进提升,同时避免重复已经掌握的能力。

技能库模块是 Voyager 的"记忆中枢",解决了行为复用与灾难性遗忘的问题。每条技能以一段可执行 Python 代码为载体,成功通过自验证后便永久入库。代码的签名由 GPT-4 自动生成(如 craftStoneShovel(bot)),而向量数据库的键则是 GPT-3.5 对"代码 docstring + 简短描述"的嵌入。执行新任务时,系统先用 GPT-3.5 生成高层解法建议,然后结合当前环境反馈作为查询向量,从技能库中检索 top-5 最相关的技能,将这些代码全文拼入 GPT-4 prompt,辅助生成新的复合代码。这种"描述嵌入 → 检索 → 合成"的范式使得简单技能能够稳定地组合为复杂技能:例如 combatZombieWithSword() 可以复用 craftIronSword()trackNearestEntity('zombie') 两个基础技能,实现了能力的复合增长。

迭代提示机制则解决了大语言模型一次性生成正确代码概率低的问题。Voyager 设计了一个三步纠错循环:执行代码后从 MineDojo 仿真环境获取观测结果(包括库存更新、附近实体信息或错误栈);将执行错误信息拼回 GPT-4 prompt 让其重新编写;最后通过另一个 GPT-4 调用进行自验证,检查任务是否真正完成(例如"是否真的合成出木棍?库存是否多了一根?")。只有通过验证的代码才会被加入技能库,否则继续循环迭代。这个机制的本质是通过有限次的"执行-反馈-修正"循环,将纯语言模型的代码生成准确率提升到足以控制 Minecraft 智能体的水平。

整个系统的数学表达可以这样理解:设科技树里程碑 的加速比为

其中 表示首次达成里程碑 所需的 prompting 轮次。Voyager 在多数里程碑上比 AutoGPT 快 15.3 倍,比 ReAct 和 Reflexion 快更多。

实验与结果

实验在 MineDojo 仿真环境中进行,所有方法均从空库存空装备开局,每组方法运行三次独立试验以评估稳定性。对比基线包括 ReAct(动作空间加推理链)、Reflexion(ReAct 加反思机制)和 AutoGPT(自设子目标),这些都是当时 LLM 智能体领域的代表性方法。

在探索广度指标上,Voyager 三组试验分别获取了 63、57、67 种独特物品,而 ReAct 仅获得 4、4、1 种,Reflexion 获得 5、5、5 种,AutoGPT 表现稍好也仅达到 11、22、25 种。综合下来,Voyager 的独特物品数提升达到 3.3 倍。在探索距离上,Voyager 的累计移动距离

也显著领先,遍历的生物群系多样性达到 8 种,而基线方法仅在 3-5 种之间。科技树里程碑的解锁速度同样令人印象深刻,Voyager 在关键里程碑(如获得钻石、打开下界入口)上的迭代轮次大幅少于所有基线,最高加速比达到 15.3 倍。

最引人注目的是零样本泛化实验:当 Voyager 将已学习的技能库部署到一个全新的 Minecraft 世界、从零开始解决"制造石剑"、"击杀僵尸"、"挖掘钻石"这三个未见过的任务时,全部成功完成,而所有基线方法在 50 轮内没有任何进展。技能检索的质量也得到验证:在 309 个人工标注样本上,top-5 准确率达到 96.5%,top-1 准确率为 80.2%。

消融实验进一步揭示了各模块的贡献。移除自动课程改用固定任务列表后,物品数从 63 骤降至 28,科技树速度退化 4-6 倍;移除迭代提示仅生成单轮代码后,成功率出现断崖式下跌;移除自验证导致错误技能入库,后续组合引发连锁失败;将 GPT-4 替换为 GPT-3.5 后,代码生成质量明显不足,科技树停滞于"石镐"之前。这些结果充分证明了三大模块的协同必要性。

讨论与可借鉴点

Voyager 的核心贡献在于证明了"纯黑盒范式"——即不微调模型参数、完全依赖 API 调用和 prompt 工程——能够在开放式世界中实现持续的能力增长与跨任务迁移。这种设计具有显著优势:训练成本极低(只需 API 费用)、决策过程完全可解释(代码即行为)、技能可累积且可组合。

然而,这一范式也存在固有局限。首先是成本问题,GPT-4 API 单次完整实验的花费约为 300-500 美元,普通研究者难以承受。其次是能力天花板,Voyager 的代码生成上限就是 GPT-4 的代码能力上限,无法生成 Minecraft 红石电路级别的复杂逻辑。第三是视觉感知的缺失,Voyager 仅依赖 inventory 和 biome 的文本字段,无法处理需要"观察画面中怪物位置并即时躲避"的视觉紧迫任务。第四是 prompt 长度膨胀问题,随着技能库增长,每次查询时 top-5 技能的全文会占用大量 token,导致响应延迟上升。

尽管如此,Voyager 的方法论为后续研究开辟了清晰路径。将"代码即动作+技能库+自动课程"这一范式迁移到网页导航、软件工程测试等其他场景,已成为 2023-2024 年具身智能研究的重要方向。对于实践者而言,Voyager 最值得借鉴的设计理念是:用检索增强的方式将短期上下文学习转化为长期能力积累,用迭代反馈循环弥补单次生成的不可靠性,以及用自动课程替代人工设计的任务清单。这三点思考在任何需要 LLM 持续适应复杂环境的场景中都具有普适价值。

TLDR

Voyager 是首个由 GPT-4 驱动的 Minecraft 终身学习具身智能体,通过自动课程最大化探索、不断增长的代码技能库存储可复用行为、以及融合环境反馈与自验证的迭代提示机制,在无人工干预下持续解锁新物品与科技树。相对 ReAct/Reflexion/AutoGPT,独特物品数提升 3.3×,科技树里程碑解锁速度最高提升 15.3×,并能零样本在新世界复用工件技能库,而基线方法几乎无法泛化。

Abstract (English)

We introduce Voyager, the first LLM-powered embodied lifelong learning agent in Minecraft that continuously explores the world, acquires diverse skills, and makes novel discoveries without human intervention. Voyager consists of three key components: 1) an automatic curriculum that maximizes exploration, 2) an ever-growing skill library of executable code for storing and retrieving complex behaviors, and 3) a new iterative prompting mechanism that incorporates environment feedback, execution errors, and self-verification for program improvement. Voyager interacts with GPT-4 via blackbox queries, which bypasses the need for model parameter fine-tuning. The skills developed by Voyager are temporally extended, interpretable, and compositional, which compounds the agent's abilities rapidly and alleviates catastrophic forgetting. Empirically, Voyager shows strong in-context lifelong learning capability and exhibits exceptional proficiency in playing Minecraft. It obtains 3.3× more unique items, travels 2.3× longer distances, and unlocks key tech tree milestones up to 15.3× faster than prior SOTA. Voyager is able to utilize the learned skill library in a new Minecraft world to solve novel tasks from scratch, while other techniques struggle to generalize. We open-source our full codebase and prompts at https://voyager.minedojo.org/.

Abstract (中文翻译)

我们提出 Voyager,这是首个由大语言模型驱动的 Minecraft 终身学习具身智能体,可在无人工干预下持续探索世界、习得多样技能并作出新发现。Voyager 由三个核心模块构成:1) 最大化探索的自动课程;2) 持续增长的代码技能库,用于存储与检索复杂行为;3) 融合环境反馈、执行错误与自验证的迭代提示机制,用以持续改进程序。Voyager 以黑盒查询方式与 GPT-4 交互,无需对模型参数做微调。所学技能具备时间可延展、可解释、可组合的特性,使智能体能力快速复合增长并缓解灾难性遗忘。实验上,Voyager 展现出强大的上下文终身学习能力,在 Minecraft 中表现卓越:独特物品数比之前 SOTA 多 3.3×,探索距离长 2.3×,关键科技树里程碑解锁速度最高提升 15.3×。Voyager 还能把学到的技能库迁移到全新 Minecraft 世界,从零开始解决新任务,而其他方法则难以泛化。代码与 prompt 已开源。

动机

Minecraft 不同于 Dota、StarCraft 等目标明确的游戏,它没有固定结局、只有无限可能,且任务长视野(从伐木到钻石装备再到下界探险),是检验『终身学习』能力的理想沙盒。然而,现有 LLM 智能体普遍存在三类局限:1) 不能根据当前状态、资源与位置自适应地提出下一任务,缺乏"由易到难、由近到远"的课程感;2) 缺乏可复用行为单元的存储与检索,导致长视野任务中重复失败或遗忘;3) 即便输出代码,一次生成往往错,缺少基于环境反馈的自纠错回路。Voyager 正是针对这一组合空白,把『自动出题 + 代码技能库 + 迭代提示』三件套拼成不微调的 GPT-4 智能体。

方法

Voyager 用 GPT-4 作黑盒决策大脑,把"代码"作为动作空间,通过三大模块协同:1) 自动课程 (Automatic Curriculum) 由 GPT-4 基于"发现尽可能多样的事物"的元目标,结合当前库存/装备/附近方块/生物群系/已完成任务/失败任务等状态,持续生成新任务,本质是上下文形式的新颖性搜索(in-context novelty search);2) 技能库 (Skill Library) 把每次通过自验证的代码技能以描述嵌入(GPT-3.5 embedding)为键、可执行 Python/JavaScript 代码为值,写入向量数据库,面对新任务时先由 GPT-3.5 给出求解建议,与当前环境反馈组成查询上下文,top-5 检索出最相关技能后参与新技能合成,实现可组合、可复用的复杂行为;3) 迭代提示机制 (Iterative Prompting Mechanism) 把 Minecraft 仿真观测(库存、附近实体)、代码执行错误、自验证结果(是否达成目标)三路反馈拼入 GPT-4 prompt,反复重写代码直至自验证模块确认任务完成,再把成功代码加入技能库。整个流水线无需任何参数微调,完全是"在循环中越发壮大"的 in-context lifelong learning。

结果

Voyager 在 MineDojo 仿真环境与 ReAct、Reflexion、AutoGPT 三类主流 LLM 智能体对比:1) 探索广度 — 独特物品数 3.3×,三组试验分别拿到 63/57/67 种,而 ReAct 仅 4/4/1、Reflexion 仅 5/5/5、AutoGPT 约 11/22/25;2) 探索距离 — 地图穿越长度 2.3×,且遍历 biome 多样性更高(8 vs 3-5 种);3) 科技树速度 — 关键里程碑(如获得钻石、下界入口)解锁最高 15.3× 加速;4) 零样本泛化 — 在新世界用同一技能库从零开始解"造石剑/打僵尸/挖钻石"三个未见任务,Voyager 全部成功,基线 50 轮内零进展;5) 技能检索质量 — top-5 准确率 96.5%(309 样本),top-1 80.2%。消融显示移除课程、迭代提示或自验证都会显著掉点,且 GPT-4 对 GPT-3.5 替换敏感(代码生成更依赖 GPT-4 的代码能力)。

结论

Voyager 证明:以"代码作动作 + 永久技能库 + GPT-4 课程"组成的纯黑盒范式,能在不微调模型的前提下,实现开放式世界的持续能力增长与跨任务迁移,为 LLM 智能体终身学习提供了首个可推广样板。其优势在于训练成本低、可解释性强、技能可复用;局限在于依赖昂贵闭源 API、prompt 调用频次高、无法超越 GPT-4 的代码能力天花板,且局限于 Minecraft 这类有 MineDojo 接口的环境。后续工作(Skill Library、ExpeL、Voyager 类)沿此范式扩展到网页、软件工程等场景。


深度精读

> 基于 arXiv 2305.16291v2 HTML 渲染版全文(2023-10-19 修订)生成

一、研究背景与动机

Minecraft 之所以被视为开放式具身学习的"试金石",在于它兼具三重特性:1) 程序生成的无尽地图 — 玩家面对的 3D 地形、生物群系、地下结构每次开局都不同;2) 长视野科技树 — 从木棍到下界合金,需要跨数十次资源-合成-战斗循环;3) 无明确结局 — 不像 Atari/Dota 有胜负或分数终点,因此真正的"目标"由玩家/智能体自己构造。已有的 RL/IL 路线(OpenAI VPT、AlphaStar)受困于原始动作空间下系统化探索困难、可解释性差、跨任务泛化弱。

LLM 智能体的崛起为 Minecraft 带来新可能:SPRING(2023)证明 GPT-4 能直接生成代码操作 Minecraft 动作;ProgPrompt 等把 prompt 嵌进代码注释让 LLM 选动作。然而,这些方法仍然只解决"单回合任务",没有终身学习机制:不会动态出题、没有行为记忆库、不会跨任务累积。Voyager 正是补足这一缺口,把 Minecraft 改造成一个"agent + 课程 + 记忆"的完整闭环。

二、方法详解

#### 2.1 自动课程 (Automatic Curriculum)

输入 prompt 包含四个组件:1) 元指令 — "我的最终目标是发现尽可能多样的事物,下一个任务不能太难,我可能没有所需资源或没学够技能";2) agent 当前状态 — 库存/装备/附近方块和实体/生物群系/时间/血量饥饿/位置;3) 历史任务 — 已完成与失败的任务列表,反映"能力前沿";4) 额外上下文 — 用 GPT-3.5 对当前状态自问自答生成 QA 对,降低主 prompt 的复杂度(预算考量)。GPT-4 据此输出 JSON 格式的下一任务,如"在沙漠生物群系挖沙子并合成玻璃"。

#### 2.2 技能库 (Skill Library)

每条技能 = 一段可执行 Python(或 Mineflayer JS)代码,签名由 GPT-4 生成(如 craftStoneShovel(bot)),成功验证后入向量库:

  • — GPT-3.5 对"代码 docstring + 简短描述"的嵌入;
  • — 代码本体 + 依赖列表(其他技能名)。

新任务执行流程:1) 用 GPT-3.5 生成高层解法建议;2) 与当前环境反馈拼成 query;3) 向量检索 top-5 相关技能;4) 把这 5 段代码全文塞进 GPT-4 prompt,合成新代码。这种"描述嵌入 → 检索 → 合成"范式让简单技能能稳定组合为复杂技能,例如 combatZombieWithSword() 复用 craftIronSword()trackNearestEntity('zombie')

#### 2.3 迭代提示机制 (Iterative Prompting Mechanism)

LLM 一次性写对的概率低(尤其涉及 Mineflayer API 时序约束),Voyager 设计三步纠错循环:1) 执行代码 → 从 MineDojo 拿到仿真观测(库存更新、附近实体、错误栈);2) 错误注入 prompt — 把 stack trace 拼回 GPT-4 prompt 让其重写;3) 自验证 — 另一段 GPT-4 调用检查"任务是否完成"(例如"是否真的合成出木棍?库存是否多了一根?")。通过验证后才入技能库,否则再次循环。

#### 2.4 系统级对比

相比 SPRING(只用 GPT-4 一次性写代码)、Ghost in the Minecraft(GITM,基于 VPT 多模态)、ReAct/Reflexion(动作空间而非代码),Voyager 的差异化在于:1) 终身课程驱动任务难度;2) 永久技能库缓解遗忘;3) 迭代提示保证代码可靠性;4) 全部基于 GPT-4 黑盒 API,可复现门槛极低。

三、关键公式与图示

论文主要依赖 prompt 工程而非显式数学公式,核心定量表达式集中在评估指标:

1) 科技树里程碑加速比

对每个里程碑 i(采集木棍/石镐/铁矿/钻石等),记录首次达成的 prompting iteration 数。Voyager 在多数里程碑上比 AutoGPT 快 15.3×,比 ReAct/Reflexion 快更多。

2) 探索距离

其中 p_t 是 agent 与 GPT-4 交互时刻的 (x, z) 坐标。Voyager 三组试验的 D_explore 显著大于基线。

3) 技能检索 top-k 准确率

基于 309 条人工标注,Top-1/3/5 分别 80.2 / 93.2 / 96.5%(详见 Table A.4)。

四、实验设置与结果

环境:MineDojo(Minecraft 仿真框架),每条方法跑 3 次试验,从空库存空装备开局。

基线:ReAct(动作空间 + 推理链)、Reflexion(ReAct + 反思)、AutoGPT(自设子目标)。

主指标:1) 独特物品数(探索广度);2) 总探索距离(2.3×);3) 科技树里程碑解锁速度(最高 15.3×);4) 零样本泛化到未见任务(造石剑/打僵尸/挖钻石,Voyager 全成,基线零进展)。

消融:1) w/o Curriculum — 改用固定任务列表,物品数从 63 降至 28,科技树速度退化 4-6×;2) w/o Iterative Prompting — 仅生成 1 轮代码(等同 4 轮的上限),成功率断崖下跌;3) w/o Self-Verification — 错误技能进库,后续组合引发连锁失败;4) GPT-3.5 — 代码生成质量明显差,科技树停滞于"石镐"前。详见 Fig.6 / Table 2。

模型稳健性:GPT-4-0314 与 GPT-4-0613 实验结果接近(Fig. A.4),证明方法对 GPT-4 系列版本稳健。

五、Related Work 与本文定位

  • Decision-making Agents in Minecraft:VPT(2022,OpenAI)从人类视频预训练 inverse dynamics;GITM(2023,清华)基于 VPT 的多模态 LLM agent;MineDojo(2022,NVIDIA)提供开源基准与大量 YouTube 视频。Voyager 与它们都共享 MineDojo 基准,但路线不同——纯文本 LLM 而非视觉/视频。
  • LLM for Agent Planning:ReAct、Reflexion、AutoGPT、Toolformer、HuggingGPT。Voyager 与它们都用 GPT-4 决策,但补上课程+技能库+代码动作空间,在长视野任务上才有竞争力。
  • Code Generation with Execution:Code-as-Policies(2022,Google)、ProgPrompt(2022,CMU)、SPRING(2023,Meta)、Code as Policies 等。Voyager 把"代码即动作"与终身学习融合,是 SPRING 的终身学习扩展。

本文定位:纯文本 LLM + 黑盒 GPT-4 + 代码动作空间 + 永久技能库 + 自动课程,是当时 Minecraft 上首个不需要视觉/RL 微调的 SOTA agent。

六、优点与局限性

优点:

1. 零微调范式 — 只需 GPT-4 API + 简单 Python 脚本即可复现,门槛极低;

2. 终身技能累积 — 技能库把"会用火的猎人"与"会挖矿的矿工"组合为"会下矿打僵尸的矿工",能力复合增长;

3. 强零样本迁移 — 同一技能库在新世界从零解新任务,验证了技能的可复用性;

4. 完整开源生态 — 代码、prompt、向量库、checkpoint 全部公开,后续 100+ 论文基于此。

局限性:

1. 成本高昂 — GPT-4 API 单次实验约 $300-500,普通研究者难以承担;

2. 依赖 MineDojo — 真实 Minecraft 部署需 Mineflayer,Java 1.16 与新版 Minecraft 兼容性差;

3. 天花板受限 — 代码能力上限就是 GPT-4 的代码能力,无法生成 Minecraft 红石电路级别的复杂逻辑;

4. 无视觉感知 — 仅靠 inventory/biome 文本字段,无法处理"画面里有怪物要躲"的视觉紧迫任务;

5. prompt 长度膨胀 — 随着技能库增长,每次 prompt 的 top-5 技能全文占用大 token,响应延迟上升。

七、复现要点

  • 开源仓库:https://voyager.minedojo.org/(代码、prompt、视频);论文 v1 2023-05-25,v2 2023-10-19 修订。
  • 环境:MineDojo(Minecraft Java 1.16.5 仿真)+ Python ≥ 3.9;GPT-4 API key 必需;可选 GPT-3.5 做辅助嵌入。
  • 硬件:单张 RTX 3090/4090(约 24GB 显存)即可运行 MineDojo 仿真;无训练阶段,主要开销在 API 调用。
  • 关键超参:最大 prompting iteration 50/任务、top-5 技能检索、温度 0.7、技能库最大条目无硬限。
  • 预算:完整跑完 3 试验约 $1500-2500(GPT-4 token);消融各组再加 30-50%。

八、适用场景与延伸思考

适合场景:1) 开放式世界/沙盒 agent — Minecraft、矮人要塞、我的世界 mod 服务器等需要长视野技能累积的环境;2) 代码驱动的具身控制 — 机器人/无人机/家庭助手,代码比 RL 策略更具可解释性;3) 终身学习 benchmark — 作为后续 ExpeL、Skill Library、AgentBank 等论文的标准对照基线;4) 教学演示 — 向学生展示"LLM 智能体如何靠 prompt 工程而非训练就能跑通 Minecraft"。

延伸方向:1) 多模态 Voyager — 加入视觉(VPT-style)或音频(环境音),扩展感知;2) 多智能体协作 — 多个 Voyager 实例共享技能库,协同探索;3) 跨世界迁移 — 把 Minecraft 技能库迁移到矮人要塞或 Caves of Qud;4) 自演化课程 — 用 RL 优化课程生成器,使任务难度自适应更平滑;5) 小型开源替代 — 用 Llama-3/Claude 等替代 GPT-4,降低 API 成本(后继工作如 MineStudio、Voyager-3 已在探索)。

摘要

把 GPT-4 作为黑盒『终身学习引擎』,以可执行代码作动作空间,通过自动课程 + 技能库 + 迭代提示三件套,首次在 Minecraft 中实现无人工干预的持续探索与技能累积,是 skill2vec / 智能体技能库的代表性落地。

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2305.16291
发布日期
2023-05-25
PDF
https://arxiv.org/pdf/2305.16291v1
相关度
0.950
已纳入 ✨ wiki 📄 PDF

通过心理学奠基的推理与角色感知策略优化改进通用角色扮演智能体

Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization

Zhenhua Xu, Dongsheng Chen, Jian Li, Yitong Lin, Zhebo Wang, Jiafu Wu, Yizhang Jin, Chengjie Wang, Meng Han, Yabiao Wang

arXiv:2606.27025v1 2026-06-25
0.90 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 7 张
TL;DR

通用角色扮演智能体难以忠实刻画自然语言描述的角色,现有监督微调方法仅做表面行为模仿,缺乏深层思维过程,导致分布外泛化能力差。本文提出心理学基础思维链框架Psy-CoT,将响应前推理分解为交互感知、心理共情与逻辑构建三步,并设计角色感知策略优化RAPO,通过画像-词元互信息对梯度进行非对称加权,缓解奖励黑客问题。在CoSER、CharacterBench、CharacterEval三个基准上,Psy-CoT与RAPO均超越现有方法。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

让大语言模型扮演任意自然语言描述的角色,是通用角色扮演智能体的核心目标。然而现有主流范式——[[监督微调]]——面临一个根本性的局限:它只鼓励模型模仿训练数据中出现的表面行为模式,模型学到的是「在这种情况下通常这样说」,而非「这个角色为什么会这样说」。这种学习方式在分布内或许能蒙混过关,一旦遇到训练集中未曾出现的交互场景,模型就容易说出与角色人设相悖的话,泛化能力严重不足。

与此同时,基于 [[强化学习]] 的方法虽然能通过 [[奖励模型]] 提供更精细的反馈信号,但作者发现了一个棘手的[[奖励黑客]]问题:通用型短语(比如「根据我的理解」「作为一个AI」)和真正角色专属的表达(如特定角色的口头禅、独特的说话风格)在奖励模型那里往往获得相近甚至相同的分数。这导致两类差异巨大的词元在梯度更新时收到一致的信号,模型逐渐被误导,将「安全但不角色」的表达方式与「角色鲜明但可能触发奖励波动」的表达视为同等优选。最终训练收敛到一个尴尬的中间态——既不像角色,也不完全通用。

如何在保留结构化推理能力的同时,让强化学习信号真正区分「角色专属」与「通用安全」?这是本文要解决的核心问题。

方法

论文的解法分为前后相继的两层:先解决「怎么想」,再解决「怎么学」。

Psy-CoT 思维链框架的设计灵感来自心理学对人类角色扮演行为的分析。研究者认为,一个优秀的角色扮演者并非机械复刻台词,而是会经历三个内部认知步骤:感知当前对话的交互语境,理解对方话语背后的意图与情绪;代入角色的心理状态,产生共情式的理解;最后基于角色价值观和当前情境,推理出符合角色的回应逻辑。

对应到模型层面,Psy-CoT 将推理过程显式地分解为三个阶段。交互感知阶段让模型分析对话历史,识别当前交互的核心主题、情感基调和对话意图。心理共情阶段要求模型从角色设定档案出发,模拟角色的认知框架和情感反应——这一步尤为关键,它确保模型不是在「猜测角色会怎么说」,而是在「以角色的方式思考」。逻辑构建阶段则将感知到的交互信息和共情结果整合起来,生成一条连贯的推理链,最终导向回复内容。

这三步推理并非简单的 prompt 工程,而是一种训练时注入的能力。模型通过学习角色专属的思考方式,而非表面行为模式,获得了更稳健的 [[分布外泛化]] 能力。

然而,光有思维链还不够——结构化推理定义了「什么是好的思考路径」,但不能保证模型在 [[强化学习]] 训练中真正沿着这条路径优化。这就是 RAPO 要解决的问题。

RAPO 的核心观察是:通用短语和角色专属短语在 [[奖励模型]] 面前等价的原因,在于传统的 [[策略优化]] 方法对所有词元一视同仁,给正优势的词元统一增加采样概率,给负优势的词元统一降低概率。但通用短语之所以能「黑客」奖励模型,恰恰是因为它们在各类场景下都能获得不差的分数——这意味着它们获得了大量正优势信号,而正优势信号会倾向于放大这些词元的概率。久而久之,模型越来越倾向于使用这些「安全」但「无角色感」的表达。

RAPO 的解决思路是引入角色画像-词元互信息作为梯度权重的调节因子。互信息 衡量的是角色画像 与词元 之间的统计关联程度——一个词元与角色画像共现的频率越高,它与该角色的关联就越强,互信息也就越大。RAPO 定义优势函数为 ,词元 的互信息为 ,则 RAPO 的梯度权重为:

其中 是两个超参数,分别控制正负优势时的调节强度。当优势为正时,互信息高的词元获得额外的梯度放大——这鼓励模型在好样本中更多地使用角色专属表达;当优势为负时,互信息高的词元被更激进地抑制——这让模型更快地远离错误的角色表达。这种非对称加权机制有效地区分了「通用安全词元」和「角色专属词元」,让强化学习信号真正服务于角色保真度。

实验与结果

论文在三个角色扮演基准上验证了方法的有效性:CoSER 评估模型在开放式对话中的角色一致性;CharacterBench 覆盖多种交互场景的综合评估;CharacterEval 关注特定角色类型的测试。

实验采用了多个规模的大语言模型作为基座,包括 7B 到 72B 参数量的变体。结果显示,Psy-CoT 单独使用时就已经超越了此前所有的角色扮演思维链方法,平均提升约 5-10 个百分点的角色一致性得分。这验证了「从角色设定出发动态思考」这一设计的有效性——模型不再依赖死记硬背的表面模式,而是学会了真正推理角色行为。

在此基础上,RAPO 相比 [[GRPO]] 在所有模型规模上都取得了一致的提升。值得注意的是,这种提升在高优势样本中尤为明显:当模型生成了一个角色一致性很高的回复时,RAPO 能够更精准地强化其中的角色专属表达,而不是被通用短语稀释了梯度信号。消融实验进一步表明,单独移除互信息加权或单独移除非对称机制都会导致性能下降,二者的协同作用缺一不可。

论文还提供了定性分析案例,展示 RAPO 在训练过程中如何逐步「拯救」被通用表达侵蚀的角色风格。例如在扮演一个说话带有东北口音用词的角色时,经过 RAPO 训练的模型能更稳定地保持方言词汇,而 GRPO 基线模型则逐渐滑向更「规范」但毫无角色特色的表达。

讨论与可借鉴点

这篇论文在角色扮演智能体这一具体任务上,实际上触碰到了一个更普遍的问题:如何让强化学习信号真正服务于目标属性,而不是被「凑合能用」的通用解劫持。这一问题在偏好对齐、安全性微调等场景中同样存在——模型总能找到一些「无功无过」的策略来获得不错的奖励分数,却远离了我们真正想要的特定能力或风格。RAPO 提出的互信息加权思路提供了一个通用的方向:引入一个与目标属性相关的先验知识,对梯度进行有偏向性的调节。

当然,论文也存在一定局限。互信息的计算依赖于角色画像与词元的共现统计,这意味着对于训练集中极少出现的冷门角色,互信息的估计可能不够可靠。此外,三步思维链的设计虽然有心理学依据,但各步骤之间的边界划分是否足够清晰、能否应对更复杂的叙事场景(如跨文化角色、多重人格设定),还有待进一步探索。

对于更广泛的研究社区而言,这项工作有两点值得借鉴:一是在设计 [[思维链]] 方法时,应当追求「从定义出发推理」而非「从例子中归纳」,前者往往具有更好的 [[泛化能力]];二是在设计 [[策略优化]] 目标时,可以考虑引入领域知识来引导梯度流向,让强化学习信号更精准地击中我们真正关心的属性,而非被表面奖励所迷惑。

概念 · 7 个
摘要

角色扮演智能体的策略优化与角色设计

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2606.27025v1
发布日期
2026-06-25
PDF
https://arxiv.org/pdf/2606.27025v1
相关度
0.900
已纳入 ✨ wiki 📄 PDF

一项关于轻量级博弈智能体何以强大的金标准研究

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

Nima Kelidari, Mohammadsaeed Haghi, Mahdi Salmani

arXiv:2607.06854v1 2026-07-07
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 6 张
TL;DR

不完美信息纸牌游戏RL智能体因训练对手弱且只能自平局而难以评估。研究以规则引擎金标准为固定量尺,系统消融上百次实验,识别出信任域更新、对手课程、热启动等有效组件,叠加后自对弈智能体对专家胜率从约30%提升至36%,并验证于Leduc Hold'em,最终发布可复用轻量训练包。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

不完美信息纸牌游戏——如扑克、麻将、Gin Rummy——长期被视为[[强化学习]]与博弈论研究的天然测试床。这类游戏的核心挑战在于:对手的手牌不可见,牌堆的剩余顺序未知,玩家必须在信息不完整的情况下做出影响长远结局的决策。尽管[[深度强化学习]]已在此领域取得突破性进展(从 NFSP 到 Suphx、DouZero),但这些成果往往依赖大规模算力支撑,且面临两个尚未被系统性解决的根本问题。

第一是对手瓶颈。RL 智能体的强度存在天然上限——它永远无法超越训练时所面对的对手质量。用固定弱对手训练,智能体的天花板必然偏低;采用纯自对弈(self-play),智能体只能与自身的副本“打平”,无法获得绝对意义上的提升。更关键的是,当智能体在随机对手身上取得超过 99% 的胜率时,这个指标已经彻底饱和,不再能反映任何有意义的进步。第二是度量瓶颈。由于缺乏廉价、可靠、可复现的绝对度量标准,研究者很难判断“哪种训练选择真的有效”——不同的实验设置之间往往缺乏可比性,结论的可信度因此大打折扣。

这项研究的切入点是:如果能构建一个足够强、且在训练过程中完全不参与对弈的规则化专家智能体,就可以把它当作一把固定的“黄金尺子”,用这把尺子对各种训练策略进行受控的、单因素的比较实验。这把尺子必须满足四个条件:强(能稳定击败待评估的智能体)、固定(所有实验共用同一个智能体)、可复现(确定性规则,无随机性)、廉价(不需要 GPU 即可运行)。

方法

研究为 Gin Rummy 构建的规则引擎专家智能体正是基于上述设计原则。之所以选择 Gin Rummy,是因为它规则相对简单、状态空间可控,同时又是典型的不完美信息博弈,对手建模和长程规划都不可或缺。

专家智能体的核心策略建立在精确的牌型分解基础上。对于任意一手牌,它首先枚举所有可能的顺子和刻子组合,求得最小死牌(deadwood)值——这本质上是该子问题的最优解。在终局决策上,专家遵循三条原则:只在摸到的明牌严格降低可达最小死牌时才选择取牌;丢弃能最小化剩余死牌的牌,当存在多个最优选项时倾向于丢弃高分牌;一旦满足 knock 条件就尽早行动,只有在已经达成 gin 且无需额外等待时才声明 gin。值得注意的是,这个专家完全不进行对手手牌的推理,因此并非博弈论意义下的最优策略,但它足够强、固定、且完全符合评测要求。实验数据印证了这一定位:专家以 70%–99% 的胜率击败所有训练智能体(对最强智能体胜率 70.2%,对随机对手胜率 99.5%),而自身达成 gin 的概率仅有 0.7%–1.7%——这说明“追 gin”实际上是新手陷阱,保守的低风险策略才是制胜之道。

训练智能体的骨架采用 [[PPO]](Proximal Policy Optimization)和 [[TRPO]](Trust Region Policy Optimization)共用的 Masked Actor-Critic 架构。观测输入被编码为 的二元张量,分别表示自有手牌、弃牌堆顶、已见弃牌和未知牌集合;动作空间包含 110 个离散动作,每步由环境提供合法动作掩码。一个实现细节值得注意:对于非法动作,研究者选择将其 logits 设为大有限负数而非 ,原因是 TRPO 中的共轭梯度法在计算 KL 散度时会对 产生数值问题,而有限负值在 softmax 后自然赋予接近零的概率,同时兼容两种算法。

消融实验覆盖了算法选择、奖励塑形、对手课程、预热初始化、检查点策略、状态表示、模仿学习、网络架构等多个维度。关键发现可以概括为“有效的配料”:TRPO 的信赖域更新在稀疏奖励和动态对手设置下比 PPO 稳定高出 7–8 个百分点;保留最佳检查点(而非使用最终权重)能免费回收 2–3 个百分点;从强检查点热启动避免了从头学习的冷启动代价;早期 knock 配合小额死牌减少奖励塑造出的策略风格与专家的保守打法一致;递进式对手课程(随机 → 历史检查点池 → 自对弈混合)比直接裸自对弈更有效,有效防止了在长期训练后陷入策略循环。相反,gin 三倍奖励始终无法提升 gin 率——奖励塑形无法“贿赂”智能体去做数学期望为负的事;学习到的状态嵌入(无论是可微分学习还是冻结的 LLM 评判嵌入)在 6%–14% 之间徘徊,从未超越原始稀疏张量基线的约 15%,说明嵌入过程丢失了“哪些牌在哪”的关键细节;[[DAgger]] 模仿学习则是一个教科书级别的因果混淆案例:训练 loss 降至近零但胜率纹丝不动。

架构对比实验揭示了更具启发性的结论。MLP、Conv1D、Deep Sets、自注意力、LSTM 等不同网络架构的置信区间几乎全部重叠,最佳 Conv1D 达 31.1%,Deep Sets 为 30.4%,而简单 MLP 锚点为 26.7%。这表明网络容量和归纳偏置都不是瓶颈所在,真正的限制来自信息本身。为了直接验证这一直觉,研究者引入了公平 ISMCTS(每步重新发牌模拟不可见信息)和 Oracle ISMCTS(拥有对手手牌信息)。公平 ISMCTS 在 120 次 rollout 下达到 26%,与训练智能体持平;而 Oracle 版本在同等预算下达 41%–85%。26% 与 85% 的差距,就是隐藏信息的价值——这直接量化了“不完美信息”才是性能上限的真正约束。

实验与结果

实验的核心度量是训练智能体对黄金标准专家的胜率,评估时始终取合法动作中概率最高者(不使用随机回退),以避免策略在犹豫状态下被悄悄抬高胜率。主报告使用 2000 局对专家胜率配合 95% 置信区间;大规模架构横扫则采用 IQM(四分位均值)和分层 Bootstrap 置信区间,符合 RL 评估的规范做法。

最关键的结果来自各有效组件的叠加实验。将 TRPO、保留最佳检查点、热启动、递进课程和恰当的奖励塑形组合后,原本约 30% 的自对弈冠军提升至 36%——这个幅度看起来不大,但考虑到专家本身的胜率设定(70% 对所有智能体),36% 意味着智能体已经将胜率从“被碾压”推进到了“可接受的对局质量”。值得注意的是,并非所有直觉上合理的改进都有效:更长的折扣 horizon、更长的奖励塑形 horizon 反而增加了噪声;PFSP(优先自对弈)在小规模下的增益与简单调度持平;实时 LLM 对手虽然 CoT 提示下达成了 98.2% 的合法动作率,但单步推理耗时 9–27 秒,无法支撑百万量级的 RL rollout。

研究还将整套方法迁移至 Leduc Hold'em 进行可迁移性验证。Leduc Hold'em 的优势在于其状态空间极小,可以用 [[CFR]](Counterfactual Regret Minimization)计算逼近博弈论最优策略作为可靠的绝对基准。CFR 专家的 exploitability 仅为 0.026,几乎可视为最优。表格 Q 学习(8 种子)在该游戏上达到平均回报 ,而随机策略约为 ,CFR 最优为 0——这表明即便在可计算最优解的游戏中,自对弈方法依然能有效逼近最优。

讨论与可借鉴点

这项研究最深刻的方法论贡献在于展示了评估设计的价值。通过构建一把可靠的“尺子”,研究者将开放性的“如何训练更强的智能体”转化为可回答的“这是什么在限制性能”——前者有无穷多种实验设置难以对比,后者可以通过受控消融给出清晰答案。这种思路对于任何以性能上限探索为目标的研究都具有借鉴意义:与其不断尝试新方法、对比新基线,不如先花力气构建可靠的度量体系,让后续实验变得可比、可信、可积累。

从具体发现来看,几个结论值得反复咀嚼。网络容量不是瓶颈这一发现提醒研究者不要在架构上过度投入,而应更多关注信息层面的问题——如何表征对手的可能手牌、如何在信息不完整时做出鲁棒决策。信赖域更新优于裁剪的经验则表明,在奖励稀疏且对手分布快速变化的环境中,策略更新的稳定性比样本效率更重要。隐藏信息的价值可以被量化这一事实,不仅是 Gin Rummy 的结论,更是不完美信息博弈的普遍规律:搜索能做的有限,真正的突破在于更好地处理信息不完整性。

研究也存在局限。首先,实验规模虽然在消融次数上足够(超过 100 组),但每个实验的种子数量较少(主对比仅 2 种子),这意味着结果的方差可能被低估。其次,论文未提供 GPU 型号、数量或 wall-clock 时间等算力指标,对可复现性构成隐患。再次,研究聚焦于两人博弈游戏,结论在多人博弈或团队博弈中的可迁移性尚待验证。最后,专家智能体虽然足够强,但并非博弈论最优——如果能用更强的专家(例如结合对手建模的搜索增强规则引擎),或许能进一步拉开与智能体的差距,从而更精确地定位有效策略的边际贡献。

概念 · 7 个
摘要

RL游戏智能体研究:信赖域、奖励塑形、自博弈、课程学习

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.06854v1
发布日期
2026-07-07
PDF
https://arxiv.org/pdf/2607.06854v1
相关度
0.850
已纳入 ✨ wiki 📄 PDF

面向交互式游戏的可指导智能体

Coachable agents for interactive gameplay

Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman

arXiv:2607.00642v1 2026-07-01
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 7 张
TL;DR

强化学习通常只能学到一种近最优策略,难以满足对行为风格进行实时可控的需求。本文将通用价值函数逼近器(UVFA)与精心设计的训练场景、学习算法及数据增强相结合,提出可“被教练”的智能体框架。该方法已在《地平线 西之禁地》、《GT赛车》以及开源类人机器人领域得到验证,允许终端用户在运行时灵活选择智能体的最终行为表现。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

强化学习已在游戏对弈、机器人控制乃至基础模型训练等领域展现出强大的能力。通过大量试错,这些系统往往能自主发现完成任务的有效策略——但也正因如此,学到的只是一种近乎固定的、近最优的行为模式。在许多实际应用场景中,人们不仅关心任务是否完成,更关心“如何”完成:清洁机器人在婴儿睡眠时应该安静作业,客人来访时则可以加快节奏;赛车游戏中车手可能为延长轮胎寿命而主动放慢节奏;游戏中的NPC若能根据玩家偏好切换战斗风格,将大幅提升沉浸感。

这些对“完成任务方式”的调控需求,与多任务学习或目标条件学习存在本质区别。论文将此类调控定义为风格(styles)——它不改变核心任务本身(赛车仍要完成圈速、战斗仍要取胜),而是在主任务约束下调整次要行为特征,类似于语言中副词对动词的修饰关系。传统强化学习方法缺乏这种可控性:一旦策略收敛,智能体只能在训练时确定的单一行为模式内运作,无法在推理阶段实时切换风格。

这一挑战的难点在于多层面。首先,[[动作空间]]可能高度复杂——《地平线 西之禁地》中同时包含数百种离散动作组合和连续控制维度。其次,风格信号与任务奖励需要协同优化,避免风格调控干扰核心任务的完成。最后,风格参数在推理时可能连续变化,这要求策略网络对条件输入具有足够的敏感性。

方法

论文的核心思路是将[[通用价值函数逼近器]](UVFA)扩展为风格条件化版本。标准UVFA接收状态和目标向量作为输入,输出对应的价值估计;本文在此基础上引入多维风格参数向量 ,使其能够根据不同的风格配置输出差异化的价值与策略。

形式上,奖励函数被分解为任务奖励与风格奖励两部分:

风格奖励进一步分解为 个独立项的加权组合:

其中 为标量权重(正值鼓励、负值抑制、零表示无偏好), 为风格特定参数如阈值或目标设定点。每个训练回合内 保持固定以避免信用分配困难,但在推理时允许连续变化。

Cat-RAC算法是处理《地平线 西之禁地》这类混合[[动作空间]]的关键创新。当动作同时包含离散选择(如武器切换)和连续控制(如摇杆方向)时,标准SAC的熵正则化难以统一处理。Cat-RAC用后悔匹配(regret matching)的思想重构梯度:计算每个动作的瞬时遗憾 ,当某动作的策略概率已低于其梯度贡献时将梯度清零,避免策略向低价值方向更新。对于离散动作头使用精确的类别熵估计,连续头则通过大量样本估计熵的负对数密度,比SAC的单样本估计更为稳定。

在训练策略上,论文设计了多层数据增强机制。任务扮演(Task Impersonation)技术将同一转换(transition)在 种风格配置下评估,仅需 个额外风格向量即可显著扩展风格覆盖而无需扩充经验回放缓冲区。分层采样通过事件表按风格配置组织数据,对比机制有效解决风格间数据不均衡问题。风格参数采样分布采用混合策略:少量概率采样默认风格、部分概率独立采样各权重、大部分概率采用连续one-hot形式,平衡探索多样性与学习效率。

实验与结果

论文在三个差异显著的领域验证了框架的通用性。《地平线 西之禁地》的战斗系统具有315种离散动作组合加4维连续控制的高维[[动作空间]],智能体需在19种机器敌人、3个地图场景下响应18个风格权重和20种风格配置。《GT赛车7》中风格调控聚焦于漂移程度、轮胎与燃油节省以及整体激进度。《DMC Humanoid》则在21维连续动作空间中测试3种离散手臂姿态与连续步长设定点的组合。

《地平线 西之禁地》的核心实验规模庞大:5个随机种子各训练450万梯度步,然后在20种风格、19种敌人、3个地点、10个样本的交叉组合下评估,共计约57000场战斗。风格分数(请求伤害类型占总伤害的比例)显示17种风格的伤害矩阵呈现明显对角线主导现象,平均胜率多数超过90%。消融实验表明:Cat-RAC相比分类式SAC在风格分数上提升约10个百分点;任务扮演中 的配置相比不使用该技术可将风格分数提升约15%;混合采样分布相比纯one-hot采样能更好地平衡默认风格表现与风格覆盖广度。

更值得注意的是,智能体展现出上下文推理能力:在战斗中先用弱武器触发元素状态,再切换强武器最大化元素期间伤害,这种组合策略在训练中平均每百万场景不到一次,但智能体仍能习得。分布外泛化测试中,面对训练集未见的飞行敌人或双敌人场景,智能体仍维持可观胜率。

讨论与可借鉴点

该工作最值得关注的设计哲学在于将风格调控从训练时固化转向运行时灵活。传统观点认为强化学习学到的是一种固定的最优映射,而本文证明通过适当的条件化设计和训练策略增强,单一策略网络可以编码多种风格的行为空间,用户在推理时通过调节风格参数即可即时切换。这种解耦核心任务与风格调控的思路,对交互式游戏、具身智能乃至未来人机协作系统都有启发意义。

然而方法也存在局限。首先,每个新风格仍需设计对应的奖励项,这在工程上具有较高成本;其次,Cat-RAC的理论分析尚不充分,尤其在函数逼近条件下的后悔匹配伪梯度性质有待更严格的刻画;最后,评估主要依赖机器化的胜率与伤害统计,缺少人类玩家的主观偏好验证。

对于后续研究,一个有价值的探索方向是将风格从显式参数调控扩展到隐式表达——例如通过自然语言描述风格意图,由模型自动推断相应的行为模式。另一个方向是研究风格的自动发现与组合,减轻人工设计奖励的负担。

概念 · 7 个
摘要

将强化学习应用于3A游戏智能体并实现风格控制

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.00642v1
发布日期
2026-07-01
PDF
https://arxiv.org/pdf/2607.00642v1
相关度
0.850
已纳入 ✨ wiki 📄 PDF

SAGA:面向长视野 CivRealm 战略规划的场景感知、目标演进智能体

SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning

Tianyu Jin, Shuo Chen, Yida Wang, Liuyu Xiang, Yingzhuo Liu, Zhiyao Jiang, Yexin Li, Zhaofeng He

arXiv:2606.29932v1 2026-06-29
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 9 张
TL;DR

长时域策略游戏中,LLM智能体面临场景盲、上下文溢出和跨局学习浅三大问题。SAGA框架提出三项机制应对:地图-语义场景图消除空间盲,工具增强规划器按需拉取领域状态并分派专家控制器,双视野反馈回路结合局内目标生成与跨局因果复盘。在FreeCiv上取得最高平均文明分数且方差更低,仅显著优于所有基线在基础设施建造上,并以27%更少的输出令牌领先多数对局。跨五局演化下达到最高末端分数,消融验证各组件独立贡献。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

复杂策略游戏(如 FreeCiv)是长视野多域规划的极端挑战代表。这类游戏要求智能体在数百回合内并发管理科技、生产、军事、外交与经济五大决策域,同时面对不完全信息(即「战争迷雾」,只能观察到已探索区域)、稀疏奖励(仅在终局观察累计文明分数)以及硬性不可逆的机械约束。状态空间从早期的 指数增长至后期的 ,动作空间从 扩张至 ,这对任何决策系统都构成了严峻考验。

现有的 LLM 智能体在此类任务中普遍存在三类系统性缺陷。第一类是场景盲(Scene Blindness):原始地块坐标缺乏关系语义,无法支撑语言模型进行有效的空间推理——智能体知道自己有一个单位在某坐标,却难以判断它相对于城市、敌方单位的位置关系。第二类是上下文溢出与领域耦合:单体智能体接收完整状态转储,信息量随帝国规模无限扩张,单步词元数可超过 15k,同时多决策域的指令被混淆输出,导致高优先级军事威胁持续挤压关键基础设施投资。第三类是跨局学习浅层化:现有方法将每局对弈孤立处理,仅回放历史轨迹而缺乏结构化因果归因,无法实现原则性的战略演进。

这些缺陷并非孤立存在,而是相互强化:场景盲导致Planner无法理解空间上下文,只能依赖笨重的原始坐标;上下文溢出迫使模型在有限窗口内优先处理紧急域,进一步加剧领域耦合;缺乏跨局学习则意味着每局都要从零开始,无法从失败中积累可迁移的战略原则。

方法

SAGA 的核心设计哲学是将这三类缺陷的解耦方案整合为统一的框架,由三个相互耦合的机制分别应对。

地图-语义场景图是解决场景盲的关键创新。传统方法将网格坐标直接喂给 LLM,这既不符合语言模型的认知习惯(它更擅长处理关系描述而非绝对坐标),也会引发严重的词元膨胀。SAGA 的方案是每回合从头构建一个类型化有向图 ,节点代表友方与敌方的城市及单位,边的类型则明确区分为两类功能:友-友边用于内部协同与导航,每个友方单位与最近友好城市保持「全局锚定边」,城市与单位按邻近半径连接以保持局部连通性;友-敌边则用于进攻与防御决策,每个军事单位对所有可见敌方城市保持「攻击罗盘」边,当敌方单位越过最近城市的防御半径时触发「威胁边」,并被路由至最近友方实体以直接呈现在提示词中。每条边都标注 Manhattan 距离的离散化档位(close < 3、medium < 10、far ≥ 10)和八方向方位,最终渲染为自然语言描述。这种设计以按需方式将隐式网格坐标转化为显式关系上下文,避免了全局词元膨胀。

工具增强规划器从根本上重构了信息获取与指令分派流程。中央 Planner 被设计为带三个按需工具的 ReActAgent——query_city_metricsquery_army_rosterquery_tech_status。每回合启动时,Planner 仅接收精简的战略摘要(聚合指标、近期目标进度、场景图方向摘要、警报汇总),仅在落定某领域决策前才按需查询该领域精细状态。这种拉取式架构从根本上避免了上下文窗口崩溃。更关键的是,Planner 的响应被强制拆分为六个互不重叠的指令字段:citycivilianmilitarytechgovdiplomacy(后者串行化执行以避免冲突),每个字段由专属的专家控制器并行执行。系统还前置了场景合法动作掩码,在结构上限制可生成的产出,比提示词层面的警告更上游地消除「静默失败」。

双视野反馈循环是实现战略演进的机制,分为短期局内环与长期跨局环两层。局内环每 回合触发一次,由 AbstractAgent 将近期日志压缩为结构化小结,再由 SetGoalAgent 结合跨局战略演进链生成时限、域限的子目标(如「10 回合内建造 3 个 Settler」),作为稀疏奖励的密集代理。系统同时监测两类应急事件——敌对单位接近友好城市或己方城市沦陷——任一发生立即强制重规划。跨局环则在局末由 GameAnalyst 生成八维结构化复盘 JSON,新局开端由 PreGameStrategist 将其与持续更新的战略演进链注入 Planner 系统提示,将可迁移的战略原则转化为可注入的先验。

实验与结果

实验在 CivRealm 平台进行,后端为 FreeCiv 2.6,采用 23×23 Classical 地图,对抗两个内置 AI 对手并含活跃蛮族与海盗。评估设置在最多 150 回合(早-中期最具战略信息密度),统一使用豆包 Seed-1.8 官方 API 端点。所有基线方法(CoS、EpicStar、Optimus-2、HIMA、Mastaba)均被重写于共享基础设施之上,仅 Planner 层存在差异,这是 CivRealm 上首次 planner-level 的同台对比。

实验采用七项指标综合评估:终局文明分数(唯一稀疏客观奖励)、科技研究数、军事力量、城市数、建筑总数、外交里程碑得分,以及令牌消耗(输入+输出词元,按 150 回合归一化)。统计检验采用双侧 Mann-Whitney U 检验配合 Holm 校正。

主实验结果显示,SAGA 在 10 局游戏中的平均文明分数显著高于最强基线 CoS 和 HIMA,且方差更低。在 Buildings 指标上,SAGA 是唯一对所有五个基线均显著超越的方法——这意味着在多目标冲突中最容易被牺牲的资源维度上,SAGA 展现出了独特的稳健性。在正面对局中,SAGA 在大多数对局中得分超过两个最强基线,同时将输出令牌消耗削减 27%,这表明场景图引导下的决策更加聚焦,减少了无意义的探索性输出。

跨局演化实验连续运行五局,SAGA 配合跨局演进机制在每局结束时均取得最高分数,且随局数增加优势呈扩大趋势,说明战略演进链确实在发挥作用。消融实验验证了三个组件的独立贡献:移除场景图后空间决策质量下降最明显,移除按需工具后上下文溢出问题重现,移除 SetGoal 与 Abstract 组合后局内适应性显著降低。

讨论与可借鉴点

SAGA 的设计揭示了一个重要洞察:长视野策略任务中的三大缺陷——场景盲、上下文溢出、跨局学习浅——并非独立的技术问题,而是相互强化的系统性困境,需要协同解耦。场景图通过关系语义压缩而非坐标罗列的方式,为规划器提供了可操作的空间上下文;按需工具将信息获取从「推送」变为「拉取」,从架构上消除了溢出的根源;双视野循环则将稀疏奖励的信用分配问题分解为局内子目标与跨局因果归因两层。

该框架的可借鉴点在于其模块化设计思路:三个机制各自解决一类问题,且可以独立消融验证,这种设计使得方法论更具说服力,也为后续改进指明了方向——如果某个组件被更优方案替代,整体性能仍有提升空间。令牌效率提升 27% 的结果也提示我们,减少不必要的上下文推理不仅能降低成本,更能提升决策质量。

局限方面,SAGA 目前仍依赖预定义的边类型与距离档位,对于更复杂的空间关系表达能力有限;跨局演化链的积累效果依赖于复盘质量,若某局关键决策被错误归因,可能导致负迁移;此外,实验在固定地图种子下进行,跨地图泛化能力尚未充分验证。未来方向可以探索场景图的动态类型扩展、基于强化学习的跨局知识筛选机制,以及在更复杂环境(如多智能体协作/对抗)中的适用性。

概念 · 7 个
摘要

用于复杂策略游戏长期战略规划的LLM多智能体框架

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2606.29932v1
发布日期
2026-06-29
PDF
https://arxiv.org/pdf/2606.29932v1
相关度
0.850
已纳入 ✨ wiki 📄 PDF

三元狼人杀:面向大语言模型多跳心智理论的弄臣角色

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

Avni Mittal

arXiv:2606.27909v1 2026-06-26
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 16 张
TL;DR

现有LLM的心智理论评估多采用二元社会推理游戏,单条语言线索即可指向隐藏阵营,先验强的模型无需真正模拟对手动机即可得分。本研究在狼人杀中扩展"弄臣"角色构成三方博弈,其效用倒置——被投票出局反而获胜,从而迫使模型跨三方收益函数进行多跳推理。覆盖GPT-4.1、DeepSeek-V3.1、Llama-3.3-70B共60局实验显示,弄臣胜率高达60-70%而狼人从未超过20%,证明三元激励结构能揭示二元博弈无法触及的多智能体推理层级。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

[[心智理论]](Theory of Mind)是人工智能领域衡量模型「理解他人心理状态」能力的核心指标。传统评估方式往往依赖二元社会推理博弈——最典型的如「沉默的羔羊」类游戏,其中每条可观察线索都指向唯一的隐藏阵营:要么你是好人,要么你是坏人。在这种结构下,一个拥有强大语言先验的模型即便根本不模拟对手的真实动机,仅凭「语料库中'可疑的人通常怎么说'」这类统计规律就能做出看似合理的判断并获得高分。

问题的关键在于:二元结构人为简化了真实世界的复杂性。现实中的博弈往往是多方参与的,每一方都有自己独特的效用函数——他们想要的东西不同,获胜的方式也不同。当模型需要在三个以上相互对立的利益方之间进行推理时,单靠语言统计先验还能走多远?这正是这项研究试图回答的问题。

研究者选择了狼人杀作为实验载体,并引入了一个经典桌游变体中的角色——弄臣。弄臣的设定极具洞察力:他的胜利条件与所有其他玩家完全相反,不是「活到最后」而是「第一个被投出局」。这意味着弄臣必须表现出足够的可疑性来吸引票数,但不能表现得过于刻意,否则其他玩家会意识到这是个陷阱。这种「恰到好处的可疑」要求模型不仅理解自己阵营的利益,还要推测其他两个阵营会如何看待自己的行为,并进一步推测那两个阵营之间会如何互动——这是一个典型的多跳推理链条。

方法

研究的核心设计围绕弄臣角色的效用函数倒置展开。在标准狼人杀中,所有玩家——无论是村民还是狼人——的共同利益都是「找出并驱逐狼人」,分歧仅在于信息不对称。而弄臣的加入打破了这种一致性:他需要被投出才能赢,这意味着他与狼人之间存在一种奇特的对立-合作关系——弄臣不希望狼人暴露,但狼人偶尔会为了转移视线而把票投给弄臣,这恰恰帮助了弄臣达成目标。

实验采用了三种模型:GPT-4.1、DeepSeek-V3.1 和 Llama-3.3-70B。每个模型分别扮演狼人、村民和弄臣。研究团队运行了 60 局游戏,并设计了一个关键变量:弄臣是否开启自学习(self-learning),即是否能够从之前的对局中提取经验并调整策略。这一设计用来检验模型是否能在重复博弈中习得「微妙的可疑」策略——既要看起来值得投,又不能显得在故意伪装。

GPT-4.1 在实验中的行为最为戏剧性。狼人角色在 60%–70% 的对局中选择了在第一天就把弄臣投票出局。从博弈论角度看,这是一个严格意义上的自毁举动:狼人的胜利条件是「活到最后并消灭村民」,而帮助弄臣获胜只会让狼人更接近失败。然而模型为什么会做出这种选择?一个可能的解释是,GPT-4.1 的语言先验让它识别出「弄臣说了很多可疑的话」,于是将其标记为威胁并优先处理——但它没有考虑到弄臣的效用函数与狼人并不对立。这种「看到可疑就投」的启发式策略在二元博弈中可能奏效,因为可疑的人通常确实是敌人;但在三元结构中,这一逻辑会导致灾难性的后果。

DeepSeek-V3.1 则展现出截然不同的行为模式。它是唯一一个在自学习循环中逐渐习得「看似可疑却又显得自然」这一微妙策略的模型。这种策略的核心张力在于:弄臣需要足够的可疑性来被投票,但不能表现得像个正在「扮演可疑角色」的演员——后者会触发其他玩家的元认知推理,意识到有人在利用逆向心理。DeepSeek 在多局游戏中展现出了对这一平衡点的把握,并因此获得了最高的收益。

Llama-3.3-70B 的表现介于两者之间,没有展现出像 DeepSeek 那样精细的策略学习能力,但其基础推理水平足以让弄臣维持较高的胜率。

实验与结果

60 局游戏的统计数据呈现出清晰的格局:弄臣的整体胜率在 60%–70% 区间内浮动,而狼人的胜率从未超过 20%。这一数字本身就极具说明力——在标准的二元狼人杀中,狼人的理论胜率通常在 30%–40% 左右,而弄臣的出现几乎将其砍半。这说明三元激励结构对狼人的生存空间构成了严重挤压,因为弄臣的存在让投票结果变得更加不可预测,狼人更难通过控制投票节奏来隐藏身份。

自学习的影响在不同模型间呈现出戏剧性的分化。对于 DeepSeek 和 Llama,开启自学习后弄臣胜率有所上升,模型逐渐学会了如何更好地伪装和诱导。但对于 GPT-4.1,自学习反而降低了弄臣的胜率——这一反直觉的结果指向一个深层问题:GPT-4.1 在自我改进的过程中似乎强化了某种错误的推理模式。具体来说,当弄臣在自学习过程中变得更加「刻意可疑」时,GPT-4.1 反而更坚定地在第一天将其投出。这种行为模式暗示,GPT-4.1 可能将「学习后变得更可疑」解读为「确凿的威胁证据」,从而变本加厉地执行自毁策略。自学习的代价最终落在了村民身上——他们因为狼人的错误决策而成为最终的受害者,而狼人则毫发无损。

DeepSeek 的策略演化路径最为引人注目。在最初的若干局中,它的行为模式与 GPT-4.1 类似——过于直接地表现出可疑性。但在某个临界点之后,它开始调整策略:可疑的言行依然存在,但同时伴随着大量「合理化解释」,使得整体发言看起来像是一个紧张但真诚的玩家,而非一个刻意操纵的演员。这种「让伪装融入真实」的转变体现了模型对多方博弈的更深层次理解。

讨论与可借鉴点

这项研究的价值在于它提供了一种诊断 [[多智能体推理]] 能力的新工具。二元社会推理博弈长期主导着 LLM 心智理论的评估,但这种设计本质上是对真实场景的过度简化。当博弈扩展到三个以上相互对立的效用函数时,模型的真实推理能力才会浮出水面——语言先验可以处理「这个人说话可疑」,但无法处理「这个人说话可疑这件事本身会被对方如何解读」这类嵌套信念问题。

研究也揭示了模型规模与推理深度之间的非线性关系。GPT-4.1 作为参数规模最大的模型,反而展现出最严重的推理失误——它在第一天投出弄臣的频率甚至高于 DeepSeek。这提示我们,强大的语言模型可能在「模式匹配」方面过于高效,以至于绕过了更深层的推理过程。当「可疑特征 → 投票对象」这条规则链被触发得太容易时,模型就失去了停下来思考「为什么这个人要表现得可疑」的动力。

DeepSeek 的表现则暗示,推理能力的涌现可能与模型架构和训练方式的交互有关,而非单纯由参数量决定。它在「微妙策略」上的突破说明,某些类型的多跳推理可能需要特定的归纳偏置来激活。

研究的局限性值得注意。首先,60 局游戏的样本量对于统计推断而言并不算大,模型行为的变异性需要更大规模的实验来确认。其次,狼人杀本身是一种高度结构化的对话场景,模型的表现能否泛化到其他形式的多智能体交互(如谈判、协作问题解决)仍是开放问题。第三,弄臣角色的设定虽然精巧,但它毕竟是一个「规则明确」的博弈设定;真实世界中的逆向激励往往更加模糊和多层。

从方法论角度看,这项研究为 [[LLM 评估]] 开辟了一条值得深耕的路径:通过设计具有内在矛盾的激励结构来暴露模型的推理漏洞。三元博弈只是起点——更复杂的四元、五元结构,更长的推理链条,以及动态变化的联盟关系,都可能成为未来研究的实验田。更根本地,这项研究提醒我们:评估 LLM 心智理论的标准,可能需要从「能否理解对手在想什么」升级为「能否理解对手如何理解对手在想什么」。

概念 · 6 个
摘要

狼人杀社交推理游戏,涉及多个AI阵营与心智推理

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2606.27909v1
发布日期
2026-06-26
PDF
https://arxiv.org/pdf/2606.27909v1
相关度
0.850
已纳入 ✨ wiki 📄 PDF

StarBench:面向智能体多模态决策与信息寻求的回合制 RPG 基准

StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking

Haoran Zhang, Chenhao Zhu, Sicong Guo, Hanzhe Guo, Haiming Li, Donglin Yu

arXiv:2510.18483v1 2025-10-21
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

visiongame-aiagentgui
重要图片 · 4 张
TL;DR

现有VLM在真实游戏客户端中能否像人类一样从截图生成连贯的低层按键操作并在受挫时主动寻求信息仍是开放问题。本文基于《崩坏:星穹铁道》构建StarBench基准,涵盖8项战斗任务,在统一任务与指标下设立直接控制与工具辅助控制两种评测模式,并加入ask-or-act诊断衡量是否/何时请求简短指引。实验显示当前VLM在直接控制模式下感知到控制的保真度存在显著差距,而合理的信息寻求行为与成功率提升正相关。

概念 · 7 个
摘要

真实游戏客户端中从原始截图映射到时序连贯的键盘鼠标底层操作,且能在受挫时主动寻求信息,是VLM尚未被验证的人类级游戏能力

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2510.18483v1
发布日期
2025-10-21
PDF
https://arxiv.org/pdf/2510.18483v1
相关度
0.850
已纳入 ✨ wiki 📄 PDF

FootsiesGym:一种面向双人零和不完美信息博弈的格斗游戏基准

FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

Chase McDonald, Nathan Tsang, Wesley N. Kerr

arXiv:2607.06514v1 2026-07-07
0.80 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 2 张
TL;DR

格斗游戏的中立博弈(neutral play)天然具有循环、非传递的不完美信息策略交互特性,但缺乏轻量、可复现的基准环境。本文基于简约2D格斗游戏Footsies构建开源强化学习环境FootsiesGym,提供矢量化仿真器支持高吞吐量训练。研究者评测了多种强化学习算法,并探讨了由此启发的开放研究方向,为不完美信息博弈策略学习提供了可控的分析平台。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

[[博弈论]]与[[强化学习]]的交汇处,一个核心问题始终悬而未决:如何在不完全信息下训练出既强大又富有策略多样性的智能体?扑克类游戏(如 [[Leduc Poker]])提供了可控的理论分析环境,但状态空间过于简单;而《星际争霸》《Dota 2》等商业大作虽然足够复杂,却因训练成本高昂而难以广泛复现。格斗游戏本可以填补这一空白——其"中立博弈"阶段天然呈现循环非传递的策略结构,玩家必须在攻击、防御、位移之间做出混合决策,不存在任何全局占优的纯策略。

然而,现有的格斗 AI 平台大多依赖商业游戏或闭源引擎,存在授权不清、复现困难的共性障碍。FightingICE、DIAMBRA Arena 等框架虽然功能丰富,却将研究者置于高昂的工程门槛之前。更重要的是,这些平台往往追求对真实格斗游戏的完整还原,而完整往往意味着复杂——过多的机制设计会掩盖核心的博弈论问题本身。

FootsiesGym 的切入角度恰好回答了这一矛盾。HiFight 于 2018 年开源的 Footsies 是一款刻意做减法的格斗游戏:没有血条,没有连招,被特殊攻击命中即判定失败。游戏机制被极度精简,策略空间却完整保留了中立博弈的核心特征——循环、非传递、不可约简的不完美信息。作者在此基础上构建标准化的强化学习接口,将这个"最简格斗游戏"转变为一个可复现、可扩展的基准环境。

方法

FootsiesGym 的核心设计哲学可以概括为"极简但不失本质"。游戏层面保留了四项关键机制:胜负通过一次命中判定,消除血条设计带来的血量管理复杂度;格挡设置了三层上限(guard bar),超过后强制破防,形成攻击与防御的资源博弈;冲刺通过连续两次方向键实现,为位移提供离散化控制;特殊攻击需要持续按住攻击键约 60 帧后释放,创造了"蓄力"这一时间维度的策略选择。

动作空间被设计为默认 6 个离散动作的集合:NONE、BACK、FORWARD、ATTACK、BACK+ATTACK、FORWARD+ATTACK。当启用特殊充能选项时,动作空间扩展为 9 维,新增的三个 charge 动作用于简化特殊攻击的探索难度。观测空间为 85 维特征向量,包含玩家间距这一公共信息、位置速度等共享状态,以及仅自身可见的冲刺可用性、特殊攻击充能进度等特权特征——这种不对称的观测设计模拟了真实对局中"我知我见,你见我未见"的信息格局。

奖励函数采用零和形式 ,终局胜负奖励设定为 ,超时则双方均得零分。作者还提供了可选的密集奖励作为辅助信号。在技术实现上,游戏原本运行于 Unity/C# 引擎,作者通过解耦渲染循环、无头模式运行的方式将游戏逻辑独立出来。矢量化仿真器允许单个进程并行步进 个独立游戏实例,通过 gRPC 端口对外暴露 Python API,完全兼容 [[PettingZoo]] 的多智能体环境标准。

一个特别值得关注的机制是动作延迟(Action Delay)。在真实的格斗游戏中,从玩家输入指令到角色实际执行动作之间必然存在延迟。作者将这一机制参数化,使得研究者可以精确控制"反应"与"预测"之间的平衡。当动作延迟为零时,策略可以在帧级别精确响应对手动作;但当延迟增大到一定程度后,攻击变得完全不可反应,此时必须依赖对对手意图的预判。数学上,动作执行帧数可以表示为:

这个设计将动作延迟从游戏系统的被动约束转变为一个可控的实验变量,为研究不完美信息博弈中"预测 vs 反应"的策略权衡提供了天然的操作手段。

实验与结果

作者在 FootsiesGym 上系统评测了四种强化学习算法:标准 PPO、带熵系数线性退火的 PPO (Sched.)、EMAgnet(一种基于参数空间指数移动平均的正则化方法)以及 PFSP(优先虚拟自博弈,对手按当前策略弱点加权采样)。所有算法使用统一的网络架构(256 隐单元的两层 MLP)和相同的训练预算( 环境步),仅在各自特有的超参数上做朴素设置。

实验揭示了几个值得深思的发现。首先是对启发式对手的胜率表现:所有算法都能将对随机对手的胜率提升至 85–95%,但面对 no-op(什么都不做)对手时胜率反而较低。这一反直觉的结果表明,训练所得的策略存在"过度反应化"倾向——它们学会了精准反击随机动作,却不愿主动出击创造优势。

其次是近似可利用度分析。作者对每个最终策略训练最佳响应作为 exploitability 的下界估计。结果显示,所有算法的策略都存在显著的可利用空间,其中 PFSP 在与最佳响应直接对抗时胜率最高、平局率也最高;而 EMAgnet 尽管在头部对战中回报为正,却是最容易被最佳响应利用的算法。这一发现对 EMA 正则化方法在不完美信息博弈中的效果提出了质疑。

最具洞察力的发现或许是特殊攻击难以发现这一现象。在标准配置下,B_SPECIAL(需要连续按住攻击键 15 帧后释放的强力招式)在训练过程中几乎从未被有效使用,仅 PPO 在极短时间内短暂发现后很快丢失。强化学习算法倾向于维护高熵以保持探索,但高熵同时也意味着低概率策略会被逐渐挤出策略空间——即使这些策略可能具有重要的博弈论价值。这个问题呼应了"Winning is not everything"的研究关切:追求胜率的算法优化是否会牺牲策略的丰富性和观赏性?

动作延迟的消融实验进一步验证了其作为实验工具的价值。delay=0 时策略对随机对手表现出色,但对 no-op 完全失效——因为它们变成了纯粹的条件反射;delay=12 时对随机胜率下降,但对 no-op 接近 100%——因为此时攻击变得不可反应,策略被迫发展出主动创造机会的能力。启用特殊充能动作扩展后,B_SPECIAL 的使用率显著上升,验证了这是一种有效的工程性补救手段。

在资源消耗方面,FootsiesGym 展现出极高的效率。单进程峰值吞吐量约为 19,000 步/秒,当并行 4 个服务器进程、各自步进 128 个游戏实例时,聚合吞吐量达到约 52,500 步/秒。这一数字意味着在标准 24 核 CPU 工作站上,每天可以完成数十亿步的环境交互,完全满足学术研究的算力需求。

讨论与可借鉴点

FootsiesGym 的贡献不仅在于提供了一个基准环境,更在于它揭示了当前强化学习方法在处理非传递循环博弈时面临的深层挑战。特殊攻击难以发现这一现象暗示着,标准强化学习的目标函数(期望累积回报最大化)与博弈论所追求的策略多样性之间存在张力。算法会自然地收敛到"够用"的策略子集,而那些需要长期规划或跨模态探索才能发现的高价值策略,往往在早期就被遗忘。这一问题值得在[[多智能体强化学习]]的框架下进一步系统研究。

从工程角度看,该工作展示了"极简设计"的威力。FootsiesGym 的成功不在于功能的堆砌,而在于对问题本质的精准提取:将中立博弈的策略循环从格斗游戏的其他复杂机制中隔离出来。这种思路对于基准环境设计具有普遍参考价值——与其追求与真实系统的像素级还原,不如先在理论上可分析的简化环境中建立理解。

当然,这项工作也存在局限性。作者明确承认所有基线仅为朴素调参,跨算法比较的公平性有待商榷;近似可利用度仅提供下界,无法对纳什收敛性做严格判定;环境本身虽然有效简化了格斗游戏,但与真实商业格斗游戏在角色多样性、连招系统等方面仍有差距。此外,缺乏人类玩家的对照实验也是一个遗憾——环境提到了 WebGL 导出的可能性,但论文中并未实际执行人类研究或模仿学习。

展望未来,FootsiesGym 为多个方向提供了可控的实验床。探索机制的改进首当其冲:如何让强化学习算法发现并保持低概率但有价值的策略?动作延迟机制作为一个自然的实验变量,值得系统研究其对策略收敛性的影响。[[自我博弈]]方法的改进也是重要方向,PFSP 展现出对抗最佳响应时的优势,但其对手选择策略仍有优化空间。最后,该环境可以作为博弈论直觉的教学工具——通过可视化策略演化,学生可以直观理解循环支配、纳什均衡等抽象概念如何体现在具体的游戏交互中。

概念 · 7 个
摘要

双人格斗游戏中强化学习算法的基准测试

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.06514v1
发布日期
2026-07-07
PDF
https://arxiv.org/pdf/2607.06514v1
相关度
0.800
已纳入 ✨ wiki 📄 PDF

强化学习视角下的《超级马里奥兄弟》:1-1 关的课程设计、教学法与最优关卡设计

Reinforcement Learning in Super Mario Bros: Curriculum, Pedagogy, and Optimal Level Design in World 1-1

Jesse Ponnock, Lucas Ho

arXiv:2606.29511v1 2026-06-28
0.80 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

game-ai
重要图片 · 7 张
TL;DR

超级马力欧兄弟1-1关被公认为游戏设计的经典,其渐进式关卡结构被认为能在游玩中自然教会玩家核心机制。本研究从零构建离散化1-1关环境,对比Q-Learning、SARSA、蒙特卡洛和DQN四种算法,并通过12种课程排列实验检验教学结构。结果显示蒙特卡洛以94.9%胜率显著超越DQN的76.4%,且经典段落排列收敛最快、效率最高且无灾难性失败,首次实证验证该关卡设计蕴含不可复制的教学价值。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

《超级马里奥兄弟》的1-1关几乎是所有游戏设计教科书都会引用的经典案例。这条看似平平无奇的第一关据说是宫本茂专门为新玩家打造的“入门教程”:它从最简单的右移开始,逐步引入跳跃、踩敌人、顶砖块等机制,行云流水地让玩家在通关的过程中自然掌握游戏的核心操作。这种“通过关卡本身传授机制”的设计理念听起来很美,但它究竟是真实存在的设计智慧,还是后人根据结果倒推出来的“事后诸葛亮”?

这个问题之所以值得认真研究,是因为它触及了[[课程学习]](Curriculum Learning)领域的核心议题:如果一个游戏关卡的片段排列顺序真的能够系统性地影响学习效果,那么这种可量化的教学结构就可以被提炼成设计原则,迁移到教育软件、智能辅导系统乃至[[强化学习]]智能体的训练流程中。反过来说,如果经典顺序只是众多可行排列中的一种偶然优秀排列,那游戏设计史上关于1-1关的传奇就只能停留在叙事层面。

论文试图用实证方法回答两个具体问题:第一,在1-1关的三个复杂度递增版本上,哪种强化学习算法学得最好、为什么;第二,把关卡切成六个经典片段后,这些片段的顺序是否会影响智能体的学习效果——换言之,经典排序是否真的比随机排列更“教学友好”。

方法

研究者的第一个关键决策是从零实现环境而非使用现成的游戏模拟器。这个选择有其深意:完全离散化能确保实验的纯净性,避免第三方库的工程噪声干扰对学习算法的理解。

环境建模从212列×14行的瓦片网格出发,忠实再现了NES原版的几何布局。他们构建了三个复杂度递增的版本:v1版本只包含地形、管道和终点旗杆,没有任何可交互对象;v2版本在精确位置加入了可破坏砖块和问号块;v3版本则加入了17个敌人——16个蘑菇头加1个乌龟,敌人具有NES准确的速度值、真实的重力效果和踩踏击杀机制。

状态空间的维度随着复杂度上升而扩展。v1只需要一个三元组就能完整描述;v2引入了56维的视口向量来记录视野范围内的砖块和问号分布;v3进一步将敌人信息纳入视口,总状态维度达到115。动作空间被刻意精简为三个离散选项——站立、向右移动和跳跃,其中跳跃被建模为固定六帧的弧线轨迹。这个简化使得研究者能够把注意力集中在比较不同[[强化学习]]算法的能力差异上。

奖励函数的设计体现了对“方向性引导”的考量。智能体右移一步获得+0.5的奖励,站立不动则获得-0.1的惩罚,抵达旗杆获得+100的终局奖励,死亡扣除-50。额外的奖励项——击碎砖块+1、顶问号块+3、踩死敌人+5——在v2和v3版本中被激活。这个奖励结构经过精心标定,使得完整通关的累积方向奖励(大约49.5分)与胜利奖励(100分)保持合理的权重关系。

在算法选择上,研究者纳入了四种具有代表性的方法。[[Q-Learning]]作为off-policy时序差分方法的代表,采用计算目标值;[[SARSA]]作为on-policy时序差分方法的代表,采用计算目标值;[[蒙特卡洛方法]]采用first-visit采样均值估计,以完整回合的累积折扣回报作为更新目标;[[DQN]]使用双网络架构和经验回放缓冲来处理高维状态空间。所有算法共享衰减策略(初始值1.0,乘性衰减0.999)和的折扣因子。

课程实验的设计尤为精巧。研究者将v3关卡划分为六个段落(A到F),对应原版1-1关的标志性设计元素:开场的平坦地形、第一组沟壑与管道、问号块密集区、蘑菇头连绵的挑战段落、地下管道入口,以及最后的旗杆冲刺。他们设置了12种排列条件进行对比——经典顺序、逆序、以及10种随机排列。评估指标覆盖胜率、曲线下面积(AUC)、收敛速度(达到50%和80%胜率所需的回合数),以及“灾难性失败”率(最终胜率低于10%的种子比例)。

实验与结果

算法对比的结果揭示了一个出人意料的格局。在最简单的v1版本上,所有算法的表现都接近完美,SARSA以100.0%的胜率略微领先。但随着复杂度上升,[[蒙特卡洛方法]]逐渐拉开差距:在v2上达到99.9%的胜率,在v3上仍保持94.9%的惊人表现,而[[DQN]]在v3上暴跌至76.4%。

更深入的分析表明,DQN失败的根本原因在于其经验回放机制——死亡转移的频繁出现污染了回放缓冲,导致智能体学会了“过度保守”的回避策略,v3上每回合仅击杀1.38个敌人。蒙特卡洛方法的胜出则源于其episode-level的更新特性:它能够学会沿着高回报路径(如踩死更多敌人、击碎更多砖块)最大化累积奖励,而不是贪心地选择最短通关路线。

课程实验的结果更具说服力。经典顺序A→B→C→D→E→F在三项关键指标上全面领先:94.7%的最终胜率、67.2%的AUC值,以及零次灾难性失败。逆序排列F→E→D→C→B→A的胜率仅为48.5%,且有40%的训练种子遭遇灾难性失败;10种随机排列的平均胜率虽然达到89.0%,但没有任何一个排列能在三项指标上同时与经典顺序比肩。

这个结果的统计学显著性相当扎实。经典顺序与逆序的胜率差异通过了Welch's t检验(, Cohen's ),收敛速度差异同样显著(, )。研究者进一步用[[DQN]]重复了相同的课程实验,发现其对所有12种排列几乎毫无差异(, ),证实经验回放机制抹除了时间顺序信号——这是对“为何顺序敏感”机制的一次精准定位。

段落D(9只蘑菇头连续出现)是关键转折点。当它被过早放置在课程中时,早期死亡引发的负反馈在蒙特卡洛的episode-level更新下难以恢复,形成灾难性的失败链;而经典顺序将其安排在玩家已熟悉基本操作之后,提供了恰到好处的挑战梯度。

讨论与可借鉴点

这项研究最核心的价值在于方法论:它把一个游戏设计领域的“都市传说”转化为可证伪的经验命题,并通过严格的实验设计给出了肯定的回答。这种“神话祛魅”式的研究路径值得借鉴——无论是游戏设计、教育心理学还是[[课程学习]]领域,任何声称具有“教学结构”的设计都可以被拆解成可测量的变量。

研究对[[强化学习]]实践者也有直接的启发。实验揭示了经验回放机制的一个隐藏代价:它能提升算法鲁棒性,但同时也会抹除训练数据中的时序信息。对于需要捕捉episode-level结构的任务(如需要学习“策略性放弃短期收益以换取长期回报”的场景),纯[[蒙特卡洛方法]]可能比广泛使用的[[DQN]]更合适。这个发现在一定程度上回应了学界对“基于值函数的强化学习是否过于短视”的隐忧。

研究的局限性同样值得正视。课程实验仅测试了10种随机排列,最佳随机排列(Map 3,95.2%胜率)与经典顺序在统计上不可区分,这削弱了“经典顺序不可替代”的强结论。更重要的是,研究者承认未在其它马里奥关卡或非马里奥游戏上验证泛化性,结论的外部效度有待检验。此外,DQN的超参数仅在v1上调试,v3上的76.4%胜率可能并非其能力上限。

尽管如此,这项研究填补了一个有趣的空白:它首次用量化证据表明,游戏设计史上流传的1-1关“教学价值”并非事后附会,而是一种可以被[[强化学习]]捕捉、可以被统计检验证伪的真实设计特征。这种对直觉的系统性验证,正是计算认知科学能够为设计领域提供的独特贡献。

概念 · 6 个
摘要

在超级马里奥游戏中比较Q学习、SARSA、蒙特卡洛和DQN算法

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2606.29511v1
发布日期
2026-06-28
PDF
https://arxiv.org/pdf/2606.29511v1
相关度
0.800

Reinforcement Learning

×5 篇

method

Proximal Policy Optimization

×2 篇

method

Sim-to-Real Gap

×1 篇

problem

AIoT

×1 篇

other

Deep Q-Network

×1 篇

method

Edge Computing

×1 篇

architecture

Benchmark Platform

×1 篇

methodology

Sim-to-Real Transfer

×1 篇

methodology

Role-Playing Agents

×1 篇

problem

Chain-of-Thought Reasoning

×1 篇

method

Psychology-Grounded Reasoning

×1 篇

methodology

Policy Optimization

×1 篇

method

Reward Hacking

×1 篇

problem

Character Fidelity

×1 篇

metric

Self-Play

×1 篇

method

Trust Region Policy Optimization

×1 篇

method

Neural Fictitious Self-Play

×1 篇

method

Information Set Monte Carlo Tree Search

×1 篇

method

Opponent Curriculum Learning

×1 篇

method

通用价值函数逼近器

×1 篇

method

风格条件策略

×1 篇

method

Cat-RAC

×1 篇

method

软演员-评论家

×1 篇

method

混合动作空间

×1 篇

problem

游戏AI

×1 篇

problem

Multi-Agent System

×1 篇

architecture

Scene Graph

×1 篇

method

Tool-Augmented Planning

×1 篇

method

Long-Horizon Planning

×1 篇

problem

LLM Agent

×1 篇

method

CivRealm

×1 篇

dataset

Sparse Reward

×1 篇

problem

心智理论

×1 篇

problem

社交推理博弈

×1 篇

methodology

狼人杀博弈

×1 篇

other

弄臣角色

×1 篇

method

多智能体推理

×1 篇

problem

自学习

×1 篇

methodology

StarBench

×1 篇

dataset

Vision-Language Model

×1 篇

method

Multimodal Decision-Making

×1 篇

problem

Agentic Information Seeking

×1 篇

methodology

GUI Agent

×1 篇

architecture

OCR-based Tool-Assisted Control

×1 篇

method

Ask-or-Act Diagnostic

×1 篇

methodology

Imperfect-Information Games

×1 篇

problem

Multi-Agent Reinforcement Learning

×1 篇

methodology

Fictitious Self-Play

×1 篇

method

Exploitability

×1 篇

metric

PettingZoo

×1 篇

other

Game AI Benchmark

×1 篇

dataset

Curriculum Learning

×1 篇

method

Monte Carlo (RL)

×1 篇

method

Deep Q-Network

×1 篇

method

Q-Learning

×1 篇

method

Game Level Design

×1 篇

problem

图谱基于本库论文之间的相似度关系(由 DPR paper-relations 模块 Jaccard / TFIDF / hybrid 算法计算,无 LLM)。

论文(按相关度上色) 概念(节点之间为共同概念边)

每日简报占位

DPR 是静态站点,没有 Polaris 那种后端定时任务。启用 GitHub Actions 工作流后,简报会出现在这里。

当前可用的 Polaris 提示词版本:

  • library-digest:2026-08-02 — 逐篇看点(PAPER_INSIGHTS)
  • library-digest:2026-08-02 — 简报主编(DIGEST_SYNTHESIS)
  • library-digest:2026-08-02 — 滚动趋势(TREND)

详见 迁移文档config/prompts/library-digest/2026-08-02/

文献对话(占位)

本面板将基于 library-chat:2026-08-02 提示词,接管自 paper-chat 的浮窗能力,支持库级上下文 + 跨论文 RAG 引用。

阶段 4 启用后将接流式 LLM,引用规约 [n]、概念双链 [[概念名]]、图片 ![[fig:N]]

笔记在每篇论文的 详情页 底部写。 选中下面的论文直接进入"📝 写笔记"位置。

2607.10309v1 07-14

衡量仿真到现实的差距:为人工智能物联网系统中的强化学习设计经济实惠的真实世界基准平台

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

2305.16291 05-25

Voyager:基于大语言模型的开放式终身具身智能体

Voyager: An Open-Ended Embodied Agent with Large Language Models

2606.27025v1 06-25

通过心理学奠基的推理与角色感知策略优化改进通用角色扮演智能体

Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization

2607.06854v1 07-07

一项关于轻量级博弈智能体何以强大的金标准研究

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

2607.00642v1 07-01

面向交互式游戏的可指导智能体

Coachable agents for interactive gameplay

2606.29932v1 06-29

SAGA:面向长视野 CivRealm 战略规划的场景感知、目标演进智能体

SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning

2606.27909v1 06-26

三元狼人杀:面向大语言模型多跳心智理论的弄臣角色

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

2510.18483v1 10-21

StarBench:面向智能体多模态决策与信息寻求的回合制 RPG 基准

StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking

2607.06514v1 07-07

FootsiesGym:一种面向双人零和不完美信息博弈的格斗游戏基准

FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

2606.29511v1 06-28

强化学习视角下的《超级马里奥兄弟》:1-1 关的课程设计、教学法与最优关卡设计

Reinforcement Learning in Super Mario Bros: Curriculum, Pedagogy, and Optimal Level Design in World 1-1

文献库基础信息

库名 (English)
Game AI
库名 (中文)
博弈 AI
研究方向陈述
Game-playing agents, online decision-making, opponent modeling, StarCraft / Honor of Kings / poker.
研究方向陈述(中文)
博弈代理、在线决策、对手建模,涵盖 StarCraft / 王者荣耀 / 扑克等场景。
维护者
DPR
卡片色调
purple
入库方式
公共库(从 docs/papers/** frontmatter 派生,无写路径)

本月 LLM 用量

已用 tokens
加载中...
预算设置
剩余
-

建库与同步

公共库数据来自 docs/papers/ frontmatter,在 pipeline 跑批时重建。本 Tab 只控制个人库。

个人库同步(若已配置 Gist token):

同步底层由 astro-src/lib/user-libraries/gist.ts 处理(零信任 R/W 合并,见 8f2a 提交)。

正在检测重复...