arXiv 2607.00642v1 · 发布 2026-07-01

面向交互式游戏的可指导智能体

Coachable agents for interactive gameplay

AUTHORS Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman
EVIDENCE 将强化学习应用于3A游戏智能体并实现风格控制
SCORE 0.8
CATEGORIES TASK game-ai
GENERATED 2026-07-04 21:38:12 UTC

📝 TLDR

强化学习通常只能学到一种近最优策略,难以满足对行为风格进行实时可控的需求。本文将通用价值函数逼近器(UVFA)与精心设计的训练场景、学习算法及数据增强相结合,提出可“被教练”的智能体框架。该方法已在《地平线 西之禁地》、《GT赛车》以及开源类人机器人领域得到验证,允许终端用户在运行时灵活选择智能体的最终行为表现。

🧭 速览

动机

传统强化学习只能习得单一近最优策略,无法在运行时灵活控制智能体完成任务的具体行为方式(风格)。

方法

结合通用价值函数逼近器(UVFA)与特定训练场景、学习算法及数据增强,构建支持风格指令的智能体框架。

结果

在赛车、战斗和类人行走等差异显著的领域中,智能体既保持任务完成能力,又能遵循指定的风格请求。

结论

提出的框架使终端用户可在运行时灵活选择智能体的最终行为,实现对核心任务执行方式的可控干预。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

强化学习智能体通常只能学到一种近最优行为,难以满足用户对任务执行风格的实时调控需求。本文将[[通用价值函数逼近器]](UVFA)与定制训练场景、学习算法及数据增强相结合,构建了一套可“被教练”的智能体框架,使智能体能在保持核心任务完成能力的同时,根据用户输入灵活切换行为风格。该框架在《地平线 西之禁地》战斗系统、《GT赛车》竞速策略及开源人形机器人步行三个差异显著的领域中均验证有效,终端用户可在运行时自由选择最终行为表现。

研究背景与动机

强化学习已在游戏对弈、机器人控制乃至基础模型训练等领域展现出强大的能力。通过大量试错,这些系统往往能自主发现完成任务的有效策略——但也正因如此,学到的只是一种近乎固定的、近最优的行为模式。在许多实际应用场景中,人们不仅关心任务是否完成,更关心“如何”完成:清洁机器人在婴儿睡眠时应该安静作业,客人来访时则可以加快节奏;赛车游戏中车手可能为延长轮胎寿命而主动放慢节奏;游戏中的NPC若能根据玩家偏好切换战斗风格,将大幅提升沉浸感。

这些对“完成任务方式”的调控需求,与多任务学习或目标条件学习存在本质区别。论文将此类调控定义为风格(styles)——它不改变核心任务本身(赛车仍要完成圈速、战斗仍要取胜),而是在主任务约束下调整次要行为特征,类似于语言中副词对动词的修饰关系。传统强化学习方法缺乏这种可控性:一旦策略收敛,智能体只能在训练时确定的单一行为模式内运作,无法在推理阶段实时切换风格。

这一挑战的难点在于多层面。首先,[[动作空间]]可能高度复杂——《地平线 西之禁地》中同时包含数百种离散动作组合和连续控制维度。其次,风格信号与任务奖励需要协同优化,避免风格调控干扰核心任务的完成。最后,风格参数在推理时可能连续变化,这要求策略网络对条件输入具有足够的敏感性。

方法

论文的核心思路是将[[通用价值函数逼近器]](UVFA)扩展为风格条件化版本。标准UVFA接收状态和目标向量作为输入,输出对应的价值估计;本文在此基础上引入多维风格参数向量 ,使其能够根据不同的风格配置输出差异化的价值与策略。

形式上,奖励函数被分解为任务奖励与风格奖励两部分:

风格奖励进一步分解为 个独立项的加权组合:

其中 为标量权重(正值鼓励、负值抑制、零表示无偏好), 为风格特定参数如阈值或目标设定点。每个训练回合内 保持固定以避免信用分配困难,但在推理时允许连续变化。

Cat-RAC算法是处理《地平线 西之禁地》这类混合[[动作空间]]的关键创新。当动作同时包含离散选择(如武器切换)和连续控制(如摇杆方向)时,标准SAC的熵正则化难以统一处理。Cat-RAC用后悔匹配(regret matching)的思想重构梯度:计算每个动作的瞬时遗憾 ,当某动作的策略概率已低于其梯度贡献时将梯度清零,避免策略向低价值方向更新。对于离散动作头使用精确的类别熵估计,连续头则通过大量样本估计熵的负对数密度,比SAC的单样本估计更为稳定。

在训练策略上,论文设计了多层数据增强机制。任务扮演(Task Impersonation)技术将同一转换(transition)在 种风格配置下评估,仅需 个额外风格向量即可显著扩展风格覆盖而无需扩充经验回放缓冲区。分层采样通过事件表按风格配置组织数据,对比机制有效解决风格间数据不均衡问题。风格参数采样分布采用混合策略:少量概率采样默认风格、部分概率独立采样各权重、大部分概率采用连续one-hot形式,平衡探索多样性与学习效率。

实验与结果

论文在三个差异显著的领域验证了框架的通用性。《地平线 西之禁地》的战斗系统具有315种离散动作组合加4维连续控制的高维[[动作空间]],智能体需在19种机器敌人、3个地图场景下响应18个风格权重和20种风格配置。《GT赛车7》中风格调控聚焦于漂移程度、轮胎与燃油节省以及整体激进度。《DMC Humanoid》则在21维连续动作空间中测试3种离散手臂姿态与连续步长设定点的组合。

《地平线 西之禁地》的核心实验规模庞大:5个随机种子各训练450万梯度步,然后在20种风格、19种敌人、3个地点、10个样本的交叉组合下评估,共计约57000场战斗。风格分数(请求伤害类型占总伤害的比例)显示17种风格的伤害矩阵呈现明显对角线主导现象,平均胜率多数超过90%。消融实验表明:Cat-RAC相比分类式SAC在风格分数上提升约10个百分点;任务扮演中 的配置相比不使用该技术可将风格分数提升约15%;混合采样分布相比纯one-hot采样能更好地平衡默认风格表现与风格覆盖广度。

更值得注意的是,智能体展现出上下文推理能力:在战斗中先用弱武器触发元素状态,再切换强武器最大化元素期间伤害,这种组合策略在训练中平均每百万场景不到一次,但智能体仍能习得。分布外泛化测试中,面对训练集未见的飞行敌人或双敌人场景,智能体仍维持可观胜率。

讨论与可借鉴点

该工作最值得关注的设计哲学在于将风格调控从训练时固化转向运行时灵活。传统观点认为强化学习学到的是一种固定的最优映射,而本文证明通过适当的条件化设计和训练策略增强,单一策略网络可以编码多种风格的行为空间,用户在推理时通过调节风格参数即可即时切换。这种解耦核心任务与风格调控的思路,对交互式游戏、具身智能乃至未来人机协作系统都有启发意义。

然而方法也存在局限。首先,每个新风格仍需设计对应的奖励项,这在工程上具有较高成本;其次,Cat-RAC的理论分析尚不充分,尤其在函数逼近条件下的后悔匹配伪梯度性质有待更严格的刻画;最后,评估主要依赖机器化的胜率与伤害统计,缺少人类玩家的主观偏好验证。

对于后续研究,一个有价值的探索方向是将风格从显式参数调控扩展到隐式表达——例如通过自然语言描述风格意图,由模型自动推断相应的行为模式。另一个方向是研究风格的自动发现与组合,减轻人工设计奖励的负担。

摘要

强化学习已被证明是构建先进人工智能与机器人系统中的一种宝贵工具,其贡献涵盖了从游戏对弈、机器人技术到基础模型等众多领域。通过试错,这些人工智能系统通常会学习到一种近乎最优的行为以完成其任务。然而,在许多应用场景中,人们希望能够对任务的解决方式施加一定程度的控制,最好还能实时进行。我们将这些对核心任务的修改称为风格(styles)。我们将通用价值函数逼近器(UVFAs)与精心选取的训练场景、学习算法以及数据增强相结合,构建了一个用于在复杂领域中指导智能体展现特定风格的框架。我们在 3A 级电子游戏《地平线:西之绝境》和《GT赛车》以及一个开源的人形机器人测试领域中展示了该框架的应用。尽管这些领域性质各异——赛车竞速、风格化的游戏战斗以及人形机器人步行——但每个智能体均能在满足其所在领域主要任务的同时,对风格请求保持高度一致性。重要的是,本文所介绍的技术允许终端用户在运行时选择最终行为,从而为最终执行表现提供灵活的控制能力。

速览

TLDR:强化学习智能体通常只学一种近最优行为,难以实时控制任务执行的具体风格。本文将通用值函数逼近器(UVFA)与精选训练场景、学习算法及数据增强相结合,构建了一套可指导智能体展现多样化风格的通用框架。该框架在《地平线 西之禁地》、《Gran Turismo》赛车及开源人形机器人等多个差异显著的域中均得到验证,智能体在完成任务的同时能保持对风格请求的高度一致响应,允许终端用户在运行时自由选择最终行为,显著增强了交互式应用的可控性与灵活性。 \

Motivation:传统强化学习只能学到单一近最优策略,无法满足运行时对执行风格的灵活调控需求。 \

Method:将UVFA与定制训练场景、学习算法及数据增强结合,构建可输出多种风格行为的智能体框架。 \

Result:在赛车、风格化战斗和仿人行走三类复杂域中均验证有效,智能体在完成任务的同时实时响应风格指令。 \

Conclusion:使终端用户可在运行时灵活选择智能体行为,提升交互式游戏与应用的可控性与表现力。


Abstract

Reinforcement learning has proven to be a valuable tool in the creation of advanced AI and robotic systems, contributing to everything from game playing to robotics to foundation models. Through trial-and-error, these AI systems typically learn one, near-optimal behavior to solve their tasks. However, there are many use cases in which one would like to assert some level of control, preferably in real time, over how the task is solved. We refer to these modifications of a core task as styles. We combine universal value function approximators (UVFAs) with carefully selected training scenarios, learning algorithms, and data augmentation to create a framework for coaching agents that exhibit styles in complex domains. We demonstrate the framework's application in the AAA video games Horizon Forbidden West and Gran Turismo, and in an open-source humanoid test domain. Despite the different nature of the domains -- car racing, stylized game combat, and humanoid walking -- each agent shows strong coherence to the style requests while still satisfying the main task in its domain. Importantly, the techniques outlined in this paper allow an end user to choose the final behavior at run time, giving them flexible control over the final executed performance.


论文详细总结(自动生成)

《面向交互式游戏的可指导智能体》论文总结

1. 核心问题与研究动机

  • 传统 RL 的局限:强化学习智能体通常只能通过试错学习到一种近乎最优的单一行为策略来完成既定任务,缺少对任务完成方式(即行为风格)的实时可控性。
  • 风格(Styles)概念的提出:论文将"对核心任务的完成方式进行的修改"定义为风格(styles),与多任务、多目标、目标条件学习等"任务层"概念形成对照——风格更接近副词修饰动词的关系,保持主任务不变,仅调整次要行为特征。
  • 应用动机:在游戏与机器人领域,用户希望根据情境对智能体进行灵活控制,例如:
  • 清洁机器人在婴儿睡觉时安静工作,客人来临时加速清洁;
  • GT Sophy 在赛车中根据策略选择牺牲圈速以延长进站间隔;
  • 游戏 NPC 根据玩家偏好使用不同武器或战术。
  • 研究目标:构建一个可在运行时被"教练"的智能体框架,使其能在同一核心任务下呈现多种行为风格,并在用户指令下即时切换。

2. 方法论

2.1 核心思想:风格条件 UVFA(Style-Conditioned UVFA)

  • 在标准 UVFA 基础上扩展:核心任务保持不变,引入多维风格参数向量 来调控行为方式。
  • 奖励分解
  • 风格奖励进一步分解 个独立风格项:
  • :标量权重(正值为鼓励,负值为抑制, 表示无偏好);
  • :风格特定参数(阈值/设定点等)。
  • 训练目标
  • 每个回合内 固定以避免信用分配问题,但在测试/执行时 可连续变化。

2.2 各域算法

算法关键特性
Humanoid (DMC)SAC标准 SAC,tanh-Gaussian 策略,固定熵权重
Gran Turismo 7QR-SAC分位数回归分布式评论家,策略先于评论家更新
Horizon Forbidden WestCat-RAC混合动作空间:离散按钮(Categorical)+ 连续摇杆(tanh-Gaussian);分类式价值函数(255 bins,HL-Gauss 编码)

2.3 Cat-RAC 关键创新

  • 动作空间正则化:用通用正则化项 替代 SAC 的熵项,按子空间分别施加正则化;
  • 离散头使用精确类别熵
  • 连续头采用 样本的负对数密度经验均值估计熵(远比 SAC 的单样本估计精确)。
  • 分类重参数化:用 Gumbel-Softmax 连续松弛 计算评论家梯度;执行时使用"硬"采样;
  • 数值稳定归一化,其中
  • 梯度修正(借鉴 CFR+ 中的伪遗憾匹配):
  • 瞬时遗憾
  • 修改后梯度
  • 分布式评论家:255 箱的分类价值分布,用交叉熵对 HL-Gauss 编码的 TD(0) 目标进行训练(std/width 比例 0.75,值域 )。

2.4 训练增强技术

  • 场景训练(Scenario Training):在多域并行 rollout 中暴露智能体于多样化初始条件;
  • 任务扮演(Task Impersonation):在每次更新时从同一分布中额外采样 个 UVFA 参数向量 ,将同一 transition 在 种风格配置下评估,扩展风格覆盖而无需扩充 replay buffer(HFW 专用);
  • 分层采样(Stratified Sampling)
  • 多表(Multi-tables) 用于 GT7,按特征/场景分桶;
  • 事件表(Event Tables) 用于 HFW,按风格配置组织,仅在风格触发事件时存储;
  • 风格参数采样策略(HFW,混合分布):
  • 概率 0.03:所有 (默认风格);
  • 概率 0.10:各 独立采样;
  • 概率 0.87:,其余为 0(连续 one-hot)。

3. 实验设计

3.1 三个测试域

特点风格维度
HFW(地平线:西之绝境)3A 级开放世界冒险游戏,PS5 手柄控制,混合动作空间(315 离散组合 + 4 维连续),19 种机器敌人,3 个地图场景18 个风格权重,20 种风格(6 武器、近战、陷阱、3 部件移除、7 元素、默认、No-SkyKiller)
GT7(GT赛车 7)AAA 赛车游戏,GT Sophy 智能体漂移( 权重)、轮胎/燃油节省()、激进度( 距离裕度)
DMC HumanoidDeepMind Control Suite 21 维连续动作空间3 种手臂姿态(离散)× 步长设定点 (连续,0.3–0.65 m)

3.2 HFW 关键实验规模

  • 5 个随机种子,训练至固定 450 万梯度步
  • 每个种子在 20 种风格 × 19 种敌人 × 3 个地点 × 10 个样本 下评估;
  • 共计 57,000 场战斗,记录胜率、伤害类型、风格分数;
  • 还测试 5 种分布外(OOD)场景,包含训练集中未见过的敌人(如飞行类、双敌人对战)。

3.3 对比基线 / 消融实验

  • 与 GT7 中已有 GT Sophy 模型(Wurman et al., 2022)的能力比较;
  • HFW 中三类消融:
  • (a) RL 算法:Cat-RAC vs 分类式 SAC;
  • (b) 任务扮演 vs vs 不使用;
  • (c) 风格参数采样:混合分布 vs 纯 one-hot vs 全独立采样;
  • 评估指标包括风格分数(满足请求的伤害占比)和胜率(核心任务完成度),通过扫描风格权重生成 Pareto 前沿曲线

4. 资源与算力

  • HFW:单进程训练器,1 块 NVIDIA H100 GPU,10.5 vCPU、55 GiB RAM,约每 10 分钟保存一次 checkpoint;1500 epochs ≈ 3 天(平均 470 epochs/day);通常 100 个 rollout workers(探索期 50 个)。
  • DMC Humanoid1 块 NVIDIA H100 GPU,10 个 CPU rollout workers,replay buffer transitions,env-steps 节流至 60 步/秒。
  • GT7:使用先前工作的 QR-SAC 设置(具体硬件未在本节详述,但继承了 Wurman et al. 2022 的基础设施)。

5. 实验数量与充分性

  • HFW 主实验:5 种子 × 20 风格 × 19 敌人 × 3 地点 × 10 样本 ≈ 57,000 次战斗,规模庞大且统计性较好。
  • HFW 风格可组合性:展示了组合风格(如"腐蚀 Blastsling + 元素风格")的有效性。
  • OOD 泛化测试:5 个分布外场景验证未过拟合。
  • Pareto 分析:通过扫描风格权重提供风格忠实度与任务表现的权衡曲线。
  • 消融实验:覆盖算法选择、任务扮演采样数、风格参数采样策略三个关键变量,每个消融使用 5 次独立运行。
  • 客观性:使用多种独立评估指标(胜率、伤害类型、风格分数),并用 SHAP 与 Saliency 两种特征归因方法分析策略对风格参数的敏感性;总体上实验设计较为充分和客观。
  • 不足:HFW 的胜负评估场景为 1v1,未涉及多人合作;种子数量仅 5 个,统计置信度有限。

6. 主要结论与发现

  • 风格可控性与任务完成兼顾:智能体在 HFW 中对 17 种风格的伤害矩阵呈现明显对角线主导现象,平均胜率多数超过 90%。
  • 风格可组合性:同一策略网络能组合多种风格(例如"使用特定武器 + 元素伤害"),尽管特定组合在训练中平均每百万场景不到一次。
  • Pareto 权衡:用户可通过调节风格权重在风格忠实度与胜率之间自由权衡(如 melee 风格权重越大,胜率下降但风格分数提升)。
  • OOD 泛化能力:面对训练中未见的飞行敌人(Aerial)与双敌人场景,智能体仍能维持可观胜率。
  • 行为复杂性:在战斗中智能体展现出上下文推理能力——例如先用弱武器触发元素状态,再切换强武器最大化元素期间伤害。
  • GT7 应用:通过 UVFA 权重调节,可让 GT Sophy 在燃油/轮胎节省与圈速之间权衡(最大节省可将进站间隔延长 ~60%,代价为 2–3 秒/圈);激进度参数可调节超车与碰撞率。
  • Humanoid 应用:3 种离散手臂姿态可与连续步长设定点任意组合,即使手臂姿态改变影响质心与平衡,智能体仍能稳定合成。
  • 风格选择存在多样性:HFW 中不同种子训练出的智能体在元素状态下偏好不同武器,反映了游戏设计者对武器平衡性的预期。

7. 方法 / 实验的亮点

  • 首次将 UVFA 概念扩展到 3A 级开放世界游戏的高维控制域,解决了行动空间、奖励结构、行为方差方面的巨大复杂性;
  • Cat-RAC 算法创新:通过后悔匹配梯度和 Gumbel-Softmax 松弛优雅地解决了混合动作空间的离散/连续统一正则化问题,且不引入温度超参数;
  • 任务扮演(Task Impersonation)的扩展应用:将原用于多任务 RL 的数据增强技术适配到风格条件 UVFA 设置,仅需少量额外样本()即可显著改善风格覆盖;
  • 分层采样(事件表):按风格配置组织 replay 数据,对比机制有效解决了风格数据不均衡问题;
  • 风格参数采样分布设计(默认 0.03 + 独立 0.10 + 连续 one-hot 0.87)兼顾了探索多样性与学习效率;
  • 跨域验证:从机器人仿真、赛车游戏到复杂战斗游戏,三个差异巨大的域共享同一框架,证明方法的通用性;
  • 特征归因分析(SHAP + Saliency)证实策略输出对 UVFA 参数高度敏感,说明风格调节确实生效。

8. 不足与局限

  • 种子数量有限:每个主要消融仅 5 个种子,统计置信度受限;
  • HFW 评估局限于 1v1 战斗:未涉及多人合作或群体对战场景;
  • 胜率/风格分数与真实人类偏好可能存在偏差:评估指标为机器化的胜率与伤害类型统计,未包含人类玩家主观感受评估;
  • 奖励设计的工程复杂性高:HFW 中需要为每种风格设计专属奖励(如部件移除、元素状态触发),泛化到新风格的成本较高;
  • Cat-RAC 的理论分析有限:附录中给出了梯度修正的直观解释,但缺乏对后悔匹配伪梯度在函数逼近下的完整收敛性证明;
  • 场景覆盖不全:HFW 训练中排除了飞行/水栖敌人和部分不稳定敌人,限制了在更复杂场景下的应用;
  • 无 SkyKiller 等"负风格"训练成本:将负值训练域扩展到 的做法虽然有效,但增加了训练复杂度;
  • OOD 性能下降:在双敌人(如双 Thunderjaw)等极端 OOD 场景下胜率显著下降;
  • 可访问性应用仅在结论部分提及:未提供具体可访问性功能的实验验证;
  • 部分视觉风格视频与训练分布略有偏差:图形化构建与无头构建之间的动力学差异使演示视频存在轻微 OOD 问题;
  • 未明确报告 GT7 的具体硬件资源:相比 HFW 与 Humanoid 域,GT7 的算力描述缺失。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记