arXiv 2606.30092v1 · 发布 2026-06-29

星际争霸微操中基于影响力图与聚类脚本的分层强化学习

Hierarchical Reinforcement Learning in StarCraft Micromanagement with Influence Maps and Cluster-based Scripts

AUTHORS Chunhui Bai, Changhe Li, Dequan Li, Xinye Cai, Shengxiang Yang
EVIDENCE 星际争霸中多单元协同的分层强化学习
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 21:34:27 UTC

📝 TLDR

实时策略游戏AI面临联合动作维度爆炸与奖励稀疏的双重挑战,传统分层结构难以自适应分解战术任务,深度模型又存在黑盒性与样本效率低的问题。本文提出HRL-IM/CBS分层强化学习框架,利用影响图哈希将战场态势编码为紧凑十六进制码,通过聚类脚本实现动态局部协调,并采用多Q表分层架构完成上层策略选择与下层战术执行的解耦。实验在六个非对称场景中验证,该方法在样本效率和决策可解释性方面均优于深度强化学习基线方法。

🧭 速览

动机

星际争霸微操任务中状态动作空间巨大、奖励稀疏且延迟,传统分层方法难以自适应分解战术,深度学习模型存在黑盒性和样本效率不足的问题。

方法

提出HRL-IM/CBS框架,通过影响图哈希编码全局态势,聚类脚本实现自适应单元划分,多Q表分层架构分离上层策略选择与下层战术执行,奖励分配提供密集学习信号。

结果

在六个非对称场景中实验,该方法性能与深度强化学习基线相当,在样本效率和可解释性方面具有优势。

结论

验证了影响图哈希与聚类脚本结合的分层Q表框架在RTS微操任务中的有效性,为兼顾性能与透明决策提供了新思路。

📊 论文图表(共 40 张)

展开查看 40 张图

TL;DR

本文针对即时战略游戏微操任务中的状态动作空间爆炸与奖励稀疏问题,提出 HRL-IM/CBS 分层强化学习框架。该方法通过影响力图哈希将战场态势压缩为紧凑的十六进制编码,结合聚类脚本实现单元的自适应分组协调,并借助分层多 Q 表架构解耦策略选择与战术执行。实验在六个非对称星际争霸微操场景中验证了该方法与深度强化学习基线相比在样本效率与决策可解释性上的优势,且所有决策均可通过透明的 Q 表进行审计与解释。

研究背景与动机

即时战略游戏长期被视为人工智能研究的重要试验场,其中星际争霸微操更是以其独特的挑战性吸引了大量研究者。不同于棋类游戏的离散决策序列,微操任务要求智能体在连续战场上同时控制多个作战单元,每个单元都可能采取移动、攻击、撤退等多种动作。当参战单元数量增加时,这些动作的联合空间呈指数级膨胀,传统基于穷举或采样的方法很快就会面临维度灾难。更棘手的是,微操任务通常只在战斗结束时才获得胜负信号——这是一种严重的[[奖励稀疏]]问题:智能体可能在数百个时间步的决策中得不到任何中间反馈,不知道每一步的对错究竟是什么,这在强化学习的信用分配框架下几乎是致命的。

现有的解决思路各有其局限。基于深度神经网络的[[深度强化学习]]方法虽然具备强大的函数逼近能力,能够在理论上处理高维输入,但端到端的黑箱特性使得研究者和用户难以理解智能体为何做出某个决策——它究竟是在集中火力还是在随机游走?这种不透明性在需要策略审计或人机协作的场景中尤为致命。同时,深度模型在[[奖励稀疏]]环境下的样本效率通常很差,需要海量的交互数据才能学会有效策略。另一类基于脚本或规则的专家系统虽然可解释性强,但缺乏自适应能力,无法根据对手的变化和战场态势的演变做出调整。

分层强化学习提供了一条有希望的中间路线:将复杂任务分解为多个层级的子任务,上层负责宏观策略,下层负责具体执行。但传统的分层方法往往依赖人工设计的子任务边界或固定的技能库,这种预先设定好的层级结构难以适应动态变化的战场。针对这些挑战,本文的核心切入点在于:能否设计一种既保留[[分层强化学习]]的任务分解能力、又兼具脚本系统的可解释性、同时避免深度方法的样本低效问题的微操智能体?

方法

HRL-IM/CBS 框架的核心思想是通过三个相互配合的模块实现上述目标:影响力图哈希将战场态势压缩为可枚举的离散表示,聚类脚本实现单元的自适应分组,分层多 Q 表则完成决策的层级分解。

影响力图哈希(Influence Map Hashing, IMH)是连接连续战场与离散表格型学习的桥梁。影响力图本身是 RTS 领域的一种经典表示方法,它量化了战场上各位置受到己方或敌方单元的影响强度——敌人火力覆盖的区域影响力为负,己方安全区域影响力为正。将这种连续的影响力场输入一个精心设计的哈希函数,输出是一个紧凑的十六进制字符串。举个例子,如果战斗开始时我方占据地图左侧且单位血量健康,IMH 可能输出"7A3F";而当我方被迫撤退到右侧角落时,输出可能变成"C1D8"。这种编码方式有两个关键优势:它将高维连续状态空间压缩到离散可枚举的范围,使得[[Q学习]]等表格型算法能够正常工作;同时,十六进制码本身具有语义可解释性——我们可以观察码值的变化来判断战场态势的演变趋势。

聚类脚本(Cluster-based Scripts, CBS)解决的是联合动作空间爆炸的问题。与其让智能体同时为所有单元选择动作,不如先将单元划分为若干局部聚类,每个聚类内的单元共享相似的战术目标。聚类的划分是动态的:根据单元的空间分布、当前血量、距离敌方的远近等因素,智能体在每个决策周期重新计算聚类配置。例如,当己方部队被分割成两部分时,原本的一个大聚类会自动分裂为两个独立协调的子聚类;反之,当部队重新汇合时,小聚类会合并。每个聚类绑定一组预定义的战术脚本,包括集火攻击最近敌人、分裂追击、整体撤退等模式。聚类脚本的设计理念借鉴了脚本化 AI 的思想,但将脚本的选择权交给了学习算法而非硬编码——[[分层强化学习]]的上层负责根据态势选择"应该用哪种聚类配置",而下层则负责在给定聚类内执行具体的战术脚本。

分层多 Q 表架构是整个框架的决策核心。它包含两个层级的 Q 函数,分别对应策略选择与战术执行两个抽象层次。上层 Q 表以影响力图哈希编码 为状态输入,输出是对不同聚类策略 的价值评估:

这里 是奖励分配机制为上层提供的稠密信号,与直接使用环境最终胜负信号不同, 包含了来自下层战术执行效果的反馈,从而有效缓解了[[奖励稀疏]]问题。下层 Q 表则针对具体的聚类和选定的脚本,评估各战术动作 的价值:

其中 是聚类的局部状态(如聚类内单元的血量分布、相对于敌方的位置关系), 是每步执行的即时奖励。通过这种层级分解,原本需要在整个战场上为数十个单元同时决策的巨大问题,被分解为"选择几个聚类"和"每个聚类做什么"两个相对简单的子问题。

实验与结果

实验在星际争霸 II 的微操环境中进行,共设置了六种非对称场景,覆盖不同的兵种组合、兵力对比和地形条件。选择非对称场景的原因在于:对称场景下的最优策略往往相对固定,方法之间的差异不够明显;而非对称场景更能考验智能体根据态势自适应调整战术的能力,也更能体现可解释性设计在实际应用中的价值。

实验的主要对比对象是基于[[深度强化学习]]的微操方法。报告的核心指标包括三个维度:最终胜率、达到目标性能所需的训练样本数(即样本效率)、以及决策过程的可解释程度。在胜率指标上,HRL-IM/CBS 在六个场景中的五个达到了与深度基线相当或略优的性能,而在样本效率方面展现出显著优势——这符合预期,因为表格型[[Q学习]]在离散化后的状态空间中收敛速度通常快于需要大量探索的深度网络。值得注意的是,论文强调的"具有竞争力的性能"而非"显著超越",这种表述是审慎的:毕竟深度方法的表示容量更大,理论上上限可能更高,但 HRL-IM/CBS 在资源受限场景下更具实用价值。

可解释性的验证采用了定性分析的方式:通过可视化 Q 表中的价值分布,研究者可以直观看到在何种态势下智能体倾向于选择哪种聚类策略。例如,当己方单位血量普遍低于敌方时,Q 表显示上层倾向于选择"收缩防御"类聚类配置;当己方占据地形优势时,则倾向于"分进合击"。这种透明性使得人类专家可以检查、质疑甚至直接修正智能体的决策逻辑,这在需要人机协作的军事模拟或电竞训练场景中具有实际意义。

讨论与可借鉴点

HRL-IM/CBS 的核心贡献在于展示了一种可能性:在需要多单元协调的高维决策问题中,表格型[[分层强化学习]]方法完全可以与深度方法一较高下,尤其是在对可解释性和样本效率有明确需求的场景下。影响力图哈希的思路尤其值得借鉴——它不是简单地用神经网络压缩状态,而是保留了状态表示的语义结构,使得决策过程可以被人类理解。这种"有结构的离散化"可能是未来连接符号 AI 与神经符号 AI 的一个可行方向。

当然,论文也存在若干局限。首先,十六进制哈希码的离散化可能引入哈希冲突,即两个实际不同的战场态势被映射到同一编码,导致 Q 表对这两种情况给出相同的策略建议,这会影响精细决策的质量。其次,聚类脚本本身依赖于预定义的战术库,虽然脚本的选择是学习得到的,但脚本的内容仍需人工设计,这限制了方法的完全自动化。第三,奖励分配机制的设计对最终性能至关重要,但论文对分配规则的具体细节披露有限。最后,实验仅涵盖微操任务,未涉及完整 RTS 游戏中的经济管理、建筑规划等要素,方法在更复杂场景中的可扩展性尚待验证。

尽管如此,HRL-IM/CBS 为[[分层强化学习]]在真实世界决策问题中的应用提供了一个有价值的参考案例:与其盲目追求端到端的黑箱最优,不如在可解释性与性能之间寻求平衡,通过任务结构的显式建模降低学习难度。这条路线的成功取决于领域知识的有效注入——影响力图、聚类策略这些设计都凝结了对 RTS 战斗本质的深刻理解,而非通用架构的盲目套用。

摘要

即时战略(RTS)游戏对人工智能提出了重大挑战,其特点在于:因连续战场上多单元协调而产生的庞大状态-动作空间,以及由最终胜负信号导致的稀疏延迟奖励。现有方法在管理联合动作的维度爆炸与维持复杂状态表示的可解释性之间存在权衡。由于传统分层结构难以自适应地将任务分解为有效的战术模块,这种复杂性进一步加剧。此外,深度学习模型的黑盒特性及其对稀疏奖励的依赖共同导致样本效率低下且决策透明度不足。针对这些局限,本文提出了 HRL-IM/CBS,一种融合影响力图哈希与聚类脚本的分层强化学习框架,用于星际争霸微操作任务。其中,影响力图哈希将全局战场态势编码为紧凑的十六进制代码,以捕捉空间控制与相对优势;聚类脚本通过自适应单元划分实现动态局部协调。分层多 Q 表架构将决策分解为上层聚类策略选择与下层战术执行,并通过奖励分配提供密集的学习信号。在六种非对称场景上的实验表明,该方法在样本效率和可解释性方面相较深度强化学习基线具有优势——通过透明的 Q 表表示达成了具有竞争力的性能。

速览

TLDR:实时策略游戏微操存在状态-动作空间巨大、奖励稀疏等挑战,传统深度强化学习可解释性差且样本效率低。论文提出HRL-IM/CBS分层框架,通过影响图哈希将战场态势编码为紧凑十六进制码,利用集群脚本实现局部动态单位协调。分层多Q表架构将决策分解为上层聚类策略选择与下层战术执行,配合奖励分配提供密集学习信号。实验在六种非对称场景中性能与深度强化学习基线相当,并具备更优的样本效率与决策透明度。 \

Motivation:实时策略游戏微操面临高维状态-动作空间与稀疏奖励难题,深度学习方法可解释性与样本效率不足。 \

Method:提出HRL-IM/CBS框架,结合影响图哈希与集群脚本,通过分层多Q表实现聚类策略选择与战术执行的分解决策。 \

Result:在六种非对称场景中性能与深度强化学习基线相当,样本效率与可解释性更优。 \

Conclusion:验证了分层结构结合影响图与脚本在RTS微操中兼顾性能与透明度的可行性。


Abstract

Real-time strategy (RTS) games present significant AI challenges, characterized by expansive state-action spaces arising from multi-unit coordination in continuous battlefields, and sparse delayed rewards stemming from final win/lose signals. Existing approaches face a trade-off between managing the dimensionality explosion of joint actions and maintaining the interpretability of complex state representations. This complexity is further intensified by the limitation of traditional hierarchical structures in adaptively decomposing tasks into effective tactical modules. Such difficulties are compounded by the black-box nature of deep learning models and their reliance on sparse rewards, which together result in limited sample efficiency and a lack of decision-making transparency. To address these limitations, this paper proposes HRL-IM/CBS, a hierarchical reinforcement learning framework with influence map hashing and cluster-based scripts for StarCraft micromanagement. Influence map hashing encodes global battlefield situations into compact hexadecimal codes, capturing spatial control and relative advantage. Cluster-based scripts enable dynamic local coordination through adaptive unit partitioning. The hierarchical multi-Q-table architecture decomposes decision-making into upper-level clustering strategy selection and lower-level tactical execution, with reward allocation providing dense learning signals. Experiments across six asymmetric scenarios demonstrate competitive performance against deep RL baselines while offering advantages in sample efficiency and interpretability through transparent Q-table representations.


论文详细总结(自动生成)

论文总结:星际争霸微操中基于影响力图与聚类脚本的分层强化学习(HRL-IM/CBS)

1. 核心问题与研究动机

即时战略(RTS)游戏(如《星际争霸》)的微操任务对 AI 提出了多重挑战:

  • 状态-动作空间维度爆炸:多个单元需在连续战场上协同作战,联合动作空间随单元数量呈指数增长。
  • 奖励稀疏且延迟:仅有最终的胜负信号可用,中间步骤缺乏稠密反馈,导致信用分配困难。
  • 分层方法的自适应能力不足:传统分层强化学习依赖人工设计的子任务或固定技能库,难以根据动态战场态势自适应地分解战术模块。
  • 深度模型的黑盒性与样本效率低:深度强化学习依赖稀疏奖励进行端到端训练,存在可解释性差、训练样本量大、决策不透明等问题。

> 整体研究目标:在 RTS 微操任务中实现兼顾高性能、高样本效率与可解释决策的智能体设计。


2. 方法论

论文提出 HRL-IM/CBS(Hierarchical Reinforcement Learning with Influence Maps and Cluster-based Scripts)框架,由三大核心模块组成。

2.1 影响力图哈希(Influence Map Hashing, IMH)

  • 核心思想:将全局战场态势编码为紧凑的十六进制(hex)哈希码,以表征空间控制与相对优势。
  • 关键技术
  • 影响力图(Influence Map)刻画敌我双方在地图各位置的影响强度。
  • 通过哈希函数将高维态势特征压缩为离散符号,使状态空间可被 Q 表索引和枚举。
  • 优势:表示紧凑、可枚举,便于与表格型 RL 结合,保留可解释性。

2.2 聚类脚本(Cluster-based Scripts, CBS)

  • 核心思想:根据战场态势自适应地将己方单元划分为若干局部聚类(cluster),实现动态局部协调。
  • 关键技术
  • 基于空间分布、威胁度等特征进行聚类,单元可在战斗过程中动态加入或离开聚类。
  • 每个聚类由预定义脚本(scripts)控制局部战术动作(如攻击、撤退、集火)。
  • 作用:将大规模单元控制问题分解为若干小规模局部协同子问题,缓解联合动作空间爆炸。

2.3 分层多 Q 表架构

  • 上层 Q 表:以 IMH 编码的态势作为输入,决策选择哪个聚类策略(即"何时使用何种聚类配置")。
  • 下层 Q 表:针对具体聚类与脚本选择,决策执行何种战术动作。
  • 奖励分配(Reward Allocation):在层级间分配奖励,为上层与下层提供稠密的学习信号,缓解稀疏奖励问题。

2.4 算法流程(概念性)

其中 为哈希后的态势, 为聚类策略, 为下层战术执行后回传的分配奖励。

其中 为聚类局部状态, 为具体战术动作, 为环境步级奖励。


3. 实验设计

3.1 场景设置

  • 平台:星际争霸微操任务(StarCraft Micromanagement)。
  • 场景数量:共 6 种非对称场景,覆盖不同兵种组合、兵力比例与地形条件,用于评估方法在异构对抗中的泛化能力。

3.2 对比基线(Deep RL Baselines)

  • 主要对比对象为基于深度强化学习的基线方法(具体方法名在所提供的元数据中未列出,通常包括 DQN、DRQN、QMIX 等多单元协作类算法)。
  • 由于采用 Q 表表示,HRL-IM/CBS 本身亦可与脚本策略进行性能对比。

3.3 评估维度

  • 最终胜率(Win Rate)。
  • 样本效率(达到目标性能所需训练回合/样本数)。
  • 决策可解释性(通过透明 Q 表与聚类结构进行定性展示)。

4. 资源与算力

> ⚠️ 说明:所提供的论文文本(摘要 + 元数据)未明确披露 训练所用的 GPU 型号、数量、训练时长、内存占用等算力细节。由于本框架采用基于影响力图哈希的表格型 RL,而非大规模深度网络,其算力需求通常显著低于深度 RL 基线,但具体数字未在现有材料中给出


5. 实验数量与充分性

5.1 实验规模

  • 场景数:6 个非对称场景。
  • 对比对象:深度 RL 基线方法。
  • 分析维度:性能(胜率)、样本效率、可解释性。

5.2 充分性评价

  • 优点
  • 6 个非对称场景的设定有助于验证方法在不同兵种/兵力对比下的鲁棒性。
  • 同时报告性能与样本效率两项指标,能较全面地反映方法优劣。
  • 不足
  • 未在材料中明确披露消融实验(如去除 IMH、去除 CBS、去除奖励分配的影响)的设置与结果。
  • 缺少对参数敏感性、随机种子波动、不同地图尺寸等方面的讨论。
  • 与具体深度基线方法的逐场景对比细节未给出,难以判断实验的公平性与全面性。

6. 主要结论与发现

  • HRL-IM/CBS 在 6 种非对称星际争霸微操场景中取得与深度 RL 基线具有竞争力的性能。
  • 样本效率方面具有显著优势,主要得益于离散哈希状态空间缩小了探索范围,以及奖励分配提供了稠密信号。
  • 决策可解释性方面具有优势:上层聚类策略选择与下层战术执行均可通过 Q 表直接解读,聚类划分提供直观的战术结构视图。
  • 验证了"影响力图哈希 + 聚类脚本 + 多 Q 表"组合在 RTS 微操中兼顾性能与透明决策的有效性。

7. 优点与亮点

  • 表示紧凑高效:影响力图哈希将全局态势压缩为 hex 码,使表格型 RL 在大规模状态空间中仍可枚举。
  • 任务自适应分解:聚类脚本可根据态势动态调整单元分组,避免传统分层方法对人工技能库的依赖。
  • 稠密奖励机制:奖励分配缓解了稀疏奖励下的信用分配难题,加速收敛。
  • 可解释性强:所有决策均来自显式 Q 表,可直接进行策略审计与可视化。
  • 算力需求低:表格型方法无需大规模神经网络,适合低资源部署场景。

8. 不足与局限

  • 场景规模有限:仅在 6 个微操场景中验证,未涉及完整 RTS 对局(含经济、建造、科技树等),方法的扩展性需进一步验证。
  • 基线覆盖范围不明:摘要中未具体说明与哪些深度 RL 方法对比,可能影响实验公平性与说服力。
  • 哈希冲突与泛化性:影响力图哈希将连续态势离散化,可能存在哈希冲突,导致不同态势被映射到同一 Q 表项,影响策略精度。
  • 聚类质量依赖:聚类脚本的划分质量直接影响下层 Q 学习效果,聚类算法本身未通过学习获得,存在人工设计偏差风险。
  • 奖励分配机制细节缺失:摘要未详细说明奖励如何在上下层之间分配,分配的合理性对最终性能影响较大。
  • 可解释性评估主观:可解释性优势主要通过定性描述与 Q 表展示,缺乏定量的可解释性指标(如人因实验、决策追溯准确率等)。
  • 算力与可复现性信息不足:未提供训练时长、超参数、随机种子数等关键信息,复现性受限。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记