arXiv 2607.03703v1 · 发布 2026-07-04

面向自适应交通信号控制的可解释强化学习

Explainable Reinforcement Learning for Adaptive Traffic Signal Control

AUTHORS Dickens Kwesiga, Nishu Choudhary, Angshuman Guin, Michael Hunter
EVIDENCE 深度强化学习应用于自适应交通信号控制
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-11 21:36:27 UTC

📝 TLDR

交通信号控制中深度强化学习模型的黑箱特性阻碍了交通部门的信任与监管落地。本文提出一种以实体为中心的可解释强化学习框架,将交叉口状态分解为车道实体与相位时序配置,通过双阶段注意力网络动态提取车道间冲突关系,并结合确定性动作掩码确保相位切换安全约束。实验表明该方法在延误最小化上超越当前最优基线,且注意力权重与交通工程原理高度吻合,为下一代自适应信号控制提供了可审计、可部署的架构。

🧭 速览

动机

深度强化学习在交通信号控制中性能优异,但黑箱特性导致交通部门接受度低、合规困难及难以调试,亟需兼顾高性能与可解释性的方案。

方法

将交叉口状态分解为车道实体与相位配置,采用交叉与自注意力双阶段网络提取车道关系并生成实时关联矩阵,同时在PPO中集成动作掩码保障安全。

结果

在微观仿真环境下延误最小化优于现有最优基线,且学到的注意力权重与交通工程学原理高度一致。

结论

为安全关键交通基础设施提供了可审计、可信赖且可部署的自适应信号控制架构。

📊 论文图表(共 11 张)

展开查看 11 张图

TL;DR

本文针对交通信号控制中深度强化学习模型不透明的问题,提出了一种以实体为中心的可解释强化学习框架。该方法将路口状态解构为车道实体与相位配置,通过双阶段注意力网络动态捕捉车道间的冲突关系,使注意力权重直接反映交通工程学中的通行能力与冲突原理。配合确定性动作掩码与 PPO 算法的集成,模型在延误最小化任务上超越了当前最优基线,同时实现了完全可追溯的决策解释,为自适应交通信号控制的可审计、可部署提供了新思路。

研究背景与动机

城市交叉口的信号控制是城市交通运行效率的关键环节。传统的固定配时方案难以应对实时变化的交通流量,而基于强化学习的自适应信号控制近年来展现出显著的性能优势。然而,将这类黑箱模型部署到真实道路上面临严峻挑战:交通管理部门需要对模型的决策逻辑拥有可理解性,以便在故障时进行排查、在异常场景下进行人工干预,同时还需满足监管合规与公众信任等非技术性要求。

现有研究在可解释性方面存在两条主要路径。一种是在模型训练完成后使用事后解释方法,如特征重要性分析或注意力可视化,这类方法只能提供近似的、可能存在偏差的解释,且难以保证与模型真实决策机制的一致性。另一种是引入模块化的可解释架构,但往往以牺牲端到端优化性能为代价。本文的核心问题是:能否在保持强化学习优化能力的同时,让模型内在地产生与人类专家判断相符的可解释决策?

方法

本文的创新点在于将交通场景的结构化先验知识嵌入强化学习模型的架构设计中,从而实现性能与可解释性的协同提升。

传统的做法通常将整个路口状态编码为单一的高维向量喂给神经网络。这种扁平化表示丢失了路口的几何拓扑信息——比如哪些车道共享同一条进口道、哪些车道之间存在直行与左转的冲突关系。本文提出将路口状态解构为车道实体相位时序配置两层结构化表示。每一股车道被建模为一个独立的实体,携带排队长度、到达率、当前信号相位等属性;相位配置则描述了各信号灯组的时序关系。这种表示方式天然保留了路口的结构拓扑,使得后续的注意力计算可以在物理意义上进行解释。

在车道实体的交互建模上,作者设计了双阶段注意力网络。第一阶段采用多头交叉注意力机制,让每个车道实体"查询"与其存在逻辑关联的其他车道——例如,左转专用道会关注对向直行车道,因为两者在合流区存在潜在的冲突。第二阶段使用自注意力机制在同一相位内部的多个车道间进行信息聚合,形成相位的整体表征。这两个阶段的顺序设计是有讲究的:先建模跨车道冲突、再建模相位内协同,恰好对应了交通工程中"冲突消解"与"通行能力优化"的两层决策逻辑。

上述交叉注意力操作产生的实时关联矩阵是本文可解释性的核心输出。矩阵中的每个元素量化了某一车道对另一车道的关注程度,这个关注程度与该车道实际获得的绿灯时长、服务车辆数等物理量高度对应。这意味着交通工程师可以直接检查注意力权重的分布,验证模型是否将注意力放在了合理的冲突对上,还是在某些场景下产生了不合理的关注。

在动作执行层面,本文将动作掩码机制直接集成到 PPO 算法的策略输出环节。与在策略网络外部后处理动作概率的做法不同,作者通过在 PPO 的梯度计算中引入掩码约束,确保无效相位切换(如当前绿灯相位仍在运行期间要求切换到冲突相位)的策略梯度被显式置零。这种确定性动作掩码保证了模型在任何情况下都不会输出物理上不可行的信号切换指令,满足了安全关键系统的严格可靠性要求。

实验与结果

实验在微观仿真环境中进行,使用标准的延误最小化指标对比多种基线方法。结果显示,本文方法在平均延误指标上优于现有的最先进基线,验证了结构化表示与双阶段注意力设计并未牺牲优化性能。

更具说服力的是注意力权重的分析实验。作者将模型学习到的车道间注意力权重与交通工程学中已知的冲突关系进行对照。以一个典型的十字交叉口为例,左转相位与对向直行相位之间的注意力权重显著高于其他车道组合,这与人因工程研究揭示的冲突模式完全吻合。在更复杂的五叉路口场景中,模型同样正确地将更多注意力分配给了交织冲突更为密集的进口道组合。这些结果表明,模型并非在隐式中拟合某种统计规律,而是通过可解释的注意力机制捕捉了真实的物理因果关系。

讨论与可借鉴点

本文为安全关键领域的可解释强化学习提供了一个有价值的设计范式:将领域知识以结构化表示的形式注入模型架构,而非依赖事后解释或性能折中。这种思路的精髓在于"可解释性应该是设计出来的,而非事后追加的"。

从实践角度,本文在强化学习框架中硬编码安全约束的做法值得借鉴。直接修改策略梯度的动作掩码方案,比基于奖励塑形的安全约束更加可靠,因为它从机制上杜绝了不安全动作的输出。对于同样涉及物理安全约束的强化学习应用(如机器人控制、自动驾驶决策),这种确定性约束集成思路具有直接的迁移价值。

论文也坦诚地指出了当前工作的局限:实验仅在仿真环境中验证,真实道路的传感器噪声、通讯延迟等因素可能影响模型表现;注意力权重的可解释性验证仍依赖人工对照交通工程知识,缺乏自动化的客观评估指标;此外,框架的计算复杂度随路口规模线性增长,在超大型路网的部署效率有待优化。这些开放问题同时也是该方向后续研究的重要切入点。

摘要

强化学习(RL)已成为自适应交通信号控制的一种强大范式。然而,在交通控制这类安全关键的基础设施中,深度强化学习模型不透明的黑盒特性给交通管理部门的接受度、监管合规性、运行信任、故障排查以及模型微调带来了挑战。为了在高性能优化与人类可理解的透明度之间架起桥梁,本研究提出了一种新颖的、以实体为中心的可解释强化学习框架,用于安全、透明的交通信号控制。该架构并未将交通状态以单一扁平的向量进行处理,而是将实时路口观测解构为不同的高维车道实体与相位时序配置,从而内在地保留路口的结构拓扑与几何布局。车道间的关联依赖与相互冲突通过一个双阶段注意力网络动态提取,该网络包含顺序的多头交叉注意力与自注意力模块。此设计产生了一个实时关联矩阵,可量化信号相位针对具体进口道流量与排队长度所产生的直接影响,从而提供完全可视化的与分析层面的可解释性。为确保严格的运行可靠性,确定性动作掩码接口被直接集成到近端策略优化(PPO)流程中,显式屏蔽无效的相位切换,从而保证对既定信号配时与安全约束的绝对遵循。在微观仿真环境中进行评估后,该方法在延误最小化方面优于现有最先进基线方法。更重要的是,所涌现出的注意力权重与既有的交通工程学原理高度吻合,为下一代自适应交通控制系统提供了一种可审计、可信赖、可部署的架构。

Abstract

Reinforcement Learning (RL) has emerged as a powerful paradigm for adaptive traffic signal control. However, in safety-critical infrastructure like traffic control, the opaque, black-box nature of deep RL models poses challenges for transportation agency acceptance, regulatory compliance, operational trust, troubleshooting, and fine-tuning. To bridge this gap between high-performance optimization and human-comprehensible interpretability, this effort introduces a novel, explainable entity centric RL framework for safe and transparent traffic signal control. Rather than processing traffic states through monolithic, flat vectors, the proposed architecture disaggregates real-time intersection observations into distinct, high-dimensional lane entities and phase temporal configurations to inherently preserve the structural topology and geometric configurations of the intersection. Relational dependencies and inter-lane conflicts are dynamically extracted via a dual-stage attention network featuring sequential multi-head cross-attention and self-attention blocks. This design yields a real time affinity matrix that quantifies the direct influence of signal phases on specific approach volumes and queues, providing full visual and analytical interpretability. To ensure strict operational reliability, a deterministic action-masking interface is integrated directly into the Proximal Policy Optimization pipeline, explicitly blocking invalid phase transitions to guarantee absolute compliance with established signal timing and safety constraints. Evaluated in a microscopic simulation environment, outperforms state-of-the-art baselines in delay minimization. More importantly, the emergent attention weights align precisely with established traffic engineering principles, offering an auditable, trust-enabling, and deployable architecture for next-generation adaptive traffic control systems.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记