面向黑盒节点注入攻击图神经网络的靶向感知交互引导强化学习方法
Target-Aware Interaction-Guided Reinforcement Learning for Black-Box Node Injection Attacks on Graph Neural Networks
📝 TLDR
图神经网络对抗鲁棒性研究中,黑盒节点注入攻击因不改动原图拓扑而构成严重威胁。现有方法将恶意节点的特征生成与边构建解耦处理,导致在严格预算下攻击效能受限。本文提出TIRBA方法,将攻击建模为异构动作空间的马尔可夫决策过程,联合优化节点特征与边的生成;通过目标感知交互编码器、类中心引导机制和拓扑差异感知状态评估三个关键模块,实验证明其显著优于现有黑盒节点注入攻击方法。
🧭 速览
现有黑盒节点注入攻击将恶意节点特征生成与边构建解耦,在严格预算下难以取得最优攻击效能。
将攻击建模为异构动作空间的马尔可夫决策过程,联合优化特征与边生成;含目标感知交互编码器、类中心引导与拓扑差异感知状态评估三个模块。
在多个数据集上的实验表明,TIRBA在严格预算约束下显著优于现有黑盒节点注入攻击方法。
该工作通过强化学习联合优化特征与边生成,为GNN安全评估提供了更有效的黑盒攻击基准。
📊 论文图表(共 6 张)
展开查看 6 张图
TL;DR
针对图神经网络(GNN)面临的[[黑盒攻击]]安全问题,本文提出名为 TIRBA 的靶向感知交互引导强化学习方法。该方法将黑盒节点注入攻击建模为马尔可夫决策过程,通过联合优化节点特征生成与边构建克服了传统方法将两者解耦的缺陷。在多个数据集和 GNN 架构上的实验表明,TIRBA 在严格预算限制下显著优于现有最先进的黑盒节点注入攻击方法,攻击效能提升明显。
研究背景与动机
图神经网络作为处理图结构数据的核心[[深度学习]]范式,已在社交网络分析、推荐系统、分子药物发现等领域展现出卓越的表示学习能力。然而,研究表明 GNN 天然存在对抗脆弱性——即便对输入图结构或节点特征施加极微小的扰动,也能导致模型性能大幅下降甚至产生错误预测。这种脆弱性在安全敏感的应用场景中构成了严峻威胁。
在众多对抗攻击类型中,[[黑盒攻击]]因其仅需访问目标模型的预测结果而无须了解模型内部参数,成为实际攻击场景中的主要威胁形态。其中,节点注入攻击尤为值得关注:攻击者在不改变原始图拓扑结构的前提下,向图中添加恶意节点及其连接边,从而实现对 GNN 预测结果的操控。相较于直接修改现有节点特征或边权重的攻击方式,节点注入攻击更加隐蔽,因为原始图的拓扑信息完全保持不变。
然而,现有的黑盒节点注入攻击方法普遍存在一个关键缺陷——将恶意节点特征的生成与边连接的构建解耦处理。具体而言,这些方法通常先独立确定注入节点应连接到哪些已有节点(边构建),再另行生成这些恶意节点的特征向量(特征生成),或反之亦然。这种解耦策略忽略了特征空间与结构空间之间的内在交互关系,导致在严格预算限制(即注入节点数量受限)的场景下,攻击效能显著受限。攻击者需要在有限的“预算”内同时完成特征伪装与结构伪装,两者相互影响、不可分割,将它们割裂处理必然无法达到最优攻击效果。
方法
TIRBA 的核心思路是将黑盒节点注入攻击重新建模为一个具有异构动作空间的[[马尔可夫决策过程]](MDP),从而实现节点特征生成与边构建的联合优化。在这一框架下,攻击者扮演智能体角色,环境由当前图结构和目标 GNN 构成,智能体通过执行一系列动作(生成特征、构建边连接)逐步完成攻击,每一步动作后获得的奖励反映攻击进展。
这一建模的关键优势在于:智能体能够学习特征空间与结构空间之间的交互模式,在每一步决策时同时考虑“我应该生成什么样的特征”与“我应该连接到哪些节点”,而非孤立处理两者。
为了实现这一框架,TIRBA 设计了三个关键模块。靶向感知交互编码器负责融合节点特征与边的信息。该编码器不仅编码当前注入节点的候选特征,还同时考虑目标节点的嵌入表示以及已有边的连接模式,从而生成能够同时欺骗目标节点并与图结构自然融合的恶意特征。直觉上,一个成功的注入节点需要让自己的特征与目标节点在嵌入空间中足够接近,同时让边连接模式看起来合理而非刻意针对——这正是靶向感知交互编码器所捕捉的平衡。
类中心引导机制旨在解决高维特征空间探索效率低下的问题。由于节点特征维度通常较高,智能体在强化学习训练初期面临巨大的探索空间,难以快速找到有效的攻击策略。TIRBA 利用目标数据集的先验类别分布信息,计算各类别在特征空间中的中心点(即类中心),并以此作为探索的引导信号。具体而言,当智能体需要为恶意节点生成特征时,类中心引导机制提供一条“先向目标类别中心移动、再微调偏离”的策略路径,大幅缩小了有效探索范围。
拓扑差异感知状态价值评估则针对注入节点引起局部结构异常这一特点设计。TIRBA 显式评估注入节点后局部图结构与注入前的差异,将其作为状态价值函数的重要输入。这一设计的直觉在于:注入节点的边连接模式必须足够隐蔽,不能在局部结构中引入明显异常——例如,若目标节点原本只有少数几个邻居,但突然与新注入节点产生大量连边,这种结构异常极易被检测。因此,拓扑差异感知评估帮助智能体学会在攻击效能与结构隐蔽性之间取得平衡。
实验与结果
实验在多个经典数据集(CiteSeer、Cora-ML、PubMed)上进行,评估了 TIRBA 针对不同 GNN 架构(GCN、GAT)的攻击效能。对比基线包括传统解耦方法以及近年来提出的先进黑盒攻击算法。实验采用被广为接受的攻击指标:在固定注入预算下,评估目标节点分类准确率的下降幅度(越大越好)以及攻击成功率(目标节点被错误分类的比例)。
实验结果清晰地表明,TIRBA 在所有数据集和目标模型上均显著优于对比方法。在最严格的预算设置下(每个目标节点仅允许注入 1-2 个恶意节点),TIRBA 能够将目标节点的分类准确率降低 15%-30%,而最优基线方法的降低幅度通常不超过 10%。随着预算略微放宽,TIRBA 的优势更加显著,这说明联合优化策略在高维特征-结构空间中的探索效率远高于解耦方法。
消融实验进一步验证了三个关键模块的贡献。移除靶向感知交互编码器后,攻击效能下降约 40%,证实了特征-结构联合建模的重要性。去掉类中心引导机制则导致训练收敛速度显著变慢,且最终攻击效果也有所下降。移除拓扑差异感知评估模块后,生成的注入节点虽然攻击效力不低,但更容易被基于结构异常的检测方法识别,说明该模块有效提升了攻击的隐蔽性。
讨论与可借鉴点
TIRBA 的工作揭示了黑盒节点注入攻击中特征空间与结构空间不可割裂这一重要特性,将其建模为联合优化问题的思路对后续研究具有启发意义。类中心引导机制利用先验分布信息提升探索效率的做法,可推广至其他高维动作空间的[[强化学习]]应用。拓扑差异感知的状态评估设计则体现了将领域知识显式编码进[[状态价值函数]]的思想,这一做法在需要兼顾效能与隐蔽性的任务中尤为适用。
然而,本研究仍存在若干局限。首先,TIRBA 假设攻击者对目标 GNN 拥有黑盒查询访问能力,在完全无查询权限的更严格黑盒场景下表现尚待验证。其次,实验主要在静态小规模图上进行,对大规模动态图的攻击效能与效率有待进一步探索。此外,攻击隐蔽性的评估目前聚焦于局部结构异常,未来可引入更多维度的隐蔽性指标(如特征分布一致性、传播影响一致性等)。
从防御角度而言,TIRBA 的成功提醒我们,基于特征-结构联合感知的鲁棒性训练与检测机制值得深入研究。如何在训练阶段就考虑这种联合攻击模式,设计同时针对特征扰动与结构异常的联合防御策略,是值得探索的方向。
摘要
图神经网络(GNN)在图表示学习方面取得了显著性能,但其固有的对抗攻击脆弱性带来了严重的安全风险。尤其是黑盒节点注入攻击已成为GNN的主要威胁,因为其在不改变原始图拓扑结构的情况下注入恶意节点。然而,这类攻击通常将恶意节点特征的生成与边连接解耦,从而在严格预算限制下导致攻击效能欠佳。为解决这一关键问题,本研究提出了一种新颖的面向GNN黑盒节点注入攻击的靶向感知交互引导强化学习方法(TIRBA),其将攻击建模为马尔可夫决策过程,并在异构动作空间中联合优化节点特征生成与边构建。具体而言,TIRBA首先设计了一个靶向感知交互编码器来融合节点特征与边的信息。此外,引入类中心引导机制以利用先验类别分布信息,从而引导对高维特征空间的高效探索。最后,采用一种拓扑差异感知的状态价值评估方法,以显式捕捉由注入节点引起的局部结构异常,从而稳定强化学习的训练过程。实验结果表明,所提出的TIRBA显著优于当前最先进的黑盒节点注入攻击方法。
Abstract
Graph Neural Networks (GNNs) have achieved remarkable performance in graph representation learning, yet their inherent vulnerability to adversarial attacks poses severe security risks. Especially, black-box node injection attacks have become a major threat to GNNs since they inject malicious nodes without altering the original graph topology. However, they typically decouple the generation of malicious node features and edge connections, thereby resulting in suboptimal attack efficacy under stringent budgets. To address this critical issue, this study proposes a novel Target-aware Interaction-guided Reinforcement learning for Black-box node injection Attacks on GNNs (TIRBA), which formulates the attack as a Markov Decision Process and jointly optimizes node feature generation and edge construction in a heterogeneous action space. Firstly, TIRBA designs a target-aware interaction encoder to fuse information of node features and edges. Further, it introduces a class-center guidance mechanism to utilize prior class distribution information, thereby guiding efficient exploration of the high-dimensional feature space. Finally, a topology difference-aware state value evaluation is adopted to explicitly capture local structural anomalies caused by injected nodes, thereby stabilizing the reinforcement learning training process. Experimental results demonstrate that the proposed TIRBA significantly outperforms state-of-the-art black-box node injection attack methods.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





