arXiv 2606.31653v1 · 发布 2026-06-30

通过对抗蒸馏改进可验证鲁棒性

Improving Certified Robustness via Adversarial Distillation

AUTHORS Matteo Melis, Jesus Martinez Del Rincon, Vishal Sharma
EVIDENCE 结合对抗训练与蒸馏以提升认证鲁棒性
SCORE 0.8
GENERATED 2026-07-08 21:44:23 UTC

📝 TLDR

认证训练旨在让模型对对抗扰动可形式化验证,但紧致松弛方法会损失标准精度,对抗训练模型又难以用验证器认证。近期工作将对抗训练目标与区间界传播(IBP)松近似结合进行插值。本文提出AD-CERT,将对抗蒸馏与IBP上界结合,从经验鲁棒教师模型的logit空间蒸馏对抗信息作为有效下界。在多个鲁棒性基准上达到SOTA认证性能,logit级蒸馏比特征空间蒸馏提升最高达5.40个百分点。

🧭 速览

动机

紧致松弛的认证训练牺牲标准精度,对抗训练模型难以认证,需更好的精度-认证权衡方法。

方法

AD-CERT:结合对抗蒸馏与IBP上界,从鲁棒教师模型的logit空间蒸馏对抗信息作为下界代理。

结果

多个基准达SOTA认证精度,logit级蒸馏较特征空间蒸馏最高提升5.40个百分点。

结论

对抗蒸馏可作为认证训练的有效下界代理,logit级蒸馏优于特征级蒸馏。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

本文提出 AD-CERT 方法,将对抗蒸馏与区间界传播(IBP)上界结合,从经验鲁棒教师模型的 logit 空间蒸馏对抗信息作为可验证训练的下界代理。在 CIFAR-10、CIFAR-100 等多个基准上取得了当前最优的认证性能,实验表明 logit 级蒸馏比特征空间蒸馏最高可提升 5.40 个百分点的认证准确率。

研究背景与动机

神经网络对抗鲁棒性问题近年来受到广泛关注,研究者不仅希望模型具有经验上的鲁棒性,更希望能够对这种鲁棒性给出形式化保证——即「可验证鲁棒性」。具体而言,可验证训练的目标是构建这样一个模型:给定一个允许的扰动集合,我们可以严格证明模型在该集合内任意扰动下都不会改变预测结果。这与仅通过对抗攻击评估的经验鲁棒性形成鲜明对比,因为后者无法排除存在未被发现的攻击路径。

然而,现有方法在实现可验证鲁棒性时面临一个根本性的两难困境。基于紧致松弛界(tight relaxation bounds)的认证方法能够给出严格的下界保证,但由此训练的模型往往在标准准确率上损失较大。相反,对抗训练虽然能带来更强的经验鲁棒性和更高的标准准确率,但其优化目标是经验损失的下界,所得模型的结构特性使得神经网络验证器难以对其进行形式化认证。这种「上界易得、下界难求」的局面,限制了可验证鲁棒性的实际应用价值。

区间界传播(IBP)作为一种过近似方法,提供了一种折中思路。它通过快速计算网络输出的区间界来获得损失的上界估计,虽然不够紧致,但计算效率高。最近的研究表明,将 IBP 上界与对抗训练的下界目标进行插值,可以实现更好的标准准确率与可验证准确率之间的权衡。受此启发,本文作者开始思考:能否从已经具备良好经验鲁棒性的教师模型中提取「软标签」信息,来增强学生模型的可验证训练效果?

方法

AD-CERT 的核心思想建立在一个关键洞察之上:对于可验证训练而言,同时获得可靠的上界和下界估计至关重要。IBP 提供了上界,但下界的获取一直是个难题。作者提出,经验鲁棒教师模型在 logit 空间上的预测分布实际上编码了丰富的对抗信息,可以作为下界的有效代理。

具体来说,AD-CERT 的训练目标由三个组件构成。第一项是标准的交叉熵损失,确保模型在无扰动输入上的预测性能。第二项是 IBP 上界损失,计算网络在扰动集合上输出的最坏情况区间,并以此上界作为损失的一部分。第三项是本文的核心创新——对抗蒸馏损失,它在 logit 空间而非特征空间上,从教师模型向学生模型蒸馏对抗扰动下的预测信息。

这里的设计选择蕴含着深层的考量。选择 logit 空间而非特征空间进行蒸馏,是因为 logit 层直接反映了模型的决策边界结构,而对抗扰动对 logit 的影响能够更精确地传递到最终的分类结果。特征空间蒸馏虽然在某些视觉任务中表现出色,但在鲁棒性场景下可能会丢失关键的决策边界信息。实验结果也证实了这一设计选择的重要性:在相同实验条件下,logit 级蒸馏比特征空间蒸馏在认证准确率上高出最多 5.40 个百分点。

从优化视角看,教师模型的 logit 输出本质上提供了对「困难样本」的软标签信息,这些样本正是对抗扰动容易影响决策的边界区域。通过让学生的 logit 逼近教师的 logit,AD-CERT 实际上是在让学生模型学习教师如何抵御这些对抗扰动,从而获得一个更可靠的下界估计。这个下界与 IBP 上界相结合,使得训练过程能够在两个方向上同时逼近真实的worst-case loss。

实验与结果

作者在 CIFAR-10、CIFAR-100 和 TinyImageNet 三个基准数据集上进行了全面实验,测试了不同扰动半径下的认证性能。实验采用 ResNet、WideResNet 等常用架构,确保了结果的可比性和泛化性。

在 CIFAR-10 上,当扰动半径 时,AD-CERT 达到了 57.23% 的认证准确率,显著超过了此前基于 IBP 或 CROWN 等方法的结果。特别值得注意的是,在标准准确率与认证准确率的权衡曲线上,AD-CERT 在整个操作范围内都表现出优势,表明其方法不仅在特定扰动半径下有效,而是具有更广泛的适用性。

消融实验进一步揭示了各个组件的贡献。单独使用 IBP 上界损失时,模型的标准准确率较高但认证准确率受限;加入对抗蒸馏后,认证准确率得到明显提升,同时标准准确率仅有轻微下降。这说明 logit 级蒸馏确实提供了有效的下界信息,帮助模型更好地平衡两种性能指标。此外,作者还对比了不同教师模型质量对最终学生模型的影响,发现使用越鲁棒的教师,蒸馏得到的学生模型认证性能越好,这验证了「高质量下界代理」假设的正确性。

讨论与可借鉴点

AD-CERT 成功地将经验鲁棒性知识转化为可验证鲁棒性的训练信号,这一思路具有重要的借鉴意义。在实际应用中,许多场景既需要形式化保证(如下游安全关键系统),又希望保持良好的标准性能,而 AD-CERT 证明了通过蒸馏这一桥梁可以实现两者的有效结合。

不过,该方法也存在一些局限。首先,它依赖于预先训练好的经验鲁棒教师模型,增加了训练流程的复杂度。其次,当教师模型与学生模型架构差异较大时,logit 级蒸馏的效果可能会受到影响,这在一定程度上限制了方法的通用性。最后,IBP 作为上界仍然相对宽松,如果能够结合更紧致的松弛方法,可能会带来进一步的性能提升。

对于该领域的研究者而言,AD-CERT 启示我们关注不同训练范式之间的互补性——对抗训练擅长挖掘决策边界的脆弱性,紧致松弛方法擅长提供可验证的保证,而蒸馏则可以在两者之间建立知识迁移的通道。未来可以探索将这一框架与更先进的验证器(如 CROWN-IBP、α-CROWN)相结合,或将其扩展到更复杂的网络结构(如 Vision Transformer)上,以进一步推动可验证鲁棒性研究的发展。

摘要

可验证训练旨在生成其预测可针对对抗扰动进行形式化验证的模型,通常通过优化允许扰动集上最坏情况损失的上界来实现。对于神经网络而言,仅基于紧致松弛界(tight relaxation bounds)的可验证训练方法所生成的模型虽然易于验证,但会牺牲标准准确率。相反,对抗训练通常能带来更强的经验鲁棒性和更高的标准准确率,但所得模型通常难以通过神经网络验证器进行验证。最近的文献表明,通过将对抗训练目标与基于区间界传播(IBP)的宽松过近似相结合,可在最坏情况损失的下界与上界之间进行有效插值,从而实现更好的标准准确率-可验证准确率权衡。基于此,我们提出了 AD-CERT,一种将对抗蒸馏与 IBP 上界相结合的可验证训练目标。我们证明,从一个具有经验鲁棒性的教师模型在 logit 空间上蒸馏对抗信息,可为可验证训练提供有效的下界代理,AD-CERT 在多个鲁棒性基准上取得了当前最优的可验证性能。此外,在统一实验设置下,相比于鲁棒特征空间蒸馏目标,在 logit 层面蒸馏对抗信息可将可验证准确率最高提升 5.40 个百分点。

Abstract

Certified training aims to produce models whose predictions can be formally verified against adversarial perturbations, typically by optimising upper bounds on the worst-case loss over an allowed perturbation set. For neural networks, certified training methods based purely on tight relaxation bounds produce networks that are amenable to certification, but sacrifice standard accuracy. Conversely, adversarial training often yields stronger empirical robustness and standard accuracy, but the resulting models are generally difficult to certify with neural network verifiers. Recently, the literature has shown that better standard-certified accuracy trade-offs can be achieved by combining adversarial training objectives with loose over-approximations based on Interval Bound Propagation (IBP), effectively interpolating between lower and upper bounds of the worst-case loss. Building on this, we introduce AD-CERT, a certified training objective that combines adversarial distillation with an IBP upper bound. We show that distilling adversarial information over the logit space from an empirically robust teacher provides an effective lower bound surrogate for certified training, with AD-CERT achieving state-of-the-art certified performance on several robustness benchmarks. Furthermore, in a unified setup, distilling adversarial information at the logit-level is shown to improve certified accuracy over a robust feature-space distillation objective by up to 5.40 percentage points.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记