通过生成式随机化与跨变体自监督学习打破虚假相关性
Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning
📝 TLDR
深度网络常因依赖"对象-背景"虚假关联而在分布偏移下表现脆弱。本文提出两阶段生成-学习框架:先用零样本分割结合保结构扩散模型,生成同一对象在不同背景下的变体;再通过跨变体自监督对比学习迫使编码器对齐对象表征、抑制背景敏感特征。在Waterbirds、MetaShift、NICO++三个分布偏移基准上取得当前最优最差组准确率,验证了背景不变表征的有效性。
🧭 速览
现有生成式反事实方法仅将合成样本用作数据增广,模型仍可能保留对背景敏感的特征,无法真正学到背景不变表征。
两阶段框架:零样本分割与保结构扩散模型生成同一对象多背景变体,跨变体自监督对比学习将其作为正样本对;ERM预热结合分组DRO分层学习率微调编码器。
在Waterbirds、MetaShift、NICO++三个分布偏移基准上分别取得92.5%、81.7%、87.4%的最差组准确率,均为当前最优。
显式利用生成式干预构造跨背景正样本对,可有效引导模型学习背景不变表征,缓解虚假关联导致的分布偏移问题。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
这篇论文针对深度网络在分布偏移下因依赖「对象-背景」虚假关联而表现脆弱的问题,提出先用零样本分割配合保结构扩散模型生成同一对象在不同背景下的变体,再通过跨变体自监督对比学习迫使编码器对齐对象表征、抑制背景敏感特征。在 Waterbirds、MetaShift、NICO++ 三个基准上达到当前最优的最差组准确率。
研究背景与动机
深度神经网络在分类任务中表现出色,但其成功背后隐藏着一个脆弱的机制:模型往往学会的是标签与背景之间的虚假相关性,而非真正以物体为核心的语义特征。当训练数据中某种背景频繁伴随特定类别出现时——比如鸟类数据集中「陆地鸟」总出现在陆地场景、「水鸟」总出现在水域场景——模型会投机取巧地将背景当作分类依据。一旦测试环境中背景分布发生变化,这种依赖就会导致性能急剧下降。
解决这一问题的思路大致分为两类。一类是[[分布偏移]]领域的经典方法,如 GroupDRO,通过显式建模不同子群体来提升最差组性能;另一类是近年来兴起的数据生成方法,利用生成模型创造「反事实」样本——改变同一物体的背景,同时保持物体本身不变。这类方法在概念上很直观:如果模型见过足够多样的背景变体,就应该学会忽略背景、聚焦物体。
然而,现有生成式方法存在一个根本性的局限:它们通常将反事实样本当作普通的数据增强来使用,模型完全可以继续无视背景变化、保留对背景敏感的表征。打个比方,这相当于给一个人看了各种背景下的苹果图片,但如果不刻意引导,他仍然可能把「有蓝天」当作判断「这是户外照片」的依据。问题的关键在于,需要一种机制迫使编码器主动对齐物体表征、主动抑制背景线索,而不是把希望寄托在「多看多样本就能自动学会」这种模糊的期望上。
方法
这篇论文提出的两阶段框架正是为了实现这种「迫使」效应。
第一阶段是生成式干预。给定一张原始图像,研究者首先使用零样本分割模型(如 Grounding DINO 配合 SAM)将前景物体从背景中分离出来。分离本身并不难,困难的是后续步骤:如何在改变背景的同时严格保持物体的身份特征?如果生成模型在替换背景时不小心修改了物体的颜色、形状或姿态,那么后续的对比学习就会把「同一物体」的标签给学歪了。
为此,作者引入了一个保结构扩散模型作为生成引擎。核心设计在于:物体区域使用原始图像的潜空间特征进行重采样并多次去噪,生成过程中以原图物体为条件引导,确保物体身份不被侵蚀;而背景区域则用文本提示(如「城市街道」「森林」等)引导生成。生成的变体与原图构成「同一对象、不同背景」的对。
第二阶段是跨变体自监督学习(Cross-Variant Self-Supervised Learning)。这一步骤是整个框架的灵魂。直觉很朴素:既然我们能生成同一物体在无数种背景下的图像,那这些变体在某种意义上应该共享一个「本质」——这个本质就是以物体为中心的语义表征。对比学习的正样本对因此定义为同一物体经过不同背景生成后的变体,而负样本对则来自不同物体的变体。
形式化地,编码器 将图像映射到表征空间,对比损失要求:
其中 和 是同一物体的两个变体, 是温度参数, 是余弦相似度。通过最小化这个损失,同一物体的不同变体在表征空间中被拉近,而不同物体的变体被推远。关键在于,这种约束不依赖任何标签信息,只需要生成器提供变体对——因此是自监督的。
在下游分类微调阶段,作者采用了先 ERM 预热再 GroupDRO 的策略。ERM 预热让编码器先学习基础分类能力,GroupDRO 阶段则进一步确保模型在各子群体上的均衡表现。分层学习率的设计让预训练编码器的底层参数更新幅度较小,保持学习到的物体表征不被破坏。
实验与结果
实验在三个标准[[分布偏移]]基准上进行:Waterbirds(陆生/水生鸟类与陆地/水生背景的组合)、MetaShift(涵盖 12 类概念的子群体偏移)和 NICO++(胶片、新闻、自然等不同上下文的挑战性设置)。
在 Waterbirds 上,该方法达到 92.5% 的最差组准确率,相比此前最优方法提升约 1.5 个百分点。在 MetaShift 的最差组评估中达到 81.7%,在 NICO++ 上达到 87.4%,均显著优于依赖单纯数据增强或单纯对抗训练的基线方法。
值得注意的是,研究者进行了详尽的消融实验来验证各组件的贡献。仅使用生成变体作为普通数据增强时,性能提升有限;引入跨变体对比学习后,最差组准确率出现明显跃升。这印证了论文的核心论点:生成变体本身不构成有效干预,必须配合能「迫使」表征对齐的机制。消融还表明,保结构扩散模型在防止物体身份泄露方面功不可没——如果物体在生成过程中被「改写」了,对比学习的正样本对就会包含语义不一致的样本,反而损害表征质量。
讨论与可借鉴点
尽管实验结果令人信服,这项工作仍有可探讨之处。首先,生成式变体的质量高度依赖底层扩散模型的能力;在复杂场景或多物体图像中,保持物体身份的保结构生成仍是一个开放问题。其次,零样本分割加扩散生成的流程引入了额外的计算开销,与端到端训练方法相比,部署成本可能更高。
从更宏观的角度看,这篇论文给我们的启发在于:数据增强本身不是万能药。在虚假相关性问题中,模型的「偷懒」倾向是如此根深蒂固,以至于只有设计出能主动惩罚背景依赖、主动奖励不变表征的学习目标,才能真正奏效。跨变体对比学习提供了一种优雅的方案:用生成模型可控地制造「伪标签」,再通过对比约束将这些标签转化为表征层面的归纳偏置。这一范式或许可以迁移到其他存在虚假关联的领域,如医学影像(病灶与设备类型)、自动驾驶(行人姿态与光照条件)等。
总的来说,这项工作将生成模型与自监督学习的优势相结合,在方法论层面展示了「可控生成 + 针对性对比」的组合拳如何精准打击虚假相关性的根源——对于追求模型鲁棒性和公平性的研究者而言,这是一条值得深挖的路径。
摘要
基于经验风险最小化(ERM)训练的深度神经网络在分布偏移下常常表现不佳,因为它们利用了物体标签与背景上下文之间的虚假相关性。近期的生成式方法通过创建具有改变上下文的反事实图像来解决这一问题,但通常将这些样本用作标准数据增强,使模型仍可能保留对背景敏感的特征表示。我们提出了一种两阶段框架,利用生成式干预来显式学习背景不变的视觉表征。首先,我们使用零样本分割来分离前景物体,并利用保持结构的扩散模型生成上下文偏移的变体,在保持物体身份的同时改变其周围环境。然后,我们引入跨变体自监督学习(Cross-Variant Self-Supervised Learning),将同一物体在不同背景下的变体作为对比学习目标中的正样本对。这鼓励编码器对齐以物体为中心的表征,同时抑制背景特有的线索。接着,我们使用 ERM 预热,然后采用具有分层学习率的 GroupDRO 对预训练编码器进行微调。在分布偏移基准上的实验表明,该方法取得了最优的最差组性能,在 Waterbirds 上达到 92.5%,在 MetaShift 上达到 81.7%,在 NICO++ 上达到 87.4%。代码地址:https://github.com/surajyadav-research/GRSSL
Abstract
Deep neural networks trained with Empirical Risk Minimization (ERM) often fail under distribution shifts because they exploit spurious correlations between object labels and background context. Recent generative approaches address this issue by creating counterfactual images with altered contexts, but typically use these samples as standard data augmentation, leaving the model free to retain background-sensitive representations. We propose a two-stage framework that uses generative intervention to explicitly learn background-invariant visual representations. First, we isolate the foreground object using zero-shot segmentation and generate context-shifted variants with a structure-preserving diffusion model, preserving object identity while varying the surrounding environment. We then introduce Cross-Variant Self-Supervised Learning, where variants of the same object under different backgrounds form positive pairs in a contrastive objective. This encourages the encoder to align object-centric representations while suppressing background-specific cues. Then, we fine-tune the pretrained encoder using an ERM warm-up followed by GroupDRO with layer-wise learning rates. Experiments on distribution-shift benchmarks demonstrate best worst-group performance, achieving 92.5% on Waterbirds, 81.7% on MetaShift, and 87.4% on NICO++. Code: https://github.com/surajyadav-research/GRSSL
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




