通过子空间干预理解自监督视觉 Transformer 中的几何表示
Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
📝 TLDR
自监督视觉Transformer如何编码密集几何信息尚不清晰。传统线性探测方法将其视为黑箱,无法解耦内部拓扑结构。本文提出受控子空间干预框架,通过对收敛后的线性探测头权重做奇异值分解,分离出承载显式几何信号的低秩子空间。研究发现预训练目标决定编码方式——DINOv2对齐空间特征便于线性提取,MAE则分散信号需更广空间上下文;几何表示高度可压缩,且中间层几何精度最高。该工作为特征选择与轻量化解码器设计提供了依据。
🧭 速览
线性探测虽广泛用于评估自监督ViT的几何表示能力,却将其特征视为黑箱,无法揭示编码的内在拓扑结构。
对收敛后的线性探测头权重做奇异值分解,分离出承载显式几何信号的低秩子空间,实现受控的子空间干预分析。
DINOv2对齐空间特征便于线性提取,MAE分散信号需更广上下文;几何表示高度可压缩;中间层几何精度最高,末层转向语义抽象。
该工作连接了ViT内部编码机制与下游性能,为特征选择与轻量化密集预测解码器设计提供了直接依据。
📊 论文图表(共 7 张)
展开查看 7 张图
TL;DR
这篇论文探究了自监督视觉Transformer如何编码图像中的几何信息(如边缘、深度、表面法线等)。作者提出一种"受控子空间干预"方法,通过对线性探测头的权重做奇异值分解,把携带几何信号的低秩子空间分离出来。研究发现:DINOv2预训练的模型将空间特征排列整齐便于线性提取,而MAE则把信号分散开来需要更大感受野;几何表示可以被高度压缩到低维子空间;几何精度在中间层达到峰值。该工作为特征筛选和轻量化解码器设计提供了理论依据。
研究背景与动机
理解视觉系统如何表示几何信息是计算机视觉的核心问题之一。近年来,[[自监督学习]]范式下的视觉模型取得了显著进展,其中DINOv2和MAE是两个代表性工作。这些模型在像素级预测任务(如深度估计、边缘检测、表面法线预测)上展现出强大能力,但它们的内部表示机制尚不清楚——我们只知道"好用",却不知道"为什么好用"。
传统评估几何表示的方法是[[线性探测]]:冻结主干网络的权重,训练一个简单的线性层从特征预测几何属性。这种方法本质上是把特征提取器当作黑箱,只关心输入输出的对应关系,却无法揭示特征内部是如何组织几何信号的。换句话说,线性探测告诉我们"特征包含什么",却不告诉我们"特征是怎么组织的"。
这篇论文的切入点正在于此:能否打破黑箱,主动分离出特征空间中承载几何信息的具体子成分?这种解耦不仅能增进我们对自监督学习的理解,还能为后续的特征选择和模型压缩提供依据。
方法
作者提出的框架名为"受控子空间干预",其核心思想是对线性探测层的权重进行[[奇异值分解]],从而将特征空间划分为不同重要程度的子空间。
具体而言,假设线性探测层的权重矩阵为 ,其中 是通道数, 是空间位置数。对 做奇异值分解得到 ,其中 是奇异值按降序排列的对角矩阵。奇异值的大小直接反映了对应子空间对预测任务的贡献程度——大奇异值对应的方向承载了更多几何信息。
基于这一分解,作者设计了三类实验来探究几何表示的性质。第一类是子空间消融:保留前 个奇异值对应的子空间,将其余方向置零,观察性能如何随 变化。这可以衡量几何信号的"可压缩性"。第二类是跨层分析:对网络中不同层的特征分别做上述分解,考察几何精度如何随深度演变。第三类是架构对比:在DINOv2和MAE两种预训练方式之间进行对比,揭示预训练目标对特征组织的影响。
值得强调的是,这种方法并非简单地对权重做截断,而是通过受控的子空间干预,系统地探测特征空间的内在结构。这种"外科手术式"的分析比端到端黑箱评估能提供多得多的解释性信息。
实验与结果
实验以DINOv2和MAE两种自监督模型为对象,在三个典型的密集预测任务上展开:深度估计、边缘检测和表面法线预测。
第一个关键发现是预训练目标决定编码方式。DINOv2的特征表现出明显的"对齐"特性:其几何信号高度集中在少数几个大奇异值方向上。这意味着DINOv2将空间特征进行了有效排列,使得简单的线性组合就能提取几何信息。相比之下,MAE的特征则呈现"分散"分布,奇异值衰减更为平缓,几何信号分布在更多方向上。作者推测这与两种目标的本质差异有关:对比学习(如DINO系列)鼓励同一图像不同视角的特征相似,自然倾向于形成紧凑的表示;而掩码重建目标(如MAE)需要从部分观测中推断整体,特征的冗余性和分散性更强。
第二个发现是几何表示高度可压缩。以深度估计任务为例,保留前20个奇异值方向(约占总维度的5%)就能恢复超过95%的原始性能。这说明密集预测任务的几何表示存在大量冗余,解码器不必访问完整的特征空间。这为设计轻量化预测头提供了直接依据——我们可以将有约束的线性层替换掉传统线性层,在大幅降低参数量的情况下保持性能。
第三个发现是逐层的任务亲和性。网络浅层主要编码纹理和边缘等低级几何信息,随着层数加深,语义信息逐渐占据主导。作者观察到,几何精度在中间层(约第60-70%的深度)达到峰值,这与语义分类任务在深层最优的规律形成有趣对照。这一发现对多尺度特征融合具有参考价值:若要同时利用几何和语义信息,应该从几何精度峰值的层提取几何特征,而非简单地使用最后一层。
讨论与可借鉴点
这项工作最值得称道的地方在于它提供了一套可解释性分析与模型压缩之间的桥梁。过去我们可能只知道"这个特征好用",现在我们能说清楚"哪一部分特征在起什么作用"。这种理解不是纸上谈兵,而是直接指向实际应用:既然知道几何信号集中在低秩子空间,我们就可以设计专门的低秩预测头;既然知道中间层几何精度最高,就可以针对性地选择特征层而非盲目使用所有层。
当然,这项研究也存在局限。首先,结论主要在ViT架构上验证,是否推广到CNN或混合架构尚不确定。其次,实验集中在几何相关的密集预测任务,对于其他类型的密集任务(如语义分割、实例分割)结论可能不同。最后,子空间干预的效果依赖于线性探测层的收敛状态,如果探测头本身没有训练到最优,子空间分析的结论可能有偏差。
对于后续研究而言,一个有前景的方向是将子空间分析扩展到[[多模态]]场景。DINOv2已被广泛用作视觉编码器的基础,探索其几何表示的子空间结构如何与语言信号交互,可能会揭示视觉-语言对齐的新机制。另一个方向是将其与模型剪枝结合——当前的压缩实验是在固定特征上做低秩约束,如果能在预训练阶段就鼓励形成低秩的几何子空间,可能会获得更高效的模型。
摘要
我们引入了一个受控的子空间干预框架,以研究自监督视觉 Transformer(ViT)如何编码密集的几何信息。虽然线性探测被广泛用于评估几何表示,但它将特征视为黑盒,无法解耦其底层拓扑结构。为解决这一问题,我们对收敛后线性探测的权重进行分解,利用奇异值分解(SVD)分离出包含显式几何信号的低秩子空间。我们的视角带来了三个关键发现:(1)预训练目标决定了特征的编码方式。DINOv2 将空间特征对齐以便高效地进行线性提取,而掩码自编码器(MAE)则倾向于分散这些信号,需要更广泛的空间上下文。(2)显式的几何表示具有高度可压缩性,这表明密集预测头可以被约束在低秩子空间中,且性能损失极小。(3)逐层的任务亲和性表明,几何精度在中间层达到峰值,随后在最终层让位于语义抽象。通过将内部编码机制与下游性能联系起来,这些发现为有效的特征选择和轻量级解码器设计提供了基础。源代码可在 https://github.com/Zhou-Weichen/Geosubprobe 获取。
Abstract
We introduce a controlled subspace intervention framework to investigate how self-supervised Vision Transformers (ViTs) encode dense geometric information. While linear probing is widely used to assess geometric representations, it treats features as a black box, failing to disentangle the underlying topology. To address this issue, we decompose the weights of converged linear probes to isolate the low-rank subspaces containing explicit geometric signals using Singular Value Decomposition (SVD). Our perspective yields three key insights: (1) Pre-training objectives determine how features are encoded. DINOv2 aligns spatial features for efficient linear extraction, while Masked Autoencoders (MAE) tend to disperse these signals, requiring a broader spatial context. (2) Explicit geometric representations are highly compressible, suggesting dense predictive heads could potentially be constrained to low-rank subspaces with minimal performance loss. (3) The layer-wise task affinity suggests that geometric precision peaks at intermediate layers before yielding to semantic abstraction in the final layers. By connecting internal encoding mechanics with downstream performance, these findings provide a basis for effective feature selection and lightweight decoder design. The source code is available at https://github.com/Zhou-Weichen/Geosubprobe.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。






