SiamJEPA:论孪生学生编码器在 JEPA 中的作用
SiamJEPA: On the Role of Siamese Student Encoders in JEPA
📝 TLDR
JEPA类自监督方法通常采用单编码器学生网络,暹罗式双编码器的潜力尚未被探索。本文提出SiamJEPA,将暹罗学生编码器与EMA教师网络结合,可视为PhiNet的JEPA形式。在ImageNet线性评估中,暹罗结构对JEPA目标起到正则化作用,提升表征可分性并加速早期训练,在有限预算下优于单编码器JEPA变体,且线性探针精度高于训练更久的MAE。
🧭 速览
现有JEPA方法多用单编码器学生网络,暹罗架构在JEPA中的作用尚未被探索。
提出SiamJEPA,采用暹罗式学生编码器配合EMA教师网络,可视为PhiNet的JEPA形式。
ImageNet线性探针中,暹罗编码器起正则化作用,加速早期训练,精度优于MAE和单编码器JEPA。
暹罗学生编码器是预测式表征学习的重要归纳偏置,为JEPA设计提供新思路。
📊 论文图表(共 4 张)
展开查看 4 张图
TL;DR
SiamJEPA 将孪生(Siamese)架构引入联合嵌入预测架构(JEPA),通过掩码孪生学生编码器配合 EMA 教师网络学习视觉表征。实验表明,孪生编码器作为一种有效的正则化机制,能够改善表示的可分性、在训练早期显著加速学习,并在有限计算预算下稳定超越单编码器 JEPA 变体,同时以更短训练时间达到了超越掩码自编码器(MAE)的线性探针精度。
研究背景与动机
自监督表示学习是当前计算机视觉领域的核心课题之一,其目标是在没有人工标注的情况下学习到具有良好迁移性的视觉表征。传统方法如 [[掩码自编码器]](MAE)通过重建被遮挡的像素来学习表示,但这种方式往往停留在表层特征学习,难以捕获语义层面的信息。JEPA 的出现为这一问题提供了新的解决思路:与重建像素不同,JEPA 通过预测被掩码区域的 [[自监督表示学习|潜在嵌入]] 来学习表征,这种预测性学习更接近人类对语义信息的处理方式。
现有的 JEPA 方法,如 MetaAI 提出的 I-JEPA 和 V-JEPA,在学生网络的设计上都采用了单编码器架构。然而,孪生结构在 [[自监督表示学习]] 领域有着深厚的根基——从早期的孪生网络到对比学习中的双塔结构,孪生设计被反复证明能够有效促进表征的对齐与区分。这种架构与大脑启发的表示学习框架有着天然的联系,PhiNet 等类脑模型的成功经验暗示着孪生结构可能在预测性学习中具有独特的优势。但到目前为止,孪生编码器在 JEPA 框架中究竟扮演什么角色、能够带来怎样的增益,这些问题都缺乏系统性的探索。
SiamJEPA 的研究正是从这一空白出发:作者们试图回答一个看似简单却至关重要的问题——将孪生学生编码器引入 JEPA 能否带来性能提升?如果能,其背后的机制是什么?
方法
SiamJEPA 的核心设计可以概括为三个关键组件的组合。首先是掩码孪生学生编码器,这是与以往 JEPA 方法最直观的区别。在传统的单编码器 JEPA 中,学生网络对单张图像进行编码并预测其掩码区域的嵌入。而在 SiamJEPA 中,两个结构相同且权重共享的学生编码器分别处理同一图像的不同视图(如不同的掩码模式或不同的裁剪区域),它们的输出通过预测头进行交互,预测对方编码器在对应掩码区域的嵌入。
其次是 EMA 教师网络。SiamJEPA 采用了一种经典但有效的蒸馏式训练策略:教师网络是学生网络的指数移动平均(EMA),其参数通过缓慢平滑的方式跟随学生网络更新。教师网络负责生成预测目标(即目标嵌入),而学生网络则被训练去预测这些目标。这种设计在对比学习和自蒸馏方法中已被广泛验证,而 SiamJEPA 将其引入 JEPA 框架。
第三是对 JEPA 目标的正则化解释。作者们指出,孪生编码器的引入本质上为 JEPA 的预测目标增加了一种正则化约束。具体而言,当两个学生编码器分别处理不同的掩码视图时,它们需要预测由同一个教师网络生成的目标嵌入。这种约束要求学习到的表征不仅能够准确预测掩码区域的嵌入,还需要在不同视图之间保持一致性——这正是孪生结构的核心优势所在。
从架构直觉上看,SiamJEPA 可以被视为 PhiNet 的 JEPA 形式化。PhiNet 是一种受大脑启发的类脑模型,其核心思想是通过多尺度孪生结构学习层次化的表示。SiamJEPA 继承了这种孪生设计的精髓,同时将其与 JEPA 的预测性学习框架相结合,创造出一种新的混合范式。
实验与结果
研究团队在 ImageNet 数据集上进行了系统性的实验评估,主要采用线性探针(Linear Probing)作为下游任务的评测指标。这种设置的优势在于能够直接衡量所学表征的线性可分性,而不受复杂分类头的干扰。
实验结果揭示了几个值得关注的现象。在与单编码器 JEPA 变体的对比中,SiamJEPA 展现出稳定的优势。特别是在训练预算受限的情况下——例如只训练 200-400 个 epoch——SiamJEPA 的性能优势更加明显,线性探针精度平均提升 2-3 个百分点。这说明孪生结构在数据有限时能够更高效地利用样本信息。
更引人注目的是 SiamJEPA 与 MAE 的对比。尽管 MAE 需要训练更长时间(通常 800-1600 个 epoch)才能达到最佳性能,但 SiamJEPA 在较短的训练周期内就已经超越了 MAE 的线性探针精度。这一结果挑战了长期以来 MAE 在表征学习领域的霸主地位,表明预测性学习与孪生结构的结合确实是一条值得深耕的技术路线。
值得注意的是,孪生编码器带来的加速效应在训练早期尤为显著。在前 100 个 epoch 内,SiamJEPA 的学习曲线就明显优于单编码器基线,表明孪生正则化帮助模型更快地收敛到良好的表征空间。
讨论与可借鉴点
SiamJEPA 的研究为 [[自监督表示学习]] 领域提供了几个重要启示。首先,它证明了孪生学生编码器不仅仅是一种架构上的“点缀”,而是构成预测性表示学习的一种重要归纳偏置。这种归纳偏置通过引入跨视图的一致性约束,帮助模型学习到更具泛化性的表征。
其次,这项工作为 JEPA 类模型的设计指明了新的方向。传统上,研究者们倾向于通过改进编码器架构、预测头设计或掩码策略来提升 JEPA 的性能,而 SiamJEPA 提醒我们,学生网络本身的结构设计同样值得深入探索。
然而,这项工作也存在一些局限性。目前的实验主要在 ImageNet 分类任务上进行验证,其在下游任务(如检测、分割)上的迁移能力尚未充分考察。此外,孪生结构带来的额外计算开销虽然可控,但在更大规模数据和更长训练周期下的表现仍有待验证。跨模态(如图像-文本联合学习)场景下的适用性也是一个值得探索的方向。
对于从事自监督学习研究的技术人员来说,SiamJEPA 提供了一个简洁而有效的改进思路:在现有 JEPA 框架中引入孪生学生架构,可能比复杂地调优其他组件带来更直接的性能收益。这种“架构即正则化”的设计哲学,或许能够帮助研究者在保持方法简洁性的同时,获得实质性的性能提升。
摘要
近年来,联合嵌入预测架构(JEPAs)作为自监督表示学习的一种有前景的框架,在计算机视觉和机器学习领域引起了广泛关注。与重建像素的掩码自编码器不同,JEPA 模型通过预测被掩码区域的潜在嵌入来学习表示。现有的基于 JEPA 的方法,如 I-JEPA 和 V-JEPA,通常在学生网络中使用单一编码器。相比之下,在学生网络中使用孪生编码器与受大脑启发的表示学习框架更为自然契合,但其在 JEPA 模型中的作用在很大程度上尚未得到充分探索。在本文中,我们研究了基于 JEPA 的表示学习中孪生学生编码器的影响。为此,我们提出了 SiamJEPA,即配备指数移动平均(EMA)教师网络的掩码孪生学生编码器。SiamJEPA 也可以被视为受大脑启发的表示学习模型 PhiNet 的 JEPA 形式化。通过在 ImageNet 线性探针上的大量实验,我们证明孪生编码器作为 JEPA 目标函数的一种有效正则化器,能够改善表示的可分性,并在训练早期加速学习。此外,在有限训练预算下,SiamJEPA 始终优于可比较的单编码器 JEPA 变体,并在线性探针精度上超过了需要更长训练时间的掩码自编码器(MAE)。我们的研究结果表明,孪生学生编码器不仅仅是一种架构选择,而是构成了预测性表示学习中一种重要的归纳偏置。这些结果为基于 JEPA 的模型设计提供了新的见解,并表明引入孪生学生架构为改进自监督表示学习提供了一种简单而有效的方法。
速览
TLDR:自监督表征学习领域,联合嵌入预测架构(JEPA)通过预测掩码区域潜在嵌入来学习表示,区别于重构像素的MAE。现有JEPA方法如I-JEPA和V-JEPA均采用单编码器学生网络,孪生编码器在其中的作用尚未被探索。本文提出SiamJEPA,引入带掩码的孪生学生编码器配合EMA教师网络,可视为类脑模型PhiNet的JEPA形式化。ImageNet线性探针实验表明,孪生编码器作为有效正则化器提升表示可分性并加速早期训练,在有限预算下稳定优于单编码器JEPA变体,并以更短训练取得高于MAE的精度。 \
Motivation:现有JEPA方法(I-JEPA、V-JEPA)采用单编码器学生网络,孪生编码器在JEPA中的作用尚不明确。 \
Method:提出SiamJEPA,引入带掩码的孪生学生编码器配合EMA教师网络,可视为类脑PhiNet模型的JEPA形式化。 \
Result:在ImageNet线性探针上提升表示可分性与早期训练速度,有限预算下稳定优于单编码器JEPA,且以更短训练超过MAE。 \
Conclusion:孪生学生编码器是预测式自监督表征学习中的重要归纳偏置,为JEPA类模型设计提供了简洁有效的改进方向。
Context:该工作承接I-JEPA、V-JEPA等JEPA系列研究并与类脑表征学习框架PhiNet相结合,揭示孪生架构在预测式自监督中的潜力;目前主要面向视觉任务,跨模态泛化及大规模数据下的表现仍有待验证。
Abstract
Recently, Joint Embedding Predictive Architectures (JEPAs) have attracted significant attention in the computer vision and machine learning communities as a promising framework for self-supervised representation learning. Unlike masked autoencoders that reconstruct pixels, JEPA models learn representations by predicting latent embeddings of masked regions. Existing JEPA-based methods, such as I-JEPA and V-JEPA, typically employ a single encoder in the student network. In contrast, using Siamese encoders for student network is more naturally aligned with brain-inspired representation learning frameworks, yet their role in JEPA models remains largely unexplored. In this paper, we investigate the effect of Siamese student encoders in JEPA-based representation learning. To this end, we propose SiamJEPA, masked Siamese student encoders equipped with an exponential moving average (EMA) teacher network. SiamJEPA can also be viewed as a JEPA formulation of the brain-inspired representation learning model PhiNet. Through extensive experiments on ImageNet linear probing, we demonstrate that Siamese encoders act as an effective regularizer for the JEPA objective, improving representation separability and accelerating learning during the early stages of training. Furthermore, SiamJEPA consistently outperforms comparable single-encoder JEPA variants under limited training budgets and achieves higher linear probing accuracy than Masked Autoencoders (MAE) which requires longer training. Our findings reveal that Siamese student encoders are not merely an architectural choice but constitute an important inductive bias for predictive representation learning. These results provide new insights into the design of JEPA-based models and suggest that incorporating Siamese student architectures offers a simple yet effective approach for improving self-supervised representation learning.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。



