arXiv 2606.27527v1 · 发布 2026-06-25

大语言模型教导视觉学生:细粒度概念知识的跨模态迁移

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

AUTHORS Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee
EVIDENCE 从LLM教师到视觉学生模型的知识蒸馏
SCORE 0.8
GENERATED 2026-07-04 02:39:52 UTC

📝 TLDR

大语言模型拥有丰富的概念知识,但如何将其迁移到视觉模型尚待探索。本文提出LaViD框架,利用纯文本LLM作为教师,通过生成多选题探测视觉类别间的语义差异,为每个类别构建软标签分布作为概念签名,指导视觉学生模型蒸馏。实验表明,LaViD无需多模态配对数据,在多个细粒度基准上优于基于视觉-语言模型的MaKD,并在Waterbirds上显著提升最差组准确率,展现了对虚假相关性的鲁棒性。

🧭 速览

动机

探索利用纯文本LLM丰富的概念知识监督视觉模型的可能性,避免依赖多模态配对数据。

方法

LaViD通过提示LLM生成多选题探测类别语义差异,将每类映射为MCQ软标签分布作为概念签名,以辅助蒸馏损失指导视觉学生模型。

结果

在多个细粒度基准上优于MaKD等视觉-语言蒸馏方法,结合logit标准化可进一步提升,Waterbirds最差组准确率显著提高。

结论

证明纯语言LLM可有效将概念知识蒸馏至视觉模型,增强细粒度识别能力并提升对虚假相关性的鲁棒性。

📊 论文图表(共 11 张)

展开查看 11 张图

TL;DR

这篇论文提出了 LaViD 框架,让纯语言的大语言模型当“老师”,通过生成多选题探测视觉类别间的语义差异,为每个类别构建软标签分布作为概念签名,再蒸馏给视觉学生模型。实验显示,LaViD 在不需要任何多模态配对数据的情况下,就在多个细粒度视觉任务上超越了依赖视觉-语言模型的 MaKD 方法,并在 Waterbirds 数据集上将最差组准确率大幅提升,证明了蒸馏能有效增强模型对虚假相关性的鲁棒性。

研究背景与动机

在计算机视觉领域,如何让模型学到丰富的语义概念一直是核心问题。传统方法依赖大量人工标注的图像数据,但标注成本高昂且难以覆盖长尾分布。近年来,视觉-语言预训练模型(如 CLIP)通过海量图文配对数据学到了广泛的概念知识,为知识蒸馏提供了新的可能性。然而,基于配对数据的方法存在一个根本性限制:图文配对的质量和数量直接影响蒸馏效果,且多模态数据本身获取成本不低。

与此同时,大语言模型通过大规模文本预训练已经蕴含了极为丰富的概念知识。LLM 知道“家燕”和“雨燕”在翅膀形状、飞行姿态、栖息环境上的微妙区别,也了解各类花朵在花瓣形态、颜色组合上的差异。这些知识能否被“提取”出来,用来指导纯视觉模型的训练呢?

一个直观的思路是直接让 LLM 描述图像内容,但这种方法需要 LLM 能看到图像,而闭源 LLM 的视觉能力有限,开源多模态模型的效果也不稳定。更关键的是,我们希望利用的是 LLM 本身通过纯文本预训练积累的概念知识,而非借助图像理解能力。LaViD 的核心洞察正是:语言模型对概念差异的理解本身就存在于其参数中,只需要设计合适的方式来“引出”(elicit)这些知识。

方法

LaViD 的设计围绕一个关键问题展开:如何让一个看不见图像的纯语言模型,为视觉分类任务提供有意义的监督信号?

作者选择的方案是多选题探测(Multiple Choice Question Probing)。具体来说,对于一个细粒度分类任务(例如区分不同品种的鸟),LaViD 首先利用 LLM 生成一系列多选题,每道题目的选项对应不同的类别,题干则聚焦于类别之间最具区分性的语义特征。举个小例子:

> 以下哪种特征最能区分“家燕”和“雨燕”?

> A. 尾羽呈深叉状

> B. 翅膀较窄长

> C. 常在飞行中捕食

> D. 在建筑物上筑巢

LLM 对每道题目的回答概率分布本身就编码了类别间的语义关系。当我们把所有题目的回答分布组合起来,每个类别就形成了一个高维的概念签名(conceptual signature):一个在多项选择题空间上的软标签分布。

形式化地,假设有 个视觉类别,生成 道多选题。对于类别 ,其在第 道题上的软标签是一个 维概率向量 ,表示 LLM 认为类别 对应各选项的概率。类别 的概念签名定义为

蒸馏损失的设计基于此:当视觉学生模型对输入图像 预测类别 时,模型同时输出一个中间表示 (可以是某个隐藏层的激活),然后通过一个投影头将其映射到“概念空间”。蒸馏损失衡量学生模型的预测分布与教师概念签名之间的差异:

其中 是学生模型对图像 预测类别 的概率, 是对应的表示向量, 是可学习的投影矩阵。整体训练目标结合了标准交叉熵损失和蒸馏损失,通过加权求和优化。

值得注意的是,这种设计的巧妙之处在于:LLM 虽然完全“看不见”图像,但它对语义差异的理解被编码在多选题的回答模式中。例如,如果 LLM 始终以高概率选择区分家燕和雨燕的正确答案,这个偏好就会体现在概念签名里,进而传递给学生模型。整个过程完全依赖文本,不需要任何图像数据。

实验与结果

论文在多个细粒度分类基准上验证了 LaViD 的有效性,包括 CUB-200-2011(鸟类)、Oxford Flowers-102(花卉)、Stanford Cars(汽车)和 Food-101(食品)。基线方法涵盖了从视觉-语言模型蒸馏的 MaKD、从同类视觉模型蒸馏的 DKD 和 MLKD,以及直接使用 CLIP 零样本分类的方法。

结果显示,LaViD 在大多数数据集上取得了最佳或接近最佳的性能。以 CUB-200-2011 为例,LaViD 的 top-1 准确率达到 ,相比 MaKD 提升了约 2 个百分点。更值得注意的是,LaViD 使用的教师模型是完全的纯语言模型,没有任何视觉感知能力,这使得上述对比结果更具启发性——仅靠语言知识就能实现对多模态教师的超越。

在 Waterbirds 数据集上,LaViD 将最差组准确率(worst-group accuracy)从基线方法中常见的 提升到了 以上。Waterbirds 是一个经典的虚假相关性(spurious correlation)测试集,图像中背景(如水面 vs. 陆地)与鸟类主体之间存在虚假的共现关系,导致模型可能依赖背景做预测而忽略真正的视觉特征。LaViD 的概念签名显式编码了类别间的语义差异,引导学生模型关注前景的细粒度特征而非背景关联,从而显著增强了鲁棒性。

消融实验进一步表明,多选题的数量和设计质量对最终效果有重要影响。当使用更少或更粗糙的探测题目时,概念签名的区分能力下降,蒸馏效果也随之减弱。这说明 LLM 蕴含的概念知识需要精心设计的“探针”才能有效提取。

讨论与可借鉴点

LaViD 展示了一条利用语言模型知识的新路径:不依赖多模态配对数据,仅通过文本层面的概念探测就能实现跨模态知识迁移。这种“纯语言教师”的设定有几个实际优势:避免了图像数据的版权和隐私问题;LLM 的推理成本可以独立于视觉模型训练规模进行优化;概念签名的构建是一次性的,可复用于不同学生模型。

然而,当前的设计也存在局限。多选题的生成依赖 prompt 工程,题目质量高度依赖 LLM 本身对目标领域的了解程度——如果 LLM 对某类专业术语不熟悉,探测效果可能受限。此外,概念签名如何与标准的交叉熵训练更好地融合、投影矩阵的初始化策略等工程细节仍有探索空间。

对于更广泛的研究社区,LaViD 的思路提示我们:大语言模型的知识不只是可以被人类“读取”,也可以被“路由”到其他模型中执行特定任务。未来的工作可以在此基础上探索:如何为更复杂的视觉任务(如检测、分割)设计概念探测机制;如何让概念签名自动适应不同学生模型的容量;以及如何结合链式思维等推理技术,让 LLM 生成更具解释性的探测题目。这些方向都可能进一步释放语言模型作为通用知识教师的潜力。

摘要

大语言模型(LLMs)通过大规模文本预训练获得了广泛的概念知识,但其监督其他模态模型的潜力尚未得到充分探索。在本工作中,我们提出了 LaViD——语言到视觉的知识蒸馏(Language-to-Visual Knowledge Distillation)——一个简单而有效的框架,用于将高层语义知识从纯语言教师模型迁移到纯视觉学生模型。LaViD 不依赖配对的多模态数据,而是通过提示大语言模型生成多项选择题(MCQs)来探查视觉类别之间的语义差异,从而引出概念信号。每个类别被映射到这些多项选择题上的一个软标签分布,形成丰富的概念签名,通过一个辅助蒸馏损失来指导学生模型。值得注意的是,尽管使用的是无法访问图像数据的纯语言教师模型,LaViD 在多个细粒度基准测试中仍然持续优于 MaKD 等从视觉语言模型蒸馏的近期方法。与 DKD 和 MLKD 等最先进的视觉蒸馏方法相比,LaViD 也取得了具有竞争力或更优的性能,并在与 logit 标准化结合时获得进一步提升。在 Waterbirds 数据集上,LaViD 大幅提升了最差组准确率,证明了蒸馏增强了对虚假相关性的鲁棒性。代码可在 https://github.com/lliangthomas/lavid 获取。

Abstract

Large Language Models (LLMs) possess broad conceptual knowledge acquired through large-scale text pretraining, yet their potential to supervise models in other modalities remains underexplored. In this work, we propose LaViD--Language-to-Visual Knowledge Distillation--a simple and effective framework for transferring high-level semantic knowledge from a language-only teacher to a vision-only student model. Instead of relying on paired multimodal data, LaViD elicits conceptual signals from an LLM by prompting it to generate multiple-choice questions (MCQs) that probe semantic distinctions between visual classes. Each class is mapped to a soft label distribution over these MCQs, forming a rich conceptual signature that guides the student through an auxiliary distillation loss. Notably, despite using a language-only teacher without access to image data, LaViD consistently outperforms recent methods like MaKD that distill from vision-language models across multiple fine-grained benchmarks. It also achieves competitive or superior performance compared to state-of-the-art visual distillation methods such as DKD and MLKD, with further gains when combined with logit standardization. On the Waterbirds dataset, LaViD substantially improves worst-group accuracy, demonstrating enhanced robustness to spurious correlations with distillation. Code is available at https://github.com/lliangthomas/lavid.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记