当前位置: 首页 > news >正文

LaSt-ViT——Vision Transformers Need More Than Registers——惰性消除视觉变换器

一、研究背景与问题

视觉变换器(ViTs)作为通用特征提取器,广泛应用于全监督、文本监督(如CLIP)和自监督(如DINO)等多种范式下的下游任务。然而,近期研究发现,ViTs在不同监督模式下均存在密集特征伪影问题:

  • 标签监督ViT存在“注意力缺陷”;

  • 文本监督ViT在开放词汇任务中无法准确对齐像素与文本;

  • 自监督ViT产生“高范数标记”,影响对象定位。

现有方法(如Register、CLIPSelf等)均只能部分缓解某一类伪影,无法统一解决。这表明学界对ViT内部工作机制的理解仍不完整。

二、核心发现:伪影源于“懒惰聚合”行为

作者通过系统分析,首次提出并验证了ViT伪影的统一根本原因——懒惰聚合(Lazy Aggregation)

  • 定义:ViT利用大量语义无关的背景块作为捷径来编码全局语义,而非真正关注前景对象。

  • 驱动因素

    1. 粗粒度语义监督:仅有图像级标签,缺乏块级空间指导;

    2. 全局注意力机制:允许前景语义扩散到背景标记中。

  • 表现特征

    • 背景块获得高“块得分”(CLS-块相似度);

    • 该偏差从训练初期即出现并持续存在;

    • 移除高得分背景块不影响甚至提升分类准确率。

三、提出的解决方案:LaSt-ViT(LazyStrike)

作者提出一种频率感知的选择性聚合机制,核心思想是将CLS标记锚定到前景稳定特征上,从而阻断背景捷径。

技术路线

  1. 稳定性得分计算:对每个块在通道维度进行一维傅里叶变换 + 低通滤波,比较原始与滤波后特征的差异,衡量其稳定性。

  2. 通道级Top-K池化:对每个通道选取最稳定的K个块进行聚合,生成新的CLS表示。

  3. 投票计数:统计每个块被选中的次数,作为其重要性指标,高投票块自然对应于前景区域。

该方法直接集成到预训练过程中,无需改变网络架构、无需事后微调或测试时干预。

四、实验验证与性能提升

作者在12个基准测试上进行了广泛验证,涵盖三种监督范式:

监督类型下游任务关键结果
全监督粗分割、PCA可视化ViT-B/16在VOC12上达到41.9% mIoU,接近DINO(47.7%),证明涌现属性并非自监督独有
文本监督(CLIP等)零样本语义分割(6个数据集)、开放词汇检测/分割在VOC上mIoU从49.0%→75.0%(+26%);在COCO检测新颖类别上提升高达+15.8%
自监督(DINO)无监督对象发现(CorLoc)VOC07达到64.4%,VOC12达67.6%,COCO达51.6%,超越LOST等SOTA方法

伪影消除效果

  • 点入框(PiB)得分从42.7提升至55.1(+12.4),接近ResNet水平;

  • 高范数现象被完全消除(图6);

  • 特征PCA可视化显示前景与背景被清晰区分。

五、消融研究与理论验证

  • 增大块大小(减少背景标记比例)→ PiB提升,但分类准确率下降 → 验证粗粒度监督的作用;

  • 限制全局注意力(窗口注意力)→ PiB提升,准确率下降 → 验证全局依赖性的作用;

  • 与MaxPool等简单池化对比,证明性能提升源于语义聚合而非池化副作用;

  • Top-K消融表明,选择约一半标记(K≈N/2)效果最佳。

六、核心贡献总结

  1. 首次统一解释了不同监督范式下ViT伪影的共同根源——懒惰聚合;

  2. 提出了两个新评价指标:块得分(Patch Score)和点入框(Point-in-Box),用于量化伪影程度;

  3. 设计了频率引导的选择性聚合方法(LaSt-ViT),简单高效,无需架构改动;

  4. 12个多样化基准上取得一致且显著的性能提升,覆盖分类、分割、检测、发现等任务;

  5. 揭示了涌现语义分割属性并非自监督独有,全监督ViT经本方法处理后同样具备。

该工作不仅提供了一个实用性强、通用性高的伪影消除方案,更从第一性原理层面深化了我们对ViT内部表征学习机制的理解,指出“全局优化目标与局部语义一致性之间的内在冲突”是ViT设计的根本性挑战,为未来架构设计和训练策略优化提供了新的理论基准。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

图 1. LazyStrike 提供了一个统一的框架,用于分析和缓解 ViT 在不同监督设置下的各种伪影。该图展示了全监督(中间)和自监督(右)下的块得分(定义为 CLS-块相似度),以及全监督下特征的 PCA 投影(左)。

摘要

在大规模数据上预训练的视觉变换器(ViTs)为各种下游任务提供了通用的表征。然而,在不同监督范式(paradigms)和下游任务中,ViTs 中的伪影(artifacts)被广泛观察到。通过对 ViTs 中伪影的系统性分析,我们发现其基本机制尚未得到充分阐明。在本文中,通过系统性分析,我们得出结论:这些伪影源于一种“懒惰聚合”(lazy aggregation)行为:ViT 利用语义上不相关的背景块作为捷径(shortcuts)来表示全局语义,这是由全局注意力和粗粒度语义监督驱动的。我们的解决方案选择性地将块特征整合到 CLS 标记中,减少了背景主导捷径的影响,并在 12 个基准测试中,在标签、文本和自监督下持续提升了性能。我们希望这项工作能为理解 ViT 行为提供一个新的视角。

1. 引言

视觉变换器(ViTs)[7] 已成为图像识别的事实标准 [6, 13, 22-24, 40]。更重要的是,它们作为各种特定视觉任务 [4, 9, 12, 33, 45] 的通用特征提取器,充当冻结的基础模型(foundation model),在大规模数据上预训练后,将图像嵌入为特征表示,这得益于其在数据和模型规模上的可扩展性。更广泛地说,这种通用的 ViT 特征提取器可以适应预训练期间的各种监督方法,不同的方法表现出特别适合不同下游任务的特征。具体来说,监督方法——例如使用全监督分类标签或文本监督的图像-文本对(例如 CLIP [27] 模型)训练 ViTs——为开放词汇(open-vocabulary)任务生成密集特征,并作为大型视觉语言模型(LVLMs)[20] 的视觉编码器。或者,自监督方法 [1, 2, 25],特别是仅基于图像训练的 DINO [1] 模型,展示了对象和部件发现的潜力,使其适用于无监督分割任务 [31]。

然而,最近的研究揭示了 ViTs 在应用于需要密集特征的下游任务时令人费解的密集特征伪影。例如,DINO [43] 证明了标签监督的 ViTs 存在注意力缺陷(attention deficit)[26],而 CLIPSelf [37] 观察到文本监督的 ViTs 无法产生在开放词汇任务中与文本线索精确对齐的密集图像特征。同时,Regiser [5] 揭示了自监督的 ViTs 在注意力图中产生伪影,通常被称为高范数标记(high-norm tokens),这对对象定位任务 [31] 产生不利影响。

这些现象表明 ViTs 中存在一个共同的潜在问题,只是在不同的监督范式下表现出不同的形式 [1, 14, 34]。在我们的初步探索中,我们发现没有单一方法 [5, 36, 44] 能够全面解决这些现象。这个结果表明,即使 ViTs 已经被研究了大约五年 [7],我们对它们的理解仍然不完整。鉴于许多问题可能源于一个共同的机制,一个统一的解决方案是可取的。在本文中,我们进行了一项基于第一性原理的研究——从头开始系统地定义、分析和解决 ViTs 中观察到的不同类型伪影。

为了为这些在不同范式下的现象建立一个统一的定义,我们引入了块得分(Patch Score)——块特征与 CLS 标记(封装了图像的全局语义)之间的相似度——从而评估相对于全局表示的局部语义一致性,独立于训练范式。块得分背后的直觉是,对于不同监督下的 ViT,训练目标旨在将 CLS 特征与监督信号(例如,标签或文本)对齐;密集特征中的任何错位都会导致非前景区域的块得分升高,如图 1 所示。为了定量评估块得分中的伪影,我们提出了点入框(Point-in-Box, PiB)指标,该指标评估得分最高的块是否位于标注的前景区域内。如图 1 和表 1 所示,我们发现,在不同的监督设置下,ViTs 将更高的块得分分配给背景块,并且与 ConvNets [11] 相比,其 PiB 得分要低得多。详细的实验设置见第 4.1 节。为清晰简洁起见,除非另有明确说明,下文中术语“伪影”特指那些错误地产生高块得分的语义无关背景标记。

基于块得分和 PiB,我们对 ViT 的行为进行了深入分析,并提出了一个旨在更好地解释这些伪影的假设:

自然图像本质上包含许多与主要对象无关的背景块。仅凭图像级监督,模型缺乏空间指导,因此倾向于通过背景证据(懒惰聚合)来编码全局语义。经验上,在预训练的 ViT 中移除前 50% 得分最高的块对 ImageNet 准确率影响微乎其微(图 2),这证实了这种依赖性。全局依赖性允许 ViT 利用这些无关的背景块作为表示全局语义的捷径。在缺乏块级标注的情况下,ViTs 可能在训练初期就采用懒惰聚合方式,将少量前景语义扩散到背景中。

表 1. 不同监督方法下的点入框(PiB)得分。我们发现 Register 减少了高范数标记,但高范数并非伪影的根本原因。

基于这种解释,我们通过提出一个直接的解决方案来进一步验证我们的假设,以消除这些伪影:通过在预训练期间调节背景块的影响,我们鼓励 ViTs 关注前景语义。具体来说,模型学习估计每个标记的贡献(第 5.1 节),并选择性地将有信息的块特征整合到 CLS 标记中,以增强前景表示。如图 5 所示,当这些比例被适当增加时,ViTs 会自动将注意力转移到前景对象上,使高得分块与前景对齐。一旦这种懒惰聚合被缓解,我们的方法——称为 LaSt-ViT (LazyStrike ViT)——就能消除所有监督类型下的块得分伪影。它有效地解决了高范数标记问题和特征错位问题。值得注意的是,在应用我们的方法后,ViTs 在不同的预训练范式下都表现出改进的涌现语义分割属性(emergent semantic segmentation properties)[43]。

贡献.(1) 我们通过块得分和点入框(PiB)系统地分析了 ViTs 中伪影的根本原因,揭示了一种早期出现并持续存在的背景主导偏差。(2) 我们提出了一个将粗粒度语义监督和全局依赖性与懒惰聚合联系起来的假设——这是一种捷径行为,即 ViTs 依赖背景块来编码全局语义,而不是关注真正的前景区域。(3) 我们提出了 LaSt-ViT,一种简单的、频率感知的选择性聚合方案,将 CLS 标记锚定到前景区域。(4) 我们在 12 个基准测试中展示了一致的性能提升,包括对象发现、语义/实例分割和开放词汇检测。

2. 相关工作

文本监督 ViT(CLIP 类型模型 [27])中的伪影。视觉-语言对比预训练 [18, 27] 的最新进展使得 CLIP 模型能够产生超越图像级分类的密集预测。

MaskCLIP [44] 首次表明,CLIP 特征可以通过像素-文本对齐实现零样本语义分割。然而,后续研究 [10, 17, 19, 36, 37, 42] 发现,尽管 ViTs 在模型容量和分类准确率上超越了 ResNets,但在密集对齐任务上表现更差。为了缓解这种错位,现有工作要么 (1) 修改最终的注意力层 [10, 17, 19, 36, 38, 42],要么 (2) 引入额外的对齐训练 [3, 37],要么 (3) 采用测试时激活编辑,例如在推理期间将高范数异常激活动态移动到未经训练的寄存器标记中 [15]。相比之下,我们的方法在预训练期间直接处理问题,避免架构更改、事后微调和测试时干预,从根本上防止文本监督 ViTs 中懒惰行为的出现。

自监督 ViT(DINO 类型模型 [1])中的伪影。Register [5] 发现 DINOv2 [25] 在单目深度估计和语义分割方面取得了成功,但由于特征图上出现的伪影,它失去了 DINO [1] 的对象检测能力。为了解决这个问题,引入了额外的标记,旨在存储全局特征并减轻这些伪影的影响。在我们对高范数现象的深入分析中,我们发现高范数仅仅是后期懒惰行为的一种表现。简单地将高范数标记从特征图移动到寄存器标记并不能完全解决下游任务中的潜在缺陷。因此,Vision Transformer 需要的不仅仅是 Registers。

3. 预备知识

3.1. 网络架构:Vision Transformer

4. 分析与假设

我们引入了两个探针——块得分(CLS-块相似度)和点入框——来分析 ViTs 中伪影出现的位置和时间(第 4.1 节)。从空间和时间两个角度(第 4.2 节),我们发现高块得分集中在背景区域,并且这种偏差从训练一开始就出现并持续存在。这些发现表明,使用粗粒度语义监督(图像级而非块级目标)训练并配备强大全局依赖性(长程注意力)的 ViTs,倾向于采用一种懒惰聚合捷径——将前景语义扩散到背景标记中。为了验证这个假设,我们隔离了每个因素:通过使用更大的块大小来减少背景标记(第 4.3 节),以及通过基于窗口的注意力来限制注意力范围(第 4.4 节)。两种干预措施都提高了点入框得分,但略微降低了分类准确率,表明减少全局依赖性有助于抑制背景偏差,但以牺牲整体识别性能为代价。所有分析都在 ImageNet-1k [6, 34] 上进行,在文本和自监督预训练 [1, 14, 28] 下也观察到了一致的趋势。进一步的观察——例如高范数标记 [5] 的作用和 DINO-v1 的独特行为——在附录中提供。

4.1. 新指标:块得分和点入框

4.2. 块得分中的伪影

问题:CLS 标记“看”向哪里?

实验设置.我们研究了一个在 ImageNet-1k [6] 上训练的 ViT-B/16(全监督)。我们可视化了归一化的块得分分布,并通过在重新评估之前直接在输入图像上屏蔽前 k 个或后 k 个块来进行探针实验。

实验结果.实验结果显示:

  1. 在 ImageNet-1k 上的块得分分布和屏蔽探针。 (a) 前景与背景块得分的归一化分布。 (b) 移除前 k 个高得分块(高达 70%)不会损害准确率,甚至可能提高准确率。

  • 分布.前景块集中在较低的块得分值,而背景块主导了高得分的尾部(图 2a)。

  • 屏蔽探针.移除高得分块不会损害准确率——甚至可能略有提升(例如,ViT-B/16 提升了 +1.2%)——即使超过 50% 的块被屏蔽。相比之下,移除低得分块会导致准确率急剧下降(在 70% 屏蔽时下降高达 60%;图 2b)。

结论:在输入图像中屏蔽背景块几乎不影响分类性能,然而这些区域显示出的特征响应与编码类别语义的 CLS 标记高度相关,这表明前景信息在训练期间已被传播到背景中——这种行为很可能是由自然图像中背景标记相对于前景标记的主导地位驱动的(如图 2b 所示,超过一半的块对分类无贡献)。

问题:这种现象何时开始?

实验设置.我们使用相同的超参数和批量大小在 ImageNet-1k [6] 上训练 ViT-B/16 [7] 和 ResNet50 [11],并在整个训练过程中跟踪 top-1 准确率和点入框得分。

实验结果.实验结果显示:

  • 点入框动态.ViT 的点入框得分反映了伪影水平(越低表示背景偏差越强),在训练过程中保持较低且几乎不变,即使分类准确率在提高(图 3)。

  • 与 ResNet 比较.与 ResNet 相比,ViT 始终表现出较低的点入框得分,揭示了尽管图像级准确率相似,但其背景偏差更为明显(图 3)。

结论:前景信息向背景的传播从训练一开始就发生。

图 3. ImageNet-1k 上的训练动态。左:top-1 准确率;右:点入框得分。随着训练的进行,ViT 的分类准确率稳步提高,但其点入框得分几乎保持平坦(约 \(0.42 \rightarrow 0.44\) ),并且在整个训练过程中始终低于 ResNet 的得分。

即使在早期迭代中,CLS 标记已经主要关注背景块而非前景区域,并且这种偏差在整个训练过程中持续存在——产生准确的图像级预测,但块级对齐效果较差。

这种早期出现表明,伪影不是后期阶段的副产品,而是 ViT 训练中的内在现象。我们假设,在训练开始时,CLS 标记寻求最小化图像级损失的最简单路径,迅速学习聚合与图像级标签相关的背景标记。结果,图像级语义通过背景区域被“短路”,导致分类准确率高但块级对齐差——这是模型懒惰聚合行为的标志。接下来,我们假设这种行为源于两个相互作用的因素:(1) 粗粒度语义监督,其中图像级标签无法提供准确的块级监督;以及 (2) 全局依赖性,其中基于注意力的标记混合允许背景标记吸收前景信息。第 4.3 节和第 4.4 节进一步分离并量化了每个因素的贡献。

4.3. 粗粒度语义监督

验证实验设置.为了评估粗粒度语义监督的影响,我们通过增加嵌入模块 Pemb(⋅) 中使用的块大小来减少背景标记的普遍性。随着块大小的增加,生成的标记更少,许多小的背景区域被合并到更大的块中,从而降低了背景标记的相对比例。具体来说,我们在 ImageNet-1k [6] 上使用 28×28 的块大小(默认:16×16)训练 ViT-Base,这使背景标记的比例减少了约 10%(详见附录)。

验证实验结果.如图 4 所示,增大块大小后,点入框从 0.44 增加到 0.52,这使背景标记的比例减少了约 10%。块得分图显示,高得分区域从背景转向对象区域。然而,top-1 准确率从 62% 下降到 55%,揭示了分类和定位准确率之间的权衡。

图 4. 粗粒度语义监督的影响。增加块大小使背景标记减少 (10%)。效果:点入框从 0.44 上升到 0.52,高得分块向前景转移。权衡:分类准确率下降,表明粗粒度语义监督导致了伪影,而简单的块粗化损害了识别能力。

4.4. ViT 全局依赖性导致的懒惰行为

验证实验设置.我们进一步检验 ViT 的全局注意力是否通过允许前景语义传播到背景区域而加剧了懒惰聚合行为。为了逐步限制长程依赖性,我们在不同层将全局自注意力替换为基于窗口的注意力 [21]。

表 2. 在 ViT-Small 上的窗口注意力消融实验。限制全局依赖性会提高点入框,但会降低 top-1 准确率。这表明不受限制的全局注意力放大了懒惰行为,因为粗粒度语义监督允许背景标记吸收扩散的语义。

验证实验结果.如表 2 所示,随着全局注意力的限制,点入框得分增加,当所有层都采用窗口注意力时达到最高值。然而,准确率相应下降,这表明虽然全局上下文有利于分类,但它也促进了语义向背景块的扩散。

结论:当视觉变换器在粗粒度语义监督下训练并配备不受限制的全局依赖性时,它们倾向于追求最简单的优化路径——将前景语义扩散到大量的背景标记中。这种捷径产生了较高的图像级准确率,但导致表示被背景信息主导,表明优化全局分类目标可能会损害 ViTs 中的块级语义一致性。

5. 方法

概述与原理.为了缓解懒惰聚合,我们将 CLS 标记聚合重新表述为一个频率感知过程,以区分前景块和背景块。在自然图像中,前景信号具有更同质的语义意义,导致深层特征图中沿通道维度的变化较小,而背景通常具有更高的语义多样性;因此,选择在通道维度上经过低通滤波后保持稳定的标记,有可能将 CLS 标记锚定到前景区域。

5.1. LaSt-ViT

图 5. LaSt-ViT 中的 CLS 标记“看”向哪里?对于每张图像,投票数分别超过图像内最大投票数的 50%、30% 或 20% 的块,从左到右以红色可视化。应用 LaSt-ViT 后,高投票块始终对应于前景区域,表明 CLS 标记主要聚合前景标记而非背景标记。

投票计数.我们将标记(块)i 的投票计数定义为

5.2. 迁移到下游任务

在本节中,我们提供更多细节并解释每个下游任务的执行方式。

无监督对象发现.由于 LazyStrike 引导 CLS 标记关注前景对象,我们可以使用块得分实现无监督对象定位。这种扩展独立于训练方法——这通常是早期工作中像 DINO 这样的自监督方法的特权——允许任何训练目标来完成此任务。我们通过应用一个定义为均值得分加一个标准差的阈值来构建掩码。得分高于此阈值的块被分类为前景。

[92, 788, 481, 899], [516, 494, 904, 525]
零样本开放词汇任务.由于 LazyStrike 确保 CLS 特征从正确的块特征聚合信息,并且 CLS 特征本身直接受到学习信号的监督,这有效地导致了块特征与监督信号之间的隐式对齐。对于文本监督的 ViTs,我们可以通过计算块特征与任意文本特征之间的相似度来获得零样本语义分割结果,从而在各种开放词汇任务中实现应用。

表 3. LazyStrike 在点入框得分上的评估。

6. 实验

6.1. 实验设置

我们首先验证了块得分中伪影的消除(第 6.2 节),并在三种训练方法上验证了我们提出的方法:全监督(第 6.3 节)、文本监督(第 6.4 节)和自监督(第 6.5 节),并检验了不同监督下 ViT 的多个下游任务,包括对象发现 [1, 31]、零样本语义分割 [27, 32, 39]、开放词汇对象检测 [16, 30]、实例分割 [29, 37] 和粗分割 [1]。

6.2. 伪影消除

特征范数和块得分中伪影的消除.表 3 展示了不同训练方法下的结果,表明 LazyStrike 不仅消除了高范数现象,还提高了点入框得分。应用 LazyStrike 后,ViT 的点入框得分接近 ResNet [11]。图 6 提供了全监督训练 [34] 下特征范数的详细分析,显示 LazyStrike 降低了最大特征值,从而缓解了高范数现象。

6.3. 全监督比较

粗分割的出现.遵循 [1],我们在 VOC12 的验证集上评估涌现属性(emerging properties),这种现象以前只出现在自监督训练中。如表 6 所示,我们的方法在不同模型大小和训练方法上持续改进了涌现属性。值得注意的是,我们的方法在监督设置下取得了接近 DINO 的性能(41.9% 对比 47.7%),表明 LazyStrike 促进了涌现属性的出现,并且这些属性并非自监督独有。

表 4. 在六个语义分割基准上的评估结果(mIoU, %%)。我们的结果以灰色标记。LazyStrike 在不同类型的 CLIP [27] 和模型大小下,持续改进了文本监督下的语义分割结果,表明在理解了问题的本质后,一个简单的方法可以统一解决不同模型的问题。

表 5. 开放词汇基准上的评估结果。我们的结果以灰色标记。LazyStrike 持续提升了开放词汇密集任务的性能,表明冻结的 ViT 可以达到与 ConvNet [11] 相当的性能。

PCA 的出现.如图 7 所示,我们计算了 LaSt-ViT 块特征的 PCA,并可视化了前景的前三个分量。LazyStrike 细化了先前纠缠的 PCA 特征,有效地区分并突出了显著的前景。

6.4. 弱监督比较

零样本语义分割基准.表 4 展示了我们提出的方法在六个语义分割基准上与几个基线模型的对比。通过将我们的修改集成到这些模型中获得的改进以蓝色突出显示。我们的方法在所有评估基准上始终优于基线模型,显示出显著的提升。例如,当应用于具有 ViT-B/16 架构的 CLIP [27] 模型时,我们的方法在 Pascal(从 11.2% 到 15.2%)、Cityscapes(从 6.5% 到 12.1%)和 VOC(从 49.0%到 75.0%)上实现了 mIoU 的大幅提升。当扩展到更大的 ViT-L 架构时,我们的方法继续提供显著的结果。对于 CLIP 模型,VOC 上的 mIoU 从 17.1% 跃升至令人印象深刻的 72.4%,

表 7. 对象发现 CorLoc。所有模型都采用 ViT-S。以前性能最佳的方法依赖于特征向量计算,而 LazyStrike 避免了这种沉重的计算需求。

图 7. PCA 分量的可视化。我们计算块特征的 PCA,并可视化前景对象的前 3 个分量。使用 LazyStrike,标签监督下的 ViT 也能区分前景和背景并分离对象部件,增强了特征表示。

Cityscapes 上从 2.7% 增加到 12.3%。总之,将我们的方法集成到基线模型中,在所有基准测试中均带来了显著改进,证明了其在不同 CLIP 模型和不同规模模型上的鲁棒性和有效性。

开放词汇对象检测和分割基准.如表 5 所示,我们选择 F-VLM [16] 和 F-ViT [37] 作为基线。两种方法都使用冻结的 CLIP [32] 作为对象检测和实例分割的骨干网络。在获取感兴趣区域后,它们对相应区域的语义得分进行加权,以确定对象类别得分。唯一的区别是 F-VLM 使用基于 ConvNet 的骨干网络,而 F-ViT 采用基于 ViT 的骨干网络。对于 OV-COCO,LaSt-ViT 在 ViT-B 和 ViT-L 的新颖类别上分别比基线提高了 15.8% 和 14.4%。对于 OV-LVIS,它在 ViT-B 和 ViT-L 的稀有类别上也分别比基线提高了 11.3% 和 6.6%。

6.5. 自监督比较

无监督对象发现.我们采用 DINO-seg [1] 和 LOST [31] 作为基线进行比较,两者都利用 ViT-S [7] 作为对象发现任务的骨干网络。比较结果见表 7。LaSt-ViT 表现出显著的性能改进。具体来说,我们的模型在所有数据集上都取得了最高的 CorLoc 得分,超过了 DINO-seg 和 LOST 模型。值得注意的是,我们的模型在 VOC 2007 上达到了 64.4% 的 CorLoc 得分,在 VOC 2012 上达到了 67.6%,在 COCO 上达到了 51.6%,分别比性能最佳的 LOST 模型提高了 2.7%、3.6% 和 0.9%。此外,我们的方法展示了每秒 55.9 张图像的惊人吞吐量。这表明我们的模型实现了优越的对象发现性能,并且运行效率更高,使其非常适合实际应用。

6.6. 消融研究

缓解伪影的其他方法.在表 8 中,我们还报告了使用 Maxpool 的结果,它自然地减少了背景激活,并作为评估伪影缓解的强有力参考。虽然 Maxpool 带来了适度的改进,但我们的方法在分类和分割任务上都实现了显著更高的性能,表明改进源于更有效的语义聚合,而非池化引起的副作用。

截断标记的数量.在表 8 中,我们通过使用不同数量的 KK 训练 OpenCLIP [14] ViT-B/16 来研究 Top-KK 的影响。使用 LazyStrike 后性能显著提高,当选择一半标记时达到峰值。表 9 显示了在标签监督的 ViT-B/32 上进一步的消融研究,该模型在 ImageNet-1k 上预训练,并报告了分类性能和 CorLoc 结果。

7. 结论

我们揭示了 Vision Transformers 通常采用一种懒惰聚合行为——由于背景块相对于前景区域具有压倒性的数量优势,它们依赖大量的背景块来编码全局语义。为了应对这个问题,我们提出了 LaSt-ViT,一种频率引导的选择性聚合方法,它将 CLS 标记集中在稳定的、与前景相关的特征上。我们的方法有效地消除了各种监督类型下的伪影,并在 12 个基准测试中取得了一致的改进,为理解 ViT 的内部行为提供了一个更清晰的视角,并为未来的研究奠定了坚实的基础。

http://www.jsqmd.com/news/1237835/

相关文章:

  • 2026年上海英国硕士留学申请评估:五家优选专业解析 - 科技焦点
  • 【Python自动化】安全库存阈值不同?库管/小白1个脚本预警
  • HarmonyOS7起始对齐吸附页实战:snapAlign Start 模式的布局结果
  • 2026年上海金山精品搬家机构甄选实用参考指南 - 热点品牌推荐
  • 渝北区青少年配眼镜门店哪家好|雷曼森眼镜16店地址电话与验配服务核对卡|2026年7月21日资料更新 - mobible
  • 移动端开发核心技术与性能优化实践
  • 设计EDA 研发总监 12 维度 JD(HR 内部仅高管层使用)
  • 前言《从Harness Engineering 到 Loop Engineering:长程任务Agent原理与实战》
  • 遂宁冷库聚氨酯地坪供应商选型攻略及本地服务指南 - 热点品牌推荐
  • 2026年7月最新卡地亚贵阳数博万达广场维修保养服务电话 - 卡地亚官方售后中心
  • 江诗丹顿西安客户服务尊享:2026年7月最新**网点地址与售后电话公告 - 江诗丹顿服务中心
  • Ollama 在 Kubernetes 上的生产化部署:GPU 拓扑感知调度与节点亲和性配置
  • 2026年电瓶车托运避坑指南:木架包装真相、打包套路解析与省钱全攻略 - 快递物流资讯
  • 【深度干货】Windows 虚拟内存(Paging File)最佳设置指南:避开四大误区与高性能配置实操
  • 手机内存总是不够用?关掉这6个隐藏开关,瞬间多出20G空间
  • 别被“保**”忽悠了!2026年靠谱SEO优化公司怎么选?6家正规GEOSEO服务商硬核测评 - 品牌前沿专家
  • 设计EDA 首席专家 12 维度 JD(HR 仅高管 / HRD 使用)
  • HarmonyOS7综合导航示例实战:导航能力整合与多页面交互协作
  • 2026年滨州环氧水磨石批发商优质企业合作** - 热点品牌推荐
  • Windows更新修复终极方案:Reset Windows Update Tool完整指南
  • 百达翡丽表扣、表带维修更换,2026 年 7 月**维修服务中心国内**售后地址 热线 - 百达翡丽官方服务中心
  • KVM主题:大页内存HugePages配置实践
  • C++ vector模拟实现:从内存管理到现代C++特性的深度解析
  • 浪琴合肥**服务热线电话+售后网点地址查询指南(2026年7月最新) - 浪琴服务中心
  • 2026昆山漏水维修专业的公司那家好实测推荐 专业防水公司**推荐(2026年7月防水补漏最新******) - 鼎万建筑修缮
  • ai写小说哪个好用?10大免费小说软件生成器盘点(含避坑指南)
  • 别花冤枉钱了!2026年这5款千元机,配置直接拉满
  • 2026年合肥展览展会策划区域聚焦:合肥壹昆文化传媒有限责任公司一体化全案实力解析 - 本地品牌推荐
  • 费用率无法实时监控怎么办?费用率联动预算管理怎么实现?
  • 2026 湟源黄金回收全域实测|丹噶尔古城 + 乡镇牧区无套路变现完整指南 - 华金汇黄金回收