当前位置: 首页 > news >正文

当视觉AI把“超载“信息塞进像素时,Yandex研究院找到了减负神器

这项由Yandex Research(俄罗斯知名科技企业旗下研究机构)主导完成的研究,论文编号为arXiv:2605.16147v2,于2026年7月6日公开发布。感兴趣的读者可以通过该编号在arXiv平台检索到完整原文。

每个人都有过这样的经历:当你把一个房间的所有杂物全塞进一个壁橱时,那个壁橱会变得一团糟,你需要的东西永远找不到,不需要的东西又总是掉出来。AI图像生成模型也面临着类似的困境——当它需要同时处理大量信息时,某些"储物格"会严重超载,导致生成的图片质量下降。

而这项研究发现了一种优雅的解决方案:给那个拥挤的房间额外增加几个专用储物柜。这些额外的储物柜在学术上被称为"寄存器令牌"(Register Tokens),它们能够吸收多余的杂乱信息,让整个系统运转得更流畅、更高效。

研究团队深入分析了当前最流行的图像扩散模型(一种AI生成图片的技术框架),发现了一个令人出乎意料的现象:即使这些模型并不像之前的视觉AI那样存在明显的"信息超载"症状,增加这些专用储物柜仍然能带来显著的质量提升。更重要的是,研究团队还发明了一种叫做"寄存器引导"(Register Guidance)的全新技巧,能够进一步利用这些储物柜来优化AI生成图片的细节和结构。

一、房间里的壁橱困境:视觉AI的旧问题

在深入了解新发现之前,有必要先理解这个领域的一段历史。

现代视觉AI通常基于一种叫做"视觉变换器"(Vision Transformer,简称ViT)的架构。这种架构把图片切成很多小方块(就像把一幅画切成拼图碎片),然后用一种叫做"自注意力机制"的方法让这些碎片互相"交谈",逐渐理解图片的整体内容。

研究人员早就发现,ViT在处理图片时会出现一个奇怪的问题:某些拼图碎片会变得异常"沉重",它们的数值远超其他碎片。而这些超重的碎片往往对应图片中背景、天空这类"无聊"的区域,不包含什么有用信息。这就好比你的壁橱里,明明应该放重要东西的位置,却被一堆废纸盒子占满了。这导致AI的注意力地图(一种可视化AI"看"哪里的工具)出现混乱,影响了模型在图像分割、目标检测等任务上的表现。

2023年,来自Meta的研究人员提出了一个聪明的解决方案:专门增加几个"寄存器令牌"作为专用储物柜。这些令牌不对应图片中的任何区域,它们的唯一任务就是充当垃圾桶,把那些本来会塞进拼图碎片的多余信息吸收走。实验证明,这个方法非常有效,视觉AI的注意力地图立刻变得干净清晰。

二、扩散模型:截然不同的图片生成方式

视觉变换器主要用于"理解"图片,而另一类模型则专门用于"生成"图片。这就是大名鼎鼎的扩散模型(Diffusion Model),也是Stable Diffusion、DALL-E等AI画图工具背后的核心技术。

扩散模型的工作原理可以理解为一个"逆向去噪"过程。给一张完全随机的噪声图(就像老式电视机没有信号时的雪花屏),让AI一步步把噪声去掉,最终变成一张清晰的图片。这个过程需要经过很多步,每一步AI都要判断"这些噪声里藏着什么图案",然后去掉一部分噪声。

近年来,扩散模型也开始采用变换器架构,这类模型被称为"扩散变换器"(Diffusion Transformer,简称DiT)。更具体地说,有两种训练方式:一种是在"潜空间"中训练,先把图片压缩成更紧凑的中间表示,在这个压缩空间里做去噪,最后再还原成图片;另一种是直接在"像素空间"中训练,对原始像素直接进行去噪,这种方式更接近我们实际看到的图片。

由于扩散变换器在结构上越来越像视觉变换器,研究团队自然而然地产生了一个问题:扩散模型会不会也遇到同样的"壁橱超载"问题?寄存器令牌对扩散模型有用吗?

三、出人意料的发现:没有病症,但药还是有效

带着这个问题,研究团队展开了系统性的调查,结果发现了一个颇为有趣的现象。

首先,他们检查了扩散变换器是否存在之前在视觉变换器中发现的那种"超重拼图碎片"问题。答案是:几乎不存在。与视觉变换器不同,扩散模型的拼图碎片们数值分布非常均匀,没有哪几个会突然暴涨。这从注意力地图也能看出来——视觉AI的注意力会莫名其妙地聚集在背景区域(那就是超重碎片所在的地方),而扩散模型的注意力则老老实实地集中在图片的主体对象上。

按照这个逻辑推断,既然扩散模型没有旧问题,那寄存器令牌应该没有用武之地。

然而,研究团队实际测试后发现完全相反的结论:给扩散模型加上寄存器令牌,图片生成质量明显提升了。以衡量图像生成质量的标准指标FID(数值越低越好)来看,以一个中等大小的像素空间扩散模型(pDiT-B/16)为例,训练200个轮次后,没有寄存器令牌的版本FID为7.39,而加上寄存器令牌后降到了5.30,提升非常显著。更大的模型(pDiT-L/16)同样如此,从4.13降到了3.17。

这就好比一个房间里没有明显的杂乱,但你仍然发现给它加上几个专用储物柜之后,整体的居住体验和办事效率提升了——因为这些储物柜承担了一些原本并不明显但实际上存在的隐性负担。

四、寄存器里装着什么:两种截然不同的角色

为了理解这些额外储物柜到底在做什么,研究团队深入分析了寄存器令牌的内部状态,发现了一个双重身份的现象。

给扩散模型加上寄存器令牌之后,这些令牌自身会发展出异常高的数值。换句话说,虽然原来的拼图碎片没有超载问题,但寄存器令牌加进来之后,自己成了"高数值令牌"。这就像原来的房间虽然没有壁橱超载,但新加的专用储物柜里很快就堆满了东西。

这些堆满东西的储物柜究竟装的是什么?研究团队用一种叫做"线性探测"的技术来分析,简单来说就是检查这些令牌里面的信息能不能用来判断图片属于哪个类别(比如是猫、狗还是汽车)。

结果非常有趣:不同的寄存器令牌呈现出截然不同的性格。有些令牌数值极高,但分类准确率极低,接近于零——这些令牌是纯粹的"垃圾桶",专门吸收那些需要从拼图碎片中卸载的杂乱信息,就像一个什么都往里扔的杂物箱。另一些令牌数值适中,但分类准确率很高,接近90%——这些令牌则像一个精心整理的档案柜,存储着关于图片整体内容的有用信息。

研究团队还通过可视化这些令牌的注意力分布,发现了更细腻的专业化分工:某些分类准确率高的令牌专门关注图片的背景(比如丛林环境),另一些则聚焦于前景物体(比如鸟类),还有一些专注于特定细节(比如树枝、鸟喙)。而那些纯粹充当垃圾桶的令牌,注意力则没有任何有意义的空间结构。

这种分工现象意味着寄存器令牌不只是被动地吸收垃圾,而是主动地参与了图片内容的组织和表达。

五、"高噪音"才是关键:为什么像素空间更需要储物柜

研究还发现了一个重要的规律:寄存器令牌对不同类型的扩散模型效果差异悬殊。

在像素空间训练的扩散模型从中获益最大;在"VAE潜空间"(一种常见的压缩表示空间)训练的模型获益中等;而在"RAE潜空间"(一种基于DINOv2视觉AI的高质量压缩空间)训练的模型,加上寄存器令牌后性能甚至略有下降。

为什么会有这种差异?研究团队通过测量中间层特征的"总变差"(TV,一种衡量特征图是否平滑的指标)找到了答案。像素空间的扩散模型产生的中间层特征异常嘈杂和不规则,而潜空间模型的中间层特征则相对平滑整洁。这一点与两类模型的数值大小也吻合:像素空间模型的特征数值远高于潜空间模型。

这就解释了差异的根源:像素空间训练本质上更困难,因为图片像素中包含大量高频细节和噪声,AI需要同时处理整体语义(这是张猫的图)和低级细节(每一根猫毛的走向),信息混杂在一起,导致所有拼图碎片都承受着沉重的信息负担。寄存器令牌在这种情况下提供了一个宝贵的"减压阀",让拼图碎片能够把全局信息卸载到专用储物柜里,专注于处理局部细节。

而潜空间模型由于原始信息已经经过了高质量的压缩和整理,中间层特征已经足够干净,寄存器令牌额外干预的必要性就小得多。RAE潜空间尤其如此,因为它使用了专门为图像语义设计的DINOv2编码器,特征已经非常有序。

六、寄存器引发的时间维度:高噪音阶段最关键

扩散模型生成图片的过程是一个时间序列——从嘈杂到清晰,需要经过几十到几百步。研究团队发现,寄存器令牌对不同时间点(噪声程度不同时)的影响并不均等。

通过计算不同时间点和不同层次的特征总变差比值(有寄存器令牌除以没有寄存器令牌),研究团队制作了一张热力图。这张图清晰显示:在噪声最强的早期阶段(t接近0时),寄存器令牌带来的特征平滑效果最为突出,比值远低于1(意味着特征明显更平滑);而在噪声较少的后期阶段(t接近1时),这种效果逐渐减弱,比值趋近于1。

这个发现有着深刻的意义:在扩散模型的生成过程中,早期高噪音阶段决定了图片的整体结构和主要内容,后期低噪音阶段则负责细化细节。寄存器令牌在最关键的整体结构阶段效果最好,这正好解释了为什么它们能够让生成图片的整体布局和对象结构更加连贯合理。

七、放在哪里、放多少:寄存器的使用细节

与视觉变换器相比,扩散模型对寄存器令牌的使用方式有两个显著不同点,这些细节非常重要。

第一个不同是放置位置。在视觉变换器中,寄存器令牌从第一层就开始加入,贯穿整个网络。但在扩散模型中,这样做反而会拖累性能,效果跟完全不用寄存器差不多。最有效的做法是从第4层开始加入(总共12层),一直到第11层(但最后一两层的贡献也不大,4到9层的配置也表现良好)。研究团队的解释是:在早期层次,模型还没有形成有意义的语义结构,这时候加入的寄存器令牌只能捕获低级、无意义的信号,反而给后续层次传递了错误的引导。通过对比线性探测的结果可以发现,从第0层就开始的寄存器令牌,很多都处于一种"两不像"的状态——数值不高(不像垃圾桶),分类精度也低(不像档案柜)——纯粹是浪费位置。

第二个不同是数量。视觉变换器通常用4个寄存器令牌就够了,但中等大小的扩散模型(B级别)需要32个才能达到最佳效果。这说明扩散模型中积累的需要卸载的信息量远比视觉变换器多,需要更多的专用储物柜来分担。

八、隐形的寄存器:现有模型早就在这样做了

研究中最精彩的一个发现是:现有的一些高性能扩散模型,在完全没有意识到"寄存器令牌"这个概念的情况下,已经自发地演化出了类似的机制。

近期有一种叫做"上下文类别条件"(In-Context Class Conditioning,简称IC)的技术在像素空间扩散模型中非常流行,代表性工作是JiT模型。这种技术的核心思路是:把类别标签(比如"这是一张猫的图")对应的特征向量复制多份,作为额外的令牌一起输入网络,让模型在生成过程中始终"记住"要生成什么类别的图片。

研究团队对JiT模型的这些额外类别令牌进行了同样的分析,发现了与寄存器令牌几乎完全相同的行为模式:部分令牌成为高数值的垃圾桶,另一部分令牌存储了远超类别信息的丰富全局语义。更关键的是,从FID数字来看,IC模型的提升与纯寄存器模型的提升相当甚至略好。这说明这些类别令牌的绝大部分贡献来自于它们扮演寄存器的角色,而非它们携带的类别信息本身。

当然,IC略好于纯寄存器这一点也说明类别信息确实有额外的帮助,让模型一开始就有了更好的语义出发点。但核心贡献是寄存器机制,这解释了为什么在扩散模型领域,加入这类额外令牌往往能带来超出直觉预期的性能提升。

同样有趣的是,在大型文字生成图片的扩散模型(如FLUX、SD3.5等)中,研究团队分析了这些模型中文本令牌的数值分布,发现文本序列中也有一些令牌呈现出高数值的垃圾桶特征,而图片区域的令牌则保持均匀。这进一步说明了一个普遍规律:扩散模型需要这种专用的信息卸载机制,当系统里有不参与生成损失计算的额外令牌时,这些令牌就会自发承担起这一角色。

九、寄存器引导:用"弱版自己"来提升生成质量

理解了寄存器令牌的作用后,研究团队进一步思考:能不能主动利用这种机制,让生成效果更上一层楼?

他们注意到一个有趣的现象:对同一个模型,有寄存器令牌和没有寄存器令牌的版本生成的图片,内容整体一致(同一只狗、同一个场景),但结构细节差异明显——没有寄存器的版本对象结构更混乱,细节更模糊,但整体布局类似。

这让研究团队联想到了一种已有的技术叫做"自动引导"(AutoGuidance),其核心思路是用一个"更弱版本的模型"来引导更强版本,就像让一个经验丰富的厨师按照见习厨师的食谱反向操作——哪里做得不够,就往那个方向加强。

把这个思路移植过来,就得到了"寄存器引导"(Register Guidance,简称RG):在生成图片的每一步,同时运行有寄存器令牌和没有寄存器令牌的两次预测,然后沿着两次预测之差的方向放大,相当于在原有预测基础上,额外增强"有寄存器版本比没有寄存器版本多了什么"的部分。

实现这个方法的代码非常简洁:每一步只需要多运行一次网络(不带寄存器),计算两次预测的速度向量之差,然后按照一个控制强度的参数w_rg加权叠加到正常预测上即可。

不过,当使用两个分开训练的模型时,会出现一个问题:在高引导强度下,生成图片会出现明显的人工痕迹和混乱。这是因为两个独立训练的模型虽然生成了类似的内容,但在细节层面存在不对齐,差值中包含了无意义的噪音。

研究团队的解决方案非常巧妙:用一个单一的模型同时支持有寄存器和无寄存器两种模式,在训练时随机以一定概率(比如5%)丢弃所有寄存器令牌。这样,同一个模型对同一张图的两种预测在内容上高度对齐,差值中就只剩下真正有意义的"寄存器带来的提升"部分,消除了人工痕迹。

测试结果证实了这一点:使用单一模型的寄存器引导,随着引导强度增加,图片质量持续改善而没有出现人工痕迹,对象结构更连贯,视觉细节更清晰。

十、与经典引导技术的搭配:1+1大于2

现有的AI图片生成系统通常会用一种叫做"无分类器引导"(Classifier-Free Guidance,简称CFG)的技术来增强条件控制——比如确保生成的图片确实符合"一只橙色的猫坐在沙发上"这样的文字描述。

研究团队发现,寄存器引导和CFG解决的是不同层面的问题:CFG主要强化"生成什么"(内容、类别的精准控制),而寄存器引导则改善"生成得好不好"(结构连贯性、视觉细节)。两者互不干扰,可以同时使用,而且联合使用比单独使用任何一种效果都更好。

在实验中,对中等大小的模型(JiT-B/16),单独使用CFG能达到3.71的FID,单独使用寄存器引导能达到3.46(最优参数下),而两者联合使用则进一步降低到3.32。在更大的模型上,这种提升同样一致:JiT-L/16联合使用后FID达到2.16,JiT-H/16达到1.80,已经与那些参数量多出许多的大模型相媲美。

实施细节上,研究团队还发现了另一个改善点:不需要在整个去噪过程的每一步都应用引导,可以只在特定的时间区间内应用(比如寄存器引导只在t=0.03到0.9之间应用),这与早期的"区间引导"研究结论一致,能够在不增加计算量的情况下进一步优化结果。

此外,研究团队还探索了让寄存器令牌和拼图碎片使用各自专用参数的"双流架构",发现在保持自注意力层共享的前提下,对归一化层(RMSNorm)、调制层(adaLN)和全连接层(MLP)使用分开的参数,能在仅增加约14%参数量的情况下进一步提升性能。这种紧凑双流设计(B级别的FID从3.71降到3.41,L级别从2.47降到2.32)也与表示对齐方法(REPA)兼容,二者结合使用还能进一步改善效果。

归根结底,这项研究揭示了一个之前被忽视的现象:扩散模型其实一直渴望有一些专用的"信息卸载空间",只是在没有寄存器令牌的情况下,这种需求没有适当的出口,导致所有的信息压力都落在本来应该专注于局部去噪的拼图碎片上。寄存器令牌的引入,相当于给一个长期超负荷工作的员工配备了专职助理,工作效率自然大幅提升。

这项研究的另一个有趣含义是:当我们看到AI文字生成图片系统中的文本令牌,或者任何其他不直接参与损失计算的额外令牌,都可以用这个框架来理解它们的角色。它们很可能并不只是在传递原本设计的信息(类别、文本描述),同时还在默默地扮演着寄存器的角色。这为理解当前最强大的图像生成模型提供了一个新的视角。

对于普通用户而言,这项研究意味着未来基于JiT架构的像素空间扩散模型,通过简单地在推理时启用寄存器引导,就能在不改变模型架构的情况下免费获得更高质量的生成图片——更清晰的对象边界、更合理的空间布局、更丰富的视觉细节。这种改进与我们已经熟悉的CFG增强是互补的,两者叠加使用能获得比任何单一技术更好的效果。感兴趣的读者可以通过arXiv编号2605.16147查阅完整论文,了解所有技术细节和实验数据。

Q&A

Q1:扩散模型加上寄存器令牌之后,生成图片的质量提升是怎么体现的?

A:主要体现在FID指标的降低上。以中等大小的像素空间扩散模型为例,训练200轮后,没有寄存器令牌的FID为7.39,加上后降至5.30,降幅约28%。从视觉上看,生成图片的对象结构更连贯,细节更清晰,整体布局更合理,尤其是在早期高噪音阶段,中间层特征会变得更加平滑有序。

Q2:寄存器引导需要重新训练模型吗?

A:不需要完全从头训练。研究团队提供了一种微调方案:在预训练好的JiT模型基础上,以较低的学习率微调约50轮,同时以30%的概率随机丢弃寄存器令牌,让模型同时学会有无寄存器两种工作模式。推理时只需额外运行一次无寄存器版本的网络预测,计算两者差值并加权叠加,即可实现寄存器引导,无需两个独立模型。

Q3:为什么像素空间扩散模型比潜空间扩散模型更需要寄存器令牌?

A:像素空间模型直接处理原始像素,其中包含大量高频细节和噪声,所有信息混在一起,每个位置的特征都承担着全局语义和局部细节的双重压力,导致中间层特征异常嘈杂,数值偏高。潜空间模型的输入已经经过了高质量的压缩整理,特征本身已经足够干净有序。寄存器令牌的核心价值在于为高度混杂的信息提供专用的卸载空间,信息越混杂,这种卸载机制的效益越大。

http://www.jsqmd.com/news/1276074/

相关文章:

  • LSTM在水文预测中的应用与优化策略
  • 基于YOLOv8的道路缺陷智能检测系统优化与实践
  • Qwen-Image-2.0:多模态AI图像生成技术解析与应用
  • SL6Pro 9KHz~6.4GHz 双通道便携射频信号源全解(对比 HT008B+SCPI 程控 Python 实战)便携式信号源9KHz-6.4GHz双通道单频扫频输出低相噪1hz分辨率
  • BuildingAI框架:模块化设计与显式控制流实践
  • 量子强化学习:突破维度灾难的智能决策新范式
  • 2026年AI写作工具实战指南:网文创作与变现全解析
  • eSpeak NG:解锁多语言文本转语音的轻量级解决方案
  • 自动驾驶紧急避障算法:伦理决策与多目标优化实践
  • dxwrapper终极指南:5步解决Windows老游戏兼容性问题
  • MonkeyCode 多模型调度与云端开发环境深度解析
  • MySQL 误删数据后除了跑路,还能怎么办?
  • 如何用开源SDR工具搭建实时飞机监控系统:gr-adsb完整指南
  • TI DSP功耗估算实战:基于活动模型的精准预测与优化指南
  • WzComparerR2完整指南:解锁冒险岛WZ文件的终极提取器
  • Rust实现LLaMA模型CPU推理引擎:从张量运算到TUI界面
  • Laravel Breeze用户必看:Jetstrap实现Bootstrap 4界面的快速教程
  • 为什么 three.js 编辑器能降低数字孪生门槛
  • 海淀五道口金饰出让,大件婚嫁黄金优先安排上门服务 - 生活时报
  • SeaTunnel AI CLI:大语言模型基准测试标准化实践指南
  • AI自动化与未来工作形态:从技术原理到社会影响分析
  • 如何使用Phoenix Swagger与Ecto模型结合:自动生成数据库相关API文档的完整指南
  • 从芯片手册到BOM:解读LM629订购型号与包装信息的实战指南
  • AI数据清洗不是预处理,是模型可信基石:IEEE最新标准下的12项合规性清洗指标详解
  • 【单片机毕业设计推荐】基于 STM32 或 51 单片机的人体生理参数监测报警装置设计与实现,基于 STM32 或 51 单片机的心率血氧体温采集与语音播报系统设计(024103)
  • CarouselPicker高级特性详解:items_visible与unselected_item_opacity属性全解析
  • AgileTC核心功能全解析:从用例收集到任务管理的完整流程
  • 暗黑破坏神2存档编辑器终极教程:5分钟掌握网页版d2s-editor
  • C++ CRC16校验:从原理到查表法与硬件优化的工程实践
  • Stacker故障排查与调试:解决CloudFormation部署难题的完整指南