Vit和VideoMAE
Vit : Vision Transformer 视觉Transformer
VideoMAE :Video Masked Autoencoders 视频掩码自编码器,是对Vit在视频上的进化。
- 传统工业视觉:单独使用 ViT / VideoMAE
- 大模型时代:作为 LLM 的视觉 Encoder
两者用途完全不同,是两种模型的神经架构。
一、单独使用 ViT,在工业上最常见业务是什么?
先说结论:
ViT 单独使用最多的不是普通图片分类,而是需要“高级视觉理解”的任务。
普通分类:
猫/狗/汽车CNN已经很好。
ViT真正发挥优势的是:
- 大规模视觉理解
- 图像检索
- 医疗影像
- 遥感
- 自动驾驶
- 工业检测
1. 图像分类(早期主要用途)
最早 ViT 就是为了 ImageNet 分类提出的。
流程:
图片 ↓ ViT Encoder ↓ 分类Head ↓ 1000类别例如:
ImageNet:
狗 猫 汽车 飞机代表模型:
ViT
Google原始版本:
- ViT-B/16
- ViT-L/16
- ViT-H/14
但是现在工业分类:
很多仍然用:
- ResNet
- EfficientNet
- ConvNeXt
原因:
CNN:
- 更快
- 更省算力
- 小数据效果好
2. 工业视觉检测(非常重要)
例如:
工厂:
检测:
- PCB缺陷
- 芯片缺陷
- 产品瑕疵
以前:
CNN:
图片 | ResNet | 分类现在:
ViT:
图片 ↓ ViT ↓ 异常特征 ↓ 缺陷判断优势:
可以捕获:
长距离关系。
例如:
PCB:
一个地方的小缺陷,可能和远处线路有关。
常用模型:
Swin Transformer
工业视觉非常常见。
原因:
纯ViT Attention计算量大。
Swin:
窗口Attention:
更适合高分辨率图片。
3. 图像检索(非常重要)
例如:
淘宝搜同款。
输入:
鞋子图片:
图片 ↓ ViT ↓ Feature Vector ↓ 向量数据库 ↓ 找相似商品常用:
- CLIP ViT
- DINOv2
- EVA
4. 医疗影像
例如:
CT:
CT切片 ↓ ViT ↓ 疾病判断MRI:
脑部影像 ↓ Transformer ↓ 病灶分析因为医疗图像:
需要全局关系。
5. 自动驾驶
例如:
摄像头:
Camera ↓ ViT/Swin ↓ 环境理解识别:
- 车辆
- 行人
- 道路
Tesla、Waymo路线大量使用Transformer视觉。
二、单独使用 VideoMAE,在工业上最常见业务是什么?
VideoMAE定位:
视频理解(Video Understanding)
不是生成视频。
1. 视频行为识别(最直接)
你的 UCF101 就属于这个。
例如:
监控:
检测:
- 打架
- 摔倒
- 奔跑
- 入侵
流程:
视频 ↓ VideoMAE ↓ 动作分类 ↓ 报警代表模型:
VideoMAE
MCG-NJU
经典。
2. 视频搜索
例如:
视频网站:
搜索:
“一个人在滑雪的视频”
系统:
视频:
↓
VideoMAE:
↓
视频Embedding:
↓
向量数据库:
↓
搜索。
3. 视频监控分析
工业非常大。
例如:
智慧城市:
摄像头:
人流 车辆 异常事件VideoMAE:
理解:
时间变化。
4. 体育分析
例如:
足球:
- 球员动作
- 战术分析
篮球:
- 投篮动作
- 防守动作
5. 机器人
机器人:
需要:
理解环境变化。
例如:
机器人看到:
人拿杯子。
Video Encoder:
提取:
动作变化。
三、单独 VideoMAE 工业常用模型有哪些?
目前主要:
① VideoMAE
最经典。
特点:
自监督预训练。
模型:
- VideoMAE Base
- VideoMAE Large
- VideoMAE Huge
② VideoMAE V2
更大规模。
适合:
大数据训练。
③ Video Swin Transformer
工业应用很多。
结构:
视频版Swin。
④ MViT
Multiscale Vision Transformer。
Meta提出。
特点:
多尺度视频理解。
⑤ SlowFast
虽然不是Transformer,但是工业仍大量使用。
Meta提出。
视频行为识别经典。
四、现在进入大模型时代:LLM里面最常用的Vision Encoder是什么?
这个和单独视觉完全不同。
现在:
LLM需要的不是分类器,而是“视觉Token生成器”。
1. 图片LLM最常用Vision Encoder
第一梯队:
CLIP ViT
目前最经典。
例如:
LLaVA:
结构:
CLIP ViT-L/14 ↓ Projector ↓ LLaMA用途:
图片问答。
SigLIP
Google提出。
现在很多新模型使用。
例如:
Gemini相关路线。
优势:
比CLIP训练方式改进。
EVA-CLIP
国内外很多视觉大模型使用。
特点:
更强视觉能力。
InternViT
商汤/InternVL路线。
例如:
InternVL:
InternViT + LLM2. 视频LLM最常用Video Encoder
这里目前比图片复杂。
因为视频成本巨大。
常见:
InternVideo
非常热门。
结构:
Video Encoder ↓ LLMVideoMAE
很多研究使用。
例如:
VideoMAE ↓ LLMVideo Swin Transformer
也是常见。
CLIP逐帧 + 时间模型
工业也很多:
Frame ↓ CLIP ViT ↓ Temporal Transformer ↓ LLM原因:
计算便宜。
五、单独模型 vs LLM视觉Encoder 对比
| 单独ViT | LLM视觉Encoder | |
|---|---|---|
| 目标 | 完成视觉任务 | 给LLM提供视觉理解 |
| 输出 | 分类/特征 | 视觉Token |
| 后面有没有LLM | 没有 | 有 |
| 训练目标 | 分类/自监督 | 视觉语言对齐 |
| 例子 | ImageNet | GPT-4V、LLaVA |
六、你作为音视频工程师,最相关路线
结合你的方向:
视频分析:
例如:
摄像头异常检测:
推荐:
RTSP视频流 ↓ 抽帧 ↓ VideoMAE / Video Swin ↓ 行为识别 ↓ 报警AI数字人/视频生成:
不是VideoMAE。
路线:
语音 ↓ LLM ↓ Diffusion Video Model ↓ 视频视频大模型:
未来路线:
视频 ↓ Video Encoder (VideoMAE / InternVideo) ↓ Projector ↓ LLM ↓ 理解视频最后总结一句:
单独使用:
ViT:
图片理解、检索、工业检测、医疗、自动驾驶。
最常见模型:
- ViT
- Swin Transformer
- DINOv2
- CLIP ViT
VideoMAE:
视频理解、行为识别、监控分析、视频搜索。
最常见模型:
- VideoMAE
- VideoMAE V2
- Video Swin Transformer
- MViT
在LLM里面:
图片:
CLIP ViT、SigLIP、EVA-CLIP、InternViT
视频:
InternVideo、VideoMAE、Video Swin、CLIP+Temporal Transformer
