开放词汇 图像识别
性能标杆:SigLIP2 与 DFN 系列
如果追求极致的通用识别准确率,尤其是ImageNet零样本分类这种基准测试上的顶尖表现,目前最领先的是SigLIP2系列模型。
根据OpenCLIP的公开排行榜,当前ImageNet零样本准确率的最高纪录由PE-Core-bigG-14-448(85.4%) 和ViT-gopt-16-SigLIP2-384(85.0%) 等模型保持。它们代表了目前CLIP架构在通用视觉任务上的最强性能。
⚡️ 效率与性能的平衡:MobileCLIP2
如果你的应用场景对模型体积和推理速度有要求(比如移动端或边缘设备),那么MobileCLIP2是值得关注的方案。
它的核心优势在于用更小的参数和更低的延迟,达到了与超大模型相近的性能。例如,MobileCLIP2-S4的规模是SigLIP-SO400M/14的一半,但ImageNet准确率与之持平,而延迟仅为后者的2.5倍(即快得多)。
能力增强的变体:LLM2CLIP 与 ReasonCLIP
还有一些模型在标准CLIP的基础上,通过融合大语言模型(LLM)或引入推理监督信号,来增强理解复杂文本或进行逻辑推理的能力。
LLM2CLIP:通过将大语言模型(LLM)嵌入到预训练的CLIP中,在几乎没有增加训练成本的情况下,显著提升了对长文本、复杂描述的理解能力,并在检索、分割等任务上表现优异。
ReasonCLIP:它专门针对CLIP在“视觉常识推理”和“组合式推理”方面的不足进行改进,通过大规模推理监督训练,让模型能更好地理解“小狗的正面”这类需要空间和逻辑关系判断的查询。
