当前位置: 首页 > news >正文

Florence-2 概括版

1. 核心目标与背景

核心目标:构建一个统一的视觉基础模型(Vision Foundation Model),通过统一的序列生成方式(Sequence-to-Sequence),同时解决不同粒度的视觉任务:

  • Image-level:图像分类、图像描述(Captioning)

  • Region-level:目标检测、区域定位(Grounding)

  • Pixel-level:像素级分割(Segmentation)

现有模型的两大痛点(Motivation):

  1. 训练数据不够全面:现有模型(如CLIP)主要依赖 Image-Text Pair,只能提供图像级全局语义,缺少目标位置、区域描述和像素级语义(如:狗在哪?Mask 是什么?)。

  2. 模型任务不统一:很多模型针对单一任务设计(检测输出 Box,分割输出 Mask,描述输出 Text),导致不同任务需要不同网络结构,难以实现真正的“基础模型”。

2. 核心创新一:Florence Data Engine 与 FLD-5B 数据集

要训练统一模型,最大的瓶颈是缺少多粒度数据。论文通过Florence Data Engine自动构建了FLD-5B数据集。

2.1 数据生成与迭代流程 (Data Engine)

采用“群体智慧”:不依赖单一模型,而是使用多个现有的视觉专家模型(Specialist Models)协同生成初始数据,再通过迭代优化(Train -> Predict -> Filter -> Refine)清洗噪声。

  • 流程:Web Images → 多专家模型协同标注 → Initial Annotations → 过滤与优化 → FLD-5B

2.2 FLD-5B 数据规模与组成

包含126M图像、5.4B视觉标注,远超同类数据集的精细度。单张图片包含多粒度标注:

  1. Text Annotation (全局):Image → Caption

  2. Region-Text Pair (区域):Image → Region (Box) → Text(如:[120,80,300,250]对应dog

  3. Phrase-Region Pair (细粒度):Text phrase → Specific Region

  4. Pixel-level (像素):Region → Segmentation Mask

对比优势:结合了 LAION 的“海量规模”与 COCO 的“多粒度精细标注”,为模型学习全局到像素级语义提供了数据基础。

3. 核心创新二:统一序列生成模型架构

Florence-2 摒弃了为不同任务设计不同 Head 的传统做法,采用Vision Encoder + Multimodal Encoder-Decoder架构,将所有视觉任务转换为 Token 序列生成。

3.1 整体架构

  • Vision Encoder (DaViT):将图像切分为 Patch 并提取视觉特征(Visual Tokens)。

  • Multimodal Encoder (BART-like):融合视觉特征(Visual Tokens)与任务指令文本(Text Tokens)。

  • Decoder (BART-like):统一进行自回归(Autoregressive)生成,输出 Text / Box / Mask Tokens。

为什么用 Encoder-Decoder 而不是 Decoder-only LLM?

视觉任务天然包含“输入(Image + Instruction)→ 输出(Structured Prediction)”的属性,Encoder-Decoder 更适合这种视觉到结构化数据的转换。

3.2 任务统一与特殊 Token 设计

非文本输出(坐标、Mask)无法直接用语言表达,Florence-2 设计了特殊 Token:

  • 位置 (Location):将连续坐标离散化。如[100, 200, 300, 400]转换为<loc_100> <loc_200> <loc_300> <loc_400>。回归问题变成了词汇表上的分类问题。

  • 分割 (Segmentation):使用<seg> mask tokens </seg>表示。

统一任务范式举例(Image + Prompt → Token Generation):

  • Caption:<image> What is in this image?A dog running in the park

  • Detection:<image> Detect objectsdog <loc_100> <loc_200> <loc_300> <loc_400>

  • Segmentation:<image> Segment dogdog <seg> mask tokens </seg>

4. 训练策略

本质是多任务自回归语言模型损失(Autoregressive Language Modeling Loss)。

  • 多任务混合训练:同一个 Batch 内混合 Caption、Detection、Grounding、Segmentation 的数据,共享一套模型参数,计算相同的 Token Prediction Loss。这使得不同任务能互相促进(如检测的空间能力辅助分割)。

  • 两阶段训练:

    1. 预训练 (Pre-training):使用 FLD-5B 学习通用视觉、空间定位、图文对齐能力。

    2. 微调 (Fine-tuning):在下游特定 Benchmark 数据上进一步优化。

  • 模型规模:Florence-2-base (232M), Florence-2-large (771M)。证明了通过高质量多粒度数据和统一架构,小模型也能具备强大的视觉基础能力(对比 Flamingo 80B)。

5. 总结与多模态模型演进对比

核心三大突破

  1. 数据基础:FLD-5B 解决了多粒度(Image/Region/Pixel)统一标注的缺失。

  2. 统一架构:抛弃独立检测/分割 Head,用 Encoder-Decoder 完成统一建模。

  3. 生成范式:创新性地用<loc><seg>Tokens 将坐标和掩码转化为序列生成问题。

多模态发展路线对比

模型核心贡献与特点输出形式
CLIP(2021)4亿图文对齐,奠定多模态基础相似度/分类
BLIP系列(2022-23)统一视觉语言预训练;通过 Q-Former 桥接冻结的 LLM 与视觉模型Text (图像描述/问答)
LLaVA / Qwen-VL(2023)视觉指令微调,侧重多模态对话和复杂问答推理Text (长文本回答)
Florence-2(2024)端到端训练,统一视觉基础任务(重基础视觉能力而非长篇对话)Text, Box<loc>, Mask<seg>

一句话总结:

Florence-2 的最大价值不在于提出了新的大语言模型,而是通过FLD-5B 多粒度数据集 + 特殊 Token 编码,成功将传统计算机视觉的“分类、检测、分割”三大独立任务,完美统一到了自然语言处理的“序列生成”框架下。

http://www.jsqmd.com/news/1283781/

相关文章:

  • Jetson ARM平台源码编译安装ZeroMQ:从依赖准备到Python绑定实战
  • RedCraft 3.0 整合包发布:低显存福音,6G 显存轻松玩转 Krea2
  • WhatsApp 消息发送的可观测性:链路追踪、指标埋点与告警设计实践
  • Sunshine游戏串流服务器完整指南:3步打造家庭云游戏系统
  • 大模型岗位解析:小白程序员必看,助你精准定位收藏!
  • springboot 课堂考勤打卡系统
  • 3步彻底解决Tabletop Simulator数据丢失难题:TTS-Backup完整指南
  • 查找老黄双卧轴减速机公司电话 对接正规高效的生产供货渠道 - 热点品牌推荐
  • 2026 年 7 月新发布:淮南比较好的高层墙体切割拆除公司联系方式,装修拆改竟有隐藏高危操作?别让这种事毁了你家的安全。 - 企业信息推荐【官方】
  • 7-28午夜盘思
  • 网络安全职业发展指南:从入门到精通
  • AI会议纪要怎么做?会议录音转文字加自动整理,三个月实测流程
  • TI TPIC7710EVM评估板实战:电子驻车制动ASIC功能验证与系统调试指南
  • 十年琴师经验!儿童小提琴选购避坑指南,4款机型精准推荐
  • 2026年淄博保险纠纷律师实战参考:从理赔案例看专业律师的选择逻辑 - 本地品牌推荐
  • 2026年球阀选购实用指南:盘点市面口碑好性价比高的优质品牌
  • 2026 年 7 月新发布:威海靠谱的螺纹烟管平台哪家靠谱,揭秘烟具里的隐藏陷阱:螺纹烟管的真相-万德金属制品 - 企业官方推荐【认证】
  • pyctp CTP接口Python封装架构设计与企业级量化交易系统实现
  • 解密Seq的核心功能:如何利用Pipeline实现高效基因组数据处理
  • SpringBoot实战:全局日志记录与请求链路追踪
  • 2026年 镂空提花网布与吊带衫辅料优质供应厂家:广州市海珠区腾兴航纺织品商行深度解析 - 优企名品
  • 从rpcbind信息泄露到NFS提权:内网渗透中的经典攻击链剖析
  • 炉石传说HsMod插件:终极游戏加速与个性化定制指南
  • 重庆化龙桥老旧小区改造,怎么搞定夜景照明“不扰居”又能省成本?
  • 上海黄浦区电路改造选哪家?3 家服务商深度对比 - 匠心24小时快修
  • 2026大模型技术演进与产业落地实践
  • 2026倍速链组装线厂家:柔性生产与高效节拍平衡的源头工厂解析 - 优企名品
  • 千问联网检索Agent-生成对话
  • 2026年珠三角地区找环保除油剂生产厂家哪家专业 - 热点品牌推荐
  • 2026年值得参考的专业做球阀的公司盘点 附采购选型避坑要点