当前位置: 首页 > news >正文

Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL

Mage-VL是微软推出的一款高效的 codec-native 流式多模态基础模型,专为图像和视频理解而设计。其视觉编码器 Mage-ViT 完全从零开始训练,规模紧凑至 4B。它旨在解决现代 VLM 的“莫拉维克悖论”——在复杂的离线推理任务上表现出色,但在简单的实时流感知任务上却速度缓慢且计算量大。

什么是 codec-native 视觉编码器?

传统的视频理解模型通常将视频解码为均匀采样的帧,然后通过冻结的网络预训练 ViT 推送密集的补丁标记网格。而 Mage-VL 则遵循现代视频编解码器的结构:将流分离为锚定(I)帧预测(P)帧,保留每个锚定补丁,并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种与编解码器对齐的稀疏性使得 Mage-VL 在保持高视觉质量的同时,能够显著降低计算成本和延迟。

Mage-ViT 的训练方法

Mage-ViT 是从两阶段从零开始的 ViT 预训练中提取的独立视觉编码器。这是仅 ViT 预训练的检查点:它没有经过与语言模型的联合 VLM 训练。微软通过以下关键步骤从零训练出 Mage-ViT:

  1. 数据准备:收集了大量的图像和视频数据,包括各种场景、物体和动作。这些数据经过预处理,以适应编解码器原生的输入格式。

  2. 架构设计:设计了一种与编解码器对齐的视觉编码器架构。该架构能够有效地处理锚定帧和预测帧,并提取其中的关键信息。

  3. 预训练:使用大规模的图像和视频数据对 Mage-ViT 进行预训练。预训练过程中,模型学习如何从编解码器原生的输入中提取视觉特征。

  4. 微调:在预训练的基础上,对 Mage-ViT 进行微调,以适应特定的下游任务,如图像理解、视频理解和实时流感知等。

Mage-VL 的整体架构

Mage-VL 是一个统一的模型,其中投影的视觉标记和文本标记共享一个因果 Qwen3 解码器。静态图像成为单个空间块;视频成为时间有序的编解码器窗口。在模式下,轻量级认知门预测每个滚动窗口的p_speak = g(h_t)(通过事件保留特征提取器保持的循环流内存),并在p_speak ≥ τ时触发生成;响应由冻结的基础模型从最近编解码器段的本地滑动窗口解码,文本查询可以随时注入。

Mage-VL 的整体架构包括以下几个关键组件:

  • Mage-ViT 视觉编码器:负责从图像和视频中提取视觉特征。
  • Qwen3 语言解码器:负责处理文本输入和生成文本输出。
  • 认知门:负责控制实时流感知任务中的生成时机。
  • 事件保留特征提取器:负责保持循环流内存,以便认知门能够准确预测生成时机。

Mage-VL 的性能表现

Mage-VL 在多个视频和时间接地基准测试中表现出色。在保持 4B Qwen3 骨干网络固定且仅交换 ViT 的情况下,Mage-VL 在所有报告的视频和时间接地基准测试中均优于 Qwen3-VL-4B——在本地化繁重的任务上优势最大(+22.5 QVHighlight,+17.1 ActivityNet,+11.0 VSI-Bench,+24.5 VideoEval-Pro)。

在 SoccerNet 基准测试中,Mage-VL-4B 在响应时间方面表现出色,具有较高的 TriggerAcc、Precision、Recall、F1 和 Latency 指标。在 OVO-Bench 基准测试中,Mage-VL 在流式架构中设置了新的最先进总体得分。

如何使用 Mage-VL?

Mage-VL 提供了一个单一的检查点microsoft/Mage-VL,它同时提供图像和视频理解以及主动流门——相同的权重可以回答离线图像/视频问题并驱动事件门控评论。它涵盖了所有 Mage-VL 功能:图像理解、帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频和事件门控流。该存储库捆绑了编解码器处理器、神经编解码器包和主动门权重——不需要单独的理解、NVC 或流检查点。

要使用 Mage-VL 进行图像和帧采样视频推理,只需安装transformers库,然后使用以下代码:

model_id = "microsoft/Mage-VL" model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True) processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

对于在线模式,可以与 OpenAI 兼容的 SGLang 服务器通信。首先使用 Mage-VL SGLang 分支构建并启动服务器(构建需要protobuf-compiler和 Rust 工具链):

git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL cd Mage-VL git checkout sglang cargo build --release ./target/release/sglang-server --model-path microsoft/Mage-VL

总结

Mage-ViT 是微软从零训练的 codec-native 视觉编码器,它通过与编解码器对齐的稀疏性,在保持高视觉质量的同时,显著降低了计算成本和延迟。Mage-VL 作为一个统一的模型,涵盖了图像理解、视频理解和实时流感知等多种功能,在多个基准测试中表现出色。如果你正在寻找一种高效的多模态基础模型,Mage-VL 绝对值得一试。

Mage-VL 采用 Apache-2.0 许可证发布,你可以在遵守许可证条款的前提下自由使用和修改它。

【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.jsqmd.com/news/1302215/

相关文章:

  • Countly远程配置高级用法:A/B测试与功能开关实现教程
  • QYResearch 数据:全球高粘度改性沥青市场稳步增长,高性能低碳化开启新周期
  • 为什么选择carefree-drawboard?Python开发者必知的5大优势
  • 5分钟快速上手OBS背景移除插件:零绿幕实现专业抠图效果
  • 旋流曝气器供应商口碑评测:技术实力与案例解析 - 精彩城市
  • 3分钟解锁Mac视频预览超能力:QuickLook Video终极指南
  • 掌握Flutter Picker联动选择器:ArrayPicker实现多级联动效果
  • BetterNCM安装器:3分钟实现网易云音乐插件自动化部署的高效方案
  • 7月 AI 能力总结:代码审查、生成式 UI 与智能工具链的月度全回顾
  • 大流量活动前端容量预估:从 PV 到 QPS 的换算与压测策略(续篇)
  • 5秒极速转换!m4s-converter:你的B站缓存视频永久保存方案
  • 2026低代码科普|不再只是程序员专属!普通人也能做企业数字化开发
  • PMP培训1980元课程服务怎么确认? - 众智商学院职业教育
  • 5分钟精通暗黑破坏神2存档修改:Diablo Edit2全方位指南
  • 从ChatGLM到Qwen:跨框架AI架构评审差异图谱,12家头部企业内部评审标准首次公开
  • 气液混合泵深度测评:一体化设计破局气浮系统难题 - 精彩城市
  • 湘美书院谈科幻未来AI小说,人工智能助力绥宁环保主义
  • 绝区零自动跳过神器:3分钟上手,告别重复点击的终极方案
  • Comet API完全参考:构建个性化Stremio流媒体体验
  • metrics-spring扩展开发:自定义Reporter与SPI实现
  • CLion嵌入式基础开发——基于F570无人机(三)
  • 3分钟快速上手:PoeCharm中文版让你的流放之路角色构建更简单
  • 从理论到实践:深入理解Norm的核心组件与实现原理
  • 主治医师考试备考资料梳理!过来人亲测实用备考攻略 - 品牌测评鉴赏家
  • 如何安全解锁Microsoft 365完整功能:实用开源方案完整指南
  • AI辅助创业决策的月度总结:从假设验证到商业模式确认的数据驱动路径
  • 竞价推广代运营机构代运营核心价值逻辑与专业实践分析:丽鸿科技行业经验深度解读
  • SwitchEmuModDownloader常见问题解决:无法连接服务器、下载中断与7-Zip依赖错误修复
  • Subfinder终极指南:3种简单方法实现智能字幕查找与批量下载
  • 2026年无锡留学中介选择推荐:五家优选品牌深度解析 - 科技焦点