当前位置: 首页 > news >正文

视频通用模型来了!何恺明等新作GenCeption:训练量仅1/500,精度持平SOTA!

再证「生成即理解」

目录

01 视觉领域长期无解的底层痛点

02 把文生扩散改造成前馈通用感知器

2.1 核心改造:迭代扩散转为单步前馈推理

2.2 统一表征:稠密、稀疏任务共用一套3通道RGB输出空间

2.3 可规模化合成数据训练管线

03 性能、数据效率、涌现能力三重突破

3.1 多任务统一SOTA,单模型对标数十款专用专家模型

3.2 碾压级数据效率:仅竞品1/7~1/500训练量即可持平精度

3.3 三大原生涌现能力

04 工程落地价值与长远行业影响

4.1 短期落地场景价值

4.2 中长期行业变革意义

4.3 待解决开放问题

05 写在最后


大语言模型依靠自预测预训练完成大一统,但计算机视觉长期停留在“单一任务专用模型”的碎片化阶段:做深度估计要用DepthAnything,分割依赖SAM,人体姿态、相机位姿、3D关键点又要单独训练专属网络。

Google DeepMind联合MIT、牛津大学等机构在ECCV 2026发表的最新论文给出了一个颠覆性结论:

大规模文生视频扩散模型,就是视觉领域等价于LLM“下一个Token预测”的通用预训练目标。

在此基础上提出的GenCeption,用一套统一主干+统一损失,依靠文本提示就能完成深度估计、表面法线预测、分割、相机位姿估计和3D关键点预测等数十类视频感知任务。

训练数据量仅为现有SOTA模型的1/7~1/500,还诞生了仿真到真实、跨类别零样本等多项涌现能力。

01 视觉领域长期无解的底层痛点

如今计算机视觉赛道分工极度割裂,根源在于三类无法同时兼顾的历史预训练方案缺陷,这也是GenCeption全部设计逻辑的出发点。

1. 专用任务模型路线

DepthAnything、SAM、Sapiens等模型各司其职,主干、解码器、损失函数全部独立设计。新增一类感知任务就要完整重训一套网络,研发成本极高;模型之间无法复用时空、3D几何先验,对动态视频时序一致性建模能力薄弱,只能处理静态图像。

图 | DepthAnything

2. 传统自监督视觉预训练(VideoMAE、V-JEPA)

以掩码重构、特征预测为目标,缺少原生图文对齐能力,无法用自然语言指令调度任务;仅能提取视觉特征,不内置4D时空、物体物理交互先验,想要做深度、法线这类几何任务,必须额外搭建下游专用头,数据利用效率极低。

图 | VideoMAE

3. 图像扩散复用方案(Marigold、Diception)

仅基于静态图像扩散,处理连续视频时预测结果会剧烈时序抖动;只能覆盖少量稠密视觉任务,无法拓展3D关键点、相机位姿这类稀疏结构化输出,通用性存在天然天花板。

图 | Marigold

三类方案全都无法同时满足通用视觉模型三大硬性要求:内置4D时空物理先验、原生图文对齐、可规模化拓展全品类感知任务。而文生视频扩散模型的训练目标天然同时满足三点,这是GenCeption的核心立论根基。

02 把文生扩散改造成前馈通用感知器

整套框架以开源文生视频模型WAN 2.1的DiT扩散Transformer为主干,核心改造思路是抛弃扩散迭代采样,将多步去噪流程转为单步前馈推理,搭配统一表征方案、合成数据多任务微调流水线,全程一套主干、一套损失搞定所有视觉任务。

2.1 核心改造:迭代扩散转为单步前馈推理

图 | GenCeption完整架构流程图:输入视频+文本提示,单步前馈输出稠密/稀疏视觉结果

传统文生视频需要数十步迭代去噪,速度慢,不适合感知推理。GenCeption做了关键简化:输入不再是噪声潜向量,直接送入原始视频干净潜特征,时序步长固定t=0(整流流模型终止状态),仅单次前向传播输出预测。

原文整流流DiT预测速度项v,模型输出取-v即可对齐目标潜空间,无需多轮迭代。这套改造完全保留预训练阶段学到的全部时空、几何、图文先验,不改动主干网络权重结构,只调整输入输出逻辑,兼顾预训练权重复用与推理速度。

图 | 范式变迁总览图:左侧GenCeption完整技术路线,右侧传统专用模型与统一通用模型架构对比

1.3B小规模模型单段81帧480×832视频推理仅5.92秒,14B大模型10秒完成,完全满足视频实时感知需求。

2.2 统一表征:稠密、稀疏任务共用一套3通道RGB输出空间

这是实现“无任务专属网络”最关键的设计,所有视觉输出全部映射至0~1三通道像素空间,仅靠文本提示(如“输出深度”“输出3D关键点”切换任务,不用更换解码器、损失。

1. 稠密任务(深度、表面法线、分割、射线图)

单通道信息(深度图)直接复制填充RGB三通道;3维法线直接使用R/G/B分别对应XYZ三轴;相机位姿这类高维射线数据设计“罗斯科分块射线图”(图5),旋转、平移分量分区域塞入同一帧RGB画面,适配统一VAE解码器。

图 | 罗斯科射线图:将6维相机射线信息压缩至单张3通道图像

2. 稀疏任务(2D/3D人体关键点)

新增一组可学习序列Token追加至视频潜序列,经过独立轻量MLP回归坐标。为匹配预训练时序位置编码,采用位置插值适配视频长度,仅新增极少量参数,不会破坏主干预训练时空建模能力。

所有任务统一使用单一L2损失,不再为深度、分割、姿态分别设计定制损失函数。传统多任务训练需要反复调平衡权重,GenCeption直接把任务差异转移到数据预处理阶段:深度图采用对数归一化消除尺度歧义,法线统一值域,不同任务仅调整训练数据混合比例,大幅降低多任务调参成本。

2.3 可规模化合成数据训练管线

图 | 深度、法线预测定性效果示例

现实带标注高质量视频数据集稀缺,尤其是同时包含深度、法线、分割、人体关键点、相机位姿多标签素材。GenCeption完全以合成虚拟视频作为主要训练数据,仅指代分割补充少量真实数据集。

数据生成流程:采用800组人物3D资产+200套CMU动作捕捉动画,搭配多样HDRI场景、可变相机焦距生成7500段合成视频,Blender批量渲染多模态真值(深度、掩码、人体关节)。训练前统一将RGB输入、多模态目标全部编码缓存为潜向量,大幅加速训练速度。

这套数据方案的核心优势:无需大量人工标注、可无限扩充人物动作与场景,同时带来极强仿真到真实世界迁移能力,也是模型数据效率碾压竞品的关键。

03 性能、数据效率、涌现能力三重突破

实验不单纯罗列刷榜数字,分层解读指标真实价值,同时对比V-JEPA、VideoMAE等主流预训练基线,明确GenCeption行业定位。

3.1 多任务统一SOTA,单模型对标数十款专用专家模型

图 | 左:多任务雷达图(通用模型vs各领域专家模型);右:数据效率对比曲线

左雷达图覆盖表面法线、深度、相机位姿、前景抠图、文本指代分割、3D人体六大主流视频感知任务。14B GenCeption通用模型在绝大多数基准上和DepthAnything3、SAM3、D4RT、Sapiens等专用模型持平甚至超越;仅少数细分任务略低于单任务专家微调版本,但差距极小。

图 | 多任务定量对比节选

14B通用模型在Hi4D法线mAE=11.47,KITTI深度AbsRel=0.156,EMDB人体MPJPE=71.8,对比专用模型没有明显短板。

需要客观说明指标边界:现有SOTA专用模型大多采用百万级真实标注视频训练,GenCeption仅依靠少量合成数据达到同等精度,纸面性能差距意义远不及数据效率优势。

3.2 碾压级数据效率:仅竞品1/7~1/500训练量即可持平精度

图 | 数据效率曲线直观体现核心工程优势

在深度估计统一测试基准上,D4RT、VGGT-Ω需要百万级训练帧,GenCeption仅需0.9M1.23M帧,数据量缩减7500倍仍能实现相近AbsRel误差。

图 | 预训练基线横向对比

同等微调数据下,基于文生视频WAN主干的GenCeption全面超过V-JEPA、VideoMAE最大版本模型。核心原因是视频扩散预训练强制模型学习真实世界4D时序因果、物体恒存、物理交互,而掩码自监督仅学习局部视觉纹理,缺少全局几何逻辑。

图 | 迁移不同预训练层数的训练损失曲线

从零随机初始化DiT训练损失几乎不下降,随着迁移预训练层数增加,收敛速度与最终精度同步提升,完整预训练层损失最低,证明视频生成预训练得到的世界先验是通用视觉的核心底座。

3.3 三大原生涌现能力

这是传统专用视觉模型完全不具备的特性,也证明视频扩散模型学到了通用世界表征,而非单一任务拟合特征。

1. 仿真到真实零样本迁移

模型全程仅用人形合成视频训练,无需真实人物素材,直接适配户外、室内各类真实视频,深度、分割细节甚至优于渲染合成素材(图6人物发丝、动物毛发精细预测)。单物体训练,支持多实例真实场景推理

训练视频单帧仅包含单人,但输入多人、多物体真实画面,可精准区分不同目标完成分割、姿态预测(图10a)。

图 | 泛化能力效果图:多人物实例泛化

2. OOD域外类别零样本泛化

训练集只有人类,输入猫、猩猩、河马、机器人等完全未训练物体,依旧能精准输出深度、掩码、3D关键点(图10b)。

图 | 泛化能力效果图:跨类别零样本(动物、人形机器人)

指代分割测试中,训练未出现“火箭”,输入提示词the rocket仍可精准分割目标。

图 | 文本指代分割定性结果,支持颜色、空间、运动、未知物体推理

该特性意味着模型掌握物体通用几何结构,而非记忆人类专属特征,距离通用世界模型更近一步。

04 工程落地价值与长远行业影响

4.1 短期落地场景价值

1. 多模态视频分析平台

安防、影视后期、虚拟拍摄仅部署单套模型,通过提示词切换深度、抠图、人体姿态、镜头位姿分析,替代5~10款独立推理模型,大幅降低显存与算力开销。

2. 数字人、虚拟内容生产

依靠合成数据训练,无需大量真人拍摄标注,一次性完成人体法线、关键点、前景分割,大幅降低虚拟资产制作标注成本。

3. 低成本机器人视觉感知

室内机械臂、巡检机器人依靠少量仿真数据训练,同时完成深度、物体分割、关键点检测,无需分别训练感知网络,降低机器人数据采集风险与成本。

4.2 中长期行业变革意义

长久以来计算机视觉和NLP存在巨大鸿沟:NLP依靠生成式预训练实现大一统,视觉却始终任务割裂。GenCeption直接证明文生视频生成是视觉领域等价于LLM下一词预测的通用预训练范式

未来视觉基础模型不再需要分别训练分割、深度、姿态专用底座,一套文生视频预训练主干,通过统一表征+文本提示即可适配绝大多数感知任务,彻底改变视觉模型研发流水线。同时涌现的跨类别、仿真转真实能力,为通用机器人世界模型、具身智能提供全新训练路径。

4.3 待解决开放问题

平衡稠密像素输出与稀疏关键点两类任务的表征冲突,缩小通用模型与单任务专家精度差距;

  1. 拓展流式长视频推理,适配监控、自动驾驶长时序连续感知;
  2. 扩充合成数据物体、极端环境覆盖范围,提升恶劣工况、非常规物体泛化能力;
  3. 轻量化蒸馏方案,让通用视觉模型落地嵌入式边缘设备。

05 写在最后

GenCeption打破计算机视觉长期碎片化研发模式,证实大规模文生视频扩散模型内置完整4D时空、几何、图文世界先验,可作为通用视觉基础模型的预训练底座。

通过将迭代扩散改造为单步前馈架构、统一多模态输出至RGB像素空间、合成数据多任务微调三大创新,实现单主干通吃深度、法线、分割、3D人体、相机位姿等数十类视频感知任务,数据效率远超传统自监督与专用模型路线,同时诞生仿真到真实、跨类别零样本等涌现能力。

尽管通用多任务训练存在小幅精度损失、轻量化落地受限等短板,但该工作打通了“生成模型反向作为感知底座”全新技术路线,为统一通用视觉大模型、具身智能世界模型提供极具参考的完整框架,或将重塑后续视觉基础模型的研发思路。

Ref

论文标题:Video Generation Models areGeneral-Purpose Vision Learners

论文链接:https://arxiv.org/abs/2607.09024

项目链接:https://genception.github.io/

http://www.jsqmd.com/news/1236425/

相关文章:

  • 掌握HLAE:终极Counter-Strike内容创作工具完整指南
  • 深度解析ipatool:App Store IPA下载与逆向工程实战指南
  • 企业软件需求不断增加,项目范围应该如何控制?
  • 2026漯河电能质量评估检测排名 TOP5 CMA 资质提供电网谐波、闪变波动、功率因数上门检测一站式服务 联系方式推荐 - 鉴安检测
  • SpringBoot10-自动配置原理
  • 从入门到精通:Plotly数据集应用终极指南 [特殊字符]
  • 深度链接协议实现原理与技术架构完整解析
  • 如何在华为HarmonyOS设备上免费使用Google服务:microG完整配置指南
  • 2026 年 7 月最新更新:闲谈靠谱代理记账公司哪家好?武汉本地前五名代理记账服务商参考 - 品牌智鉴榜
  • AI Agent安全边界设计与权限治理实践
  • 为什么选择Electron Vite Monorepo?Vue 3 + TypeScript桌面开发新选择
  • 企业管理系统为什么上线后没人用?流程和员工体验问题分析
  • TiDB In Action性能优化:10个提升查询效率的实用技巧
  • 如何用Ansible自动化管理gh_mirrors/pi/pi-cluster:新手也能轻松掌握
  • 如何快速部署rstat.us:10分钟搭建私有微博服务的完整教程
  • 【小程序计算机毕业设计案例】基于 SpringBoot 的数字化商品供货配送服务系统 多商户供货协同管理服务小程序(程序+文档+讲解+定制)
  • ACE-Step UI:免费本地AI音乐创作终极指南 - 开源Suno替代方案
  • 2026沈阳电能质量评估检测排名 TOP5 CMA 资质提供电网谐波、闪变波动、功率因数上门检测一站式服务 联系方式推荐 - 鉴安检测
  • 2026 温州代理记账十大排名,注册公司代理记账狠人优选指南 - 品牌智鉴榜
  • 2026自驾游大容量充电宝实测榜单:新国标合规轻量快充,EAK巨能充登顶首选 - GrowUME
  • 2026苏州第三方验房检测排名 TOP5 CMA 资质提供房屋质量检测、水电验收、墙面地面检测一站式服务 联系方式推荐 - 科信检测
  • 全网视频下载神器:res-downloader让资源获取变得如此简单!
  • AionUi:本地AI协作平台的架构革新与多智能体生态解析
  • Unity实时通信新选择:NativeWebSocket如何简化WebSocket集成难题?
  • 告别手动更换封面!SteamGrid让你的非Steam游戏也拥有精美网格图
  • 2026卫生资格考试题库性价比实测排名,第一名果然是它 - 医考机构品牌测评专家
  • 2026年储物空间优化高端旧房翻新推荐:住商收纳系统空间扩容优质品牌选择指南 - 全域品牌推荐
  • 2026年7月最新宁波奉化区江口街道亨得利官方名表服务中心电话公示 - 亨得利官方博客
  • 新驾校 vs 老牌驾校怎么选为什么宝鸡懂行的人更推荐 28 年的冶峰驾校 - 优企甄选
  • 【小程序计算机毕业设计案例】基于 SpringBoot 的社区养老服务与保障信息管理小程序 常态化社区养老保障数字化服务系统(程序+文档+讲解+定制)