当前位置: 首页 > news >正文

视频生成之LongLive-2.0详解:如何把 5B 长视频生成推到 45.7 FPS

写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

长视频生成把扩散模型的成本同时推向三个方向:时间序列越长,训练时的激活、VAE 编码和 DiT 计算越重;自回归推理不断累积 KV cache;最终的视频还要经过 VAE 解码,模型侧“帧率很高”并不等于用户很快拿到成片。

LongLive-2.0把这些瓶颈视为一个训练—推理协同问题。训练侧以 Balanced Sequence Parallelism(Balanced SP)重新排列 clean history 与 noisy target,让每张 GPU 同时承担上下文和监督目标,并把 VAE 编码按相同时间块切开;NVFP4 随后覆盖 AR 训练和少步蒸馏。推理侧采用 W4A4 NVFP4、FP4 KV cache、并行反量化与异步流式 VAE 解码。算法侧则用分块提示和双层 attention sink 支持多镜头、交互式长视频。

64 秒训练中,NVFP4 + Balanced SP 将单次迭代从 BF16 + SP 的 1372.9 秒降至 639.5 秒;2-step 版本在 5B、720p 设置下达到 45.7 FPS。速度并非没有代价:VBench 总分从 BF16 4-step 的 85.06 降到 NVFP4 2-step 的 83.14,VBench-Long 的动态程度也出现明显下降。

猫先生认为,LongLive-2.0 的技术价值在于把低精度从“训练完再压缩”的末端操作,提前成了数据布局、训练数值格式、缓存表示和解码调度共同遵守的系统约束。45.7 FPS 是这套协同设计的结果,不能只归功于 FP4。

  • 论文标题:LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
  • 论文地址:https://arxiv.org/abs/2605.18739
  • 项目主页:https://nvlabs.github.io/LongLive/LongLive2/
  • GitHub:https://github.com/NVlabs/LongLive
  • HuggingFace:https://huggingface.co/Efficient-Large-Model/LongLive-2.0-5B
  • 示例数据集:https://huggingface.co/datasets/Efficient-Large-Model/LongLive2.0-Toy-Dataset

图 1:LongLive-2.0 的 BF16 / NVFP4 多镜头样例,以及训练速度、推理速度和显存对比。来源:论文 Figure 1。

原文脉络

第 1 节把长视频生成的成本拆成训练、推理和部署三类瓶颈。第 2 节介绍 Balanced SP 与 NVFP4 训练,第 3 节沿 W4A4 推理、KV cache 量化和异步 VAE 解码展开。第 4 节补齐多镜头 AR 训练与 attention sink,第 5 节评估速度、显存和生成质量,第 6 节总结硬件依赖等限制。相关工作、12 万条多镜头数据的构造、SP 细节和量化消融被放在附录。

1. Introduction:长视频需要端到端基础设施

已有长视频工作主要改造生成算法,例如使用因果注意力、滑动窗口或 Self-Forcing 式蒸馏。系统实现仍有两处断裂。其一,训练和部署精度不同:常见 PTQ 在 BF16 训练结束后才把模型压到 4 bit,数值误差没有进入训练适配。其二,许多速度报告只计算扩散模型,不计算 KV cache 管理和 VAE 解码,难以代表端到端延迟。

LongLive-2.0 基于 Wan2.2-TI2V-5B,把双向扩散模型直接微调成分块自回归模型。每个时间块根据已经生成的 clean history 去噪当前 noisy target,多个镜头可以绑定不同提示词。整套系统同时覆盖长视频训练、少步蒸馏和流式推理。

附录中的相关工作进一步界定了它的位置。Ring Attention、DeepSpeed-Ulysses 和各类视频 SP 主要优化通用长序列的通信或激活显存,没有处理 AR teacher forcing 特有的 clean/noisy 成对布局;既有 FP4 视频方案多集中在部署期 PTQ,也缺少低精度训练、KV cache 与解码流水线的统一实现。LongLive-2.0 因此更接近一篇系统论文:生成算法提供工作负载结构,贡献集中在如何让这类结构稳定地跨卡、跨精度运行。

图 2:训练侧组合 AR training、Balanced SP、NVFP4 和独立 DMD LoRA;推理侧组合 W4A4、FP4 KV cache、并行反量化与异步解码。来源:论文 Figure 2。

2. Training Infrastructure:Balanced SP 与 NVFP4 如何配合

2.1 Balanced SP:让每张 GPU 都拥有 clean 与 noisy 时间块

高效 teacher forcing 会把同一段视频编码成两条流:clean latent 提供历史上下文,noisy latent 作为当前预测目标。块稀疏注意力允许每个 noisy chunk 读取此前的 clean chunks 和自身 noisy tokens,一次前向即可监督多个时间块。

普通 Sequence Parallelism 直接切分[all clean; all noisy]长序列,容易让部分 GPU 主要拿到 clean token,另一些 GPU 承担带损失的 noisy token,计算负载不均;VAE 还可能在各 rank 上重复编码完整视频。

Balanced SP 改为按时间范围分配所有权。每个 rank 本地编码自己的原始视频块以及覆盖 VAE 时间感受野的左侧 halo,再构造同一时间段的 clean / noisy latent。Ulysses All-to-All 交换后,注意力在通信原生的交错序列上直接生成 teacher-forcing mask,无需每层先重排成[all clean; all noisy]。VAE 的单卡编码量由整段视频缩小到“局部块 + halo”,损失 token 也均匀落到各卡。

图 3:传统 SP 存在 loss 负载不均和重复 VAE 编码;Balanced SP 统一了视频块、clean/noisy latent、注意力 mask 与 loss 的分片方式,右侧 NVFP4 进一步加速 GEMM。来源:论文 Figure 3。

猫先生认为,Balanced SP 的新意不在 All-to-All 本身,而在于让 teacher forcing 的语义结构决定并行布局。它优化的是 clean/noisy 配对、VAE 前处理和损失负载这一整条路径,属于算法结构与并行执行的联合设计。

2.2 NVFP4:用训练感知的 4 bit 对齐部署

NVFP4 用 E2M1 保存 4 bit 数值,每 16 个元素配一个 FP8 E4M3 block scale,整个张量再配 FP32 global scale。线性层的权重采用二维 block scaling,激活与梯度采用一维 block scaling;归约、归一化统计和优化器状态等敏感部分继续保留较高精度。权重梯度路径还使用 Random Hadamard Transform 缓解异常值对量化的影响。

AR 训练和 DMD 蒸馏都在 NVFP4 下运行。DMD 中的 generator、real-score 与 fake-score 共置于 GPU,量化主干被冻结,只训练 LoRA。作者还为 block scale 比较“映射最大值到 6”与“映射到 4”两种编码,逐块选择重建误差更小的方案,缓解 E2M1 在高幅值区间过稀的问题。

2.3 Clean Pipeline:长视频能力与少步能力分开训练

Self-Forcing 系列通常经历 ODE 初始化、短视频 DMD、长视频继续训练等阶段。LongLive-2.0 先用 12 万条经过镜头切分和逐镜头描述的长视频,直接把基础扩散模型训练成长、多镜头、可交互的 AR 模型;另一条支路从原始 Wan2.2 模型独立训练少步 DMD LoRA。训练完成后,把 LoRA 注入不同 AR checkpoint,即可把 4 步推理压到 2 步。

这 12 万条视频按 16—32 秒、32—64 秒和 64 秒以上三档均匀分布。数据管线先切分镜头,再从场景、人物、动作和摄影语言等维度生成结构化描述,最后合并为跨镜头叙述;带水印、剧烈抖动、异常倍速、过曝、失焦和低运动量的样本会被过滤。所谓“直接长视频训练”依赖的并不只是并行效率,还包括能为分块提示和镜头切换提供监督的数据组织。

图 4:AR 长视频训练与少步 LoRA 蒸馏可以并行进行,LoRA 最后注入 AR 模型,省去 ODE 初始化和多阶段 long tuning。来源:论文 Figure 4。

独立 LoRA 提高了复用性,但“clean pipeline”依赖强数据和大规模基础设施。AR 阶段使用 32 张 GB200、训练 600 次迭代,消耗约 1920 GB200 GPU 小时;DMD LoRA 还需 16 张 GB200、5000 次迭代和约 60 GPU 小时。流程阶段少了,资源门槛仍然很高。

3. Inference Infrastructure:模型、缓存与解码一起降成本

3.1 W4A4 与 FP4 KV cache

部署时,权重和激活均使用 NVFP4,即 W4A4。训练期间已经适应目标精度,因此比直接 PTQ 更接近 BF16 质量:4-step VBench 总分分别为 BF16 85.06、PTQ NVFP4 84.04、预训练 NVFP4 84.51。

KV cache 随历史长度线性增长。LongLive-2.0 按 8 帧一块量化 K/V,block scale 与模型 NVFP4 路径保持一致,实际压缩比约 3.6 倍。定制 CUDA kernel 并行恢复滑动窗口内的缓存块,量化和反量化开销控制在 2% 以下。

3.2 异步流式 VAE 解码

集中式解码会先积累全部 latent,再顺序执行 VAE。LongLive-2.0 把 3D VAE 改成逐块解码并立即卸载到 CPU,同时单独使用一张 GPU 运行 VAE:DiT 生成下一块 latent 时,VAE 并行解码上一块。这样 VAE 显存由随视频块数量线性增长,变为只保留一个时间块。

图 5:FP4 KV cache 控制历史显存,并行反量化取回当前窗口;独立 VAE GPU 与 DiT 流水执行。来源:论文 Figure 6。

异步解码把 64 秒视频的端到端时间从 99.5 秒降到 57.6 秒,但它使用了额外一张 GPU。这个数字证明流水线能隐藏解码开销,也意味着“端到端加速”与“单卡效率提升”应分开理解。

4. Algorithm-level Designs:多镜头提示与双层 Attention Sink

每个 latent chunk 绑定自己的文本提示,提示在 chunk 边界切换即可形成新镜头,已经生成的历史无需重新计算。滑动窗口让每步注意力成本保持有界,却会在旧帧离开窗口后逐渐丢失人物和场景锚点。

Multi-Shot Attention Sink 同时保留两组 anchor:视频最开始的global sink维持全局人物身份,当前镜头最开始的shot-level sink维持镜头内部的外观和布局。提示切换时只重新绑定 shot-level sink,global sink 与此前历史保持不变;shot sink 只用起点和长度指针定位,不需要额外复制 KV。

图 6:global sink 跨镜头保留身份,shot-level sink 在每次场景切换后重新锚定局部一致性。来源:论文 Figure 7。

这套机制处理的是长视频生成中两种不同时间尺度的记忆:跨镜头应保留“是谁”,镜头内部还要保留“此刻长什么样、场景如何摆放”。固定一个全局首帧无法同时完成两项任务。

5. Experimental Results:速度、显存与质量的交换关系

5.1 训练效率

输入长度BF16 无 SPBF16 + SPBF16 + Balanced SPNVFP4 + Balanced SP
16 秒75.3 s52.2 s45.8 s40.1 s
32 秒202.7 s162.7 s136.8 s119.3 s
64 秒OOM1372.9 s1196.5 s639.5 s

序列越长,NVFP4 的收益越明显,因为 GEMM 在总耗时中的占比上升。DMD 三模型逐步量化后,单卡峰值显存从 70.5 GB 降至 49.0 GB,即 BF16 基线的 0.69 倍。

原论文 Figure 1 把 1372.9 和 639.5 标成毫秒,Table 1 标题与第 5.1 节正文则明确使用秒;本文按表格和实验正文采用秒。这处单位不一致不影响 2.15 倍的相对加速比,但复现时不应直接混用绝对延迟。

5.2 推理效率

64 秒视频设置FPS端到端时间峰值显存
BF16,4 steps24.8112.9 s36.4 GB
NVFP4,4 steps32.096.0 s29.7 GB
+ NVFP4 KV cache29.799.5 s19.4 GB
+ 异步解码29.757.6 s19.4 GB
NVFP4,2 steps45.736.3 s19.4 GB

KV cache 量化优先换取显存,因反量化带来轻微速度损失;异步解码主要缩短端到端等待;少步 LoRA 才把模型吞吐推到 45.7 FPS。三项优化解决的是不同瓶颈。

表中的 FPS 与端到端时间是两个指标。45.7 FPS 描述模型侧吞吐;包含流式 VAE 后,64 秒视频需要 36.3 秒完成,约为 1.76 倍实时速度。它依然达到实时生成,但不能把 45.7 FPS 直接当作完整流水线的最终输出帧率。

5.3 生成质量

短视频 VBench 中,LongLive-2.0 BF16 4-step 得到 85.06,NVFP4 4-step 为 84.51,NVFP4 2-step 为 83.14。速度从 24.8 FPS 提升到 45.7 FPS 的同时,总分下降 1.92。

60 秒 VBench-Long 中,BF16 与 NVFP4 的平均排名分别为 3.67 和 3.83。NVFP4 的主体一致性略升至 97.62,背景一致性维持在 96.97,但动态程度由 BF16 的 60.62 降到 45.88。量化版本仍保持较强长程一致性,运动丰富度却是需要继续观察的质量维度。

猫先生认为,论文用速度、显存和基准质量构成了较完整的证据,但 45.7 FPS 对应NVFP4 + 2-step LoRA + Blackwell 原生支持 + 异步解码流水线。脱离这组软硬件条件单独引用帧率,会高估方法在普通 GPU 上的可迁移性。

6. 结论、局限与可复现性

NVFP4 的核心加速依赖 Blackwell Tensor Core。A100、H100 等非 Blackwell GPU 缺少原生 FP4 kernel,论文提供 SP inference 作为替代,并用 4 bit KV cache 降低 All-to-All 通信,但无法获得完全相同的单卡低精度路径。

质量评测以 VBench 和 VBench-Long 为主,多镜头交互能力主要由演示与 attention sink 消融支撑,尚缺少大规模用户交互、镜头级提示遵循和叙事一致性评测。异步解码还增加一张专用 GPU,部署成本需要结合吞吐并发量计算。

官方已经开放代码、5B 权重、NVFP4 2-step / 4-step 模型和示例数据,复现接口相对完整;完整训练仍需要 GB200 集群、自定义 CUDA / Triton kernel 与较高 GPU 时预算。

LongLive-2.0 把长视频系统拆成四个相互咬合的层次:Balanced SP 负责长序列训练布局,NVFP4 对齐训练与部署精度,量化 KV cache 和异步 VAE 处理端到端推理,多镜头 sink 稳定长程记忆。读者应带走的判断是:长视频“实时化”不是把扩散步数降到 2 就结束了,训练布局、数值格式、历史缓存和解码流水线必须一起设计。

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

http://www.jsqmd.com/news/1271989/

相关文章:

  • 2026年AI查重工具评测与选型指南
  • TMS320C6421 DSP外设深度解析:定时器、PWM、VLYNQ与GPIO实战指南
  • PSO优化BP神经网络的MATLAB实现与调优
  • 学术写作AI检测应对:语义重构技术解析与实践
  • RPIC 2026:机器人感知与智能控制前沿技术解析
  • ArXivMax:AI论文自动转视频的技术原理与实战教程
  • 西门子S7-200 PLC实现水泵一用一备控制系统详解
  • LLaMA Factory:大模型微调实战指南与优化策略
  • Frida动态插桩技术:深入解析Spawn与Attach模式在Windows MFC程序逆向中的应用
  • 嵌入式BI在SaaS产品中的技术架构与优化实践
  • 前端国际化测试自动化:伪语言与视觉回归测试的CI集成实践
  • 具身智能之DualVLN详解:2 Hz 负责认路,30 Hz 负责避障——如何拆开推理与控制
  • 三菱iQ-R系列PLC控制系统开发与优化实战
  • AI内容检测与降AI率技术全解析
  • C++虚函数与多重继承内存布局深度解析:从原理到调试实战
  • Python量化实战:用TuShare搭建A股情绪周期量化指标
  • Solon AI Remote Skills架构解析与企业级实践
  • 2026年7月双鸭山监控设备回收/监控设备回收优质公司推荐_双鸭山市云起安防科技有限责任公司 - 品牌宣传支持者
  • 创业路演PPT怎么写,投资人想看什么
  • 2026年环保项目信息获取:市场开发的核心竞争力与制胜关键
  • 大语言模型在情感分析中的技术演进与应用实践
  • Wukong AICRM Docker化部署全流程解析:从环境搭建到生产实践
  • Meta AI升级:从问答工具到持续任务助手的工程实践
  • 学术写作智能助手:提升研究生论文效率的AI工具
  • YOLOv26在智能安防中的实时目标检测优化实践
  • 2026 年新消息:雄县优秀的阻燃挤塑板源头厂家哪家权威,这个材料如何让你的产品瞬间“免责”? - 行业严选官
  • FinBERT金融情感分析实战:从模型部署到交易策略
  • Java插件实现DICOM文件断点分片上传:架构设计与工程实践
  • Python datetime类深度解析:从核心原理到时区处理实战
  • 培华安全初级 第一次作业