当前位置: 首页 > news >正文

第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频)

特别说明:本篇文章是建立在前期文章的基础上的,有些前期文章已经讲过的细节问题,本章内容可能不会重复,若有看不懂的地方,请先看前期文章。

上一章我们实现了LTX-2.3模型,首尾帧视频工作流的搭建。

这一章我们将去实现,LTX-2.3模型,图像音频转视频工作流的搭建。图像音频转视频就是给一个人物的照片,再给一段录音,让图片中的人物把这段录音说出来。

有的同学可能会说了,LTX不是本身就能生成音频吗?为啥还要单独去弄个录音?

因为如果我们要创建一个数字人模特,除了外形好看,他的声音也得有自己的特色!就像我们人一样,每个人都有自己的音色,那么我们的数字人也是需要自己固定的音色的。你不能今天说话是这个声音,明天又变成了另外一个声音。

和前面一样我们先去看官方的图像音频转视频工作流是怎么搭建的。

一、官方高度集成版工作流

第一步:进入模板

第二步:搜索“LTX-2.3”,选择“图像音频转视频”工作流

先看看他所用到的模型,这些模型文件我们前面已经下载好了,这里重新选择一下,改成自己的路径就ok了!

我们先用这个工作流试试效果,这里有个小技巧,大家看下图,我给的这个音频是7s的时长,我给的视频长度要求是8s。因为如果视频也要求7s的时长的话,那么视频最后的一个字一般都不完整。

二、图像音频转视频工作流详解

这个工作流是做数字人很实用的工作流,我们就参考官方工作流,来一步一步的来自己搭建一个属于自己的工作流。

1)加载模型文件,这里面用到的文件,我们前面都已经下载过了,直接用就行。lora是ltx官方替工的一个加速lora。

2)加载两个clip文版框,用来输入提示词。

3)添加视频分辨率(高、宽)、帧率、时长,这里需要注意LTX2.3要求视频分辨率的高、宽必须能比32整除,因此其720P视频的分辨率为( 横板1280 × 704 竖版704 × 1280)、
1080P视频的分辨率为(横板1920 × 1056 竖版896 × 1536)。

4)加载图片并对图像进行处理(详细介绍请看前期文章)

5)构建生成尺寸二分之一的图像潜空间,缩小采样提升速度(详细介绍请看前期文章)

6)音频材料加载

7)音频裁剪,由于有时候音频时长会比较长比如1分钟,我们没法一次性生成一个1分钟的视频,需要分段去生成,因此需要对音频进行裁剪。设置一个起始时间,裁剪一段和视频时长相同的音频。

8)构建音频的潜空间

这里面我们需要主义的是这个“纯快遮罩”,他的作用是生成一张纯色、无渐变、矩形整体遮罩图。

明度 0.0(全黑遮罩)采样器看到这个 mask:音频 latent 整片区域禁止添加噪声,这样音频编码出来的特征全程被保护,采样过程不会破坏音频信息,保障音画联动、口型稳定,不会出现音频条件失效。

明度 1.0(全白遮罩)采样器允许对 audio_latent 正常加噪声。这样模型会改动音频潜空间,容易破坏原始音频特征,大概率导致音画脱节、口型乱掉。

9)汇总提示词条件和帧率

10)将视频和音频汇总到一个潜空间

11)实现初次采样(详细介绍请看前期文章)

12)对初次采样的结果进行二次放大,因为我们在初次采样时是在原本设置的分辨率上缩小1/2进行采样的,所以需要加一个二次放大,再使图像恢复到原本的分辨率。

我的电脑配置如果不加二次放大,直接一次采样出结果,720P的视频,会比先一次缩小采样 加 二次放大采样多出来近1倍的时间。

13)对放大后的图像进行二次采样 并 输出视频。

---------结束线---------

到这里,我们图像音频转视频的工作流就全部搭建好了。本篇文章发布后,我会在我们的交流群,把今天我们搭建好的工作流文件分享到群共享文件。

有兴趣的朋友可以加一下交流群,平时学习中有什么困惑,也可以和群里的朋友们互相交流。

如果大家在阅读文章的时候有什么困惑,可以在文章的底部留言,我看到的第一时间就会进行回复。

再一个,也可以在赞赏文章后,针对所赞赏文章的内容,有不明白的地方,可以和我约个时间,进行一对一的实时交流,赞赏金额不限制,多少都可以!

http://www.jsqmd.com/news/1256162/

相关文章:

  • 荣耀Robot Phone机械云台解析:四自由度防抖与大师电影模式
  • 2026年打房产继承官司靠谱的律师怎么选:文天文房产业务诉讼团队专业权威 - GrowthUME
  • AI分子设计:深度学习如何革新药物与材料研发
  • 解锁AMD Ryzen隐藏潜力:SMUDebugTool硬件级调试完全指南
  • Revit 公式能力技术文档
  • AI模型代码兼容性检测实战手册:从TensorFlow 1.x到PyTorch 2.4,6步完成零误差平滑迁移
  • 2026年在湖北评职称继续教育有什么要求?一文详细给你讲清楚
  • 纤维球过滤器(运行原理)-杭州鑫凯
  • 生物医药科研协作平台架构深度评测:十大技术选型指南
  • C++的引用折叠与完美转发:类型推导的深层机制
  • springboot社区垃圾分类系统微信小程序
  • 从零散文件到标准化管理:高效文件命名与批量处理实践
  • Istio 环境搭建与 Sidecar 注入实战:从安装到验证
  • AI Agent记忆系统:分层记忆体系的技术架构与实践
  • Unity手游植被渲染优化:GPU Instancing与Culling Group实战指南
  • 普通人南京卖黄金全过程|透明交易流程手把手教学 - 奢侈品回收评测
  • 10分钟用Godot Open RPG搭建可运行RPG原型:模块化框架实战指南
  • 免费虚拟显示器终极方案:为Windows瞬间扩展10个虚拟屏幕的完整指南
  • 【IEEE出版】第三届数字媒体、通信与信息系统国际学术会议(DMCIS 2026)
  • SMUDebugTool:AMD锐龙处理器硬件调试的完整指南
  • Flutter从入门到进阶:一本面向鸿蒙时代的实战电子书
  • MSP430F5529 LaunchPad USB开发实战:从零到复合设备
  • 大语言模型技术演进:从Transformer到GPT-4的突破与应用
  • ARMday06-IMX6ULL-CCM clock tree
  • 九大网盘直链下载终极指南:告别限速,重获下载自由
  • #define 和 const 的区别
  • 40+平台直播录制终极指南:一次配置永久值守的技术探秘
  • 湖南首批养老护理员技师、高级技师考前辅导在长启动 高技能养老人才评价迈入新阶段 - 资讯速览
  • Chrome滚动截图神器:一键保存完整网页的终极解决方案
  • 大众点评数据采集终极指南:轻松破解动态字体加密,获取全站商家信息