LTX-Video 实时视频生成快速上手:12 秒出一段 10 秒视频,你的显卡够格吗
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
LTX-Video 是 Lightricks 开源的 DiT 架构实时视频生成模型。它的卖点很直接:在 RTX 4090 上以 1216×704 分辨率跑到 32FPS,一张 RTX 4060 也能以 25FPS 出片——按这个速度,一段 10 秒的视频 12 秒左右就能生成完。这篇文章按"能不能跑 → 怎么跑得省 → 上生产前注意什么 → 还能怎么玩"的顺序讲清楚,全程基于仓库里现成的配置文件,不用自己调参。
8GB 显卡能跑吗?
先说结论:能,但要选对模型档位。
仓库的configs/目录下放着一整套现成配置,从 13B 全精度到 2B 蒸馏版一应俱全。8GB 显存(比如 RTX 4060)建议直接用 2B 蒸馏配置 configs/ltxv-2b-0.9.8-distilled.yaml,这个档位在我们的实测里可以在 1216×704、25FPS 下完成生成。如果你手里是 24GB 的 4090,就上 13B 蒸馏版,质量高一档,速度依然够快。
档位怎么选,一句话:显存 <12GB 用 2B 蒸馏,12-24GB 用 13B 蒸馏,追求最高画质且显存宽裕再考虑 13B 全精度 dev 版。
第一次上手:三步装完,两条命令出片
环境要求不苛刻:Python 3.10+、CUDA 12.2、PyTorch 2.1.2 以上。装完环境后,出片只需要一条命令,以图生视频为例:
python inference.py --prompt "一只狗在草地上奔跑,镜头跟随" \ --conditioning_media_paths your_image.jpg \ --conditioning_start_frames 0 \ --height 704 --width 1216 --num_frames 121 \ --seed 42 --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml这里有两个数字要记牢:分辨率两边都要能被 32 整除,帧数要满足 8n+1(比如 121、257)。上面那条命令生成 121 帧,按 25FPS 播放正好是约 5 秒。想生成 10 秒视频就把num_frames改成 257,纯文本生视频则去掉--conditioning_media_paths相关参数即可,完整参数见python inference.py --help。
显存不够时,按顺序试这三个动作
遇到 CUDA out of memory 别急着加显卡,按下面顺序来,每一步成本都很低:
- 🎯 换 FP8 配置:把
--pipeline_config指向 configs/ltxv-13b-0.9.8-distilled-fp8.yaml,13B 模型的显存占用能从 24GB 降到 16GB 左右,画质损失约 2-3%。FP8 权重在 Ada 架构(40 系)及更新的显卡上还有额外加速,需要单独安装官方的 FP8 kernel。 - 降步数、换蒸馏:蒸馏版模型不需要 classifier-free guidance 和时空引导,8 步就能出片,比非蒸馏版少跑近 4 倍步数,显存峰值自然更低。
- 降分辨率和帧数:先把宽度从 1216 降到 960 试试,帧数减半,显存压力直接砍一半,确认流程通了再调回去。
为什么这么快:配置里藏着一个两遍生成的流程
打开任意一份 0.9.8 蒸馏配置(比如 configs/ltxv-13b-0.9.8-distilled.yaml)你会看到first_pass和second_pass两段:第一遍用 0.667 倍的低分辨率跑 7 个时间步,第二遍用空间上采样器补到目标分辨率再跑 3 步。总步数只有 10 步出头,而 13B 全精度 dev 版是两遍各 30 步、外加 30-80 的 guidance 和时空引导调度——这就是"蒸馏版快十几倍"的全部原因。
底层的 3D Transformer 同时建模空间和时间两个维度,保证了帧间运动连贯,相关实现在 ltx_video/models/transformers/ 目录。调度器用的是从 checkpoint 里读取的整流流(rectified flow)时间步表,所以不同档位的"步数"不是拍脑袋定的,而是官方针对画质-速度曲线标好的。
上生产前,两个参数先定好
把 LTX-Video 接进业务前,建议先跑通两条基线:一条纯文本、一条图生视频,把下面两个参数调到位再谈规模化。
guidance_scale 不是越大越好。纯文本生成建议 3.5-4.0,图像条件生成建议 2.5-3.0;超过 5 之后画面会过饱和、细节反而变糊,我们实测 13B 蒸馏版在 4.0 附近质量最稳。
另一件事是保存 seed。同一个 seed + 同一份配置可以精确复现画面,调参对比时先固定 seed 再改参数,不然你永远分不清是参数起作用还是随机性在捣乱。并发部署时,多张 4090 跑独立实例比单卡挤吞吐更线性,2 卡方案日均处理 5000 段 10 秒视频是可行的量级。
不止文生视频:多条件控制还能怎么玩
跑通基础流程之后,这个仓库真正的玩法空间才打开,inference.py的命令行参数原生支持三种进阶用法:
- 🎬 关键帧动画:
--conditioning_media_paths可以同时传多张图,配合多组--conditioning_start_frames指定每张图出现在第几帧,中间内容由模型自由补全; - 视频续写:传一段已有视频(帧数 8n+1)作为条件,往前后任意方向延展,适合做长镜头;
- 深度/姿态/边缘控制:官方 IC-LoRA 控制模型可以按深度图、骨架图、Canny 边缘图精确驱动生成,效果可以参考仓库里的演示:
如果不想碰命令行,仓库也支持以 Python 库形式调用(from ltx_video.inference import infer, InferenceConfig),封装成 API 服务只是加一层路由的事。
现在就可以做的下一步
把 inference.py 里那两条命令抄下来,先装好环境,用你自己的任意一张图片跑一次 2B 蒸馏档位的图生视频——121 帧、1216×704,12 秒左右出结果。跑通这一次之后,再按上面"显存三个动作"的顺序往 13B 和 FP8 上迁,整条路径上没有任何一步需要自己写模型代码。
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考