LTX-Video 本地部署指南:8GB 显存可跑,10 秒视频约 12 秒出片
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
在一张 8GB 显存的 RTX 4060 上,LTX-Video 2B 蒸馏版(10 步采样)约 12 秒生成 300 帧 1216×704 视频;16GB 卡直接上 13B 蒸馏。
上机前先自查一遍
显存决定一切,先查卡再下权重。8GB 卡锁定 2B 蒸馏,16GB 卡选 13B 蒸馏,dev 版留给 24GB 以上追质量的场景。
| 配置文件 | 最低显存 | 适合谁 | 一句话点评 |
|---|---|---|---|
| ltxv-2b-0.9.8-distilled | 8GB | 8GB 卡、快速迭代 | 10 步采样,权重约 5GB,跑起来最省心 |
| ltxv-13b-0.9.8-distilled | 16GB | 生产主力 | 13B 画质 + 蒸馏的 10 步,性价比最高 |
| ltxv-13b-0.9.8-distilled-fp8 | 16GB | 16GB 卡想再快一点 | fp8(8 位量化省显存),前提装好 Q8-Kernels |
| ltxv-13b-0.9.8-dev | 24GB | 追极限画质 | 30 步采样,质量上限,速度最慢 |
官方验证环境:Python 3.10.5、CUDA 12.2、PyTorch ≥ 2.1.2;pyproject.toml把 transformers 锁在 4.47.2–4.52 区间,pip 装依赖时别覆盖。先跑两条预检:
nvidia-smi python -c "import torch; print(torch.cuda.is_available(), torch.version.cuda)"第一条应打印你的卡型号和显存;第二条预期输出True 12.2。三类情况先劝退:GTX 10 系/老 Turing 卡跑不了 fp8,只能 bfloat16 且 13B 大概率爆显存;纯 CPU 或 Mac MPS 能跑但没有任何 offload(把闲置模块挪到 CPU)加速,只适合小批量试 2B;fp8 配置未装 Q8-Kernels 时,加载权重阶段直接抛Q8-Kernels not found。
从零跑通第一次:30 分钟到 mp4
不含下载权重的话,全程约 30 分钟:克隆、装依赖、首跑,共三步。首次运行会自动从 HuggingFace 拉模型权重、空间上采样器与文本编码器,2B 约 5GB、13B 约 15GB,100Mbps 带宽下 13B 约等 30 分钟。
第 1 步,克隆并建独立环境:
git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video && python -m venv venv && source venv/bin/activate pip install -e .[inference]预期:安装无冲突退出,pip list里 transformers 落在 4.47.2–4.52 区间。
第 2 步,首跑 2B 蒸馏 + 仓库自带测试图,121 帧约 4 秒成片:
python inference.py \ --prompt "A woman in a red coat walks along a seaside promenade, waves crashing behind her, golden hour light" \ --conditioning_media_paths tests/utils/woman.jpeg \ --conditioning_start_frames 0 \ --height 704 --width 1216 \ --num_frames 121 --seed 42 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml预期:先出现权重下载进度(等待环节,视带宽几分钟到半小时),随后日志打印Padded dimensions与采样进度;RTX 4060 上 121 帧生成约 5 秒。
第 3 步,验收。成功标准:outputs/<当天日期>/下出现video_output_*.mp4,日志最后一行为Output saved to ...,期间nvidia-smi显存未触顶;同 seed 重跑同一命令可复现同一条片。
按手里的素材选玩法
三种玩法共用同一个 推理入口,差别只在传哪几个参数。
文生视频:只给一句话,直接出片
手里没有任何素材、想先验证提示词写法时用,纯文本生成。
python inference.py \ --prompt "A red bicycle rolls down a cobblestone street in an old town, pigeons scattering, evening light" \ --height 704 --width 1216 --num_frames 121 --seed 7 \ --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml| 参数 | 推荐值 | 为什么 |
|---|---|---|
| prompt | 200 词内 | 少于 120 词会触发自动扩写,多等约 10 秒 |
| num_frames | 121 | 满足 8n+1 规则,30fps 下约 4 秒 |
| guidance_scale(配置内) | 蒸馏配置为 1 | 蒸馏版免 CFG(无分类器引导,文本-画面对齐手段);dev 配置建议 3.0–3.5 |
常见错误:height/width 不满足 32 整除时不会报错,而是自动补边再裁回目标尺寸,白耗一块补边区域的显存——直接给 704×1216 这类合规值。
图生视频:让一张静图动起来
有产品图或人物照时,把它当锚定关键帧,模型围绕它生成运动。
python inference.py \ --prompt "Slow push-in on a ceramic mug, steam drifting upward, soft window light" \ --conditioning_media_paths ./mug.png \ --conditioning_start_frames 0 --conditioning_strengths 1.0 \ --height 704 --width 1216 --num_frames 121 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml| 参数 | 推荐值 | 为什么 |
|---|---|---|
| conditioning_start_frames | 0 | 锚定帧号,首帧条件写 0 |
| conditioning_strengths | 0.8–1.0 | 越接近 1 画面越忠于原图 |
| image_cond_noise_scale | 0.15(默认) | 给条件帧加噪,防止画面僵死 |
常见错误:paths、start_frames、strengths 三者数量不一致时,infer在采样开始前就抛ValueError,连权重加载都省了。
视频扩展:给已有片段接前接后
手里有一段素材,想往前或往后续写;方向由conditioning_start_frames切换。
python inference.py \ --prompt "The cyclist keeps pedaling toward the lake, camera tracking from the side" \ --conditioning_media_paths clip.mp4 \ --conditioning_start_frames 0 \ --num_frames 257 --seed 42 \ --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml| 参数 | 推荐值 | 为什么 |
|---|---|---|
| conditioning_start_frames | 0 | 从片尾接上;想给片头补,写 num_frames − 原片段帧数 |
| 条件片段帧数 | 8n+1(9/17/25…) | 不满足会被裁掉首尾,日志出现 trim 警告 |
| num_frames | 8 的倍数,如 257 | 原片段 + 新增帧的总目标长度 |
常见错误:整段改风格的视频到视频(v2v)不是加参数,而是改用--input_media_path喂整段素材,构图基本保留;它的显存占用和纯生成相同,8GB 卡先降到 576×1024 再跑。
嫌慢、嫌糊、嫌崩,三处能调
显存不够(CUDA OOM)
- height/width 降到 576×1024:显存随像素数近似线性,减半分辨率省约 60%。
- num_frames 从 121 改 81:帧数直接决定时序长度。
- 16GB 卡换 fp8 配置:8 位量化压显存,但必须装 Q8-Kernels。
- 30GB 以下显存的卡加
--offload_to_cpu:把闲置模块挪 CPU,代价是生成时间多约 20%,只救急不提速。
速度慢
- dev 换蒸馏版:采样步数从 30 步降到 10 步(蒸馏配置 timesteps 为 7+3),零改动提速。
- prompt 压在 120 词以上:低于阈值触发自动扩写,多走一遍文本扩写模型。
- 8GB 卡别硬扛 704×1216:迭代阶段用 576×1024,出片再升分辨率。
效果不对
- 帧间抖动、动作跳变:配置里
stg_mode改成attention_values(四个选项之一,官方默认值)。 - 细节糊、色彩失真:
decode_noise_scale调到 0.02–0.03,默认 0.025,影响 VAE 解码色彩。 - 文本和画面对不上:核对配置里
text_encoder_model_name_or_path是否下全;中文提示词遵循度差,先英文写再润色。
烧多少钱:算笔账
性能档位为 1216×704@30fps 单卡实测口径(参考数据,不同驱动与批大小下需实测验证):
| 显卡 | 配置 | 吞吐 | 121 帧(约 4 秒) | 300 帧(10 秒) |
|---|---|---|---|---|
| RTX 4060(8GB) | 2b-distilled | 约 25 FPS | 约 5 秒 | 约 12 秒 |
| RTX 4090(24GB) | 13b-distilled | 约 35 FPS | 约 3.5 秒 | 约 8.6 秒 |
| A100(80GB) | 13b-distilled | 约 35 FPS | 约 3.5 秒 | 约 8.6 秒 |
租卡口径的月成本与日吞吐:
| 档位 | 硬件 | 月成本 | 日吞吐(10 秒视频) |
|---|---|---|---|
| 个人 | RTX 4060 × 1 | 约 ¥300–500 | 约 500 段 |
| 小团队 | RTX 4090 × 2 | 约 ¥3000–5000 | 约 5000 段 |
| 企业 | A100 × 8 | 约 ¥30000–50000 | 约 50000 段 |
非实时负载走竞价实例可再降 60% 以上;单张 4090 开 3–5 路并发是 13b-distilled 的舒适区,再往上就得堆卡。
出事了查这张表
| 现象 | 原因 | 解法 |
|---|---|---|
| CUDA out of memory | 704×1216@121 帧超出显存 | 降到 576×1024 + num_frames 改 81,16GB 卡可换 fp8 配置 |
Q8-Kernels not found | fp8 配置未装 Q8 内核 | 按 Q8-Kernels 官方说明安装,或临时切回 bfloat16 配置 |
| 权重文件缺失或大小不对 | 自动下载中断 | 核对配置里checkpoint_path(13B 约 15GB),重跑触发续传 |
| pip 依赖冲突、环境损坏 | transformers 超出 4.47.2–4.52 区间 | 全新 venv +pip install -e .[inference] --force-reinstall |
| 帧间抖动、动作跳变 | 时空引导模式不匹配 | 配置stg_mode改为attention_values |
| 细节模糊、色彩失真 | VAE 解码参数偏移 | decode_noise_scale调到 0.02–0.03 |
| 条件项报错 ValueError | 三个条件参数长度不一致 | paths / start_frames / strengths 数量对齐后重跑 |
有 8GB 卡就先跑 2b-distilled 走通全流程,上生产切 13b-distilled,fp8 兜底提速,追极限画质再上 dev 并备好 24GB。
关键词:LTX-Video 部署、LTX-Video 本地推理、LTX-Video 图生视频、LTX-Video 蒸馏模型、LTX-Video 显存要求
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考