LTX-Video 上手指南:文生视频、图生视频与多条件帧控制
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
LTX-Video 是一个基于 DiT(Diffusion Transformer)视频模型架构的实时 AI 视频生成模型,覆盖文生视频、图生视频和帧级参考控制,并提供可视化界面与命令行两种入口,适合想做零代码视频生成的创作者:你不需要写代码,一段文字几分钟就能变成视频。它的多条件控制还能让你在指定帧上放一张图片或一段短视频片段,引导模型按你的时间线出画。
LTX-Video 能替你做什么
把它理解为一个「三合一」的视频生成工具:
- 文生视频:给一段文字描述,直接产出短片,用来最快验证一个创意。
- 图生视频:给一张静图,让它动起来,首帧构图和外观保持不变。
- 多条件帧控制:在指定帧打参考点,参考点可以是图片或视频片段,逐帧约束时间线。
怎么安装、模型怎么选
环境要求:Python 3.8 或更高版本,至少 10GB 可用磁盘空间,推荐带 CUDA 的 NVIDIA 显卡;Mac M 系列芯片也可以使用。
git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video pip install .装好后先挑模型配置,常用的有三档:
| 模型 | 适用场景 | 配置文件 | 显存需求 |
|---|---|---|---|
| 13B 蒸馏 | 快速迭代,日常兼顾速度与质量 | configs/ltxv-13b-0.9.8-distilled.yaml | 中等 |
| 13B 完整 | 最终成片,追求最高质量细节 | configs/ltxv-13b-0.9.8-dev.yaml | 较高 |
| 2B 蒸馏 | 低显存机器快速出图 | configs/ltxv-2b-0.9.8-distilled.yaml | 较低 |
💡 显卡是 Ada 架构(RTX 40 系列)及更新型号时,可额外安装 FP8 内核,最高约 3 倍加速并降低显存占用。
5 分钟拿到第一个视频
最短路径就四步:
- 进入刚装好的项目目录。
- 运行可视化界面:
python inference.py --gui- 浏览器会自动打开页面;若没打开,手动访问控制台显示的地址(通常是
http://localhost:7860),在页面里选好模型配置、输入提示词并设置分辨率与帧数。 - 生成结束后,视频保存在
outputs/目录里。
如果想用一张图而不是文字来驱动画面,同一套参数加上--conditioning_media_paths指向该图片即可,图生视频的效果大致如下:
提示词怎么写才会动
视频质量很大程度取决于提示词,而不是模型本身。按五个要素组织提示词,顺序如下:
- 主体:画面里是谁或什么物体
- 动作:主要动作用一句话讲清,再补动作细节
- 外观:服装、体型、质感等可辨认特征
- 场景:环境、道具、天气等背景信息
- 镜头与光影:拍摄角度、镜头运动、光源与色调
好的示例:
一位穿红色连衣裙的年轻女子在城市街道优雅行走,长发随风扬起;阳光穿过高楼,摄像机以低角度跟拍,光影带有电影感。
对比之下,如果只写「一个女子在街上走路」,模型不知道她怎么走、镜头从哪个角度拍、光线是什么状态,结果往往是站姿呆滞或动作随机。动作描述和镜头语言这两句,正是提示词把静图变成「片子」的关键。仓库里还附带了提示词增强模块,可以把短句扩写成完整的分镜描述。
参数怎么调、精细控制怎么做
五个旋钮是每次生成都要碰的:
| 参数 | 推荐取值 | 作用 |
|---|---|---|
| 分辨率 | 512×512、768×768 等 | 宽和高都必须是 32 的倍数 |
| 帧数 | 257(约 8.5 秒) | 必须是 8 的倍数加 1 |
| 引导比例 | 3.0–3.5 | 结果贴合提示词的程度 |
| 步数 | 20–40 | 步数越多质量越高、速度越慢 |
| 种子 | 任取一个固定值 | 同种子同参数可复现同一结果 |
多条件生成值得单独说明,它的本质是「在指定帧打参考点」:用--conditioning_media_paths传入图片/视频列表,再用--conditioning_start_frames逐一对应目标帧号。例如执行python inference.py --prompt "跳舞的机器人" --conditioning_media_paths image1.jpg video1.mp4 --conditioning_start_frames 0 50 --height 512 --width 512 --num_frames 257,得到的视频第 0 帧会贴近 image1.jpg,第 50 帧起跟随 video1.mp4 的内容。
效果不对时查这里
视频闪烁?大概率是提示词内部存在冲突。先简化提示词,删掉相互矛盾的描述,再重新生成。
画面模糊?通常是分辨率过低。提高分辨率,或在生成后接潜空间上采样器补细节。
运动不自然?检查帧率设置:帧率与帧数要匹配目标平台的节奏;需要更强的动作约束时,换用深度、姿态或边缘这类控制模型。
色彩失真?先检查输入图像的色彩格式。参考图本身色彩空间异常时,生成结果会继承这份偏差。
更进一步
- 硬件选型:RTX 4090 可流畅运行 13B 模型;RTX 3060 及以上适合 2B 蒸馏模型;Mac M 系列芯片走 MPS 加速(需 PyTorch 2.3.0 以上版本)。
- 视频扩展:支持前向、后向和双向三种扩展方向;注意输入视频片段的帧数需为 8 的倍数加 1。
- 控制模型:官方提供深度、姿态、边缘检测三类控制模型,可对构图与运动做更细的约束。
- 批量生成:一次跑多个镜头时,用库里的
infer()循环调用、只换参数即可:
from ltx_video.inference import infer, InferenceConfig for i, prompt in enumerate(["一只猫跃过屏幕", "一艘船在浪上起伏"]): infer(InferenceConfig( pipeline_config="configs/ltxv-2b-0.9.8-distilled.yaml", prompt=prompt, output_path=f"out_{i}.mp4", seed=i + 1))- 生态资源:ComfyUI-LTXVideo 提供现成工作流,Diffusers 有官方集成;想改生成逻辑时,从核心 pipeline读起。
现在就用 2B 蒸馏模型在可视化界面里生成一条 512×512、257 帧的视频,把它当作基准样本,之后调参才有比较的对象。
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考