今天给大家演示的是一个基于Wan2.1 VACE系列的 ComfyUI 视频生成工作流,整个流程通过加载扩散模型与 LoRA 结合文本提示,生成高质量的视频片段,并支持对输入视频进行扩展与再创作。
在效果层面,这个工作流能够将一段简单的输入视频素材,转化为带有艺术感和电影氛围的动态影像,直观展示了文本到视频的生成能力,同时支持多种分辨率和帧数配置,适合在不同显卡条件下进行实验与创作。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- CLIPTextEncode(Positive Prompt) 控制视频主体语义与风格
- CLIPTextEncode(Negative Prompt) 排除不需要的错误视觉
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
该工作流围绕视频生成与编辑展开,涵盖模型加载、文本编码、采样解码、掩码扩展、尺寸调整以及最终视频导出等环节。整体结构清晰,将文本与视频元素有机结合,用户能够在不同分辨率与时长设定下快速得到期望的视频结果。
核心模型
工作流依托 Wan2.1 系列扩散模型与 VAE、文本编码器配合实现视频生成,其中 14B 版本模型提供更高的画质与分辨率支持,而 1.3B 模型则在速度与硬件占用方面更具优势。搭配 CausVid LoRA,可在保证画面质量的同时大幅度缩短生成时间,从而提升效率与可操作性。
| 模型名称 | 说明 |
|---|---|
| wan2.1_vace_14B_fp16.safetensors | 高精度大模型,支持 480P 与 720P 视频生成,画质更佳,但推理耗时较长 |
| wan2.1_vace_1.3B_fp16.safetensors | 中等规模模型,仅支持 480P,速度快,适合硬件资源有限场景 |
| wan_2.1_vae.safetensors | 负责视频潜空间与图像间的解码 |