ComfyUI-WanVideoWrapper:4步快速跑通你的第一条WanVideo AI视频
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
ComfyUI-WanVideoWrapper 是面向 WanVideo 视频生成模型的 ComfyUI 自定义节点包,覆盖文本生成视频、图像生成视频、上下文窗口长视频三类能力。只要你有一块 NVIDIA 显卡和装好的 ComfyUI,就能在约半小时内产出第一条 AI 视频,1.3B 模型最低 5GB 显存即可运行。
官方示例图片,配合 example_workflows 目录里的图像转视频工作流使用
🛠 搭好环境:硬件要求与安装步骤
先看两档硬件基准,数据来自仓库 README 的实测记录:
- 最低档:NVIDIA 显卡 +8GB 显存,跑1.3B轻量模型即可(官方实测 81 帧窗口生成 1025 帧长视频,显存占用不到5GB)
- 推荐档:16GB 以上显存,跑14B高质量模型(512x512 分辨率、81 帧、交换 20/40 个块做卸载,实测约16GB)
最小安装步骤(在 ComfyUI 的上级目录执行,共 3 行):
git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper ComfyUI/custom_nodes/ComfyUI-WanVideoWrapper cd ComfyUI/custom_nodes/ComfyUI-WanVideoWrapper pip install -r requirements.txt用 Windows 便携版 ComfyUI 的用户,把最后一条命令换成python_embeded\python.exe -m pip install -r指向 requirements.txt 的路径即可。
下载模型文件后按 README 指定路径存放:
- 文本编码器 →
ComfyUI/models/text_encoders/ - Clip vision 模型 →
ComfyUI/models/clip_vision/ - 主视频模型(Transformer)→
ComfyUI/models/diffusion_models/ - VAE →
ComfyUI/models/vae/
作者个人推荐fp8 scaled量化版模型,显存占用更低而质量接近;主模型加载器同时也支持 GGUF 格式。装完重启 ComfyUI,节点菜单里会出现WanVideoWrapper分类。
🏃 跑通第一个结果:4步从提示词到视频
- 加载示例工作流:在 ComfyUI 中导入 example_workflows/ 里的 JSON,新手建议从
wanvideo_2_1_14B_I2V_example_03.json(图生视频)或wanvideo_2_1_14B_T2V_example_03.json(文生视频)开始。 - 对号入座:把工作流里的模型加载节点指向你刚放进上面 4 个目录的文件,把提示词改成你自己的创意文本,分辨率和帧数保持默认。
- 排队生成:点击 Queue Prompt。采样核心是 WanVideoSampler 节点,默认30 步、cfg 6.0、shift 5.0、unipc 调度器——第一次运行不要动这些值。
- 查看结果:视频写入 ComfyUI 的
output目录,生成期间节点会显示进度条。
如何确认成功:output 里出现视频文件,且画面没有明显的块状撕裂或闪烁,就算跑通了。想要更长的视频,再接一个 WanVideoContextOptions 节点——官方用 81 帧窗口 + 16 帧重叠跑出了 1025 帧的长视频。
它能帮你做什么:6个高频场景
| 场景 | 输入→输出 | 上手难度 |
|---|---|---|
| 文本生成视频(T2V) | 文本提示词 → 视频 | ★ 简单 |
| 图像生成视频(I2V) | 图片 + 提示词 → 带运动的视频 | ★ 简单 |
| 长视频生成 | 提示词 + 上下文窗口参数 → 1000帧以上视频 | ★★ 中等 |
| ReCamMaster 运镜重拍 | 现有视频 → 新镜头运动的视频 | ★★★ 较难 |
| VACE 视频编辑 | 视频 + 参考图 → 重排/编辑后的视频 | ★★★ 较难 |
| 说话人头像(FantasyTalking / MultiTalk) | 人物图 + 音频 → 对口型说话视频 | ★★★ 较难 |
除此之外,wrapper 还支持 SkyReels、ATI、Uni3C、MoCha、WanAnimate、LongCat-Video 等数十个扩展模型,完整清单在 readme.md 的 "Supported extra models" 一节,按名称对照即可。
说话人头像与图像转视频场景的示例输入,人物正脸图片
📋 关键参数速查
最影响结果的 5 个参数,默认值都写在采样与上下文节点里:
| 参数 | 推荐值 | 调大的变化 | 调小的变化 |
|---|---|---|---|
steps(采样步数) | 30(默认) | 质量更高、耗时更长 | 更快,容易模糊和伪影 |
cfg(提示词强度) | 6.0(范围 0–30) | 更贴合提示词,易过饱和 | 运动更发散,易偏离描述 |
context_frames(帧窗口) | 81(范围 2–1000) | 连续段更长、显存更高 | 显存更低,窗口拼接更多 |
context_overlap(窗口重叠) | 16(范围 4–100) | 窗口衔接更平滑、更慢 | 更快,边界易出接缝 |
blocks_to_swap(块交换) | 20(14B 共 40 块,1.3B/5B 共 30 块) | 显存更低、速度更慢 | 更快,显存更高 |
补充一点:若用 TeaCache 加速,新版节点的阈值要比旧版高约10 倍,配合系数时0.25–0.30是比较稳的区间,start step 可保持 0。
📦 新手常见问题
1. 装完找不到 WanVideoWrapper 节点,或节点报红
- 确认仓库是直接 clone 进
custom_nodes目录,没有被多包一层文件夹 - 重新执行 requirements.txt 安装,留意终端里的依赖报错
- 完全重启 ComfyUI,查看控制台是否有 import 错误
2. 生成过程中爆显存(OOM)
- 换成1.3B模型 + fp8 scaled 权重,分辨率先降到 512x512
- 调大
blocks_to_swap,14B 模型可从默认 20 块逐步加到 30–40 块 - 把
context_frames从 81 降到 49 或 33,并开启 tiled VAE 分块解码
3. 开启 torch.compile 后第一次运行显存异常高
- 用相同输入尺寸再跑一次,triton 缓存建立后显存通常会回落
- 仍异常就按 README 指引清理 triton 缓存目录(Windows 默认在
C:\Users\<用户名>\.triton) - 先关掉 torch.compile 保证能出片,新版 wrapper 已降低对 compile 的依赖
下一步往哪走
跑通基础工作流后,建议两条路线并行:一是在 example_workflows/ 里按场景翻 JSON,ReCamMaster 运镜、Fun 相机控制、Ovi 音视频同步都有现成文件可直接加载;二是回头精读 readme.md,重点理解上下文窗口与块交换这两组参数的取舍,再去挑战 1000 帧级别的长视频生成。
图像转视频场景下,毛绒玩具这类静物也能动起来
别急着改参数,先把wanvideo_2_1_14B_I2V_example_03.json完整跑通一次,再换成你自己的提示词。连续生成 2–3 次满意结果后,再开始逐个调整 cfg 和窗口参数。
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考