Pixelle-Video 完整指南:如何 3 步从一个主题生成 AI 短视频成片
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
你想出一条短视频的选题,坐下来却卡住了:文案不会写、配图要会提示词、剪辑还得学软件?Pixelle-Video 是一个开源的 AI 全自动短视频引擎,输入一个主题,它自动完成文案、配图、配音、合成四道工序,几分钟内产出一条能直接发布的成片。本文按「快速上手 → 风格定制 → 踩坑与花费」三部分,带你从装好环境到调出自己想要的画面。
它是什么
Pixelle-Video 的定位是一台"输入主题、输出成片"的短视频生成引擎。你只需要给一句话选题,它背后会走完四道工序:
- 文案生成:LLM 把主题扩写成 3~5 个分镜的解说词
- 配图规划:每个分镜调用图像模型生成一张对应插图
- 音频合成:TTS 把解说词转成语音,可再叠一段 BGM 背景音乐
- 视频合成:按你选的模板把图、字、音拼成最终成片
它的设计思路是"模块化解耦":四道工序每一环都是可单独替换的模块——文案用通义千问、GPT 还是本地 Ollama 都行;配图走本地 ComfyUI、RunningHub 云端,或直连 DashScope、OpenAI 等供应商 API;语音在 Edge-TTS、Index-TTS 之间切换。换掉任何一环,其他环节不受影响。
第一部分:快速上手
安装路径:整合包与源码两条
Windows 用户走整合包:到 Release 页下载 Windows 整合包,解压后双击start.bat,浏览器会自动打开 http://localhost:8501。包内已带全部依赖,不用装 Python、uv 和 ffmpeg,首次使用只需在界面里填密钥。
macOS / Linux 用户走源码:先装好uv(Python 包管理器)和ffmpeg(视频处理工具),然后执行 3 行命令:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器弹出 Web 界面,说明装好了。
首次配置清单
打开界面,展开⚙️ 系统配置面板,按顺序填三处:
- LLM 配置:从下拉菜单选一个模型预设(通义千问、GPT-4o、DeepSeek、本地 Ollama),预设会自动填好 base_url 和模型名,你只补API Key。没有显卡建议选通义千问,性价比最高;有显卡直接选 Ollama,走 0 元路线。
- 图像生成:想跑本地就填 ComfyUI 地址(默认
http://127.0.0.1:8188),点测试连接验证通过再保存;想省事就在「API 媒体模型配置」里填 RunningHub 或 DashScope、OpenAI、Seedream、Kling 的密钥,直连云端模型。 - 点保存配置,第一步就绪。
生成第一条 AI 短视频
左侧栏内容输入选「AI 生成内容」,输入一个具体主题——越具体越好,"为什么要养成阅读习惯"比"读书"更容易出好文案。中间栏依次选 TTS 工作流(默认 Edge-TTS 即可)、图像生成工作流、视频模板(新手推荐竖屏 1080×1920)。右侧点生成视频按钮。
5 分镜的视频大约 2~5 分钟出片,界面会实时报进度,比如"分镜 3/5 - 生成插图"。完成后视频自动播放,文件存在output/目录。
第二部分:让它变成你的风格
模板怎么选:三种尺寸与命名前缀
模板决定画面版式,全部放在 templates/ 目录,按尺寸分三组:
- 竖屏 1080×1920(25 套):适配抖音、快手、小红书
- 横屏 1920×1080(5 套):适配 YouTube、B 站
- 方形 1080×1080:适配朋友圈、Instagram
文件名前缀告诉你它走哪道工序:static_*是纯文字静态模板,不跑 AI 生图,出片最快、零成本,新手可以先从这类起步;image_*用 AI 生成的图片当背景;video_*直接用 AI 生成的视频当背景。每套模板都能在界面里预览并传自定义参数试效果。
方形版式紧凑,发朋友圈正合适:
四种替换:画风、音色、工作流、模板
Pixelle-Video 把能力拆成"原子"模块,每种替换都有明确的操作入口:
- 换配图画风:图像生成换一套工作流(ComfyUI 工作流或
api/...直连模型),再在提示词前缀里填一段画风描述(用英文,如 "minimalist black-and-white matchstick figure style"),点预览风格先试再生成,全片配图风格随之统一。 - 换音色:TTS 工作流在 Edge-TTS、Index-TTS 之间切换;选支持声音克隆的引擎后上传一段 MP3/WAV 参考音频,AI 短视频就会用你自己的声音说话。
- 换工作流:在 ComfyUI 里搭好工作流、导出 JSON,丢进 workflows/ 目录,界面下拉框里立即可选,不用改一行代码。预置工作流分
selfhost/(本地跑)和runninghub/(云端跑)两套,详见 工作流定制文档。 - 换模板:复制一个现有 HTML 模板改样式,存到对应尺寸目录。模板支持
{{ title }}、{{ text }}、{{ image }}三个变量,改起来比写代码快。
第三部分:踩坑与花费
排障清单:四类故障按现象对号
出问题时先定位"卡在哪道工序",再按表排查,故障排查文档 有完整清单:
| 现象 | 常见原因 | 处理办法 |
|---|---|---|
| 连不上 ComfyUI | 服务没启动 / 地址填错 / 防火墙拦截 | 确认服务在跑、地址是默认的http://127.0.0.0.1:8188还是你自己改过的,界面里点测试连接直接验证 |
| LLM 调用失败 | API Key 错 / 网络不通 / 余额不足 | 按 Key、网络、余额三件事依次核对,错误提示通常会直接说明原因 |
| 出图失败 | 模型没下全 / 磁盘空间不足 / 工作流文件损坏 | 先在 ComfyUI 里手动跑一遍同样工作流,跑通再回来看环境 |
| TTS 语音失败 | 工作流选错 / 参考音频格式不支持 | 检查 TTS 工作流选择;用声音克隆时确认参考音频是 MP3/WAV/FLAC |
效果不好但不报错,就依次拉四个杠杆:换 LLM 模型(管文案风格)→ 调提示词前缀和图像尺寸(管画风)→ 换 TTS 工作流(管音色)→ 换模板(管版式)。
成本算账:三档方案对比
| 方案 | 成本 | 适合人群 |
|---|---|---|
| Ollama 本地 LLM + 本地 ComfyUI | 0 元 | 有本地显卡的用户 |
| 通义千问 + 本地 ComfyUI | 约 0.01~0.05 元/条 | 大多数用户 |
| OpenAI + RunningHub 云端 | 较高(按调用量计) | 不想维护本地环境 |
有显卡直接走全免费档;没有的话通义千问性价比最高,一条 3 分镜的 AI 短视频花费不到一瓶水。批量生成前,先出一条样本确认效果再跑量,能省掉返工烧掉的 API 费用。
现在就可以展开系统配置、填好密钥,挑一套竖屏模板,输入你第一个主题,几分钟内拿到一条能直接发出去的成片。更多细节看 官方文档 与 配置示例 config.example.yaml。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考