Pixelle-Video AI短视频生成教程:数字人口播与声音克隆自动出片
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
做一条短视频要写脚本、拍素材、剪辑、配音,流程太重。Pixelle-Video 是一款 AI 短视频生成引擎,把这条链路全部自动化:输入一个主题,它自动写文案、生成配图和视频、配上解说与背景音乐,直接产出成片。下面按实用场景拆开讲,先懂它能干什么,再看怎么上手。
初印象:输入一个主题,拿到带文案、配音的成片
一句话定位 Pixelle-Video:输入是"一个主题",输出是"能直接发布的短视频"。中间的文案由 LLM 撰写,配图和动态画面由图像/视频生成模型产出,解说由 TTS 合成,剪辑环节完全不需要你参与。
它适合三类人:想运营自媒体但不会剪辑的;有内容选题但没空拍素材的;想体验声音克隆但不想写代码的。
成片里到底有什么
每个分镜包含:AI 写的解说词、一张配图或一段动态画面、一行合成配音,整体叠加背景音乐。成片自动保存到output/文件夹,在 Web 界面里可直接预览。
实操场景一:三步选对生成流水线
Pixelle-Video 内置多条生成流水线,在 Web 界面顶部切换,对应实现都在 web/pipelines/ 目录。
按素材情况选流水线
- 没有素材,只有想法:选「快速创作」。输入「为什么要养成阅读习惯」这样的主题,LLM 写脚本并自动拆分镜,默认 5 个分镜。
- 不想出镜,但想要口播感:选「数字人口播」。给一段文本、两张图片、一段音频,AI 生成数字人口播视频,不用真人拍。
- 手头已有插画,想让它动起来:选「图生视频」。图片加提示词生成动态片段,可搭配动态模板使用。
- 有自己的照片或录像:选「自定义素材」。AI 分析你的素材后配文案、配配音。
此外还有「动作迁移」:给一张图和一段参考视频,把视频里的动作复刻到图上。
三十多种视觉模板,按画幅挑
视频画面由 HTML 模板决定,全部放在 templates/ 目录,命名前缀区分类型:static_纯文字(不生成 AI 媒体,速度最快)、image_配 AI 图、video_动态背景。竖屏 1080x1920 对应抖音快手,横屏 1920x1080 对应 B 站、YouTube。
拿不准就先选默认模板,点「预览模板」用示例内容看排版,满意再定。
实操场景二:TTS 怎么选,怎么克隆自己的声音
配音是短视频的灵魂。Pixelle-Video 的 TTS 走工作流机制,系统自动扫描 workflows/ 目录中tts_前缀的工作流供你选择。
TTS 方案速查
| 方案 | 特点 | 声音克隆 |
|---|---|---|
| Edge-TTS | 开箱即用、免部署,支持多语言音色 | 不支持 |
| Index-TTS | 音色自然,需 ComfyUI 工作流 | 支持 |
第一次用选默认 Edge-TTS 就行;想让解说变成"自己的声音",就上 Index-TTS。
用 10 秒参考音频克隆自己的声音
- 录一段清晰参考音频(MP3/WAV/FLAC,10~30 秒,避开背景噪音);
- 在「语音设置」里选支持克隆的 TTS 工作流,上传参考音频;
- 输入一句测试文本,点「预览语音」试听,满意后直接生成。
参考音频质量直接决定克隆效果,杂音大的录音克隆出来也会糙。细节见声音克隆文档。
进阶:把流水线改成你自己的
对默认效果满意之后,每个"原子能力"——生图、生视频、TTS、素材分析——都可以替换:
- 懂 ComfyUI:把自己的工作流 JSON 放进 workflows/(
selfhost/放本地用的、runninghub/放云端用的),界面会自动识别。想把默认生图模型换成别的,只需替换图像生成工作流。 - 不想装 ComfyUI:用「直连 API」方式接模型供应商,Web 界面支持配置 DashScope、OpenAI、Seedream、Seedance、Kling 的密钥,还能单独开本地代理。
- 想要专属画面排版:从
templates/复制一个模板改 HTML/CSS,存到对应尺寸子目录即可。
零基础上手:从克隆仓库到第一条成片
- 克隆仓库:
git clone https://gitcode.com/gh_mirrors/pi/Pixelle-Video - 装好两个前置依赖:Python 包管理器
uv和视频处理工具ffmpeg(macOS 可brew install ffmpeg一步到位);Windows 用户也可直接用官方一键整合包,省去环境安装 - 在项目目录启动 Web 界面:
uv run streamlit run web/app.py,浏览器自动打开 localhost:8501 - 展开「系统配置」,填 LLM 的 API Key(通义千问、GPT、DeepSeek 都支持)和图像生成服务(本地 ComfyUI 地址或 RunningHub 密钥),点「保存配置」
- 输入主题、确认分镜数(默认 5),TTS 和模板保持默认,点「生成视频」
5 分镜的视频约需 2~5 分钟,取决于 LLM 响应速度、生图速度和网络。界面会显示每一步进度:文案 → 配图 → 配音 → 合成,完成后直接在预览区播放。
避坑手册:三个高频问题
配音合成老是失败
现象是反复点生成都卡在语音步骤。Edge-TTS 依赖外部服务,网络波动时失败率偏高;换成tts_前缀的 ComfyUI TTS 工作流,稳定性会好很多。
ComfyUI 连接失败
先确认 ComfyUI 服务真的在运行,再核对地址(默认 http://127.0.0.1:8188),最后在界面点「测试连接」验证。手头没有本地 ComfyUI 的话,改用 RunningHub 云端或直连 API 方案绕过。
LLM 调用报错或文案质量差
Key 填错、余额不足、网络问题最常见,先看报错里的具体原因;文案风格不满意就换 LLM 预设,不同模型写出的脚本风格差别明显。
写在最后
Pixelle-Video 把写脚本、做配图、配音、合成这套活收进了一条一键流程:普通用户选流水线、选模板、选 TTS 就能拿到成片,爱折腾的人再往里塞自己的工作流和模型。按上面的步骤先零成本出一条片,再根据效果逐个替换环节,是最省时间的用法。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考