Pixelle-Video:一个主题 3 分钟出片,AI 短视频生成完整上手指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
手里有一个选题,却卡在没有剪辑软件、没有配音员、也没人帮忙配图的环节?Pixelle-Video 是一个 AI 短视频生成引擎:输入一个主题,它自动完成文案撰写、AI 配图、语音解说、背景音乐和视频合成,产出完整成片。按官方口径,一个 3~5 个分镜的视频大约 2~5 分钟即可生成,全程不需要打开剪辑软件。
它替你自动化了哪几件事
传统流程里,一条口播短视频要过文案、素材、配音、配乐、剪辑五道工序,每道工序都得动手。Pixelle-Video 把这五道工序压进一次点击:
- 写稿:LLM 根据主题生成解说词,支持 GPT、通义千问、DeepSeek、Ollama 等模型
- 配图:为每个分镜生成 AI 插图,也支持图生视频
- 配音:调用 Edge-TTS、Index-TTS 等工作流合成语音,可用参考音频克隆音色
- 配乐:叠加内置或自定义的 BGM
- 合成:按模板逐帧合成,最终视频落在
output/目录
第一次上手:从克隆到出片
安装:克隆仓库并装好依赖
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video源码方式需要两个前置工具:Python 包管理器uv和视频处理工具ffmpeg(Linux 上sudo apt install ffmpeg,macOS 上brew install ffmpeg)。Windows 用户也可以直接下项目发布的一键整合包,双击start.bat即可,不用装环境。
配置:启动后填两组参数
./start_web.sh浏览器打开http://localhost:8501后,展开「系统配置」面板,必须填两处:一是 LLM 的模型和 API Key(决定文案质量);二是图像生成来源,三选一——本地 ComfyUI 地址、RunningHub API Key,或直连 DashScope、OpenAI、Kling 等模型的密钥。只跑纯文字模板可以只配 LLM。点「保存配置」即可。
首次生成:输入主题,盯着进度条
在左侧「内容输入」选「AI 生成内容」,填一个主题(如"为什么要养成阅读习惯"),默认 5 个分镜;中间栏确认 TTS 工作流(默认 Edge-TTS)、模板(推荐竖屏 1080x1920)和图像尺寸;右侧点「生成视频」。进度条会按"生成文案 → 生成配图 → 合成语音 → 合成视频"滚动,完成后视频自动播放,文件保存在output/目录。
挑 3 个典型用法先试
AI 生成内容:一个主题出完整解说
适合"有观点没素材"的场景。输入主题后,AI 负责写稿、配图、配音一条龙,生成界面还会显示实时进度(如"分镜 3/5 - 生成插图")。知识科普、观点分享类主题最顺手,分镜数量可以在输入区调整,控制视频长短。
固定文案:现成脚本直接成片
文案已经写好时,切到「固定文案内容」模式,把脚本贴进去,系统跳过 AI 写稿,直接按段落、行或句子切分成分镜去配图配音。小说解说、带货话术这类已有成稿的内容,省一次 LLM 调用也省时间。
自定义素材:上传自己的照片和视频
「自定义素材」模式允许上传自己的照片和视频,AI 分析素材内容后生成对应解说脚本;如果选了支持动态视频的模板,还能按旁白音频时长生成 API 视频片段。旅行 vlog、生活记录这种"素材是自己的、文案懒得写"的内容,走这条路。
把它调成你的风格
- 换模板:模板是 HTML 文件,按分辨率放在 templates/ 下,命名规则即类型:
static_*.html纯文字、不用生成媒体;image_*.html用 AI 图片做背景;video_*.html用 AI 视频做背景。改文字位置、配色、布局就是改 CSS,新模板按对应尺寸目录放进templates/就能在下拉菜单里选到。 - 统一配图风格:「提示词前缀」写一段英文风格描述(如极简火柴人插画风),所有配图都会带上这段风格约束,界面里可以先「预览风格」再决定用不用。
- 加自己的工作流:熟悉 ComfyUI 的话,把导出好的 JSON 放进 workflows/(
selfhost/或runninghub/目录),图像、视频、TTS 工作流都会被 Web 界面自动扫描出来;支持声音克隆的 TTS 工作流还能在界面上传参考音频。
资源和成本怎么配
- 本地免费:LLM 走 Ollama + ComfyUI 本地部署 + Edge-TTS,官方明确标注 0 元方案,需要本地显卡
- 云端按量:LLM 用通义千问,图像/视频走 RunningHub;
config.example.yaml里的默认配置就是本地 ComfyUI + RunningHub 的image_flux工作流 - 混合搭配:日常批量内容用经济模型,重点内容换高质量模型;每个供应商在「API 媒体模型配置」里可单独开关代理
容易踩的几个坑
- ComfyUI 连接失败→ 服务没起、URL 或端口填错、防火墙拦截 → 确认 ComfyUI 正在运行,核对地址(默认
http://127.0.0.1:8188),在界面点「测试连接」 - LLM 调用报错→ API Key 填错、断网、余额不足 → 先核对 Key,再看错误提示定位具体原因,别急着换模型
- 视频生成中断→ 工作流文件损坏、ComfyUI 没下载对应模型、磁盘或显存不足 → 依次检查工作流是否存在、模型是否下过、空间是否够用
- 生成太慢→ 分镜多、走云端、LLM 响应慢 → 减少分镜数量,把云端工作流换成本地,或改用响应更快的 LLM;3~5 分镜正常就是 2~5 分钟,超出太多再排查
继续深挖
- 配置与上手细节:docs/zh/getting-started/(含配置说明和快速上手)
- 模板开发规范:docs/zh/user-guide/templates.md
- 故障排查手册:docs/zh/troubleshooting.md
打开模板文档挑一个竖屏模板,把你的主题填进内容输入区,先出第一条成片再谈调参。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考