Pixelle-Video AI视频生成指南:输入一个主题,5分钟做出专业短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
你脑子里有个好创意,想剪成短视频,却卡在学剪辑软件、写脚本、找素材、录配音这一堆事上?Pixelle-Video 就是来解决这个的。它是一个 AI 全自动短视频引擎:你只输入一个主题,它自己写文案、配 AI 图、合成语音、加背景音乐,最后拼出一条完整视频。这篇会带你从零跑通它,并讲清楚哪些地方最容易踩坑。
🚀 极速上手:3步跑通第一个AI视频生成
整个过程不到3步:装好依赖、填一个 API Key、点生成按钮,就能拿到成片。
第一步:装环境并启动 Web 界面
先装好两个依赖:uv(Python 包管理器)和ffmpeg(视频处理)。然后:
- macOS / Linux:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video ./start_web.sh- Windows:clone 后运行
start_web.bat
脚本会自动拉起 Web 界面并打开http://localhost:8501。
第二步:填 AI 服务密钥
首次打开,展开「系统配置」面板,填两块:
- LLM 配置:选一个模型(通义千问、GPT、DeepSeek、Ollama 都行),填 API Key
- 图像 / 视频生成:配本地 ComfyUI 地址,或 RunningHub / 直连 API 的密钥
填完点「保存配置」。
第三步:输入主题,点生成
- 左侧「内容输入」选「AI 生成内容」,输入主题,比如"如何提升工作效率"
- 中间栏选个 TTS 工作流(默认 Edge-TTS 即可)、挑个视频模板
- 点右侧「生成视频」,等 2-5 分钟,成片自动播放
视频存在output/目录。跑通这一步,剩下的都是微调。
🧩 能力拆解:Pixelle-Video 的4条流水线怎么用
它把"一条视频"拆成文案、画面、声音、合成四段流水线,每一段你都能单独换模型。
1. 智能文案生成
- 能做什么:给主题,输出结构完整的解说词,并自动拆成分镜
- 怎么用:选「AI 生成内容」输入主题即可
- 有什么讲究:想要更稳的文案,选 temperature 低的模型;已有稿子就选「固定文案内容」,还能按段落、按行或按句子分割
2. AI 配图 / 配视频
- 能做什么:每个分镜自动配一张插画,或生成一段动态视频
- 怎么用:选图像工作流(FLUX、Qwen 等)或视频工作流(WAN 2.1),工作流都在 工作流配置目录 里
- 有什么讲究:配图风格由"提示词前缀"控制,填英文描述(如"黑白火柴人简笔画"),改这一行就能换整套画风
3. 语音合成(TTS)
- 能做什么:把文案读成配音,支持多种音色
- 怎么用:选 TTS 工作流(Edge-TTS 免费、Index-TTS 支持声音克隆)
- 有什么讲究:想用自己或他人的声音,就上传参考音频走声音克隆,Index-TTS 效果最好
4. 模板与合成
- 能做什么:把画面、字幕、配音、BGM 按模板拼成 MP4
- 怎么用:在 模板目录 里按尺寸选,竖屏、横屏、方形都有
- 有什么讲究:
static_开头是纯文字模板(不生成媒体,最快);image_用 AI 图;video_用 AI 视频
⏱️ 效率对比:从半天到5分钟,它到底省在哪
同样一条 3-5 分镜的短视频,传统做法要半天,用它只要几分钟。
| 制作环节 | 没有 Pixelle-Video | 有了之后 |
|---|---|---|
| 脚本 | 自己研究写,1-2 小时 | AI 自动写,30 秒内 |
| 配图 | 找素材 / 拍摄 | AI 逐镜生成 |
| 配音 | 录音设备 + 后期 | TTS 一键合成 |
| 剪辑 | 学软件 + 手动拼 | 自动按模板合成 |
| 总耗时 | 3-8 小时 | 约 3-5 分钟 |
数据是典型值,实际看分镜数、网络和你选的模型。真正省时间的不是某一环,而是把"写稿→找图→录音→剪辑"这条串行链条压成了一个按钮。
🎬 真实场景演练:3类人怎么用AI短视频
同一个工具,教师、电商、个人博主的用法完全不同,但口诀都是"定主题→选模板→选音色"。
🎓 教师做科普:把概念拆成易懂片段
- 谁在用:要讲"黑洞形成原理"的老师
- 怎么操作:选「AI 生成内容」写主题;模板选
image_book(横屏用image_film);音色选清晰的教学音 - 拿到什么:AI 把复杂概念拆成易懂片段,每段配对应插画,直接发给学生
🛒 电商做推广:一条成片带出一串系列
- 谁在用:想给新品做宣传片的卖家
- 怎么操作:主题里塞进产品卖点和关键词;模板选和调性匹配的(商务用
image_modern);音色选有说服力的 - 拿到什么:一条有卖点、有画面、有 BGM 的成片,改个主题就能再出一条系列
📷 个人博主日更:声音克隆统一声线
- 谁在用:日常分享生活感悟的博主
- 怎么操作:想用自己的声音就走声音克隆(Index-TTS + 参考音频);模板选治愈风;BGM 选内置或自定义
- 拿到什么:统一声线加统一风格,批量出"日更"内容不费神
想要方形图(发 Instagram 那种),用 1080x1080 的image_minimal_framed模板:
⚠️ 避坑与调优:新手最常踩的3个坑
九成"生成失败"和"效果差",都出在配置没对齐和模板选错,不是模型不行。
坑1:ComfyUI 连不上现象是点生成卡在"生成配图"。先点「测试连接」,确认 ComfyUI 真的在跑、URL 对(默认http://127.0.0.1:8188)、防火墙没拦。Docker 用户要把 URL 换成host.docker.internal:8188。
坑2:配图风格全跑偏别怪模型,去改"提示词前缀"。它是英文的,决定整套画风,改完点「预览风格」先试一张,再批量跑。
坑3:想要 AI 配图却没配 ComfyUIstatic_纯文字模板才不需要 ComfyUI,又快又稳,新手先用它跑通;选了image_*却没媒体服务就会卡住,这时要配本地 ComfyUI、RunningHub 或直连 API。
省钱配置:有显卡就用 Ollama(本地 LLM)加本地 ComfyUI,成本 0;没显卡就用通义千问加本地 ComfyUI,一条视频大概 0.01-0.05 元。默认项参考 配置文件示例。
❓ 读者FAQ:费用与效果,最关心的4个问题
关于"要不要钱、效果差怎么办",这里给你能直接照做的答案。
Q1:第一次生成一条要多久?3-5 分镜的视频一般 2-5 分钟,看 LLM 响应、出图速度和网络。它在按"文案→配图→配音→合成"一步步跑,右侧有实时进度,别急着关。
Q2:效果不满意怎么救?按这个顺序换,每次只动一个:
- 换 LLM 模型(改文案风格)
- 改提示词前缀(改配图风格)
- 换 TTS 工作流或上传参考音频(改声音)
- 换模板和尺寸(改版式)
Q3:要花多少钱?
- 免费:Ollama + 本地 ComfyUI = 0 元
- 推荐:通义千问 + 本地 ComfyUI ≈ 0.01-0.05 元/条
- 云端:OpenAI / RunningHub,贵但不用本地环境
Q4:必须装 ComfyUI 吗?不一定。纯文字static_模板不用,直接能跑;要 AI 配图或配视频才需要,可用本地 ComfyUI、RunningHub 或直连 API。
现在打开终端,运行./start_web.sh,填好 API Key,输入你的第一个主题,点「生成视频」。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考