零基础 5 分钟,免费做出第一条 AI 短视频的完整上手指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一个开源的 AI 全自动短视频引擎:你输入一个主题,它自动写完文案、生成配图、合成语音,最后渲染出成片,适合老师、带货商家和想做自媒体却没有剪辑经验的人。
它能做什么,适合谁
Pixelle-Video 的定位很单一:把"写稿—找图—配音—剪辑"这条流水线整个交给 AI,你只负责出主意和按一个按钮。它支持竖屏、横屏、方形三种画幅,内置二十多个视觉模板和多种 TTS 音色。
- 老师做科普短视频:讲一个概念,自动生成解说词和配图
- 带货做产品展示:输入卖点,直接出营销向视频
- 自媒体发个人成长内容:把碎想法整理成有条理的成片
- 企业做培训宣讲:内部知识快速变成可播放的视频
零基础做出第一条视频:5 分钟
下载安装:两种方式任选
Windows 新手建议用整合包:到项目发布页下载最新 Windows 一键整合包,解压到任意目录,双击start.bat,浏览器会自动打开http://localhost:8501,不需要装 Python、ffmpeg 任何东西。
源码方式适合 Mac / Linux 或想改配置的人,先装好uv和ffmpeg,然后:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py完成后你会看到:浏览器停在 8501 端口,页面是三栏布局——左边"内容输入",中间"语音 / 视觉设置",右边"生成视频",左侧还有一个可展开的"⚙️ 系统配置"面板。
接通 AI 服务:文案模型加图像生成
首次使用展开"⚙️ 系统配置",要接两个服务:
文案模型(LLM),负责写稿,选一个填 Key 即可:
- 通义千问:中文表现好,成本低,新手首选
- GPT 系列:多语言能力强
- DeepSeek:便宜,国内访问稳定
- Ollama:本地运行,完全免费,需要电脑带显卡
图像生成,负责每句文案的配图,选一条路:
- 本地 ComfyUI:填服务地址(默认 http://127.0.0.1:8188),点"测试连接"确认能通
- RunningHub 云端:只填一个 API Key,不用显卡
- 直连 API:填 DashScope、OpenAI、Seedream、Kling 等供应商的 Key,跳过 ComfyUI
填完点"保存配置"。完成后你会看到:面板收起,配置被记住,重启程序不用再填一遍。
输入并生成:看进度条走完
在左侧"📝 内容输入"选"AI 生成内容",输入框里写主题,比如"为什么每天阅读 30 分钟能改变习惯"或"如何在家做出五分钟健康早餐",分镜数默认 5 个不动。中间栏把 TTS 工作流留默认 Edge-TTS,视频模板选一个竖屏的,想省时间可以选static_开头的静态模板——它不生成 AI 配图,纯文字排版,出片最快。然后点右侧"🎬 生成视频"。
点下去之后右侧会出现实时进度:先"生成文案",再逐条"分镜 1/5 - 生成插图",接着"合成语音",最后"合成视频"。全部走完后视频直接在右侧播放器里自动播放,下方显示时长、文件大小和分镜数,文件同时落在output/文件夹里,可以直接拿去发平台。
用好它的几种玩法
- 知识科普:输入"反脆弱是什么" → 知识类模板 + 清晰专业的男声 → 效果接近自制课程切片
- 产品展示:输入"这款保温杯的三个卖点" → 现代简约模板 + 自信语速的解说 → 可直接投放的带货素材
- 情感故事:输入"写给下班后还在加班的自己" → 治愈风格模板 + 柔和女声,配一段舒缓 BGM → 有氛围感的口播向成片
避坑提醒
- 生成要等几分钟才正常:5 分镜的片子通常 2-5 分钟,卡在"生成插图"时多半是图像服务慢,别反复点重开
- 竖屏横屏别选错:发抖音、快手选 1080x1920 竖屏模板,发 B 站、YouTube 选 1920x1080 横屏,模板按尺寸分组,跟着平台挑就行
- 想零成本跑:LLM 换 Ollama 本地模型、图像用本地 ComfyUI,整条链路一分钱不花
- 本地显卡显存不够 6GB:别再折腾本地 ComfyUI,图像生成切到 RunningHub 或直连 API
- 文案不满意:换 LLM 模型、改图像提示词前缀、换 TTS 音色,比重新写主题更快见效
进阶玩法
- 自定义素材:上传自己的照片和视频,AI 分析内容后生成匹配文案和解说,工作流在 web/pipelines/asset_based.py
- 声音克隆:在语音设置里上传一段参考音频,生成的解说接近你的音色,教程见 docs/zh/tutorials/voice-cloning.md
- 直连视频模型:选 DashScope Wan、Kling、Seedance 等 API 视频模型,让画面从静图变成动态片段,模板开发文档在 docs/zh/user-guide/templates.md
第一条视频跑通之后,剩下的功夫全花在挑模板和换音色上。工具不会替代你对内容的判断,但它把出片成本从几个小时压到一杯咖啡的时间。
- 下载整合包,确认浏览器能打开 8501 端口
- 在"系统配置"里接好 LLM 和图像生成,点"保存配置"
- 输入一个主题,先用静态模板生成第一条片子
- 再试一次图片模板 + 声音克隆
- 把
output/里的成片发到你的平台
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考