news 2026/9/30 2:22:25

Pixelle-Video:AI短视频引擎安装、核心功能与进阶调优

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Pixelle-Video:AI短视频引擎安装、核心功能与进阶调优

Pixelle-Video:AI短视频引擎安装、核心功能与进阶调优

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 短视频生成引擎:输入一个主题,它自动完成文案撰写、AI 配图、语音合成和视频合成,全程不需要剪辑软件或设计经验。

本文从安装、首次出片讲起,再拆解流水线、模板、工作流三个核心模块,最后覆盖进阶用法、调优参数与落地场景,目标是让你看完能跑起来、能看懂核心逻辑。

🚀 快速上手

前置需要uv(Python 包管理器)和ffmpeg(音视频合成用,macOS 用 brew 安装、Debian 系用 apt 安装),然后克隆项目并启动 Web 界面:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py

启动后浏览器打开 http://localhost:8501,界面是三栏布局:左栏内容输入(主题/固定脚本/BGM),中栏语音与视觉设置,右栏生成按钮和预览区。首次使用要展开「系统配置」面板填两类信息:LLM 的 API Key(负责文案生成),以及媒体生成服务(本地 ComfyUI 地址、RunningHub API Key、或直连模型供应商三选一)。也可以把仓库根目录的config.example.yaml复制为config.yaml直接填好,文件里对 base_url 和模型名都有预置注释,照抄即可。

第一次完整体验只需 4 步:

  1. 内容输入区选「AI 生成内容」,输入主题如「为什么要养成阅读习惯」,默认 5 个分镜;
  2. 语音设置选默认 Edge-TTS,视觉设置选默认图像工作流和竖屏1080x1920/image_default.html模板;
  3. 点「生成视频」,右侧实时显示「生成文案 → 逐分镜配图 → 合成语音 → 合成视频」四段进度;
  4. 2~5 分钟后视频自动播放,文件保存在output/目录。

🔍 核心能力拆解

两种生成流水线:从零创作与自定义素材

核心逻辑在pixelle_video/pipelines/目录,两条主流水线:

  • 标准流水线(standard.py):适合从主题出发创作。LLM 先把主题拆成 5 个(可配置)短解说,为每条解说生成配图提示词,再逐分镜并行生成 TTS 音频和 AI 配图,用 HTML 模板合成帧,最后 ffmpeg 拼接并混入 BGM。也支持「固定文案」模式:粘贴现成脚本,按段落/行/句子自动分镜,跳过 AI 写稿环节。
  • 自定义素材流水线(asset_based.py):适合已有素材。上传自己的照片或视频,AI 分析内容后按素材写脚本、把每个场景匹配到对应素材,再配上解说合成视频。想用自己的产品图、店铺照片出片就走这条线。

两条流水线共用基类linear.py的模板方法,各阶段(文案、配图规划、素材生成、合成)都可单独覆写,扩展新流水线只需重写对应步骤。

模板系统:三种尺寸与三种类型

视频的视觉形态由templates/目录的 HTML 模板决定,命名前缀对应三种能力:static_*.html纯文字版式、不生成配图,速度最快成本最低;image_*.html用 AI 图做背景;video_*.html用 AI 生成视频做背景。按尺寸分三组:

尺寸模板数适用平台
1080x1920 竖屏25抖音、TikTok、Instagram Reels
1920x1080 横屏5YouTube、B站、视频号
1080x1080 方形1Instagram、小红书

Web 界面按尺寸分组选择模板,选中前可预览效果。配图的提示词前缀控制整体画风,默认是黑白火柴人简笔画风格,换成卡通、胶片等英文风格描述即可改变全部配图观感。会写 HTML 的话,往templates/对应尺寸目录放新模板文件即可被自动识别。

工作流与模型层:ComfyUI、RunningHub 与直连 API

媒体生成能力统一抽象为「工作流」,workflows/目录的 JSON 文件分两套:

  • runninghub/:云端工作流,只需配 API Key,无需显卡,覆盖 Flux、Qwen、SDXL 生图和 Wan 2.2 生视频;
  • selfhost/:本地工作流,需要自部署 ComfyUI(默认 http://127.0.0.1:8188)。

还可以绕开 ComfyUI 直连厂商 API:config.example.yaml的api_providers段覆盖 OpenAI、DashScope、火山 ARK(Seedream/Seedance)、可灵,每家可单独开关本地代理,适合必须走代理的环境。语音层同理,默认selfhost/tts_edge.json(Edge-TTS,免费在线),可换 Index-TTS(本地部署,支持声音克隆)。

⚙️ 进阶用法与调优

数字人口播:在 Web 界面切换到数字人流水线,上传人物图后系统生成该人物口播脚本的视频,适合课程介绍、品牌宣传。对应工作流在workflows/runninghub/digital_*.json。

图生视频与动作迁移:图生视频流水线(web/pipelines/i2v.py)把静态图变成视频片段;动作迁移流水线(web/pipelines/action_transfer.py)上传参考视频和图片,把视频里的动作(如舞蹈)迁移到新角色上,适合做趣味和宠物内容。

声音克隆与多语言:语音设置里上传参考音频(MP3/WAV/FLAC),支持克隆的工作流(如 Index-TTS)会用该音色配音;Edge-TTS 自带 10 余种语言音色,做韩语、英语口播直接选对应音色即可。

批量生成与历史:History 页面(web/pages/)支持连续创建多个视频任务,任务的元数据和分镜会持久化到磁盘,方便回看参数和复跑。

常用调优参数:

参数推荐区间说明
n_scenes 分镜数4~8默认 5,分镜越多视频越长、调用成本越高
tts_speed 语速1.0~1.5默认 1.2,解说仓促时调低
runninghub_concurrent_limit1~10RunningHub 分镜并发数,默认 1,有配额可上调

常见问题:

  • 生成慢或超时 → 多为图像生成或 LLM API 响应慢 → 换响应更快的直连 API 工作流,或减少分镜数;先确认网络与代理正常。
  • 配图与内容不符 → 提示词前缀风格干扰 → 把前缀改成更具体的英文风格描述,或换更强的生图模型。
  • 语音机械、读错字 → Edge-TTS 默认音色不合适 → 换音色,或用参考音频走 Index-TTS 克隆。
  • 选不到某个模板 → 文件命名不符合规范 → 文件名须以static_/image_/video_开头并放入对应尺寸目录。
  • 拼接视频报错 → 缺少 ffmpeg → 按平台安装后用ffmpeg -version验证。

📌 落地参考

个人博主:需要日更一个固定主题账号。用 AI 生成模式输入选题,竖屏image_default.html模板 3 分钟出 5 分镜成片,直接发抖音或视频号;想固定口吻就切固定脚本模式,复用同一套模板参数。

电商运营:需要把产品图库变成推广短视频。走自定义素材流水线,上传 5~10 张产品图,AI 写脚本并自动匹配素材,产出口播式推广视频,换模板即可做 A/B 测试。

教育机构:新课上线需要课程介绍和数字人口播。标准模式生成课程脚本后,切数字人流水线用讲师形象出讲解视频,产出公众号或小程序用的课程介绍片。

制作环节传统方式Pixelle-Video
文案2~4 小时LLM 数秒生成
配图/素材1~2 小时AI 逐分镜生成
配音录制1 小时TTS 自动合成
剪辑合成3~5 小时自动拼接混音
合计7~12 小时2~5 分钟

📚 资源索引

  • README.md:项目总览、功能清单、快速开始与 Web 界面完整使用说明
  • config.example.yaml:完整配置模板,LLM、直连 API 供应商、ComfyUI/RunningHub 都有预置项,复制改名即可
  • docs/zh/:中文文档,getting-started 下有安装、配置、快速上手,user-guide 下有模板与 API 指南
  • templates/:按尺寸分组的全部视频模板,配套效果图在docs/images/
  • workflows/:RunningHub 与自托管的 ComfyUI 工作流 JSON,含生图、生视频、TTS、素材分析四类
  • bgm/:把自定义背景音乐文件放这里,即可在 Web 界面选择
  • output/目录:生成视频与任务中间文件的默认保存位置(首次生成后自动创建)

个人博主建议从 Edge-TTS 加 RunningHub 生图工作流起步,零本地环境即可出片;本地有显卡可上 ComfyUI 自托管实现全流程免费;想扩展功能的开发者,先读pixelle_video/pipelines/linear.py弄清各阶段的覆写方式再动手。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/30 2:19:48

Finetuning Large Language Model as an Effective Symbolic Regressor

论文总结与翻译:《Finetuning Large Language Model as an Effective Symbolic Regressor》 一、论文主要内容 该论文聚焦于符号回归(SR)任务——从观测数据中推导支配方程,这是科学发现的核心环节。当前基于大型语言模型(LLMs)的符号回归方法存在局限性,如依赖直接推…

作者头像 李华
网站建设 2026/9/30 2:19:46

Win10激活码查询全攻略:注册表与slmgr命令实战详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/30 2:19:36

waifu2x 基准测试指南:用 tools/benchmark.lua 复现 PSNR 与耗时评测

计算机视觉深度学习 【免费下载链接】waifu2x Image Super-Resolution for Anime-Style Art 项目地址: https://gitcode.com/gh_mirrors/waifu/waifu2x 点击查看 免费下载 本文围绕 waifu2x 仓库自带的基准测试文档(appendix/benchmark.md)展…

作者头像 李华
网站建设 2026/9/30 2:18:40

手撸轻量PROFINET从站:裸机+FreeRTOS+p-net实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/30 2:18:33

【信息科学与工程学】计算机科学与自动化——第一百八十九篇 计算机硬件 系列一 微处理器04

微处理器工艺的数学物理——覆盖 LOD 效应、RDF、1/f 噪声、体效应、背偏效应、热载流子寿命、NBTI AC 模型、自热效应、功耗模型、电压调节器效率、片上互连传输线、电迁移 Blech 长度、低 k 机械强度、CMP 速率、光刻胶对比度、EUV 掩模缺陷修复、ALD 保形性、铜电镀填充、TS…

作者头像 李华
网站建设 2026/9/30 2:18:17

【项目记录】数据库集群巡检推送

数据库集群自动化巡检与推送报告系统 —— 项目记录 脱敏声明:本文为技术复盘,文中所有 IP、主机名、域名、账号、邮箱、数据源 UID、大盘 UID、 集群业务名称、部署路径均已替换为占位符(如 db-mysql-01、10.20.x.y、grafana.example.com、 业务集群A)。PromQL、指标名、判…

作者头像 李华