news 2026/9/5 22:24:11

零基础 5 分钟,免费做出第一条 AI 短视频的完整上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
零基础 5 分钟,免费做出第一条 AI 短视频的完整上手指南

零基础 5 分钟,免费做出第一条 AI 短视频的完整上手指南

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 全自动短视频引擎:你输入一个主题,它自动写完文案、生成配图、合成语音,最后渲染出成片,适合老师、带货商家和想做自媒体却没有剪辑经验的人。

它能做什么,适合谁

Pixelle-Video 的定位很单一:把"写稿—找图—配音—剪辑"这条流水线整个交给 AI,你只负责出主意和按一个按钮。它支持竖屏、横屏、方形三种画幅,内置二十多个视觉模板和多种 TTS 音色。

  • 老师做科普短视频:讲一个概念,自动生成解说词和配图
  • 带货做产品展示:输入卖点,直接出营销向视频
  • 自媒体发个人成长内容:把碎想法整理成有条理的成片
  • 企业做培训宣讲:内部知识快速变成可播放的视频

零基础做出第一条视频:5 分钟

下载安装:两种方式任选

Windows 新手建议用整合包:到项目发布页下载最新 Windows 一键整合包,解压到任意目录,双击start.bat,浏览器会自动打开http://localhost:8501,不需要装 Python、ffmpeg 任何东西。

源码方式适合 Mac / Linux 或想改配置的人,先装好uvffmpeg,然后:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py

完成后你会看到:浏览器停在 8501 端口,页面是三栏布局——左边"内容输入",中间"语音 / 视觉设置",右边"生成视频",左侧还有一个可展开的"⚙️ 系统配置"面板。

接通 AI 服务:文案模型加图像生成

首次使用展开"⚙️ 系统配置",要接两个服务:

文案模型(LLM),负责写稿,选一个填 Key 即可:

  • 通义千问:中文表现好,成本低,新手首选
  • GPT 系列:多语言能力强
  • DeepSeek:便宜,国内访问稳定
  • Ollama:本地运行,完全免费,需要电脑带显卡

图像生成,负责每句文案的配图,选一条路:

  • 本地 ComfyUI:填服务地址(默认 http://127.0.0.1:8188),点"测试连接"确认能通
  • RunningHub 云端:只填一个 API Key,不用显卡
  • 直连 API:填 DashScope、OpenAI、Seedream、Kling 等供应商的 Key,跳过 ComfyUI

填完点"保存配置"。完成后你会看到:面板收起,配置被记住,重启程序不用再填一遍。

输入并生成:看进度条走完

在左侧"📝 内容输入"选"AI 生成内容",输入框里写主题,比如"为什么每天阅读 30 分钟能改变习惯"或"如何在家做出五分钟健康早餐",分镜数默认 5 个不动。中间栏把 TTS 工作流留默认 Edge-TTS,视频模板选一个竖屏的,想省时间可以选static_开头的静态模板——它不生成 AI 配图,纯文字排版,出片最快。然后点右侧"🎬 生成视频"。

点下去之后右侧会出现实时进度:先"生成文案",再逐条"分镜 1/5 - 生成插图",接着"合成语音",最后"合成视频"。全部走完后视频直接在右侧播放器里自动播放,下方显示时长、文件大小和分镜数,文件同时落在output/文件夹里,可以直接拿去发平台。

用好它的几种玩法

  • 知识科普:输入"反脆弱是什么" → 知识类模板 + 清晰专业的男声 → 效果接近自制课程切片
  • 产品展示:输入"这款保温杯的三个卖点" → 现代简约模板 + 自信语速的解说 → 可直接投放的带货素材
  • 情感故事:输入"写给下班后还在加班的自己" → 治愈风格模板 + 柔和女声,配一段舒缓 BGM → 有氛围感的口播向成片

避坑提醒

  • 生成要等几分钟才正常:5 分镜的片子通常 2-5 分钟,卡在"生成插图"时多半是图像服务慢,别反复点重开
  • 竖屏横屏别选错:发抖音、快手选 1080x1920 竖屏模板,发 B 站、YouTube 选 1920x1080 横屏,模板按尺寸分组,跟着平台挑就行
  • 想零成本跑:LLM 换 Ollama 本地模型、图像用本地 ComfyUI,整条链路一分钱不花
  • 本地显卡显存不够 6GB:别再折腾本地 ComfyUI,图像生成切到 RunningHub 或直连 API
  • 文案不满意:换 LLM 模型、改图像提示词前缀、换 TTS 音色,比重新写主题更快见效

进阶玩法

  • 自定义素材:上传自己的照片和视频,AI 分析内容后生成匹配文案和解说,工作流在 web/pipelines/asset_based.py
  • 声音克隆:在语音设置里上传一段参考音频,生成的解说接近你的音色,教程见 docs/zh/tutorials/voice-cloning.md
  • 直连视频模型:选 DashScope Wan、Kling、Seedance 等 API 视频模型,让画面从静图变成动态片段,模板开发文档在 docs/zh/user-guide/templates.md

第一条视频跑通之后,剩下的功夫全花在挑模板和换音色上。工具不会替代你对内容的判断,但它把出片成本从几个小时压到一杯咖啡的时间。

  1. 下载整合包,确认浏览器能打开 8501 端口
  2. 在"系统配置"里接好 LLM 和图像生成,点"保存配置"
  3. 输入一个主题,先用静态模板生成第一条片子
  4. 再试一次图片模板 + 声音克隆
  5. output/里的成片发到你的平台

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 22:14:31

Cesium填挖方分析组件:空间对齐与混合算法工程实践

简介:本资源是一个面向GIS前端开发者的Cesium三维地理信息分析功能组件,聚焦于工程土方量计算中的填挖方分析场景,特别适配需同时处理真实地形与BIM/倾斜摄影模型的项目需求。资源包共4个文件,含2个核心JavaScript模块&#xff08…

作者头像 李华
网站建设 2026/9/5 22:12:45

基于Netty与Java构建高并发MUD游戏服务器:架构设计与工程实践

简介:本资源是吉林大学Java程序设计课程高分课程设计成果——MUD多人在线文字冒险游戏系统源码,面向Java初学者及课程设计、期末大作业、毕业设计实践者,解决网络编程、多线程会话管理与实时交互等核心教学难点。压缩包共40个文件&#xff0c…

作者头像 李华
网站建设 2026/9/5 22:11:31

调和映射与奇异空间:从正则性理论到液晶缺陷建模

1. 问题背景:为什么 CSDN 上很难搜到这篇报告 先给结论:这次大会报告涉及的是调和映射理论中的 奇异空间 分支,属于几何分析、PDE 与度量几何的交叉方向。 很多做工程和算法的读者看到“调和映射”会先想到图像修复、网格参数化、弹性形变…

作者头像 李华
网站建设 2026/9/5 22:07:30

多AI-Agent协作的量化工作台:盘前盘中盘后自动化闭环架构

前阵子有个读者给我留言,问我一个人怎么盯盘前、盘中、盘后三套流程,还要兼顾策略优化和风控,是不是得组个团队才能扛下来。我当时正好在做QuantBot——一个多AI-Agent协作的量化工作台,把从盘前数据准备、信号生成,到…

作者头像 李华