Open Generative AI:免费用400+模型生成AI图像与视频,从本地部署到出片的完整指南
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个 MIT 许可的自托管 AI 图像与视频生成工作台:它把 Flux、Midjourney、Kling、Sora、Veo 等 400+ 模型装进同一套界面,没有订阅费、没有内容过滤,也能在你自己的电脑上离线跑图像模型。这篇文章写给第一次接触它的人,讲清楚它有什么能力、需要什么硬件、以及怎么在半小时内部署好。
为什么用开源替代商业AI视频平台
如果你用过商业 AI 图像或视频工具,大概熟悉这三件事:按月订阅(项目文档里给出的市场参考价:Midjourney 约 $10–120/月,Runway 约 $12–76/月,实际以各家定价页为准)、提示词偶尔被拒或被改写、你上传的图和提示都存放在对方服务器上。
Open Generative AI 把这三点都换掉了:
- MIT 许可,代码完全公开,可以商用、改界面、做成自己的产品
- 提示词照原样处理,不经过内容过滤
- 部署在自己机器或自己的服务器上,数据不离开本地
需要注意,它不是"一个开源模型",而是一个把 400+ 云端模型接进来的应用,同时自带两套本地推理引擎。先理解这一点,后面会好懂很多。
🖼️ 它能干什么:14 个工作室装在一个应用里
打开应用后是一排顶部标签,每个标签是一个"工作室",对应一类创作任务:
- Image Studio:文生图 50+ 模型、参考图改图 55+ 模型。有没有上传参考图,系统自动切换对应模型池,不用手动选模式。兼容的编辑模型一次最多喂 14 张参考图,选择时带序号,顺序会原样传给模型。
- Video Studio:同一套逻辑,40+ 文生视频、60+ 图生视频。传一张静态图就能变成动态素材。
- Lip Sync Studio:9 个模型、两种输入——肖像图 + 音频得到说话视频,或已有视频 + 音频做口型修正。
- Cinema Studio:虚拟摄影机,选机身、镜头、焦距、光圈来统一画面风格。
- Workflow Studio:节点编辑器,把图像、视频、音频模型拖成流水线,带模板库和社区模板。
- Agent Studio:对话式代理,用一句话描述任务,由它规划和执行生成。
- 另有音频、视频高光剪辑、动态特效、营销素材、人物换形、AI 虚拟网红等专用工作室。
贯穿所有工作室的通用能力:参考图上传一次就存在本地,跨会话直接复用;历史生成结果有专门页面,可全分辨率一键下载。工作室的界面组件在 packages/studio/src/ 下,想改哪个就看哪个。
模型清单:400+ 模型由一个文件管理
不同厂商的模型走统一 API:先提交生成请求,再轮询结果,直到拿到图片或视频地址。文件上传走同一通道,参考图传完返回一个 URL,再交给模型使用。
各类模型的数量与代表(按仓库模型定义核对):
| 生成类型 | 数量 | 代表模型 |
|---|---|---|
| 文生图 | 50+ | Flux、Nano Banana 2、Seedream 5.0、Midjourney、GPT-4o |
| 图生图 | 55+ | Nano Banana 2 Edit、Flux Kontext、Seedream Edit |
| 文生视频 | 40+ | Kling、Sora、Veo、Wan、Seedance 2.0、Hailuo |
| 图生视频 | 60+ | Kling I2V、Veo3 I2V、Runway I2V、Midjourney I2V |
| 视频后期与特效 | 35+ | Vibe Motion、AI Clipping |
| 口型同步 | 9 | Infinite Talk、LTX Lipsync、LatentSync |
| 音频 | 15+ | 文本转音乐、remix、音频编辑 |
| 身体/外观替换 | 3 | 图像与视频的 Recast |
合计 420+。所有模型的宽高比、分辨率、时长、质量档位等参数都写在 packages/studio/src/models.js 这一个文件里,网页版和桌面版读同一份定义,所以新增或调整模型只改这一处。
📦 如何在 Mac / Windows / Linux 上安装:三种方式
方式一:桌面安装包(推荐大多数人)
官方发布版为 1.0.9,提供免 Node.js 环境的一键安装包:
- macOS Apple Silicon(M1–M4):arm64 DMG
- macOS Intel:标准 DMG
- Windows x64:NSIS 安装程序 exe
- Linux:AppImage 或 .deb(Ubuntu / Debian 适用)
安装时有两个系统提示,各只会出现一次:
- macOS 首次启动被拦截:应用没有经过 Apple 公证。可以走"系统设置 → 隐私与安全性"点"仍要打开",或在终端执行
xattr -cr "/Applications/Open Generative AI.app"再打开。 - Windows SmartScreen 警告:点"更多信息"→"仍要运行",安装到本地应用目录并生成开始菜单快捷方式。
- Ubuntu 24.04+:内核安全策略可能阻止 AppImage 启动,建议直接装 .deb(自带 AppArmor 配置)。
方式二:从源码构建(贡献者或想改界面的人)
先装 Node.js 18+,然后:
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run electron:dev # 桌面版;网页版用 npm run devnpm run setup会一次完成子模块初始化、依赖安装和 studio、workflow、agents 等子包构建,这一步是必须的——只跑npm install起不来。
方式三:Docker(服务器自托管)
仓库根目录的 docker-compose.yml 把容器 3000 端口映射到主机 3001,一条命令启动并配置为异常自动重启。
一个边界要说在前面:本地推理只在桌面版可用;网页版和 Docker 版都走云端模型,首次使用需要填一个 MuAPI 访问密钥(只用本地模型则可跳过)。
⚙️ 最低硬件要求是什么:在自己机器上离线跑图
桌面版的"设置 → 本地模型"里有两套独立引擎,按你的硬件各取所需。
引擎一:sd.cpp(内置,只出图)
C++ 推理引擎,与应用同机运行。在设置页一键安装后,模型直接下载到应用数据目录,不动系统目录,也不装到系统全局。
- Apple Silicon 走 Metal GPU 加速,已内置在 macOS 安装包里
- Linux / Windows 支持 CUDA、Vulkan、ROCm
- 所有平台都能纯 CPU 跑,只是慢
可离线运行的模型:
| 模型 | 基座 | 体积 | 说明 |
|---|---|---|---|
| Dreamshaper 8 | SD 1.5 | 2.1 GB | 通用,Mac 上最轻的选择 |
| Realistic Vision v5.1 | SD 1.5 | 2.1 GB | 照片写实 |
| Anything v5 | SD 1.5 | 2.1 GB | 动漫与插画 |
| SDXL Base 1.0 | SDXL | 6.9 GB | 高分辨率 |
| Z-Image Turbo | DiT | 2.5 GB + 共享辅助文件 2.7 GB | 8 步快出,吃内存 |
| Z-Image Base | DiT | 3.5 GB + 共享辅助文件 2.7 GB | 50 步高质量,吃内存 |
硬件参考:8GB 内存可以跑 SD 1.5 系列;Z-Image 系列建议 16GB RAM(权重加运行缓冲约 10GB),8GB 的 M 系列机器上已知会卡死系统,那台机器请留在 SD 1.5。磁盘预留 10–30GB 放权重,想放到其他盘就启动前设置环境变量OPEN_GENERATIVE_AI_LOCAL_AI_DIR。生成时在 Image Studio 选中本地模型、打开"Local"开关即可,不需要任何 API 密钥。相关逻辑见 electron/lib/localInference.js。
引擎二:Wan2GP(自架 GPU 服务器,图 + 视频)
这套引擎不随应用分发。你在一台有 CUDA 或 ROCm GPU 的机器上自己跑 Wan2GP 服务(开源的 Python + PyTorch 项目),桌面版只负责发提示词和取结果。
- 覆盖 Flux.1 Dev、Qwen Image 等图像模型,以及 Wan 2.2、Hunyuan Video、LTX Video 等视频模型
- GPU 机器可以是家里另一台游戏 PC,也可以是租来的 GPU 实例
- 所以在 Mac 上同样可用:Mac 跑应用,局域网里填服务器地址(形如
http://192.168.1.42:7860),点测试通过后保存
为什么不直接内置?因为 Wan2GP 的运行时(Sage attention、flash-attn 等内核)只兼容 CUDA,没有 Apple Silicon 路径,做成远程服务器形态才能覆盖全部用户。
🎥 Cinema Studio:用光圈和焦距控制画面
如果说图像工作室是"写提示词就行",Cinema Studio 则把一台虚拟摄影机摆到你面前:选好的参数会被翻译成优化过的提示词修饰,随请求一起送出。
可调参数:
- 机身 6 种:8K 数字模块、全画幅电影数字、35mm 影棚数字,到 70mm 大画幅胶片、16mm 经典胶片
- 镜头 11 种:移轴、紧凑型变形宽银幕、极端微距、70 年代电影定焦、旋涡散景、卤化光晕扩散等
- 焦距 6 档:8mm 超广角到 85mm 特写人像,含 35mm 人眼视角、50mm 人像焦段
- 光圈 3 档:f/1.4 浅景深、f/4 均衡、f/11 深对焦
适合需要统一视觉风格的场景:品牌物料、系列封面、短视频头图。
✅ 适合谁用,开始前要知道什么
适合你,如果:
- 不想按月订阅,且创作题材在商业平台上容易被拦
- 想自托管、让数据和素材留在自己机器
- 想把"模型库 + 工作室"嵌进自己的产品——MIT 许可,源码可读、界面可改
开始前确认三件事:
- 云端模型走 MuAPI,首次使用要填访问密钥;纯本地模式(sd.cpp)不需要密钥,但只能出图
- 本地推理只在桌面版可用,网页版和 Docker 版都是云端
- 没有 CUDA / ROCm GPU 就跑不了本地视频模型,视频仍走云端;14 张参考图、口型同步这类能力也依赖对应云端模型
边界接受之后,上手成本其实很低:下载安装包双击装好,在"设置 → 本地模型"下载一个 2.1GB 的 SD 1.5 权重,8GB 内存的机器就能离线出第一张图。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考