Open Generative AI本地部署指南
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个可自托管的开源 AI 图像与视频生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 420+ 主流模型装进同一套界面。它解决的是:不付订阅费、没有内容过滤、数据不出本机,也能用上一套完整的生成工作台。最直观的一点——所有模型定义都开放在同一个文件里,你改一处,云端版和本地版同时生效。
⚡ 它凭什么值得一试
这一节讲它和普通付费平台最直接的三点区别。
- 一个库全模型:420+ 模型定义集中在单一文件
packages/studio/src/models.js,应用里图像、视频、Cinema、口型、工作流等 14 个工作室全部从它读取,每个模型的画幅、分辨率、时长等参数选项都声明在这份清单里。 - 零过滤生成:没有提示词拒答,也没有内容护栏。你写什么就发给模型什么,MIT 许可证下代码和产物都归你处置。
- 本地推理:桌面版自带两套本地引擎——sd.cpp 在本机跑图像模型,Wan2GP 连接你自己的 GPU 服务器;没有 GPU 也可以只用云端模型,两条路都通。
功能全景速览
下表按类别列出主要能力,规模数字来自 README 对模型文件的核对结果。
| 类别 | 规模 | 代表能力 | 典型用途 |
|---|---|---|---|
| 文本到图像 | 70+ | Flux、Midjourney v7、Nano Banana 2 | 概念图、广告主视觉 |
| 图像到图像 | 70+ | Nano Banana 2 Edit(最多 14 张参考图)、背景去除 | 风格迁移、修图增强 |
| 文本到视频 | 85+ | Kling、Sora 2、Veo 3、Seedance 2.0 | 3–12 秒短视频片段 |
| 图像到视频 | 120+ | Seedance 2.0 I2V、Kling I2V | 让单帧画面动起来 |
| 视频到视频 | 35+ | AI Clipping、Vibe Motion | 长视频自动提取高光 |
| 口型同步 | 15 | Infinite Talk、LTX Lipsync、Sync | 人像+音频 → 说话视频 |
| 音频 | 15+ | 文本生成音乐、音频编辑 | 配乐、旁白生成 |
| Cinema 工作室 | 6 种机身 / 11 种镜头 | 焦距 8–85mm、光圈 f/1.4–f/11 | 电影质感静帧 |
技术底座怎么搭的
这一节讲它底层的三层:模型数据、本地推理、API 调用,只说各自负责什么。
一份模型清单,全应用吃这一份
models.js 是仓库里唯一的数据源头,由模型数据自动生成:
- 每个模型条目记录 API 端点、参数 schema(提示词、画幅、分辨率、时长)和提供方
- 工作室页面不硬编码选项,而是根据 schema 动态渲染控件,新增模型后界面自动补全
- 自托管版本与官方托管在线版共用这份文件,一次更新两处同步
双引擎本地推理
localInference.js 负责桌面版的本地引擎管理:
- sd.cpp 引擎:Stable Diffusion 的 C++ 实现,随应用打包;Apple Silicon 走 Metal,Linux/Windows 支持 CUDA/Vulkan/ROCm
- 模型库:Z-Image Turbo/Base、Dreamshaper 8、Realistic Vision v5.1、SDXL 等;跑 Z-Image 建议 16GB 内存
- Wan2GP 模式:桌面应用只是 HTTP 客户端,你在 CUDA/ROCm GPU 机器上自跑 Wan2GP 服务器,把地址填进设置即可
- 配置入口:Settings → Local Models,一键下载引擎与模型,默认存放在应用数据目录
统一的 API 调用
muapi.js 客户端使用“提交后轮询”的统一模式:
POST /api/v1/{模型端点}提交任务,返回请求 ID- 轮询
GET /api/v1/predictions/{id}/result直到状态完成 - 鉴权用
x-api-key请求头,密钥只存在浏览器 localStorage,不经过任何第三方
🚀 三步跑起来
这一节按安装 → 配置 → 首次生成的顺序,从 0 到出第一张图只需要几条命令。
第 1 步 安装:
# 1. 克隆仓库(必须带上子模块) git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI # 2. 安装依赖并构建工作区包(不可省略) npm run setup # 3. 启动 Web 版,浏览器打开 localhost:3000 npm run dev三种部署方式任选:
- 桌面版(新手推荐):从 release 页下载对应平台的安装包,无需 Node 环境;macOS 首次启动需按 README 说明解除系统拦截
- Web 版:上面的
npm run dev即可开发调试;生产环境用npm run build && npm run start - Docker:仓库自带 docker-compose.yml,执行
docker compose up -d后访问 3001 端口
第 2 步 配置:首次使用会提示输入模型服务 API 密钥;如果只用本地模型可以跳过。本地推理则进 Settings → Local Models 安装引擎、下载模型。
第 3 步 首次生成:打开 Image Studio,输入提示词、选好模型点击生成;或者打开 ⚡ Local 开关改用本地模型,全程不消耗云端额度。
谁在用、怎么用
这一节选三个典型场景,每个都按痛点 → 怎么用 → 效果来讲。
1. 小团队做游戏美术资产
- 痛点:外包角色和场景美术贵,改稿周期长,风格难统一。
- 怎么用:Image Studio 批量生成角色概念图,用最多 14 张参考图锁住风格;再用 Workflow Studio 把图像增强、视频模型串成自动流程。
- 效果:设计阶段一轮提示词就能拿到几十张候选方案,参考图让多轮产出的风格保持一致。
2. 自媒体 / 营销做广告素材
- 痛点:同一产品要铺多个投放位,人工修图、裁图跟不上节奏。
- 怎么用:Marketing Studio 从一个输入出发生成多组广告创意变体;Cinema Studio 用 f/1.4 浅景深这类参数统一出片调性。
- 效果:一张基础图派生出多种画幅、多种风格的投放素材,一次会话产出整套。
3. 口播视频 / 数字人创作者
- 痛点:逐帧对口型极其耗时,现成软件大多要订阅。
- 怎么用:Lip Sync Studio 提供两种模式——“人像图+音频 → 说话视频”“视频+音频 → 口型同步”,选 Infinite Talk 或 LTX Lipsync 等模型等待结果即可。
- 效果:一条分钟级口播视频只需准备两份输入(图像或视频 + 音频),不用手工调任何一帧。
写在最后
Open Generative AI 把 420+ 模型和 14 个工作室装进了一个开源仓库,让“自托管生成工作台”从特权变成默认选项。需要 AI 图像和视频生成能力时,你不必再在订阅费和封闭生态之间二选一。
现在就可以做的三件事:
- 体验托管在线版:注册官方托管版账号,不装任何东西就能用全部工作室
- 本地部署:下载桌面安装包,或
docker compose up单机部署 - 参与贡献:修改 models.js 添加新模型,或提 PR 修复一个 bug
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考