news 2026/9/4 10:07:22

Open Generative AI本地部署指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI本地部署指南

Open Generative AI本地部署指南

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个可自托管的开源 AI 图像与视频生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 420+ 主流模型装进同一套界面。它解决的是:不付订阅费、没有内容过滤、数据不出本机,也能用上一套完整的生成工作台。最直观的一点——所有模型定义都开放在同一个文件里,你改一处,云端版和本地版同时生效。

⚡ 它凭什么值得一试

这一节讲它和普通付费平台最直接的三点区别。

  • 一个库全模型:420+ 模型定义集中在单一文件packages/studio/src/models.js,应用里图像、视频、Cinema、口型、工作流等 14 个工作室全部从它读取,每个模型的画幅、分辨率、时长等参数选项都声明在这份清单里。
  • 零过滤生成:没有提示词拒答,也没有内容护栏。你写什么就发给模型什么,MIT 许可证下代码和产物都归你处置。
  • 本地推理:桌面版自带两套本地引擎——sd.cpp 在本机跑图像模型,Wan2GP 连接你自己的 GPU 服务器;没有 GPU 也可以只用云端模型,两条路都通。

功能全景速览

下表按类别列出主要能力,规模数字来自 README 对模型文件的核对结果。

类别规模代表能力典型用途
文本到图像70+Flux、Midjourney v7、Nano Banana 2概念图、广告主视觉
图像到图像70+Nano Banana 2 Edit(最多 14 张参考图)、背景去除风格迁移、修图增强
文本到视频85+Kling、Sora 2、Veo 3、Seedance 2.03–12 秒短视频片段
图像到视频120+Seedance 2.0 I2V、Kling I2V让单帧画面动起来
视频到视频35+AI Clipping、Vibe Motion长视频自动提取高光
口型同步15Infinite Talk、LTX Lipsync、Sync人像+音频 → 说话视频
音频15+文本生成音乐、音频编辑配乐、旁白生成
Cinema 工作室6 种机身 / 11 种镜头焦距 8–85mm、光圈 f/1.4–f/11电影质感静帧

技术底座怎么搭的

这一节讲它底层的三层:模型数据、本地推理、API 调用,只说各自负责什么。

一份模型清单,全应用吃这一份

models.js 是仓库里唯一的数据源头,由模型数据自动生成:

  • 每个模型条目记录 API 端点、参数 schema(提示词、画幅、分辨率、时长)和提供方
  • 工作室页面不硬编码选项,而是根据 schema 动态渲染控件,新增模型后界面自动补全
  • 自托管版本与官方托管在线版共用这份文件,一次更新两处同步

双引擎本地推理

localInference.js 负责桌面版的本地引擎管理:

  • sd.cpp 引擎:Stable Diffusion 的 C++ 实现,随应用打包;Apple Silicon 走 Metal,Linux/Windows 支持 CUDA/Vulkan/ROCm
  • 模型库:Z-Image Turbo/Base、Dreamshaper 8、Realistic Vision v5.1、SDXL 等;跑 Z-Image 建议 16GB 内存
  • Wan2GP 模式:桌面应用只是 HTTP 客户端,你在 CUDA/ROCm GPU 机器上自跑 Wan2GP 服务器,把地址填进设置即可
  • 配置入口:Settings → Local Models,一键下载引擎与模型,默认存放在应用数据目录

统一的 API 调用

muapi.js 客户端使用“提交后轮询”的统一模式:

  • POST /api/v1/{模型端点}提交任务,返回请求 ID
  • 轮询GET /api/v1/predictions/{id}/result直到状态完成
  • 鉴权用x-api-key请求头,密钥只存在浏览器 localStorage,不经过任何第三方

🚀 三步跑起来

这一节按安装 → 配置 → 首次生成的顺序,从 0 到出第一张图只需要几条命令。

第 1 步 安装

# 1. 克隆仓库(必须带上子模块) git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI # 2. 安装依赖并构建工作区包(不可省略) npm run setup # 3. 启动 Web 版,浏览器打开 localhost:3000 npm run dev

三种部署方式任选:

  • 桌面版(新手推荐):从 release 页下载对应平台的安装包,无需 Node 环境;macOS 首次启动需按 README 说明解除系统拦截
  • Web 版:上面的npm run dev即可开发调试;生产环境用npm run build && npm run start
  • Docker:仓库自带 docker-compose.yml,执行docker compose up -d后访问 3001 端口

第 2 步 配置:首次使用会提示输入模型服务 API 密钥;如果只用本地模型可以跳过。本地推理则进 Settings → Local Models 安装引擎、下载模型。

第 3 步 首次生成:打开 Image Studio,输入提示词、选好模型点击生成;或者打开 ⚡ Local 开关改用本地模型,全程不消耗云端额度。

谁在用、怎么用

这一节选三个典型场景,每个都按痛点 → 怎么用 → 效果来讲。

1. 小团队做游戏美术资产

  • 痛点:外包角色和场景美术贵,改稿周期长,风格难统一。
  • 怎么用:Image Studio 批量生成角色概念图,用最多 14 张参考图锁住风格;再用 Workflow Studio 把图像增强、视频模型串成自动流程。
  • 效果:设计阶段一轮提示词就能拿到几十张候选方案,参考图让多轮产出的风格保持一致。

2. 自媒体 / 营销做广告素材

  • 痛点:同一产品要铺多个投放位,人工修图、裁图跟不上节奏。
  • 怎么用:Marketing Studio 从一个输入出发生成多组广告创意变体;Cinema Studio 用 f/1.4 浅景深这类参数统一出片调性。
  • 效果:一张基础图派生出多种画幅、多种风格的投放素材,一次会话产出整套。

3. 口播视频 / 数字人创作者

  • 痛点:逐帧对口型极其耗时,现成软件大多要订阅。
  • 怎么用:Lip Sync Studio 提供两种模式——“人像图+音频 → 说话视频”“视频+音频 → 口型同步”,选 Infinite Talk 或 LTX Lipsync 等模型等待结果即可。
  • 效果:一条分钟级口播视频只需准备两份输入(图像或视频 + 音频),不用手工调任何一帧。

写在最后

Open Generative AI 把 420+ 模型和 14 个工作室装进了一个开源仓库,让“自托管生成工作台”从特权变成默认选项。需要 AI 图像和视频生成能力时,你不必再在订阅费和封闭生态之间二选一。

现在就可以做的三件事:

  1. 体验托管在线版:注册官方托管版账号,不装任何东西就能用全部工作室
  2. 本地部署:下载桌面安装包,或docker compose up单机部署
  3. 参与贡献:修改 models.js 添加新模型,或提 PR 修复一个 bug

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 10:05:34

Ente Auth 完整教程:5 分钟上手端到端加密的开源两步验证

Ente Auth 完整教程:5 分钟上手端到端加密的开源两步验证 【免费下载链接】ente 💚 End-to-end encrypted cloud for everything. 项目地址: https://gitcode.com/GitHub_Trending/en/ente 密码泄露、手机丢失,最怕的不是钱&#xff0…

作者头像 李华
网站建设 2026/9/4 10:05:19

Ubuntu误删引导文件卡在grub>?从原理到手工修复的完整自救指南

1. 事故现场:你以为的“废了”,大概率只是引导链断了敲下rm -rf回车的那一瞬间,大多数人脑子是空白的。尤其当重启后发现屏幕不再出现熟悉的Ubuntu Logo,而是直接甩给你一个黑底白字的grub>提示符,那种“系统可能彻…

作者头像 李华
网站建设 2026/9/4 10:05:11

Chat2DB 升级 Pro 版迁移指南:三类用户 4 步完成迁移

Chat2DB 升级 Pro 版迁移指南:三类用户 4 步完成迁移 【免费下载链接】Chat2DB Chat2DB is a free, cross-platform, local-first database client and SQL workspace for developers, DBAs, analysts, and data teams. Connect to 40 databases, manage data, edit…

作者头像 李华
网站建设 2026/9/4 10:05:09

跨任务通用对抗纹理威胁VLA模型:UniTexture技术解析与评估框架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 10:03:11

STM32实现工业级RS485 MODBUS从站:从协议栈到抗干扰设计

简介:本资源是一套面向嵌入式开发工程师与工业自动化项目实践者的STM32 MODBUS从站完整软件例程,聚焦RS485物理层通信下的标准MODBUS RTU协议实现,解决工业现场设备快速接入MODBUS主站网络的核心需求。压缩包共669个文件,涵盖90个…

作者头像 李华
网站建设 2026/9/4 10:01:31

Qt音乐播放器工业级实现:跨平台音频架构与实时控制

简介:本资源是一份基于Qt框架开发的完整音乐播放器项目源码,面向C与Qt初学者及GUI应用开发者,解决从零构建跨平台音频播放应用的学习痛点。压缩包共59个文件,含3个核心CPP源文件、2个UI界面设计文件、2个头文件、1个pro工程配置、…

作者头像 李华