news 2026/9/4 12:14:27

Open Generative AI:本地自托管 400+ 图像视频生成模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI:本地自托管 400+ 图像视频生成模型

Open Generative AI:本地自托管 400+ 图像视频生成模型

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

做 AI 素材的团队大多被同一个问题卡住:图走一个平台、视频走一个平台、口型同步再找一个平台,各自订阅、各自排队,提示词还不能跨平台复用。更隐蔽的成本是内容过滤——同一个角色设定,换个措辞才被放行,重做的时间比生成本身还长。

它是什么:一个自托管的 AI 图像视频工作台

Open Generative AI 是一个可自托管的工作台,把 400 多个图像、视频、音频模型(Flux、Midjourney、Kling、Sora、Veo 等)收进同一套界面,MIT 协议。它不是一个又一个模型 API 的目录,而是直接给你 10 个能用的工作室。

三个点让它和平台订阅制拉开差距:无订阅门槛,云端模型走 MuAPI 网关、本地推理完全免费;无内容过滤,提示词不会被拦截或改写;模型可插拔,全部参数定义集中在 packages/studio/src/models.js,加模型不用动 UI。

十个工作室一次装齐:图像、视频、口型、工作流

工作室干什么
Image Studio50+ 文生图、70+ 图生图,自动按是否提供参考图切换模型集
Video Studio40+ 文生视频、120+ 图生视频(Kling、Sora、Veo、Seedance 2.0 等)
Lip Sync Studio肖像图 + 音频,或视频 + 音频,9 个口型模型
Cinema Studio按机身、镜头、焦段、光圈生成电影感画面
Audio Studio文生音乐、remix 与音频编辑
Vibe Motion / AI Clipping风格化动态生成;长视频自动剪辑高光
Recast Studio图像或视频里替换主体外观
Marketing Studio一个输入出多组广告素材变体
Workflow Studio节点式编辑器串多步流水线,带社区模板库
Agent / Design Agent / AI Influencer对话式任务规划、画布式自主设计、人设内容一致

五分钟上手:从克隆到出第一张图

  1. 装 Node.js 18+,克隆仓库(--recurse-submodules必带,workflow 和 agent 包都在子模块里)
  2. npm run setup——它替你装依赖并构建 4 个 workspace 包,只跑npm install会缺东西
  3. 起服务:Web 版npm run dev(Next.js,访问 localhost:3000),桌面版npm run electron:dev
  4. 首次使用让你填 MuAPI key;只想用本地推理就直接跳过
  5. 进 Image Studio 输提示词生成;或到 Settings → Local Models 装本地引擎,之后生成不再需要 key
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run dev # 或 npm run electron:dev

不想折腾构建,也可以直接下官方预编译的桌面安装包(macOS/Windows/Linux 都有),或按 docker-compose.yml 一条docker compose up起在 3001 端口。

核心功能拆解:本地双引擎、14 图融合、虚拟摄影机

本地推理:sd.cpp 离线出图,8GB 机器也能跑

解决"没有网也不想让提示词出内网"的问题。桌面应用内置 electron/lib/localInference.js 调度的 sd.cpp 引擎,支持 Apple Silicon 的 Metal 和 Linux/Windows 的 CUDA、Vulkan、ROCm。用法是 Settings → Local Models 一键装引擎、下模型,回 Image Studio 打开模型选择框旁的本地开关,全程无 API key。

具体数字:SD 1.5 系模型(Dreamshaper 8、Realistic Vision v5.1)约 2.1GB,8GB 内存的 M 系 Mac 能跑,官方实测 Metal 生效时 1~2 秒一步;Z-Image Turbo 要 5.2GB 权重,建议 16GB 起步,8GB 机器上会卡死系统。实际体验上,如果出图慢到约 10 秒一步,多半是回退到了 CPU 而不是配置问题。

多参考图融合:一次喂 14 张图锁住角色一致性

解决"单张参考图锁不住角色 + 服装 + 道具"的问题。Nano Banana 2 Edit、Flux Kontext Dev 这类编辑模型最多接收 14 张参考图:多选面板里每张带序号标签,支持批量上传,按你点选顺序送进模型。实际体验是改设定不用重描述——把角色设定图、服装参考、色板图一次选进去,生成时按顺序生效。

Cinema Studio:把摄影机参数变成提示词

解决"AI 出图没有镜头语言"的问题。6 种机身(含 70mm 胶片、16mm 胶片)、11 种镜头、6 档焦段(8mm 到 85mm)、3 档光圈(f/1.4 到 f/11),选好后自动拼成优化过的提示词修饰,不碰 prompt 工程。

实际体验是同一组片子里景深和虚化终于一致了——以前全靠提示词里"cinematic"这种词碰运气,现在直接锁 f/4 + 50mm。

实战演练:30 张立绘加 6 段过场动画的一天

背景:小团队做手游首发素材,要 30 张角色立绘加 6 段过场动画,要求光影统一,但外包一轮报价超出预算,自己用商业平台又要分头订阅。

做法分四步。先用 Image Studio 出 3 张风格基准图;再开多参考图,把角色设定图、服装参考、色板图一起选进请求,批量生成 30 张立绘,角色和服装不用重新描述。过场部分固定 Cinema Studio 的机身、镜头、光圈,只换主体描述出静帧,光学风格自然一致;静帧送进 Video Studio 的图生视频模型转成 5 秒动画。最后把"参考图融合 → 静帧 → 动画"整条串进 Workflow Studio,下次只换角色参数重跑。

结果:36 件素材当天过完,立绘之间、立绘与过场之间的风格靠 Cinema 参数和多参考图兜底,没有再出现"同一角色两张图像两个人"的情况。

选型参考:什么人选它,什么人别选

  • 适合:想把生成链路自托管、提示词和数据不过第三方平台的团队;有 GPU 想用 sd.cpp 离线出图、把推理成本压到自己电费上的;需要多模型串流水线、反复调参做 A/B 的。
  • 不适合:想开箱即用到商业 SaaS 那种完整度的——自托管版仍是工作流,部分能力(比如 Wan2GP 视频模型在 Video Studio 的完整接入)还在路线图上;没有可用 GPU 也不想学模型配置的,订阅现成平台更省事。
  • 和同类比:ComfyUI 偏节点流、面向专业流程、上手门槛高;Open Generative AI 是成品应用形态,10 个工作室开箱即用,代价是细粒度控制不如前者。
  • 成本账:云端模型走 MuAPI,需要 key;纯本地推理零 key、离线可用。自托管就是 docker-compose.yml 一个服务,端口映射 3001。

写在最后

它把"选模型、拼流程、管 key"这三件最磨人的事从工作流里拿走了,适合有 GPU 和时间、想把生成环节攥在自己手里的团队。项目是 MIT 协议,核心模型定义和推理调度都可以直接读源码改,社区在 Discord 里,更新节奏看仓库提交就知道。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 12:13:57

STM32H743 QSPI PSRAM内存扩展实战:从硬件连接到XIP代码执行

简介:本资源是面向嵌入式开发工程师与STM32进阶学习者的实战型工程例程,聚焦STM32H7系列高性能MCU在复杂存储扩展场景下的QSPI外设驱动开发。针对64 Mbit容量VTI7064 SRAM芯片,完整实现基于STM32H743VIT6的QSPI总线读写控制、时序配置与内存映…

作者头像 李华
网站建设 2026/9/4 12:09:12

KOReader 使用指南:Kindle 上 PDF 重排与多格式电子书阅读

KOReader 使用指南:Kindle 上 PDF 重排与多格式电子书阅读 【免费下载链接】koreader An ebook reader application supporting PDF, DjVu, EPUB, FB2 and many more formats, running on Cervantes, Kindle, Kobo, PocketBook and Android devices 项目地址: htt…

作者头像 李华
网站建设 2026/9/4 12:08:19

AI重构美国购车模式:从对话选车到在线下单的工程实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 12:07:18

ESP32在线烧录全解析:从原理到实战,浏览器就是你的刷机工具

上周一个外地朋友让我帮忙刷ESP32固件,他那台电脑上干干净净,没装Python,没装Arduino IDE,更别说esptool命令行工具了。我本来以为要远程指导他装一堆环境,结果只让他打开了一个网页,插上开发板&#xff0c…

作者头像 李华
网站建设 2026/9/4 12:05:24

10 分钟语音数据,练出专属变声模型:RVC 快速上手指南

10 分钟语音数据&#xff0c;练出专属变声模型&#xff1a;RVC 快速上手指南 【免费下载链接】Retrieval-based-Voice-Conversion-WebUI Easily train a good VC model with voice data < 10 mins! 项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voi…

作者头像 李华