news 2026/9/4 14:17:15

Open Generative AI:免费用400+模型生成AI图像与视频,从本地部署到出片的完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI:免费用400+模型生成AI图像与视频,从本地部署到出片的完整指南

Open Generative AI:免费用400+模型生成AI图像与视频,从本地部署到出片的完整指南

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个 MIT 许可的自托管 AI 图像与视频生成工作台:它把 Flux、Midjourney、Kling、Sora、Veo 等 400+ 模型装进同一套界面,没有订阅费、没有内容过滤,也能在你自己的电脑上离线跑图像模型。这篇文章写给第一次接触它的人,讲清楚它有什么能力、需要什么硬件、以及怎么在半小时内部署好。

为什么用开源替代商业AI视频平台

如果你用过商业 AI 图像或视频工具,大概熟悉这三件事:按月订阅(项目文档里给出的市场参考价:Midjourney 约 $10–120/月,Runway 约 $12–76/月,实际以各家定价页为准)、提示词偶尔被拒或被改写、你上传的图和提示都存放在对方服务器上。

Open Generative AI 把这三点都换掉了:

  • MIT 许可,代码完全公开,可以商用、改界面、做成自己的产品
  • 提示词照原样处理,不经过内容过滤
  • 部署在自己机器或自己的服务器上,数据不离开本地

需要注意,它不是"一个开源模型",而是一个把 400+ 云端模型接进来的应用,同时自带两套本地推理引擎。先理解这一点,后面会好懂很多。

🖼️ 它能干什么:14 个工作室装在一个应用里

打开应用后是一排顶部标签,每个标签是一个"工作室",对应一类创作任务:

  • Image Studio:文生图 50+ 模型、参考图改图 55+ 模型。有没有上传参考图,系统自动切换对应模型池,不用手动选模式。兼容的编辑模型一次最多喂 14 张参考图,选择时带序号,顺序会原样传给模型。
  • Video Studio:同一套逻辑,40+ 文生视频、60+ 图生视频。传一张静态图就能变成动态素材。
  • Lip Sync Studio:9 个模型、两种输入——肖像图 + 音频得到说话视频,或已有视频 + 音频做口型修正。
  • Cinema Studio:虚拟摄影机,选机身、镜头、焦距、光圈来统一画面风格。
  • Workflow Studio:节点编辑器,把图像、视频、音频模型拖成流水线,带模板库和社区模板。
  • Agent Studio:对话式代理,用一句话描述任务,由它规划和执行生成。
  • 另有音频、视频高光剪辑、动态特效、营销素材、人物换形、AI 虚拟网红等专用工作室。

贯穿所有工作室的通用能力:参考图上传一次就存在本地,跨会话直接复用;历史生成结果有专门页面,可全分辨率一键下载。工作室的界面组件在 packages/studio/src/ 下,想改哪个就看哪个。

模型清单:400+ 模型由一个文件管理

不同厂商的模型走统一 API:先提交生成请求,再轮询结果,直到拿到图片或视频地址。文件上传走同一通道,参考图传完返回一个 URL,再交给模型使用。

各类模型的数量与代表(按仓库模型定义核对):

生成类型数量代表模型
文生图50+Flux、Nano Banana 2、Seedream 5.0、Midjourney、GPT-4o
图生图55+Nano Banana 2 Edit、Flux Kontext、Seedream Edit
文生视频40+Kling、Sora、Veo、Wan、Seedance 2.0、Hailuo
图生视频60+Kling I2V、Veo3 I2V、Runway I2V、Midjourney I2V
视频后期与特效35+Vibe Motion、AI Clipping
口型同步9Infinite Talk、LTX Lipsync、LatentSync
音频15+文本转音乐、remix、音频编辑
身体/外观替换3图像与视频的 Recast

合计 420+。所有模型的宽高比、分辨率、时长、质量档位等参数都写在 packages/studio/src/models.js 这一个文件里,网页版和桌面版读同一份定义,所以新增或调整模型只改这一处。

📦 如何在 Mac / Windows / Linux 上安装:三种方式

方式一:桌面安装包(推荐大多数人)

官方发布版为 1.0.9,提供免 Node.js 环境的一键安装包:

  • macOS Apple Silicon(M1–M4):arm64 DMG
  • macOS Intel:标准 DMG
  • Windows x64:NSIS 安装程序 exe
  • Linux:AppImage 或 .deb(Ubuntu / Debian 适用)

安装时有两个系统提示,各只会出现一次:

  • macOS 首次启动被拦截:应用没有经过 Apple 公证。可以走"系统设置 → 隐私与安全性"点"仍要打开",或在终端执行xattr -cr "/Applications/Open Generative AI.app"再打开。
  • Windows SmartScreen 警告:点"更多信息"→"仍要运行",安装到本地应用目录并生成开始菜单快捷方式。
  • Ubuntu 24.04+:内核安全策略可能阻止 AppImage 启动,建议直接装 .deb(自带 AppArmor 配置)。

方式二:从源码构建(贡献者或想改界面的人)

先装 Node.js 18+,然后:

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run electron:dev # 桌面版;网页版用 npm run dev

npm run setup会一次完成子模块初始化、依赖安装和 studio、workflow、agents 等子包构建,这一步是必须的——只跑npm install起不来。

方式三:Docker(服务器自托管)

仓库根目录的 docker-compose.yml 把容器 3000 端口映射到主机 3001,一条命令启动并配置为异常自动重启。

一个边界要说在前面:本地推理只在桌面版可用;网页版和 Docker 版都走云端模型,首次使用需要填一个 MuAPI 访问密钥(只用本地模型则可跳过)。

⚙️ 最低硬件要求是什么:在自己机器上离线跑图

桌面版的"设置 → 本地模型"里有两套独立引擎,按你的硬件各取所需。

引擎一:sd.cpp(内置,只出图)

C++ 推理引擎,与应用同机运行。在设置页一键安装后,模型直接下载到应用数据目录,不动系统目录,也不装到系统全局。

  • Apple Silicon 走 Metal GPU 加速,已内置在 macOS 安装包里
  • Linux / Windows 支持 CUDA、Vulkan、ROCm
  • 所有平台都能纯 CPU 跑,只是慢

可离线运行的模型:

模型基座体积说明
Dreamshaper 8SD 1.52.1 GB通用,Mac 上最轻的选择
Realistic Vision v5.1SD 1.52.1 GB照片写实
Anything v5SD 1.52.1 GB动漫与插画
SDXL Base 1.0SDXL6.9 GB高分辨率
Z-Image TurboDiT2.5 GB + 共享辅助文件 2.7 GB8 步快出,吃内存
Z-Image BaseDiT3.5 GB + 共享辅助文件 2.7 GB50 步高质量,吃内存

硬件参考:8GB 内存可以跑 SD 1.5 系列;Z-Image 系列建议 16GB RAM(权重加运行缓冲约 10GB),8GB 的 M 系列机器上已知会卡死系统,那台机器请留在 SD 1.5。磁盘预留 10–30GB 放权重,想放到其他盘就启动前设置环境变量OPEN_GENERATIVE_AI_LOCAL_AI_DIR。生成时在 Image Studio 选中本地模型、打开"Local"开关即可,不需要任何 API 密钥。相关逻辑见 electron/lib/localInference.js。

引擎二:Wan2GP(自架 GPU 服务器,图 + 视频)

这套引擎不随应用分发。你在一台有 CUDA 或 ROCm GPU 的机器上自己跑 Wan2GP 服务(开源的 Python + PyTorch 项目),桌面版只负责发提示词和取结果。

  • 覆盖 Flux.1 Dev、Qwen Image 等图像模型,以及 Wan 2.2、Hunyuan Video、LTX Video 等视频模型
  • GPU 机器可以是家里另一台游戏 PC,也可以是租来的 GPU 实例
  • 所以在 Mac 上同样可用:Mac 跑应用,局域网里填服务器地址(形如http://192.168.1.42:7860),点测试通过后保存

为什么不直接内置?因为 Wan2GP 的运行时(Sage attention、flash-attn 等内核)只兼容 CUDA,没有 Apple Silicon 路径,做成远程服务器形态才能覆盖全部用户。

🎥 Cinema Studio:用光圈和焦距控制画面

如果说图像工作室是"写提示词就行",Cinema Studio 则把一台虚拟摄影机摆到你面前:选好的参数会被翻译成优化过的提示词修饰,随请求一起送出。

可调参数:

  • 机身 6 种:8K 数字模块、全画幅电影数字、35mm 影棚数字,到 70mm 大画幅胶片、16mm 经典胶片
  • 镜头 11 种:移轴、紧凑型变形宽银幕、极端微距、70 年代电影定焦、旋涡散景、卤化光晕扩散等
  • 焦距 6 档:8mm 超广角到 85mm 特写人像,含 35mm 人眼视角、50mm 人像焦段
  • 光圈 3 档:f/1.4 浅景深、f/4 均衡、f/11 深对焦

适合需要统一视觉风格的场景:品牌物料、系列封面、短视频头图。

✅ 适合谁用,开始前要知道什么

适合你,如果

  • 不想按月订阅,且创作题材在商业平台上容易被拦
  • 想自托管、让数据和素材留在自己机器
  • 想把"模型库 + 工作室"嵌进自己的产品——MIT 许可,源码可读、界面可改

开始前确认三件事

  • 云端模型走 MuAPI,首次使用要填访问密钥;纯本地模式(sd.cpp)不需要密钥,但只能出图
  • 本地推理只在桌面版可用,网页版和 Docker 版都是云端
  • 没有 CUDA / ROCm GPU 就跑不了本地视频模型,视频仍走云端;14 张参考图、口型同步这类能力也依赖对应云端模型

边界接受之后,上手成本其实很低:下载安装包双击装好,在"设置 → 本地模型"下载一个 2.1GB 的 SD 1.5 权重,8GB 内存的机器就能离线出第一张图。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 14:13:31

SpringBoot+Vue全栈实战:个人财务管理系统设计与实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 14:12:50

【单片机毕业设计】多档位可调语音控制智能台灯硬件系统设计 基于单片机的自动调光人体感应智能台灯实现(021406)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

作者头像 李华
网站建设 2026/9/4 14:11:17

OpenScreen 导出失败快速修复:MP4 与 GIF 导不出的 3 个主因

OpenScreen 导出失败快速修复:MP4 与 GIF 导不出的 3 个主因 【免费下载链接】openscreen Create stunning demos for free. Open-source, no subscriptions, no watermarks, and free for commercial use. An alternative to Screen Studio. 项目地址: https://g…

作者头像 李华
网站建设 2026/9/4 14:09:55

一份配色,适配 20+ 终端:iTerm2-Color-Schemes 完整使用指南

一份配色,适配 20 终端:iTerm2-Color-Schemes 完整使用指南 【免费下载链接】iTerm2-Color-Schemes Over 450 terminal color schemes/themes for iTerm/iTerm2. Includes ports to Terminal, Konsole, PuTTY, Xresources, XRDB, Remmina, Termite, XFCE…

作者头像 李华
网站建设 2026/9/4 14:09:46

V 语言安装完整指南:5 分钟从零开始跑通 Hello World

V 语言安装完整指南&#xff1a;5 分钟从零开始跑通 Hello World 【免费下载链接】v Simple, fast, safe, compiled language for developing maintainable software. Compiles itself in <1s with zero library dependencies. Supports automatic C > V translation. ht…

作者头像 李华
网站建设 2026/9/4 14:09:21

微信聊天记录导出完全指南:4 种格式加年度报告,数据不出本机

微信聊天记录导出完全指南&#xff1a;4 种格式加年度报告&#xff0c;数据不出本机 【免费下载链接】WeChatMsg 提取微信聊天记录&#xff0c;将其导出成HTML、Word、CSV文档永久保存&#xff0c;对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_…

作者头像 李华