Open Generative AI:免费的开源AI创意工作室,420+模型做图、剪片、数字人口播
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个免费开源(MIT 协议)的 AI 创意工作室,覆盖文生图、图生图、文生视频、图生视频和口型同步,共 420 多个模型可选,没有内容过滤、没有订阅费。对你最大的好处是:不想给平台交月费、不想担心提示词被拦截、又想在自家机器上完全离线跑生成,它一条路就能走通。
它到底能干哪几件事
三个最常见的需求,它都直接给了对应的工作室,不用自己拼工具链。
出一张商业海报:文字出图,也能拿十几张参考图混风格
图像工作室是默认入口。你只输文字时,它给你 50 多个文生图模型:Flux、Nano Banana 2、Seedream 5.0、Midjourney、GPT-4o 都在里面,Nano Banana 2 支持 1K/2K/4K 分辨率输出。
真正少见的能力是多参考图:上传一张图后自动切换到 55+ 图生图模型,其中 Nano Banana 2 Edit 一次最多吃 14 张参考图,还有顺序编号,你排好顺序它按顺序用。做风格融合、换装、品牌视觉统一这类活,不用再手动抠图拼接。
剪一支短片:文生视频、图生视频加一套虚拟相机
视频工作室是同一套逻辑:纯文字走 40+ 文生视频模型(Kling、Sora、Veo、Wan、Seedance 2.0、Runway),给一张起始帧就切到 60+ 图生视频模型。Seedance 2.0 支持 5/10/15 秒时长和 16:9、9:16 等比例,横竖屏都能出。
想更"像拍的",去电影工作室:它把相机、镜头、焦距、光圈做成选择器,翻译成提示词修饰符——焦距从 8mm 超广角到 85mm 人像长焦,光圈 f/1.4(浅景深)、f/4(均衡)、f/11(全焦段清晰)三档。等于你不用写提示词,拨几个旋钮就控制景深和镜头语言。
让一张肖像开口说话:数字人口播和给视频换配音
口型同步工作室是它区别于多数图像工具的地方,9 个模型、两种模式:
- 肖像图 + 音频 → 讲话视频,LTX 2.3 Lipsync 这类模型最高支持 1080p;
- 已有视频 + 音频 → 口型重同步,适合给宣传片换语言配音。
做数字人口播、课程讲解、多语言素材,这两条路径都覆盖了。
上手最短路径
推荐直接下桌面应用,不用 Node、不用配环境:
- 从项目的 Releases 下载页选对应平台安装包(macOS 有 Apple Silicon 和 Intel 两个包,Windows 是 .exe,Linux 是 AppImage/.deb);
- 安装完成。macOS 首次会被 Gatekeeper 拦截,右键选"打开"即可;
- 首次使用会要一个 API key,填了就能用云端模型;只打算本地跑模型可以跳过。
想从源码跑(改代码、二次开发),最小步骤是:
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run electron:dev注意npm run setup这步不能省,它负责构建 studio、工作流等子包,只跑npm install会起不来。
它凭什么值得试
- 14 张参考图上限:Nano Banana 2 Edit 一次接收 14 张参考图,多数商业平台只给 1-3 张;
- 口型同步双模式:9 个模型覆盖"肖像+音频"和"视频+音频",480p 到 1080p 都有;
- 本地推理两条路:内置 sd.cpp(Metal/CUDA/Vulkan/ROCm)跑图像模型,外加可对接自己的 Wan2GP 服务器跑视频和大图模型,全程不需要 API key;
- 镜头语言可视化:电影工作室把焦距、光圈、镜头类型做成选择器,见 CinemaStudio 组件;
- 无内容过滤、可自托管:MIT 协议,数据留在自己机器上,提示词不被平台审查;
- 可视化工作流:节点式编辑器把图、视频、音频模型串成管道,还能被 API 调用,引擎源码在 packages/Vibe-Workflow/。
按你的硬件对号入座
本地推理只在桌面应用里可用,且模型选型很吃内存。仓库 README 里给过实测结论,我整理如下:
| 你的机器 | 选什么 | 结果如何 |
|---|---|---|
| 8GB 内存(如 M 系基础款 Mac) | SD 1.5 模型:Dreamshaper 8 或 Realistic Vision v5.1(各约 2.1GB) | Metal 加速下约 1-2 秒/步;别碰 Z-Image,官方明确说 8GB 上会卡死系统 |
| 16GB 内存及以上 | Z-Image Turbo(2.5GB 权重 + 约 2.7GB 共享辅助文件) | 8 步出图,是目前本地速度质量平衡最好的 |
| 另有一台带 NVIDIA/AMD GPU 的机器 | 跑 Wan2GP 远程服务,桌面应用填 URL 对接 | 解锁 Wan 2.2、Flux.1 Dev、LTX Video 这些云端贵模型,Mac 也能当"前端" |
两个实用提示:模型文件默认存在系统应用数据目录,多 GB 的权重想放别的盘,启动前设环境变量OPEN_GENERATIVE_AI_LOCAL_AI_DIR即可;上传过的参考图会存本地历史,跨会话复用不用重复传。
适合谁,不适合谁
适合:被 Midjourney、Runway 这类订阅制卡住预算的人;需要数字人口播、多语言配音的创作者;想在自有产品里嵌入生成能力、愿意读 模型定义文件 加自己模型的开发者;有一台 M 系 Mac、想不联网生成图像的人。
不适合:完全不想装任何东西、只想打开网页点几下的人——它没有一键云端托管形态,要么填 API key 要么本地配置;本地视频生成(Wan 2.2 这类)在消费级 GPU 上速度很慢,指望它当天出 1080p 长视频会失望,这种需求现阶段还是走云端模型更现实。
一句话判断:它解决的是"自由度和成本",不是"开箱即用的爽快"。想清楚自己要哪个,再决定要不要花半小时装本地模型。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考