news 2026/9/4 15:13:46

Open Generative AI:免费的开源AI创意工作室,420+模型做图、剪片、数字人口播

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI:免费的开源AI创意工作室,420+模型做图、剪片、数字人口播

Open Generative AI:免费的开源AI创意工作室,420+模型做图、剪片、数字人口播

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个免费开源(MIT 协议)的 AI 创意工作室,覆盖文生图、图生图、文生视频、图生视频和口型同步,共 420 多个模型可选,没有内容过滤、没有订阅费。对你最大的好处是:不想给平台交月费、不想担心提示词被拦截、又想在自家机器上完全离线跑生成,它一条路就能走通。

它到底能干哪几件事

三个最常见的需求,它都直接给了对应的工作室,不用自己拼工具链。

出一张商业海报:文字出图,也能拿十几张参考图混风格

图像工作室是默认入口。你只输文字时,它给你 50 多个文生图模型:Flux、Nano Banana 2、Seedream 5.0、Midjourney、GPT-4o 都在里面,Nano Banana 2 支持 1K/2K/4K 分辨率输出。

真正少见的能力是多参考图:上传一张图后自动切换到 55+ 图生图模型,其中 Nano Banana 2 Edit 一次最多吃 14 张参考图,还有顺序编号,你排好顺序它按顺序用。做风格融合、换装、品牌视觉统一这类活,不用再手动抠图拼接。

剪一支短片:文生视频、图生视频加一套虚拟相机

视频工作室是同一套逻辑:纯文字走 40+ 文生视频模型(Kling、Sora、Veo、Wan、Seedance 2.0、Runway),给一张起始帧就切到 60+ 图生视频模型。Seedance 2.0 支持 5/10/15 秒时长和 16:9、9:16 等比例,横竖屏都能出。

想更"像拍的",去电影工作室:它把相机、镜头、焦距、光圈做成选择器,翻译成提示词修饰符——焦距从 8mm 超广角到 85mm 人像长焦,光圈 f/1.4(浅景深)、f/4(均衡)、f/11(全焦段清晰)三档。等于你不用写提示词,拨几个旋钮就控制景深和镜头语言。

让一张肖像开口说话:数字人口播和给视频换配音

口型同步工作室是它区别于多数图像工具的地方,9 个模型、两种模式:

  • 肖像图 + 音频 → 讲话视频,LTX 2.3 Lipsync 这类模型最高支持 1080p;
  • 已有视频 + 音频 → 口型重同步,适合给宣传片换语言配音。

做数字人口播、课程讲解、多语言素材,这两条路径都覆盖了。

上手最短路径

推荐直接下桌面应用,不用 Node、不用配环境:

  1. 从项目的 Releases 下载页选对应平台安装包(macOS 有 Apple Silicon 和 Intel 两个包,Windows 是 .exe,Linux 是 AppImage/.deb);
  2. 安装完成。macOS 首次会被 Gatekeeper 拦截,右键选"打开"即可;
  3. 首次使用会要一个 API key,填了就能用云端模型;只打算本地跑模型可以跳过。

想从源码跑(改代码、二次开发),最小步骤是:

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run electron:dev

注意npm run setup这步不能省,它负责构建 studio、工作流等子包,只跑npm install会起不来。

它凭什么值得试

  • 14 张参考图上限:Nano Banana 2 Edit 一次接收 14 张参考图,多数商业平台只给 1-3 张;
  • 口型同步双模式:9 个模型覆盖"肖像+音频"和"视频+音频",480p 到 1080p 都有;
  • 本地推理两条路:内置 sd.cpp(Metal/CUDA/Vulkan/ROCm)跑图像模型,外加可对接自己的 Wan2GP 服务器跑视频和大图模型,全程不需要 API key;
  • 镜头语言可视化:电影工作室把焦距、光圈、镜头类型做成选择器,见 CinemaStudio 组件;
  • 无内容过滤、可自托管:MIT 协议,数据留在自己机器上,提示词不被平台审查;
  • 可视化工作流:节点式编辑器把图、视频、音频模型串成管道,还能被 API 调用,引擎源码在 packages/Vibe-Workflow/。

按你的硬件对号入座

本地推理只在桌面应用里可用,且模型选型很吃内存。仓库 README 里给过实测结论,我整理如下:

你的机器选什么结果如何
8GB 内存(如 M 系基础款 Mac)SD 1.5 模型:Dreamshaper 8 或 Realistic Vision v5.1(各约 2.1GB)Metal 加速下约 1-2 秒/步;别碰 Z-Image,官方明确说 8GB 上会卡死系统
16GB 内存及以上Z-Image Turbo(2.5GB 权重 + 约 2.7GB 共享辅助文件)8 步出图,是目前本地速度质量平衡最好的
另有一台带 NVIDIA/AMD GPU 的机器跑 Wan2GP 远程服务,桌面应用填 URL 对接解锁 Wan 2.2、Flux.1 Dev、LTX Video 这些云端贵模型,Mac 也能当"前端"

两个实用提示:模型文件默认存在系统应用数据目录,多 GB 的权重想放别的盘,启动前设环境变量OPEN_GENERATIVE_AI_LOCAL_AI_DIR即可;上传过的参考图会存本地历史,跨会话复用不用重复传。

适合谁,不适合谁

适合:被 Midjourney、Runway 这类订阅制卡住预算的人;需要数字人口播、多语言配音的创作者;想在自有产品里嵌入生成能力、愿意读 模型定义文件 加自己模型的开发者;有一台 M 系 Mac、想不联网生成图像的人。

不适合:完全不想装任何东西、只想打开网页点几下的人——它没有一键云端托管形态,要么填 API key 要么本地配置;本地视频生成(Wan 2.2 这类)在消费级 GPU 上速度很慢,指望它当天出 1080p 长视频会失望,这种需求现阶段还是走云端模型更现实。

一句话判断:它解决的是"自由度和成本",不是"开箱即用的爽快"。想清楚自己要哪个,再决定要不要花半小时装本地模型。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 15:10:39

国内GEO优化服务商:传声港GEO六大行业服务经验与适配能力解析

国内GEO优化服务商:传声港GEO六大行业服务经验与适配能力解析在搜索"国内GEO优化服务商"时,越来越多企业开始关注服务商的行业经验——"这家GEO公司服务过我们行业吗""他们懂我们行业的规则和用户习惯吗"。GEO不是一套通用…

作者头像 李华
网站建设 2026/9/4 15:07:19

基于Matlab的深度学习人脸识别:从原理到工程实践

简介:本资源是一套基于MATLAB实现的深度学习人脸识别完整源码方案,面向计算机、电子信息工程、数学等专业的本科生,适用于课程设计、期末大作业或毕业设计中人脸识别模块的参考实现。代码采用Matlab深度学习工具箱构建端到端流程,…

作者头像 李华
网站建设 2026/9/4 15:05:49

软件测试效率提升实战:从用例设计到自动化与AI辅助

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 15:03:23

游戏辅助工具技术原理剖析:从图像识别到自动化控制

这次我们来看一个名为“依旧带飞辅助治疗王昭君”的项目。从标题来看,这很可能是一个与《王者荣耀》游戏角色“王昭君”相关的辅助工具或脚本,核心功能可能涉及“辅助治疗”或“带飞”等自动化操作。这类项目通常会引起技术爱好者对游戏AI、自动化脚本或…

作者头像 李华
网站建设 2026/9/4 14:59:41

ESP32-S3转接板PCB设计全流程:从原理图到打样

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 14:58:58

Claude HUD 实战:3 行实时状态监控,告别上下文焦虑

Claude HUD 实战:3 行实时状态监控,告别上下文焦虑 【免费下载链接】claude-hud A Claude Code plugin that shows whats happening - context usage, active tools, running agents, and todo progress 项目地址: https://gitcode.com/GitHub_Trendin…

作者头像 李华