Open Generative AI 开源入门教程:600+ 模型 5 分钟做出 AI 绘画与视频
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
这篇文章介绍 Open Generative AI——一个开源的 AI 图像与视频生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 600+ 主流模型接进同一个界面,没有内容过滤,不收订阅费,可以完全自托管。读完后,你能画出第一张 AI 绘画、让一张照片动起来、让肖像开口说话,并把同样的能力接进自己的应用。
🖼️ 文生图:写出真正出效果的提示词
图像工作室走"双轨"逻辑:默认是文生图模型,你一旦上传一张参考图,它就自动切换到图生图模型,不用手动切换模式。
写提示词时,把主体说全比堆形容词重要:"一只在阳光里睡觉的橘色虎斑猫,毛发有光泽"比"一只猫"好用得多;风格直接点名(油画、水墨、赛博朋克);光线、拍摄角度、材质这类细节值得单独一句。不想要的东西写进负面提示。第一次生成的结果不满意很正常,对照差距一次只改一处,迭代几轮通常会明显收敛。
新手选模型速查表
| 想做什么 | 推荐模型 | 备注 |
|---|---|---|
| 纯文字画图 | Flux、Nano Banana 2 | 输出稳定,适合起步 |
| 改已有图片 | Nano Banana 2 Edit、Flux Kontext | 风格迁移、局部重绘 |
| 文字生成视频 | Kling、Seedance 2.0 | 支持 5/10/15 秒时长 |
| 让肖像说话 | Infinite Talk、LTX Lipsync | 配合上传的音频 |
部分编辑类模型还支持多图输入,一次最多带 14 张参考图,上传面板带顺序编号,按你勾选的次序发给模型。实现细节可以看 图像工作室源码。
🎬 文生视频与 AI 口型同步
视频工作室和图像是同一套双轨:不传图走文生视频(40+ 模型),上传首帧走图生视频(60+ 模型)。时长、画幅(16:9、9:16 等)和质量档位都在同一块区域调整。
口型同步的两种模式与 9 个模型
Lip Sync 分两种输入模式:
- 肖像图 + 音频:最常用,模型让图里的人开口并对上音轨,输出 480p 到 1080p;
- 现有视频 + 音频:修正已有视频里的人物口型。
操作流程是固定的:选模式 → 传图或传视频 → 传音频 → 可选写一句期望的动作描述 → 点生成。任务历史单独保存,刷新页面后未完成的任务会自动续上。
🎥 电影工作室:把虚拟相机调出胶片感
想要"电影感"画面,用 Cinema Studio。它提供一台虚拟相机,把你的选择自动翻译成提示词修饰语,不用自己手抄相机参数。
四个相机参数要知道
- 机身:从 16mm 复古胶片到 8K 数字,共 6 种,决定画面"底子";
- 镜头:变形宽银幕、复古定焦、旋焦人像等 11 种;
- 焦距:8mm 超广角到 85mm 人像,控制取景范围;
- 光圈:f/1.4 浅景深、f/4 均衡、f/11 前后都实。
对应实现在 src/components/CinemaStudio.js。
💻 Open Generative AI 的三种安装方式
| 方式 | 需要什么 | 适合谁 |
|---|---|---|
| 在线版 | 一个浏览器 | 快速体验,零安装 |
| 桌面应用 | DMG / EXE / DEB 安装包 | 日常使用、本地推理 |
| 源码构建 | Node.js 18+ | 改功能、提代码 |
在线版打开即用,模型版本始终最新;桌面应用一键安装,还额外支持下面说的本地推理。走源码路线时,克隆命令必须带--recurse-submodules——工作流与 agent 两个子包放在子模块里,漏了的话启动会报"找不到 pages 目录"。
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI && npm run setup npm run electron:dev # 桌面版;npm run dev 启动网页版,地址 :3000首次使用会要求填 API key;只打算跑本地模型的话可以跳过。
⚡ 桌面本地推理:用自己的显卡生成
桌面应用打开 设置 → Local Models,会看到两个可选引擎:
- sd.cpp:引擎随应用附带、一键下载,能跑 SD 1.5、SDXL、Z-Image 系列;Apple Silicon 走 Metal 加速,无需 API key,在图像工作室模型选择器旁打开"Local"开关即可用;
- Wan2GP:你自己跑一个服务端(Python + PyTorch,NVIDIA/AMD 显卡),应用只连它的 URL,可以跑 Flux、Qwen-Image、Wan 2.2、Hunyuan 这类大模型。
内存方面注意:Z-Image 系列建议 16GB 内存,8GB 的 Mac 用轻量 SD 1.5 更稳。模型权重默认放在应用数据目录(macOS 是~/Library/Application Support/open-generative-ai/local-ai),可通过环境变量挪到别的磁盘,设置面板会显示解析后的目录。
🛟 常见启动与生成问题排查
启动被拦怎么办
- macOS Gatekeeper 拦截:在终端执行一次
xattr -cr "/Applications/Open Generative AI.app",或对应用图标右键选择"打开",只需做一次; - Windows SmartScreen 警告:点"更多信息"→"仍要运行";
- Linux 下 AppImage 起不来:先给它执行权限;还报错就补装 libfuse2 依赖;Ubuntu 24.04 及更新版本建议直接装 .deb,它自带 AppArmor 配置,能避开内核沙箱限制。
生成不符合预期怎么办
- 细节不够:提高分辨率或切到高质量模式;
- 没出结果:先核对模型类型和素材是否匹配——图生图模型不传图、文生图模型却传了图,都会被拒;
- 速度慢:检查网络,或改用本地推理。
所有作品都进本地历史,可一键下载原图;之前上传过的素材能从历史面板里直接复用,不必重复上传。
🧭 上手之后:API、工作流与自定义模型
- 接进自己的服务:应用内部生成统一走"提交任务 → 轮询结果"两步,网关代码在 app/api/,你可以用同样方式调用;
- 可视化编排:Workflow Studio 用节点连接多个模型,带社区模板和本地调试台;
- 扩展能力:模型清单集中在
packages/studio/src/models.js维护,加自己的模型从这一处入手。
建议先选 Flux 连出几张图找到提示词手感,再试一次口型同步——那是从图像走到视频最短的一条路径。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考