news 2026/9/4 13:15:19

Open Generative AI 开源入门教程:600+ 模型 5 分钟做出 AI 绘画与视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI 开源入门教程:600+ 模型 5 分钟做出 AI 绘画与视频

Open Generative AI 开源入门教程:600+ 模型 5 分钟做出 AI 绘画与视频

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

这篇文章介绍 Open Generative AI——一个开源的 AI 图像与视频生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 600+ 主流模型接进同一个界面,没有内容过滤,不收订阅费,可以完全自托管。读完后,你能画出第一张 AI 绘画、让一张照片动起来、让肖像开口说话,并把同样的能力接进自己的应用。

🖼️ 文生图:写出真正出效果的提示词

图像工作室走"双轨"逻辑:默认是文生图模型,你一旦上传一张参考图,它就自动切换到图生图模型,不用手动切换模式。

写提示词时,把主体说全比堆形容词重要:"一只在阳光里睡觉的橘色虎斑猫,毛发有光泽"比"一只猫"好用得多;风格直接点名(油画、水墨、赛博朋克);光线、拍摄角度、材质这类细节值得单独一句。不想要的东西写进负面提示。第一次生成的结果不满意很正常,对照差距一次只改一处,迭代几轮通常会明显收敛。

新手选模型速查表

想做什么推荐模型备注
纯文字画图Flux、Nano Banana 2输出稳定,适合起步
改已有图片Nano Banana 2 Edit、Flux Kontext风格迁移、局部重绘
文字生成视频Kling、Seedance 2.0支持 5/10/15 秒时长
让肖像说话Infinite Talk、LTX Lipsync配合上传的音频

部分编辑类模型还支持多图输入,一次最多带 14 张参考图,上传面板带顺序编号,按你勾选的次序发给模型。实现细节可以看 图像工作室源码。

🎬 文生视频与 AI 口型同步

视频工作室和图像是同一套双轨:不传图走文生视频(40+ 模型),上传首帧走图生视频(60+ 模型)。时长、画幅(16:9、9:16 等)和质量档位都在同一块区域调整。

口型同步的两种模式与 9 个模型

Lip Sync 分两种输入模式:

  • 肖像图 + 音频:最常用,模型让图里的人开口并对上音轨,输出 480p 到 1080p;
  • 现有视频 + 音频:修正已有视频里的人物口型。

操作流程是固定的:选模式 → 传图或传视频 → 传音频 → 可选写一句期望的动作描述 → 点生成。任务历史单独保存,刷新页面后未完成的任务会自动续上。

🎥 电影工作室:把虚拟相机调出胶片感

想要"电影感"画面,用 Cinema Studio。它提供一台虚拟相机,把你的选择自动翻译成提示词修饰语,不用自己手抄相机参数。

四个相机参数要知道

  • 机身:从 16mm 复古胶片到 8K 数字,共 6 种,决定画面"底子";
  • 镜头:变形宽银幕、复古定焦、旋焦人像等 11 种;
  • 焦距:8mm 超广角到 85mm 人像,控制取景范围;
  • 光圈:f/1.4 浅景深、f/4 均衡、f/11 前后都实。

对应实现在 src/components/CinemaStudio.js。

💻 Open Generative AI 的三种安装方式

方式需要什么适合谁
在线版一个浏览器快速体验,零安装
桌面应用DMG / EXE / DEB 安装包日常使用、本地推理
源码构建Node.js 18+改功能、提代码

在线版打开即用,模型版本始终最新;桌面应用一键安装,还额外支持下面说的本地推理。走源码路线时,克隆命令必须带--recurse-submodules——工作流与 agent 两个子包放在子模块里,漏了的话启动会报"找不到 pages 目录"。

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI && npm run setup npm run electron:dev # 桌面版;npm run dev 启动网页版,地址 :3000

首次使用会要求填 API key;只打算跑本地模型的话可以跳过。

⚡ 桌面本地推理:用自己的显卡生成

桌面应用打开 设置 → Local Models,会看到两个可选引擎:

  • sd.cpp:引擎随应用附带、一键下载,能跑 SD 1.5、SDXL、Z-Image 系列;Apple Silicon 走 Metal 加速,无需 API key,在图像工作室模型选择器旁打开"Local"开关即可用;
  • Wan2GP:你自己跑一个服务端(Python + PyTorch,NVIDIA/AMD 显卡),应用只连它的 URL,可以跑 Flux、Qwen-Image、Wan 2.2、Hunyuan 这类大模型。

内存方面注意:Z-Image 系列建议 16GB 内存,8GB 的 Mac 用轻量 SD 1.5 更稳。模型权重默认放在应用数据目录(macOS 是~/Library/Application Support/open-generative-ai/local-ai),可通过环境变量挪到别的磁盘,设置面板会显示解析后的目录。

🛟 常见启动与生成问题排查

启动被拦怎么办

  • macOS Gatekeeper 拦截:在终端执行一次xattr -cr "/Applications/Open Generative AI.app",或对应用图标右键选择"打开",只需做一次;
  • Windows SmartScreen 警告:点"更多信息"→"仍要运行";
  • Linux 下 AppImage 起不来:先给它执行权限;还报错就补装 libfuse2 依赖;Ubuntu 24.04 及更新版本建议直接装 .deb,它自带 AppArmor 配置,能避开内核沙箱限制。

生成不符合预期怎么办

  • 细节不够:提高分辨率或切到高质量模式;
  • 没出结果:先核对模型类型和素材是否匹配——图生图模型不传图、文生图模型却传了图,都会被拒;
  • 速度慢:检查网络,或改用本地推理。

所有作品都进本地历史,可一键下载原图;之前上传过的素材能从历史面板里直接复用,不必重复上传。

🧭 上手之后:API、工作流与自定义模型

  • 接进自己的服务:应用内部生成统一走"提交任务 → 轮询结果"两步,网关代码在 app/api/,你可以用同样方式调用;
  • 可视化编排:Workflow Studio 用节点连接多个模型,带社区模板和本地调试台;
  • 扩展能力:模型清单集中在packages/studio/src/models.js维护,加自己的模型从这一处入手。

建议先选 Flux 连出几张图找到提示词手感,再试一次口型同步——那是从图像走到视频最短的一条路径。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 13:15:02

里德伯量子门原理与中性原子计算平台技术解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 13:08:58

5分钟把Blender连上Claude:BlenderMCP AI 3D建模手把手完整教程

5分钟把Blender连上Claude:BlenderMCP AI 3D建模手把手完整教程 【免费下载链接】blender-mcp Community plugin to control Blender 3D with any LLM of your choice 项目地址: https://gitcode.com/GitHub_Trending/bl/blender-mcp BlenderMCP 通过 MCP 协…

作者头像 李华
网站建设 2026/9/4 13:07:05

STM32音乐播放器开发指南:从音频解码到DMA传输实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 13:05:52

PPT Master:3步把文档变成原生可编辑的AI生成PPT

PPT Master:3步把文档变成原生可编辑的AI生成PPT 【免费下载链接】ppt-master AI turns documents or topics into real, native PowerPoint decks—with native shapes, transitions and animations, data-backed charts and tables on demand, audio narration fr…

作者头像 李华
网站建设 2026/9/4 13:02:55

MATLAB直连光谱仪SDK:打通硬件控制与实时数据闭环

简介:本资源是一份面向光学测量科研人员与自动化仪器开发工程师的MatLab与Morpho光谱仪集成实践方案,解决光谱数据采集系统快速原型搭建与SDK底层调用难题。压缩包仅含2个核心MATLAB脚本文件(.m),总大小仅2KB&#xff…

作者头像 李华