用 kohya_ss 训练你的 AI 画师:零基础 LoRA 训练完整教程
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
你手里有 20 张喜欢的图,想让 AI 学会其中的"味道",再生成同风格的新图。这正是 kohya_ss 干的事:它把 Stable Diffusion 训练脚本包进图形界面,训练 LoRA 模型全程点击操作,不用写一行代码。
📇 kohya_ss 项目名片
kohya_ss 是一个免费开源的扩散模型训练工具,用 Gradio Web 界面包装了 Kohya 训练脚本。启动后浏览器里是一排训练标签页:选模型、选数据集、调参数,点"开始训练"它会自动拼出对应的命令行。
- 支持 LoRA、Dreambooth、完整微调、Textual Inversion 等训练方式
- 底模覆盖 SD 1.5/2.x、SDXL、SD3、Flux.1、Lumina Image 2.0 等
presets/内置大量预设配置,一键加载- 附带自动标注、图片分组等批量工具
🚀 三行命令跑起来
训练需要一张 NVIDIA 显卡,跑 SDXL LoRA 建议显存 12GB 以上。把项目拿到电脑上:
git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ssWindows 双击运行gui-uv.bat,Linux/macOS 执行:
./gui-uv.sh听起来很技术?其实剩下的都归脚本管:它检测到没装 uv 时会提示你,按 Y 就自动装好,环境、依赖它自己处理。首次启动下载依赖比较慢,完成后浏览器打开http://localhost:7860就能看到训练界面。
🎯 出好效果的关键:先备好食材
模型好坏,八成由训练数据决定。把数据当食材、预设当调味包——食材不行,再好的料也救不回来。项目自带一套标准样例:test/img/10_darius kawasaki person/里 8 张 512x512 的图片,每张配一个同名.txt描述文件,这就是理想的目录结构。
- 10~20 张高质量图足够,质量比数量重要
- 分辨率至少 512x512,SDXL 底模可更高
- 同一主题、风格统一,剔除模糊带水印的图
- 每张图一个同名
.txt,描述写法保持一致 - 角色类 LoRA 在描述里重复特征词 2~3 次(预设注释推荐)
- 先用 5 张图训 10 轮验证方法,跑通再上量
🧭 选一条适合你的路
三种主要训练方式,投入和产出差别很大:
| 方式 | 做什么 | 产物 | 适合谁 |
|---|---|---|---|
| LoRA | 训练一个可插拔的小网络 | 几十 MB 文件 | 新手首选:角色、风格、物体 |
| Dreambooth | 把特征注入底模整体训练 | 改后的底模 | 图片很少时的角色训练 |
| 完整微调 | 重训整个底模 | 数 GB 新模型 | 要深度改变模型气质 |
拿不准就选 LoRA:训得快、显存吃得少,效果不满意删掉重来也不心疼。
✍️ 上手:做出你的第一个 LoRA
目标:用 20 张喜欢的图教会 AI 一种新风格。
配置:图片放一个文件夹,用tools/caption.py批量生成同名.txt描述文件。打开 LoRA 标签页,选好底模和文件夹,加载presets/lora/SDXL - LoRA AI_characters standard v1.0.json这个预设。
关键参数只需动五个:
max_resolution:保持预设的 1024,1024。SDXL 的标准分辨率,低了上限就低了network_dim:保持预设的 32。角色风格 LoRA 的均衡选择,过小学不动,过大易过拟合- 学习率:保持预设的 2e-05。社区验证过的值,乱改是最常见的翻车原因
max_train_epochs:预设默认 100,首次改成 10~20。不够再加,宁少勿过sample_every_n_epochs:设为 5。每 5 轮出一张预览图,效果靠眼看
训练时盯两件事:loss 稳步下降,预览图一轮比一轮贴近你的训练图。如果预览开始糊掉、或者只"背"住了某一张图,就是过拟合,下次早点停。
训练结束会得到一个几十 MB 的 LoRA 文件,在出图软件里加载它、提示词带上特征词,就能生成你的风格了。
⚠️ 踩坑之前先看这
启动时提示 uv is not installed?按 Y 让脚本自动安装;按 N 就需要自己装完再跑一次。
报错 No module called tkinter?重装 Python 并确保勾选了"Add to PATH"。
Windows 报 page file 相关错误?调大系统页面文件(虚拟内存),训练会临时占用大量内存。
远程/SSH 下文件选择器点不动、确认框卡死?启动时加--headless,界面会隐藏本机选择器、改为手输路径,并跳过覆盖确认。
效果总是糊、细节丢失?八成是数据问题:分辨率低、风格杂、缺描述文件。回到"食材"一节重查。
🧰 再进一步
tools/group_images.py按主题自动给图片分组,整理大批素材省时间- 把
config example.toml复制成config.toml填好默认路径,模型目录、输出目录以后不用再选 - 不想手写描述?界面里的自动标注标签页(BLIP、WD14 tagger 等)可以批量生成
写在最后
跑通比完美更重要:第一个 LoRA 不惊艳很正常,关键是你会知道下一轮该动哪里。先照着test/img/的样例看懂目录长什么样,再换上自己的 20 张图——这一步走完,你就成功了一半。
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考