1. 先搞清楚 Flux 3、Krea 2 和深度图洗图到底能做什么
如果你最近在玩 AI 图像生成,尤其是 Stable Diffusion 这类工具,那你大概率被 Flux 3、Krea 2 和“深度图洗图”这几个词刷过屏。很多人一上来就找模型、下提示词,但折腾半天发现要么跑不起来,要么效果和预期差很远。
这篇文章不绕弯子,直接说结论:Flux 3 是目前在图像质量和细节控制上表现非常突出的一个开源模型,Krea 2 是一个强大的在线风格库和提示词灵感工具,而“深度图洗图”则是利用 ControlNet 的深度图功能,对现有图片进行风格、细节重构的高级玩法。这三者结合,能让你从“抽卡碰运气”升级到“有目的地控制画面”。
但别急着去下载。在动手前,你得先明白它们各自解决什么问题:
- Flux 3:它不是一个“更好”的 SD 模型那么简单。它的核心优势在于对复杂提示词的理解更精准,生成的图像细节(如纹理、光影、结构)更丰富、更合理。这意味着你写“一个穿着复杂蕾丝长裙的精灵在发光森林里”,它更有可能把蕾丝的纹理和森林的光晕都做出来,而不是糊成一团。
- Krea 2:它解决了“我有想法,但不知道怎么写提示词”的痛点。它的风格库里有大量由社区训练好的视觉风格(LoRA 或概念),你选择一个风格,它就能生成与之匹配的高质量提示词。它是个“提示词翻译器”和“风格灵感库”,能极大降低你构思提示词的难度。
- 深度图洗图:这是 ControlNet 的一个经典应用。简单说,就是用一张现有图片(比如你拍的照片或一张不满意的 AI 图)生成它的深度信息图,然后用这个深度图去约束新的生成过程。这样,新图会保持原图的构图和空间结构,但人物、风格、细节、光照全部可以按你的新提示词彻底改变。这就是“洗图”——保留骨架,换掉血肉和皮肤。
所以,这套组合拳的价值在于:用 Krea 2 找到风格和提示词灵感,用 Flux 3 实现高质量、高细节的生成,再用深度图 ControlNet 来精准控制画面构图,对不满意的图进行定向改造。适合已经会用 SD WebUI(如 AUTOMATIC1111 或 ComfyUI)基础功能,想进一步提升出图质量和控制力的玩家。
2. 环境准备:你的机器到底能不能跑 Flux 3?
在兴奋地下载模型之前,先冷静下来检查你的硬件和软件环境。这是避免后续 90% 报错的关键。
2.1 硬件与显存要求
Flux 3 模型体积不小,对显存有明确要求。别相信“低配也能玩”的片面说法,那通常意味着大幅牺牲分辨率或批量数,体验很差。
- 最低要求:拥有一张8GB 显存的 NVIDIA GPU(如 RTX 3070, RTX 4060 Ti)。在这个配置下,你基本只能以512x512或768x768的分辨率进行单张图片生成。开启一个 ControlNet(如深度图)后,显存会非常紧张,容易爆显存(Out of Memory)。
- 流畅体验:建议12GB 显存及以上(如 RTX 3060 12G, RTX 4070, RTX 4080)。这个配置可以在1024x1024分辨率下比较从容地运行,并且可以同时使用 1-2 个 ControlNet 进行控制。
- CPU 和内存:虽然主要吃 GPU,但一个性能尚可的 CPU(如 Intel i5/R5 以上)和16GB 以上的系统内存是保证 WebUI 稳定运行的基础。处理大图或复杂流程时,内存不足也会导致崩溃。
我的建议是:先别管模型,打开你的任务管理器或nvidia-smi命令,看看你日常跑 SD 1.5 或 SDXL 模型时显存占用多少。如果已经接近满负荷,那么跑 Flux 3 就需要更精细的参数调整。
2.2 软件与部署选择
Flux 3 目前主要可以通过两种方式使用:
集成在 SD WebUI 中(如 AUTOMATIC1111 或 ComfyUI):
- 这是最推荐给个人玩家的方式。你需要将 Flux 3 的模型文件(通常是
.safetensors格式)下载到正确的模型文件夹。 - 对于 AUTOMATIC1111:模型应放在
stable-diffusion-webui/models/Stable-diffusion/目录下。 - 对于 ComfyUI:模型应放在
ComfyUI/models/checkpoints/目录下。 - 你需要确保你的 WebUI 版本是比较新的,以支持 Flux 3 所需的特定参数(如
guidance_scale范围可能不同)。
- 这是最推荐给个人玩家的方式。你需要将 Flux 3 的模型文件(通常是
官方或第三方提供的独立工具/API:
- 有些平台提供了在线试玩或封装好的客户端。这对于不想本地部署的用户是快速体验的途径。
- 但请注意:在线服务通常有次数、分辨率或内容限制,且无法与本地丰富的 ControlNet 插件生态无缝结合。对于“深度图洗图”这种需要高度自定义控制的操作,本地部署的 WebUI 是唯一选择。
部署决策点:如果你已经熟悉 SD WebUI 的操作,并且主要想玩“深度图洗图”这种进阶控制,务必选择本地 WebUI 部署。如果只是想快速感受下 Flux 3 的出图质量,可以尝试在线服务。
3. 实战第一步:获取并验证 Flux 3 与 Krea 2 风格提示词
环境确认无误后,我们开始实操。第一步不是直接生成大师级作品,而是确保基础流程能跑通。
3.1 获取与放置 Flux 3 模型
- 模型来源:从可信的模型发布站(如 Civitai、Hugging Face)搜索 “Flux 3” 或 “flux-dev”。注意辨别,选择下载量高、评价好的版本。核心模型文件通常叫
flux3-dev.safetensors或类似名称。 - 放置模型:如前所述,将下载的
.safetensors文件放入你 WebUI 对应的 checkpoints 模型目录。 - 重启 WebUI:放置后,重启你的 WebUI 界面,在模型选择下拉列表中应该能看到新加入的 Flux 3 模型,选中它。
3.2 利用 Krea 2 风格库获取高质量提示词
Krea 2 是一个网站,不需要本地安装。它的用法是:
- 访问 Krea 2 网站。
- 在它的“风格探索”或“提示词生成”区域,浏览你喜欢的风格。比如你想生成“赛博朋克城市夜景”或“水墨风山水”。
- 点击某个风格,Krea 2 通常会展示用该风格生成的样图,并提供生成这张图所使用的完整提示词(Prompt)。
- 复制这段提示词。这就是你的“风格种子”。
关键点:不要直接照搬 Krea 2 的提示词就以为万事大吉。你需要理解这段提示词的结构。它通常包含:
- 风格描述词:如
digital art, concept art, cinematic lighting。 - 质量强化词:如
masterpiece, best quality, ultra detailed, 8k。 - 核心主体描述:如
a lone samurai standing on a cliff, cherry blossoms flying。 - 技术参数:有时会包含像
flux这样的模型触发词,或者sharp focus这样的细节要求。
你的任务是学习这种描述结构,而不是死记硬背。将复制的提示词作为模板,替换其中的主体部分,来生成你想要的内容。
3.3 运行第一个 Flux 3 生成测试
现在,在 WebUI 中执行一次最简单的生成,目的是验证模型加载是否正确。
- 选择模型:确保下拉菜单选中了 Flux 3。
- 输入提示词:使用一段从 Krea 2 获取的、相对简单的提示词。例如:
masterpiece, best quality, a serene landscape with a lake and mountains, digital art。 - 设置基础参数:
- 采样器(Sampler):对于 Flux 3,可以尝试
DPM++ 2M Karras或Euler a。不同采样器效果有差异,这是出图风格的一部分。 - 迭代步数(Steps):20-30 步是一个不错的起点。Flux 3 可能在较少步数下就有不错表现,可以逐步调整。
- 提示词引导系数(CFG Scale):Flux 3 常用的范围可能与 SDXL 不同,可以从 5-7 开始尝试。
- 分辨率(Width/Height):根据你的显存,先从 768x768 或 1024x1024 开始。
- 批量大小(Batch):第一次只生成 1 张。
- 采样器(Sampler):对于 Flux 3,可以尝试
- 点击生成:观察过程是否报错,以及最终输出图片的质量。
成功标志:能够正常完成采样过程,并输出一张符合提示词描述的、细节丰富的图片。如果在此步就出现显存不足、黑图或严重扭曲,需要回到第二步检查环境和参数(尤其是降低分辨率)。
4. 核心玩法:深度图 ControlNet 一键“洗图”全流程
单张生成验证通过后,进入最有价值的环节——深度图洗图。这个功能让你能彻底改造一张现有图片。
4.1 什么是深度图?为什么它能“洗图”?
深度图是一张灰度图,用颜色的深浅来表示画面中物体距离摄像机的远近。白色代表最近,黑色代表最远。 ControlNet 的深度图模型,能先提取一张输入图片的深度信息,然后在生成新图片时,强制让 AI 按照这个深度结构去“作画”。这样,新图就和原图有了完全相同的构图和空间关系,但画面内容可以天差地别。
4.2 准备工作:安装与启用 ControlNet
- 安装:如果你使用 AUTOMATIC1111,在“扩展(Extensions)”标签页中,安装
sd-webui-controlnet扩展并重启。 - 下载模型:你需要下载 ControlNet 的深度图预处理器和模型。在 WebUI 的 ControlNet 面板,点击“模型”旁边的下载图标,找到并下载
control_v11f1p_sd15_depth或control_v11p_sd15_depth等深度模型。对于 Flux 3,可能需要适配 SDXL 的深度模型,如controlnet-depth-sdxl-1.0,请根据你的 Flux 3 版本选择。 - 放置模型:下载的模型文件(
.pth或.safetensors)应放在stable-diffusion-webui/extensions/sd-webui-controlnet/models/目录下。
4.3 “洗图”五步操作法
假设你有一张人物照片original.jpg,你觉得背景杂乱,人物表情也不够好,想把它重构成一张奇幻风格的肖像画。
第1步:上传原图并启用 ControlNet在文生图(txt2img)或图生图(img2img)页面,展开 ControlNet 面板。将你的original.jpg拖入 ControlNet 的图像上传区域。勾选“启用(Enable)”和“像素完美(Pixel Perfect)”(如果可用)。勾选“允许预览(Allow Preview)”。
第2步:选择预处理器与模型
- 预处理器(Preprocessor):选择
depth_anything、depth_midas或depth_zoe。它们都是提取深度图的算法,效果略有差异。depth_anything是较新且通用的选择。点击“预览(Preview)”按钮,你会在旁边看到生成的黑白深度图。检查深度图是否清晰地区分出了前景(人物,较白)和背景(较黑)。 - 模型(Model):选择你下载的深度图控制模型,例如
control_v11f1p_sd15_depth。
第3步:设置控制权重与模式
- 控制权重(Control Weight):通常从0.8 到 1.2开始尝试。权重越高,新图对原图结构的遵从度越强。如果你想大幅度改变人物姿态,可以调低(如0.6);如果想严格保持姿势,就调高(如1.2)。
- 引导介入/终止时机(Starting/Ending Control Steps):对于深度图控制,通常让 ControlNet 在生成早期介入,中后期减弱影响。可以设置为开始 0.0, 结束 0.8。这意味着从第0步开始控制,到总步数的80%时逐步放弃控制,让AI在最后阶段自由发挥细节。
- 控制模式(Control Mode):选择“平衡”或“我的提示词更重要”。
第4步:编写你的“重绘”提示词这是“洗图”的灵魂。你要用文字描述你希望的新图是什么样子。
- 正向提示词:结合从 Krea 2 学到的风格词。例如:
(masterpiece, best quality, ultra detailed, 8k), 1girl, fantasy elf queen, intricate silver crown, glowing blue eyes, ethereal light, in a mystical crystal forest, digital painting, art by greg rutkowski and alphonse mucha。 - 反向提示词:写上你不想要的内容,如
worst quality, low quality, normal quality, blurry, deformed hands, extra fingers。
第5步:生成与迭代
- 回到主界面,选择 Flux 3 模型。
- 采样步数可以设高一些,如 30-40,给 AI 更多细化空间。
- 去噪强度(Denoising strength):如果你在图生图(img2img)模式下操作,这个参数至关重要。它决定了在原有图片基础上“改动”的幅度。对于彻底“洗图”,通常需要较高的值,如0.7 到 0.9。在文生图(txt2img)模式下配合 ControlNet 使用,则无需关心此参数。
- 点击生成。
结果判断:成功的“洗图”作品,应该能清晰看到原图的人物轮廓和站位,但服装、发型、面容、背景乃至光照全部变成了你提示词描述的奇幻风格。如果发现人物姿势严重变形或背景混乱,需要调整 ControlNet 权重、引导时机,或者检查深度图预览是否准确。
5. 参数深度解析与高级技巧
基础流程跑通后,通过调整这些参数,你能更精细地控制输出。
5.1 Flux 3 关键参数理解
- CFG Scale:提示词相关性。Flux 3 可能对 CFG 更敏感。太低(<5)会导致图像忽略你的提示,自由发挥;太高(>10)可能导致图像颜色过饱和、细节生硬甚至出现伪影。建议在5.0 - 8.0之间微调。
- 采样器与步数:
DPM++ 2M Karras通常能产生清晰、细节丰富的图像,20-30步即可。Euler a可能色彩更鲜艳,但有时需要更多步数(30+)来稳定细节。可以固定一个提示词,用不同采样器各跑几张,对比选择。 - 分辨率与高分辨率修复(Hires. fix):Flux 3 在原生高分辨率下表现更好。如果显存不足,可以先用基础分辨率(如768x768)生成,然后开启 Hires. fix,使用一个 upscaler(如
4x-UltraSharp)进行2倍放大,并设置一个较低的重绘幅度(Denoising strength, 如0.2-0.35),这样能在放大同时补充细节。
5.2 ControlNet 深度图进阶控制
- 多 ControlNet 叠加:深度图可以和其他 ControlNet 模型叠加使用,实现更强控制。例如:
- 深度图 + Canny(线稿):深度控制结构,Canny 控制轮廓边缘,能让生成的角色更精准地贴合原图外形。
- 深度图 + OpenPose(姿态):深度控制场景空间,OpenPose 控制人物骨骼姿态,适合在复杂场景中精确重塑人物动作。
- 使用技巧:叠加时,要适当降低每个 ControlNet 的权重(例如都设为0.7),避免控制信号冲突导致图像扭曲。
- 预处理器参数调整:在深度图预处理器旁可能有
Preprocessor Resolution参数。调高它(如从512到1024)会让深度图更精细,但也更消耗计算资源,且不一定总是更好,有时会导致过度分割。
5.3 提示词工程:超越 Krea 2 模板
Krea 2 是起点,但不是终点。你需要学会自己“写”提示词。
- 结构化提示词:将提示词分为几个部分,用逗号分隔。例如:
[质量词], [主体描述], [细节描述], [风格/艺术家], [技术参数]。 - 权重调整:使用
(word:1.2)来增加某个词的权重,使用[word]来降低权重。例如:(crystal armor:1.3)会让水晶盔甲的概念更突出。 - 负面提示词的重要性:对于 Flux 3 这种高能力模型,好的负面提示词能有效过滤掉低质量、畸变的元素。除了通用的质量负面词,还可以加入你特定不想看到的,如
cartoon, 3d render, photo如果你想要绘画感。 - 迭代与记录:不要指望一次成功。用一个固定的种子(Seed),只修改一个参数(比如 CFG、某个提示词权重),批量生成4-6张图,对比效果。这是理解参数影响最有效的方法。
6. 常见问题排查与优化建议
遇到问题别慌,按这个顺序排查。
6.1 生成失败或报错
- 爆显存(CUDA out of memory):
- 首先降低分辨率(Width/Height)。
- 关闭 Hires. fix。
- 将批量大小(Batch size)设为1。
- 在 WebUI 设置中启用
--medvram或--lowvram参数启动(对 AUTOMATIC1111)。 - 尝试使用
xformers优化(如果已安装)。
- 生成黑图或纯色图:
- 检查是否选对了 Flux 3 模型。
- 检查提示词是否过于简单或矛盾。
- 大幅调整 CFG Scale 值,尝试 3 到 10 的范围。
- 更换采样器。
- ControlNet 不生效(图片完全不受控制):
- 确认 ControlNet 单元已“启用(Enable)”。
- 检查预处理器是否成功生成了预览图(非全黑或全灰)。
- 确认选择的“模型”与“预处理器”匹配(如 depth 预处理器对应 depth 模型)。
- 提高控制权重(Control Weight)到 1.0 以上。
6.2 输出质量不佳
- 画面模糊、缺乏细节:
- 增加采样步数(Steps)。
- 尝试不同的采样器。
- 在提示词中加入细节描述词,如
ultra detailed, intricate details, sharp focus。 - 使用 Hires. fix 进行放大和轻微重绘。
- 颜色怪异或过饱和:
- 降低 CFG Scale。
- 在负面提示词中加入
oversaturated, vibrant。
- 人物脸部或手部畸形:
- 这是 AI 通病。在负面提示词中强化
deformed hands, bad hands, mutated hands, ugly face, bad face。 - 使用 ADetailer 等面部修复扩展进行后期处理。
- 尝试使用“深度图+OpenPose”双重控制,更稳定地锁定人体结构。
- 这是 AI 通病。在负面提示词中强化
6.3 工作流优化建议
- 分步进行:不要试图一步到位生成完美大图。先用小分辨率(如512x768)和较低步数(20步)快速测试构图、风格和 ControlNet 效果。确定满意后,再固定种子(Seed),提高分辨率和步数进行精炼。
- 管理你的资源:Flux 3 模型文件很大,定期清理不用的模型。生成的图片及时整理,可以使用标签工具进行管理。
- 备份与版本:当你调试出一组非常满意的参数(模型、提示词、ControlNet 设置、采样参数)时,及时保存为 WebUI 的“预设(Preset)”或截图记录。这比你下次凭记忆重新调要可靠得多。
这套从 Flux 3 模型准备,到 Krea 2 提示词获取,再到深度图 ControlNet 洗图的流程,其核心价值在于将“不可控的随机生成”变成了“有输入、可控制的定向创作”。真正的熟练,来自于针对具体问题(比如“如何把这张自拍照变成中世纪骑士”)进行反复的参数调试和提示词打磨。开始时可能会觉得繁琐,但一旦掌握了这个控制回路,你创作的自由度和成功率会远超漫无目的地抽卡。