一、说明
文章中的描述只是尝鲜的记录,还没有深度学习,知其所以然的阶段,所以都是描述性文字,目的是想看看V100能跑多少comfyui模型,后续也许会有更深点的学习,当然在应用阶段
Qwen-Image是阿里巴巴通义千问团队发布的首个图像生成基础模型。它是一个在 Apache 2.0 许可证下开源的 20B 参数 MMDiT(多模态扩散 Transformer)模型。该模型在复杂文本渲染和精准图像编辑方面取得了重大进展,实现了包括英文和中文在内的多种语言的高保真输出。模型亮点:
- 卓越的多语言文本渲染:支持英文、中文、韩文、日文等多语言高精度文本生成,保持字体细节和布局一致性
- 多样化的艺术风格:从写实场景到印象派画作,从动漫美学到极简设计,流畅适应各种创意提示词
- 中文支持很好,就可以让我们用它了
二、看看我们将实验哪几个工作流
qwen与z-image是我们重点学习对象,z-image后面我们还会深入学习,今天看看qwen
三、开始qwen image之旅
1、Qwen Image 2.1 图像编辑
首先看看需要的模型,得下载,时间啊时间
中间这个就是Qwen Image 2.1图像编辑节点
关于Qwen Image 2.1图像编辑节点,所有参数均围绕“替换角色服装”的编辑任务配置,下面为你逐项拆解说明。
📋 输入与提示词配置
- 参考图通道:提供了
image_1到image_10共10个图像输入位,完全匹配Qwen-Image-2.1最多支持10张参考图的特性,可同时导入角色原图、服装参考图等素材,保证编辑后人物身份特征不丢失。- resolution:当前值为0,代表由模型自动适配输入参考图的原生分辨率,无需手动强制指定输出尺寸。
- positive_prompt:当前填写的编辑指令为
Replace costumes for the character,明确告知模型本次任务是替换图中角色的服装。- refine_prompt:该选项已开启,可对生成结果进行细节优化,进一步提升服装替换后的画面精细度。
- negative_prompt:当前为空,可后续补充不需要出现的画面元素,避免生成瑕疵。
⚙️ 生成核心参数
- cfg:当前值为1.0,符合Qwen-Image-2.1默认不开高CFG的特性,该设置下模型生成自由度更高,画面风格更自然。
- steps:当前设置为25步,属于兼顾生成速度与画面质量的中等采样步数,适合快速完成服装替换类编辑任务。
- custom_size:已开启自定义尺寸,输出分辨率设置为
width 1024、height 1024,是1:1的标准正方形高清输出尺寸。- sampler:选择euler采样器,是AI绘图中速度快、稳定性强的经典采样算法。
- scheduler:当前配置为simple调度器,适配轻量快速的生成场景。
- seed:固定随机种子为
1095460012924539,锁定该值后,在其他参数不变的情况下可以复现完全一致的生成结果。🧩 模型加载配置
- user_name:加载的是
qwen_image_2_1_int8_convrot.safetensors,是INT8量化后的图像生成主干模型,可大幅降低显存占用。- clip_name:加载的是
qwen3v_8b_int8_convrot.safetensors,是INT8量化的Qwen3-VL-8B文本图像统一编码器,负责解析编辑指令和参考图像内容。- vae_name:加载的是
qwen_image_2_1_vae_bf16.safetensors,是BF16精度的RGBA 64通道VAE自编码器,支持原生透明通道输出,能输出高质量的图像细节。- cache_device:设置为auto,由程序自动选择最合适的硬件设备缓存模型权重。
- dtype:设置为default,自动匹配当前硬件支持的最优数据精度。
- PE_model:加载的是
qwen3.5_9b_qwen_image_2_1_pe_i2:int8_conv...,是INT8量化的位置编码扩展模型,进一步提升大分辨率下的画面生成稳定性。
运行后,出现[ERROR] !!! Exception during processing !!! deltanet_conv_step launch reject错误
关闭refine_prompt后正常出图
这说明之前的报错根源完全定位到了refine_prompt模块的算子冲突问题,是非常典型的功能模块兼容故障。
🔍 故障根因分析
- 开启refine_prompt时,Qwen Image 2.1会额外调用Qwen3.5文本编码器的二次语义优化链路,触发了有问题的deltanet_conv_step自定义卷积算子,直接导致内核启动被拒绝。
- 关闭该功能后,模型跳过了二次语义优化的计算分支,完全绕开了有bug的自定义算子,自然不会再触发之前的RuntimeError报错,生成链路可以正常走完完成出图。
故障没解决
2、qwen image edit 2509
需要的模型
基于阿里开源Qwen-Image-Edit模型打造的专用图像编辑节点,依托20B参数的图像编辑模型实现自然语言驱动的精准改图能力,是本地端实现“言出法随”式修图的核心组件。
📋 输入接口说明
- image:必填主输入图,是你需要进行编辑操作的原始素材。
- image2 (optional):可选第二张参考图,支持多图联动编辑场景。
- image3 (optional):可选第三张参考图,适配更复杂的多图融合编辑需求。
- lora_name:用于指定加载的自定义LoRA模型,实现特定风格或效果的定向编辑。
🔍 核心参数配置
- positive_prompt:正向编辑指令,图中示例指令为“Replace the cat with a dalmatian, keeping the environment and scene consistent”,即要求将图中的猫替换为斑点狗,同时完整保留原有环境和场景的一致性。
- negative_prompt:反向排除指令,可填入不希望在编辑结果中出现的内容,规避生成瑕疵。
- seed:随机种子值,固定该数值可以让每次生成的编辑结果保持一致,方便效果复现和参数调试。
- unet_name:加载的扩散模型,图中配置为
qwen_image_edit_2509_fp8_e4m3fn.safetensors,是该节点的核心编辑基底模型。 - clip_name:加载的视觉语言文本编码器,图中配置为
qwen_2.5_vl_7b_fp8_scaled.safetensors,负责理解你输入的自然语言编辑指令。 - vae_name:加载的视觉解码器,图中配置为
qwen_image_vae.safetensors,负责把控编辑后图像的外观细节、色彩和画质表现。 - enable_turbo_mode:涡轮加速开关,图中已开启该选项,可大幅缩短图像生成耗时。
- lightning_lora:闪电加速LoRA,图中配置为
Qwen-Image-Edit-2509-Lightning-4steps-V1.0...,能将原本需要几十步的生成过程压缩到仅4步,在几乎不损失画质的前提下实现极速出图。
✨ 节点核心能力
该节点依托Qwen-Image-Edit的双路控制机制,同时实现了两大编辑能力:
- 高级语义编辑:精准理解自然语言指令,完成物体替换、元素增删、视角调整等高层级修改。
- 低级外观编辑:完整保留原图的色彩、风格、字体质感等细节,避免编辑后出现画面违和感。
它还支持中英双语的精准文字编辑,在保留原有文字大小、字体、风格的前提下直接修改图片内的文字内容,是目前开源图像编辑领域表现顶尖的本地部署方案。
运行,