news 2026/10/1 6:40:19

ComfyUI全方位指南(8)Qwen-Image ComfyUI 原生工作流学习,全面实验

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ComfyUI全方位指南(8)Qwen-Image ComfyUI 原生工作流学习,全面实验

一、说明

文章中的描述只是尝鲜的记录,还没有深度学习,知其所以然的阶段,所以都是描述性文字,目的是想看看V100能跑多少comfyui模型,后续也许会有更深点的学习,当然在应用阶段

Qwen-Image是阿里巴巴通义千问团队发布的首个图像生成基础模型。它是一个在 Apache 2.0 许可证下开源的 20B 参数 MMDiT(多模态扩散 Transformer)模型。该模型在复杂文本渲染和精准图像编辑方面取得了重大进展,实现了包括英文和中文在内的多种语言的高保真输出。模型亮点:

  • 卓越的多语言文本渲染:支持英文、中文、韩文、日文等多语言高精度文本生成,保持字体细节和布局一致性
  • 多样化的艺术风格:从写实场景到印象派画作,从动漫美学到极简设计,流畅适应各种创意提示词
  • 中文支持很好,就可以让我们用它了

二、看看我们将实验哪几个工作流

qwen与z-image是我们重点学习对象,z-image后面我们还会深入学习,今天看看qwen

三、开始qwen image之旅

1、Qwen Image 2.1 图像编辑

首先看看需要的模型,得下载,时间啊时间

中间这个就是Qwen Image 2.1图像编辑节点

关于Qwen Image 2.1图像编辑节点,所有参数均围绕“替换角色服装”的编辑任务配置,下面为你逐项拆解说明。

📋 输入与提示词配置

  • ‌参考图通道‌:提供了image_1到image_10共10个图像输入位,完全匹配Qwen-Image-2.1最多支持10张参考图的特性,可同时导入角色原图、服装参考图等素材,保证编辑后人物身份特征不丢失。
  • ‌resolution‌:当前值为0,代表由模型自动适配输入参考图的原生分辨率,无需手动强制指定输出尺寸。
  • ‌positive_prompt‌:当前填写的编辑指令为Replace costumes for the character,明确告知模型本次任务是替换图中角色的服装。
  • ‌refine_prompt‌:该选项已开启,可对生成结果进行细节优化,进一步提升服装替换后的画面精细度。
  • ‌negative_prompt‌:当前为空,可后续补充不需要出现的画面元素,避免生成瑕疵。

⚙️ 生成核心参数

  • ‌cfg‌:当前值为1.0,符合Qwen-Image-2.1默认不开高CFG的特性,该设置下模型生成自由度更高,画面风格更自然。
  • ‌steps‌:当前设置为25步,属于兼顾生成速度与画面质量的中等采样步数,适合快速完成服装替换类编辑任务。
  • ‌custom_size‌:已开启自定义尺寸,输出分辨率设置为width 1024、height 1024,是1:1的标准正方形高清输出尺寸。
  • ‌sampler‌:选择euler采样器,是AI绘图中速度快、稳定性强的经典采样算法。
  • ‌scheduler‌:当前配置为simple调度器,适配轻量快速的生成场景。
  • ‌seed‌:固定随机种子为1095460012924539,锁定该值后,在其他参数不变的情况下可以复现完全一致的生成结果。

🧩 模型加载配置

  • ‌user_name‌:加载的是qwen_image_2_1_int8_convrot.safetensors,是INT8量化后的图像生成主干模型,可大幅降低显存占用。
  • ‌clip_name‌:加载的是qwen3v_8b_int8_convrot.safetensors,是INT8量化的Qwen3-VL-8B文本图像统一编码器,负责解析编辑指令和参考图像内容。
  • ‌vae_name‌:加载的是qwen_image_2_1_vae_bf16.safetensors,是BF16精度的RGBA 64通道VAE自编码器,支持原生透明通道输出,能输出高质量的图像细节。
  • ‌cache_device‌:设置为auto,由程序自动选择最合适的硬件设备缓存模型权重。
  • ‌dtype‌:设置为default,自动匹配当前硬件支持的最优数据精度。
  • ‌PE_model‌:加载的是qwen3.5_9b_qwen_image_2_1_pe_i2:int8_conv...,是INT8量化的位置编码扩展模型,进一步提升大分辨率下的画面生成稳定性。

运行后,出现[ERROR] !!! Exception during processing !!! deltanet_conv_step launch reject错误

关闭refine_prompt后正常出图

这说明之前的报错根源完全定位到了refine_prompt模块的算子冲突问题,是非常典型的功能模块兼容故障。

🔍 故障根因分析

  • 开启refine_prompt时,Qwen Image 2.1会额外调用Qwen3.5文本编码器的二次语义优化链路,触发了有问题的deltanet_conv_step自定义卷积算子,直接导致内核启动被拒绝。
  • 关闭该功能后,模型跳过了二次语义优化的计算分支,完全绕开了有bug的自定义算子,自然不会再触发之前的RuntimeError报错,生成链路可以正常走完完成出图。

故障没解决

2、qwen image edit 2509

需要的模型

基于阿里开源Qwen-Image-Edit模型打造的专用图像编辑节点,依托20B参数的图像编辑模型实现自然语言驱动的精准改图能力,是本地端实现“言出法随”式修图的核心组件。

📋 输入接口说明

  • ‌image‌:必填主输入图,是你需要进行编辑操作的原始素材。
  • ‌image2 (optional)‌:可选第二张参考图,支持多图联动编辑场景。
  • ‌image3 (optional)‌:可选第三张参考图,适配更复杂的多图融合编辑需求。
  • ‌lora_name‌:用于指定加载的自定义LoRA模型,实现特定风格或效果的定向编辑。

🔍 核心参数配置

  • ‌positive_prompt‌:正向编辑指令,图中示例指令为“Replace the cat with a dalmatian, keeping the environment and scene consistent”,即要求将图中的猫替换为斑点狗,同时完整保留原有环境和场景的一致性。
  • ‌negative_prompt‌:反向排除指令,可填入不希望在编辑结果中出现的内容,规避生成瑕疵。
  • ‌seed‌:随机种子值,固定该数值可以让每次生成的编辑结果保持一致,方便效果复现和参数调试。
  • ‌unet_name‌:加载的扩散模型,图中配置为qwen_image_edit_2509_fp8_e4m3fn.safetensors,是该节点的核心编辑基底模型。
  • ‌clip_name‌:加载的视觉语言文本编码器,图中配置为qwen_2.5_vl_7b_fp8_scaled.safetensors,负责理解你输入的自然语言编辑指令。
  • ‌vae_name‌:加载的视觉解码器,图中配置为qwen_image_vae.safetensors,负责把控编辑后图像的外观细节、色彩和画质表现。
  • ‌enable_turbo_mode‌:涡轮加速开关,图中已开启该选项,可大幅缩短图像生成耗时。
  • ‌lightning_lora‌:闪电加速LoRA,图中配置为Qwen-Image-Edit-2509-Lightning-4steps-V1.0...,能将原本需要几十步的生成过程压缩到仅4步,在几乎不损失画质的前提下实现极速出图。

✨ 节点核心能力

该节点依托Qwen-Image-Edit的双路控制机制,同时实现了两大编辑能力:

  • 高级语义编辑:精准理解自然语言指令,完成物体替换、元素增删、视角调整等高层级修改。
  • 低级外观编辑:完整保留原图的色彩、风格、字体质感等细节,避免编辑后出现画面违和感。
    它还支持中英双语的精准文字编辑,在保留原有文字大小、字体、风格的前提下直接修改图片内的文字内容,是目前开源图像编辑领域表现顶尖的本地部署方案。

运行,

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 6:36:30

VMware 17安装Windows 10失败根因:虚拟硬件版本与固件配置深度解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/1 6:36:20

D3.js + dagre-d3 构建可交互企业级拓扑图

1. 项目概述:为什么拓扑图非得用 D3.js 来画?拓扑图不是那种拖拽几下就能出效果的图表——它本质是节点与连接关系的结构化表达,背后是图论(Graph Theory)在前端的真实落地。你看到的“企业网络拓扑图”“微服务依赖图…

作者头像 李华
网站建设 2026/10/1 6:35:32

DevDay 2026 全解读:OpenAI 开始卖“数字员工“了

![ ▲ 图:Sam Altman 展示 ChatGPT 12 亿周用户 北京时间 9 月 30 日凌晨 1 点,OpenAI DevDay 2026 在旧金山 Fort Mason 开场。Sam Altman 主持了开幕主题演讲,一口气带来 20 多项发布。 这次 DevDay 的意思很直白:OpenAI 开始…

作者头像 李华