Skip to main content
Qwen-Image 是阿里巴巴通义千问团队发布的首个图像生成基础模型,这是一个拥有 20B 参数的 MMDiT(多模态扩散变换器)模型,基于 Apache 2.0 许可证开源。该模型在复杂文本渲染精确图像编辑方面取得了显著进展,无论是英语还是中文等多种语言都能实现高保真输出。 模型亮点
  • 卓越的多语言文本渲染:支持英语、中文、韩语、日语等多种语言的高精度文本生成,保持字体细节和布局一致性
  • 多样化艺术风格:从照片级真实到印象派绘画,从动漫美学到极简设计,流畅适应各种创意提示
相关链接*: 另外目前 Qwen-Image 有多种 ControlNet 支持

ComfyOrg Qwen-Image live stream

Qwen-Image in ComfyUI - Lightning & LoRAs
Qwen-Image ControlNet in ComfyUI - DiffSynth

Qwen-Image 原生工作流示例

请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

Qwen-Image:文生图

使用 Qwen-Image 的 20B MMDiT 模型,以出色的多语言文本渲染和编辑能力生成图像。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Qwen-Image”
示例输出 本文档所附工作流中使用了三种不同的模型:
  1. Qwen-Image 原始模型 fp8_e4m3fn
  2. 8步加速版:Qwen-Image 原始模型 fp8_e4m3fn 与 lightx2v 8 步 LoRA
  3. 蒸馏版:Qwen-Image 蒸馏模型 fp8_e4m3fn
显存使用参考 GPU: RTX4090D 24GB

1. 工作流文件

更新 ComfyUI 后,你可以从模板中找到工作流文件,或者将下面的工作流拖入 ComfyUI 中加载。 蒸馏版

下载蒸馏版工作流

下载 JSON 工作流

2. 模型下载

ComfyUI 中可用的模型
  • Qwen-Image_bf16 (40.9 GB)
  • Qwen-Image_fp8 (20.4 GB)
  • 蒸馏版(非官方,仅需 15 步)
全部模型均可在 HuggingfaceModelScope 找到 Diffusion model Qwen_image_distill
  • 蒸馏版的原始作者建议使用 15 步和 cfg 1.0。
  • 根据测试,该蒸馏版在 10 步和 cfg 1.0 下也表现良好。你可以根据想要的图像类型选择 euler 或 res_multistep。
LoRA 文本编码器 VAE qwen_image_vae.safetensors 模型保存位置

3. 工作流使用说明

  1. 确保 Load Diffusion Model 节点已加载 qwen_image_fp8_e4m3fn.safetensors
  2. 确保 Load CLIP 节点已加载 qwen_2.5_vl_7b_fp8_scaled.safetensors
  3. 确保 Load VAE 节点已加载 qwen_image_vae.safetensors
  4. 确保 EmptySD3LatentImage 节点已设置正确的图像尺寸
  5. CLIP Text Encoder 节点中设置提示词;目前至少支持英语、中文、韩语、日语、意大利语等。
  6. 如果要启用 lightx2v 的 8 步加速 LoRA,请选中该节点并使用 Ctrl + B 启用,然后按第 8 步中的说明修改 KSampler 设置。
  7. 点击 Queue 按钮,或使用快捷键 Ctrl(cmd) + Enter 运行工作流。
  8. 对于不同的模型版本和工作流,请相应调整 KSampler 参数。
蒸馏版模型和 lightx2v 的 8 步加速 LoRA 似乎无法同时使用。你可以尝试不同的组合,以验证它们是否可以一起使用。

Qwen Image InstantX ControlNet 工作流

这是一个 ControlNet 模型,因此你可以像使用普通 ControlNet 一样使用它。

Qwen-Image InstantX Union ControlNet

使用 Qwen-Image InstantX ControlNet 生成图像,支持 Canny、软边缘、深度和姿态。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索”Qwen-Image InstantX ControlNet”
输入素材 将此文件上传到对应的 LoadImage 节点:

image_qwen_image_instantx_controlnet_input_image.jpg

LoadImage 节点 71 · image_qwen_image_instantx_controlnet_input_image.jpg

1. 工作流和输入图像

2. 模型链接

  1. InstantX ControlNet
下载 Qwen-Image-InstantX-ControlNet-Union.safetensors 并将其保存到ComfyUI/models/controlnet/文件夹中
  1. Lotus Depth模型
我们将使用该模型来生成图像的深度图。需要下载以下两个模型: Diffusion模型 VAE模型
你还可以使用类似 comfyui_controlnet_aux 的自定义节点来生成深度图。

3. 工作流说明

  1. 确保加载ControlNet模型节点正确加载了Qwen-Image-InstantX-ControlNet-Union.safetensors模型
  2. 上传输入图像
  3. 该子图使用Lotus Depth模型。你可以在模板中找到它,或编辑子图以了解更多信息,确保所有模型都已正确加载
  4. 点击运行按钮,或使用快捷键Ctrl(cmd) + Enter来运行工作流

Qwen Image ControlNet DiffSynth-ControlNets 模型补丁工作流

Qwen-Image ControlNet 模型补丁

使用 Qwen-Image ControlNet 模型控制图像生成。通过模型补丁支持 canny、depth 和 inpainting 控制。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Qwen-Image ControlNet Patch”
输入材料 将以下文件上传到匹配的 LoadImage 节点:

image_qwen_image_controlnet_patch_input_image.png

LoadImage 节点 71 · image_qwen_image_controlnet_patch_input_image.png

1. 工作流与输入图像

更新 ComfyUI 之后,你可以从模板中找到工作流文件,或将上方的工作流预览拖入 ComfyUI 以加载它。

2. 模型链接

其他模型与 Qwen-Image 基础工作流一致。你只需下载下面的模型,并将其保存到 ComfyUI/models/model_patches 文件夹中。

3. 工作流使用说明

目前,diffsynth 有三个补丁模型:Canny、Depth 和 Inpaint。 如果你是第一次使用与 ControlNet 相关的工作流,你需要了解:控制图像需要先预处理为受支持的图像格式,才能被模型使用和识别。
  • Canny:处理后的 canny 边缘,线稿轮廓
  • Depth:预处理后的深度图,体现空间关系
  • Inpaint:需要使用 Mask 标记需要重绘的区域
由于此补丁模型分为三个不同的模型,你需要在输入时选择正确的预处理类型,以确保图像预处理正确。 Canny 模型 ControlNet 使用说明
  1. 确保已加载 qwen_image_canny_diffsynth_controlnet.safetensors
  2. 上传输入图片,用于后续处理
  3. Canny 节点是原生预处理节点,它会根据你设置的参数对输入图像进行预处理,以控制生成
  4. 如有需要,你可以修改 QwenImageDiffsynthControlnet 节点中的 strength 参数,以控制线稿控制的强度
  5. 点击 Run 按钮,或使用快捷键 Ctrl(cmd) + Enter 来运行工作流
对于使用 qwen_image_depth_diffsynth_controlnet.safetensors,你需要将图像预处理为深度图,并替换 image processing 部分。关于此用法,请参考本文档中的 InstantX 处理方法。其他部分与使用 Canny 模型类似。
Inpaint 模型 ControlNet 使用说明 对于 Inpaint 模型,需要使用遮罩编辑器绘制一个遮罩,并将其作为输入控制条件。
  1. 确保 ModelPatchLoader 加载的是 qwen_image_inpaint_diffsynth_controlnet.safetensors 模型
  2. 上传图片,并使用遮罩编辑器绘制遮罩。你需要将相应 Load Image 节点的 mask 输出连接到 QwenImageDiffsynthControlnetmask 输入,以确保对应的遮罩被加载
  3. 使用 Ctrl-B 快捷键将工作流中的原始 Canny 设置为绕过模式,使对应的 Canny 节点处理不生效
  4. CLIP Text Encoder 中输入你希望将遮罩区域修改成的内容
  5. 如有需要,你可以修改 QwenImageDiffsynthControlnet 节点中的 strength 参数,以控制对应的控制强度
  6. 点击 Run 按钮,或使用快捷键 Ctrl(cmd) + Enter 来运行工作流

Qwen Image Union ControlNet LoRA 工作流

Qwen-Image Union Control

使用 Qwen-Image 的统一 ControlNet LoRA 生成具有精确结构控制的图像。支持多种控制类型,包括 canny、depth、线稿、softedge、法线和 openpose。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Qwen-Image Union Control”
输入材料 将此文件上传到对应的 LoadImage 节点:

image_qwen_image_union_control_lora_input_image.png

LoadImage 节点 73 · image_qwen_image_union_control_lora_input_image.png
示例输出
原始模型地址:DiffSynth-Studio/Qwen-Image-In-Context-Control-Union Comfy Org 重新托管地址:qwen_image_union_diffsynth_lora.safetensors:支持 canny、depth、pose、线稿、softedge、法线、openpose 的图像结构控制 LoRA

1. 工作流及输入图像

更新 ComfyUI 之后,你可以从模板中找到工作流文件,或者将上方的工作流预览拖入 ComfyUI 中进行加载。

2. 模型链接

下载下面的模型。由于这是一个 LoRA 模型,需要保存到 ComfyUI/models/loras/ 文件夹下

3. 工作流说明

这个模型是一个统一控制 LoRA,支持 canny、depth、pose、线稿、softedge、法线、openpose 控制。由于许多图像预处理原生节点并未完全支持,你应该使用类似 comfyui_controlnet_aux 的工具来完成其他图像预处理。
  1. 确保 LoraLoaderModelOnly 正确加载 qwen_image_union_diffsynth_lora.safetensors 模型
  2. 上传输入图像
  3. 如有需要,你可以调整 Canny 节点的参数。由于不同的输入图像需要不同的参数设置才能获得更好的图像预处理结果,你可以尝试调整相应的参数值,以获得更多/更少的细节
  4. 点击 Run 按钮,或使用快捷键 Ctrl(cmd) + Enter 运行工作流
对于其他类型的控制,你还需要替换图像处理部分。