Skip to main content
Qwen-Image는 알리바바의 Qwen 팀이 발표한 최초의 이미지 생성 기반 모델입니다. 이 모델은 Apache 2.0 라이선스로 오픈소스화된 20B 파라미터 MMDiT(멀티모달 디퓨전 트랜스포머) 모델입니다. 이 모델은 복잡한 텍스트 렌더링정밀한 이미지 편집에서 큰 진전을 이루었으며, 영어와 중국어를 포함한 여러 언어에 대해 고화질 출력을 달성했습니다. 모델 주요 특징:
  • 우수한 다국어 텍스트 렌더링: 영어, 중국어, 한국어, 일본어 등 다양한 언어에서 고정밀 텍스트 생성을 지원하며, 글꼴 세부 정보와 레이아웃 일관성을 유지합니다.
  • 다양한 예술적 스타일: 포토리얼리즘 장면부터 인상파 그림, 애니메이션 스타일부터 미니멀리즘 디자인까지 다양한 창작 프롬프트에 유연하게 적응합니다.
관련 링크: 현재 Qwen-Image는 여러 ControlNet 지원 옵션을 제공합니다:

ComfyOrg Qwen-Image 라이브 스트림

Qwen-Image in ComfyUI - Lightning & LoRAs
Qwen-Image ControlNet in ComfyUI - DiffSynth

Qwen-Image 네이티브 워크플로우 예시

ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

Qwen-Image: 텍스트 기반 이미지 생성

Qwen-Image의 20B MMDiT 모델을 사용하여 탁월한 다국어 텍스트 렌더링 및 편집 기능으로 이미지를 생성하세요.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로우 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “Qwen-Image” 검색
출력 예시 이 문서에 첨부된 워크플로우에는 세 가지 다른 모델이 사용됩니다:
  1. Qwen-Image 원본 모델 fp8_e4m3fn
  2. 8단계 가속 버전: Qwen-Image 원본 모델 fp8_e4m3fn에 lightx2v 8단계 LoRA 적용
  3. 증류 버전: Qwen-Image 증류 모델 fp8_e4m3fn
VRAM 사용량 참고 GPU: RTX4090D 24GB

1. 워크플로우 파일

ComfyUI를 업데이트한 후, 템플릿에서 워크플로우 파일을 찾거나 아래 워크플로우를 ComfyUI로 드래그해 불러올 수 있습니다. 증류 버전

증류 모델용 워크플로우 다운로드

JSON 워크플로우 다운로드

2. 모델 다운로드

ComfyUI에서 사용 가능한 모델
  • Qwen-Image_bf16 (40.9 GB)
  • Qwen-Image_fp8 (20.4 GB)
  • 증류 버전 (비공식, 15단계만 필요)
모든 모델은 HuggingfaceModelscope에서 확인 가능합니다. Diffusion 모델 Qwen_image_distill
  • 증류 버전의 원저자는 cfg 1.0에서 15단계 사용을 권장합니다.
  • 테스트 결과, 이 증류 버전은 cfg 1.0에서 10단계에서도 우수한 성능을 보입니다. 원하는 이미지 유형에 따라 euler 또는 res_multistep 중 선택할 수 있습니다.
LoRA 텍스트 인코더 VAE qwen_image_vae.safetensors 모델 저장 위치

3. 워크플로우 지침

  1. Load Diffusion Model 노드가 qwen_image_fp8_e4m3fn.safetensors를 로드했는지 확인하세요.
  2. Load CLIP 노드가 qwen_2.5_vl_7b_fp8_scaled.safetensors를 로드했는지 확인하세요.
  3. Load VAE 노드가 qwen_image_vae.safetensors를 로드했는지 확인하세요.
  4. EmptySD3LatentImage 노드가 정확한 이미지 크기로 설정되었는지 확인하세요.
  5. CLIP Text Encoder 노드에 프롬프트를 설정하세요. 현재 영어, 중국어, 한국어, 일본어, 이탈리아어 등을 지원합니다.
  6. 8단계 가속 LoRA를 lightx2v로 활성화하려면 해당 노드를 선택하고 Ctrl + B를 눌러 활성화하고, 8번 단계에서 설명한 대로 Ksampler 설정을 수정하세요.
  7. Queue 버튼을 클릭하거나, 단축키 Ctrl(cmd) + Enter를 사용해 워크플로우를 실행하세요.
  8. 모델 버전과 워크플로우에 따라 KSampler 파라미터를 적절히 조정하세요.
증류 모델과 lightx2v의 8단계 가속 LoRA는 동시에 사용하기에는 호환되지 않는 것으로 보입니다. 함께 사용할 수 있는지 다양한 조합으로 실험해 보세요.

Qwen Image InstantX ControlNet 워크플로

이것은 ControlNet 모델이므로 일반 ControlNet처럼 사용할 수 있습니다.

Qwen-Image InstantX Union ControlNet

Qwen-Image InstantX ControlNet으로 이미지를 생성할 수 있으며, canny, soft edge, depth, pose를 지원합니다.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON을 다운로드하거나 템플릿 라이브러리에서 “Qwen-Image InstantX ControlNet”을(를) 검색하세요.
입력 자료 이 파일을 해당 LoadImage 노드에 업로드하세요:

image_qwen_image_instantx_controlnet_input_image.jpg

LoadImage 노드 71 · image_qwen_image_instantx_controlnet_input_image.jpg

1. 워크플로 및 입력 이미지

2. 모델 링크

  1. InstantX 컨트롤넷
Qwen-Image-InstantX-ControlNet-Union.safetensors을(를) 다운로드한 후 ComfyUI/models/controlnet/ 폴더에 저장합니다.
  1. Lotus Depth 모델
이 모델을 사용하여 이미지의 뎁스 맵을 생성합니다. 다음 두 모델을 다운로드해야 합니다. Diffusion 모델 VAE 모델
comfyui_controlnet_aux와 같은 커스텀 노드를 사용하여 뎁스 맵을 생성할 수도 있습니다.

3. 워크플로 안내

  1. 컨트롤넷 모델 로드 노드가 Qwen-Image-InstantX-ControlNet-Union.safetensors 모델을 올바르게 로드하는지 확인합니다.
  2. 입력 이미지를 업로드합니다.
  3. 이 서브그래프는 Lotus Depth 모델을 사용합니다. 템플릿에서 찾거나 서브그래프를 편집하여 더 알아볼 수 있습니다. 모든 모델이 올바르게 로드되었는지 확인하세요.
  4. Run 버튼을 클릭하거나 단축키 Ctrl(cmd) + Enter를 사용하여 워크플로를 실행합니다.

Qwen-Image ControlNet DiffSynth-ControlNets 모델 패치 워크플로

Qwen-Image ControlNet 모델 패치

Qwen-Image ControlNet 모델을 사용하여 이미지 생성을 제어합니다. 모델 패치를 통해 canny, depth, inpainting 제어를 지원합니다.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “Qwen-Image ControlNet Patch” 검색
입력 자료 이 파일을 해당 LoadImage 노드에 업로드하세요:

image_qwen_image_controlnet_patch_input_image.png

LoadImage 노드 71 · image_qwen_image_controlnet_patch_input_image.png

1. 워크플로 및 입력 이미지

ComfyUI를 업데이트한 후, 템플릿에서 워크플로 파일을 찾거나 위의 워크플로 미리보기를 ComfyUI로 끌어다 놓아 로드할 수 있습니다.

2. 모델 링크

다른 모델은 Qwen-Image 기본 워크플로와 동일합니다. 아래 모델만 다운로드하여 ComfyUI/models/model_patches 폴더에 저장하면 됩니다.

3. 워크플로 사용 방법

현재 diffsynth에는 Canny, Depth, Inpaint 세 가지 패치 모델이 있습니다. ControlNet 관련 워크플로를 처음 사용하는 경우, 제어 이미지를 모델이 사용하고 인식할 수 있도록 지원되는 이미지 형식으로 전처리해야 한다는 점을 이해해야 합니다.
  • Canny: 처리된 canny 엣지, 라인 아트 윤곽선
  • Depth: 공간 관계를 보여주는 전처리된 뎁스 맵
  • Inpaint: 다시 그려야 할 영역을 표시하려면 마스크를 사용해야 합니다.
이 패치 모델은 세 가지 서로 다른 모델로 나뉘므로, 입력 시 올바른 전처리 유형을 선택하여 이미지가 올바르게 전처리되도록 해야 합니다. Canny 모델 ControlNet 사용 방법
  1. qwen_image_canny_diffsynth_controlnet.safetensors가 로드되었는지 확인합니다.
  2. 후속 처리를 위해 입력 이미지를 업로드합니다.
  3. Canny 노드는 설정한 파라미터에 따라 입력 이미지를 전처리하여 생성을 제어하는 기본 제공 전처리 노드입니다.
  4. 필요한 경우 QwenImageDiffsynthControlnet 노드의 strength 값을 수정하여 라인 아트 제어 강도를 조절할 수 있습니다.
  5. Run 버튼을 클릭하거나 Ctrl(cmd) + Enter 단축키를 사용하여 워크플로를 실행합니다.
qwen_image_depth_diffsynth_controlnet.safetensors를 사용하려면 이미지를 뎁스 맵으로 전처리하고 image processing 부분을 교체해야 합니다. 이 사용법은 이 문서의 InstantX 처리 방법을 참조하세요. 나머지 부분은 Canny 모델을 사용할 때와 유사합니다.
Inpaint 모델 ControlNet 사용 방법 Inpaint 모델은 마스크 편집기를 사용하여 마스크를 그리고 이를 입력 제어 조건으로 사용해야 합니다.
  1. ModelPatchLoaderqwen_image_inpaint_diffsynth_controlnet.safetensors 모델을 로드하는지 확인합니다.
  2. 이미지를 업로드하고 마스크 편집기를 사용하여 마스크를 그립니다. 해당 Load Image 노드의 mask 출력을 QwenImageDiffsynthControlnetmask 입력에 연결하여 해당 마스크가 로드되도록 해야 합니다.
  3. Ctrl-B 단축키를 사용하여 워크플로의 원본 Canny를 실행 건너뛰기 모드로 설정하면 해당 Canny 노드 처리가 비활성화됩니다.
  4. CLIP Text Encoder에서 마스크 영역을 어떤 내용으로 변경할지 입력합니다.
  5. 필요한 경우 QwenImageDiffsynthControlnet 노드의 strength 값을 수정하여 해당 제어 강도를 조절할 수 있습니다.
  6. Run 버튼을 클릭하거나 Ctrl(cmd) + Enter 단축키를 사용하여 워크플로를 실행합니다.

Qwen Image ControlNet DiffSynth-ControlNets 모델 패치 워크플로우

Comfy Cloud에서 실행하기 이 모델은 실제로 ControlNet이 아니라, 캐니, 딥스, 인페인트 등 세 가지 다른 제어 모드를 지원하는 모델 패치입니다. 원본 모델 주소: DiffSynth-Studio/Qwen-Image ControlNet
Comfy Org 재호스팅 주소: Qwen-Image-DiffSynth-ControlNets/model_patches

1. 워크플로우 및 입력 이미지

아래 이미지를 다운로드해 ComfyUI로 드래그해 해당 워크플로우를 불러오세요.

JSON 형식 워크플로우 다운로드

아래 이미지를 입력으로 다운로드하세요:

2. 모델 링크

다른 모델은 Qwen-Image 기본 워크플로우와 동일합니다. 아래 모델만 다운로드해 ComfyUI/models/model_patches 폴더에 저장하면 됩니다.

3. 워크플로우 사용 지침

현재 diffsynth는 캐니, 딥스, 인페인트 세 가지 패치 모델을 제공합니다. ControlNet 관련 워크플로우를 처음 사용한다면, 제어 이미지는 모델이 인식하고 사용하기 전에 지원되는 이미지 형식으로 사전 처리되어야 한다는 점을 이해해야 합니다.
  • 캐니: 처리된 캐니 에지, 라인아트 윤곽선
  • 딥스: 공간 관계를 나타내는 사전 처리된 깊이맵
  • 인페인트: 마스크를 사용해 다시 그려야 할 영역을 표시해야 합니다.
이 패치 모델은 세 가지 다른 모델로 나뉘므로, 입력 시 정확한 사전 처리 유형을 선택해 이미지가 제대로 처리되도록 해야 합니다. 캐니 모델 ControlNet 사용 지침
  1. qwen_image_canny_diffsynth_controlnet.safetensors가 로드되었는지 확인하세요.
  2. 이후 처리를 위해 입력 이미지를 업로드하세요.
  3. 캐니 노드는 원본 사전 처리 노드로, 설정한 매개변수에 따라 입력 이미지를 처리해 생성을 제어합니다.
  4. 필요하다면 QwenImageDiffsynthControlnet 노드의 strength를 수정해 라인아트 제어 강도를 조정할 수 있습니다.
  5. Run 버튼을 클릭하거나, 단축키 Ctrl(cmd) + Enter를 사용해 워크플로우를 실행하세요.
qwen_image_depth_diffsynth_controlnet.safetensors를 사용하려면 이미지를 깊이맵으로 사전 처리하고 image processing 부분을 교체해야 합니다. 이 사용법은 이 문서의 InstantX 처리 방법을 참고하세요. 다른 부분은 캐니 모델 사용법과 비슷합니다.
인페인트 모델 ControlNet 사용 지침 인페인트 모델의 경우, Mask Editor를 사용해 마스크를 그린 후 이를 입력 제어 조건으로 사용해야 합니다.
  1. ModelPatchLoaderqwen_image_inpaint_diffsynth_controlnet.safetensors 모델을 로드했는지 확인하세요.
  2. 이미지를 업로드하고 Mask Editor를 사용해 마스크를 그립니다. 해당 Load Image 노드의 mask 출력을 QwenImageDiffsynthControlnetmask 입력에 연결해 정확한 마스크가 로드되도록 해야 합니다.
  3. Ctrl-B 단축키를 사용해 워크플로우의 원래 캐니를 바이패스 모드로 설정해 해당 캐니 노드의 처리를 무효화하세요.
  4. CLIP Text Encoder에서 마스크로 변경하고 싶은 내용을 입력하세요.
  5. 필요하다면 QwenImageDiffsynthControlnet 노드의 strength를 수정해 해당 제어 강도를 조정할 수 있습니다.
  6. Run 버튼을 클릭하거나, 단축키 Ctrl(cmd) + Enter를 사용해 워크플로우를 실행하세요.