Skip to main content
Wan2.1 Video シリーズは、アリババ社が 2025 年 2 月に Apache 2.0 ライセンス の下でオープンソース化した動画生成モデルです。
このモデルには以下の 2 つのバージョンがあります:
  • 14B(140 億パラメータ)
  • 1.3B(13 億パラメータ)
    テキストから動画への生成(T2V)や画像から動画への生成(I2V)など、複数のタスクに対応しています。
    このモデルは既存のオープンソースモデルを性能面で上回るだけでなく、特に軽量版はわずか 8GB の VRAM で実行可能であり、導入ハードルを大幅に低減しています。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

Wan2.1 ComfyUI ネイティブワークフローのサンプル

サンプルを開始する前に、ComfyUI を最新版に更新し、ネイティブな Wan Video 対応が有効になっていることを確認してください。

モデルのインストール

このガイドで言及されるすべてのモデルは、こちら から入手できます。以下は、このガイドの例で必要となる一般的なモデルで、事前にダウンロードできます: Text encoders からいずれか 1 つのバージョンを選択してダウンロードしてください:

umt5_xxl_fp16.safetensors

FP16精度のテキストエンコーダー。ComfyUI/models/text_encoders/ に配置してください。

umt5_xxl_fp8_e4m3fn_scaled.safetensors

FP8スケーリング済みテキストエンコーダー。ComfyUI/models/text_encoders/ に配置してください。
VAE

wan_2.1_vae.safetensors

Wan2.1 VAE モデル。ComfyUI/models/vae/ に配置してください。
CLIP Vision

clip_vision_h.safetensors

画像条件付け用の CLIP Vision モデル。ComfyUI/models/clip_vision/ に配置してください。
ファイルの保存先:
diffusion モデルについては、このガイドでは fp16 精度のモデルを使用します。bf16 バージョンよりも性能が優れているためです。他の精度のバージョンが必要な場合は、こちら からダウンロードしてください。

Wan2.1 テキストから動画へのワークフロー (1.3B)

Wan 2.1 テキストから動画へ

Wan 2.1 を使用してテキストプロンプトからビデオを生成します。

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで「Wan 2.1 Text to Video」を検索してください

モデルのダウンロード

wan2.1_t2v_1.3B_fp16.safetensors

Wan2.1 テキストから動画生成用の拡散モデルです。ComfyUI/models/diffusion_models/ に配置してください。
他の t2v 精度バージョンが必要な場合は、こちら からダウンロードしてください。

実行手順

  1. Load Diffusion Model ノードが wan2.1_t2v_1.3B_fp16.safetensors モデルを読み込んでいることを確認してください。
  2. Load CLIP ノードが umt5_xxl_fp8_e4m3fn_scaled.safetensors モデルを読み込んでいることを確認してください。
  3. Load VAE ノードが wan_2.1_vae.safetensors モデルを読み込んでいることを確認してください。
  4. (任意) 必要に応じて、EmptyHunyuanLatentVideo ノードでビデオのサイズを変更できます。
  5. (任意) プロンプト(ポジティブとネガティブ)を変更する必要がある場合は、番号 5CLIP Text Encoder ノードで変更してください。
  6. Run ボタンをクリックするか、ショートカット Ctrl(cmd) + Enter を使用してビデオ生成を実行してください。

Wan2.1 画像から動画へのワークフロー(14B)

Wan Videoは480Pモデルと720Pモデルを分けているため、このガイドでは両方の解像度の例を紹介する必要があります。異なるモデルを使用するだけでなく、パラメータにもわずかな違いがあります。

480Pバージョン

Wan 2.1 画像から動画へ

Wan 2.1を使用して画像からビデオを生成します。

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで”Wan 2.1 Image to Video”を検索してください
入力素材 対応するLoadImageノードにこのファイルをアップロードしてください:

image_to_video_wan_start_image.png

LoadImageノード52 · image_to_video_wan_start_image.png

モデルのダウンロード

wan2.1_i2v_480p_14B_fp16.safetensors

Wan2.1 I2V 480P用の拡散モデル。ComfyUI/models/diffusion_models/に配置してください。

実行手順

  1. Load Diffusion Modelノードがwan2.1_i2v_480p_14B_fp16.safetensorsモデルを読み込んでいることを確認してください
  2. Load CLIPノードがumt5_xxl_fp8_e4m3fn_scaled.safetensorsモデルを読み込んでいることを確認してください
  3. Load VAEノードがwan_2.1_vae.safetensorsモデルを読み込んでいることを確認してください
  4. Load CLIP Visionノードがclip_vision_h.safetensorsモデルを読み込んでいることを確認してください
  5. Load Imageノードに提供された入力画像をアップロードしてください
  6. (任意)CLIP Text Encoderノードに生成したいビデオの説明コンテンツを入力してください
  7. (任意)必要に応じてWanImageToVideoノードでビデオのサイズを変更できます
  8. Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してビデオ生成を実行してください

720Pバージョン

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

ワークフロー画像をダウンロードしてComfyUIにドラッグすると、ワークフローを読み込めます

入力画像

デフォルトの入力画像をダウンロードするか、ご自身の画像を使用してください。

モデルのダウンロード

wan2.1_i2v_720p_14B_fp16.safetensors

Wan2.1 I2V 720P用の拡散モデル。ComfyUI/models/diffusion_models/に配置してください。

実行手順

  1. Load Diffusion Modelノードがwan2.1_i2v_720p_14B_fp16.safetensorsモデルを読み込んでいることを確認してください
  2. Load CLIPノードがumt5_xxl_fp8_e4m3fn_scaled.safetensorsモデルを読み込んでいることを確認してください
  3. Load VAEノードがwan_2.1_vae.safetensorsモデルを読み込んでいることを確認してください
  4. Load CLIP Visionノードがclip_vision_h.safetensorsモデルを読み込んでいることを確認してください
  5. Load Imageノードに提供された入力画像をアップロードしてください
  6. (任意)CLIP Text Encoderノードに生成したいビデオの説明コンテンツを入力してください
  7. (任意)必要に応じてWanImageToVideoノードでビデオのサイズを変更できます
  8. Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してビデオ生成を実行してください