Skip to main content
Qwen Image 3.0 Pro は、Alibaba の第 3 世代画像生成モデルであり、純粋な美的表現ではなく、インフォグラフィック、ドキュメント、指示ベースの編集といった実用的な出力を中心に設計されています。密度が高く情報量の多いビジュアルを 1 回のパスで作成するツールとして位置づけられており、「リッチなコンテンツ、本物の詳細、深い知識」というキャッチコピーを掲げています。 このモデルは最大 4,500 トークンのプロンプトを受け付けることができ、これは前世代の入力長の約 4.5 倍に相当します。この余裕を活用して、新聞ページ、マルチパネルのインフォグラフィック、判読可能な数式表記を含む学術論文、その他の高密度レイアウトを、指示内容を数文に圧縮することなく構成します。さらに、12 言語・20 以上のフォントで約 10 ピクセルまでの小さなテキストも判読可能にレンダリングし、天気図やライブ配信インターフェースの再現などのタスクに世界知識を統合します。

Qwen Image 3.0 Pro が得意なこと

  • 超長文プロンプト: 詳細で情報量の多い構図を作成するための指示を最大 4,500 トークンまで受け付けます
  • 高密度で実用的なレイアウト: 新聞のページ全体、複数パネルのインフォグラフィック、数式を含む学術ドキュメントを一度に生成します
  • 小さな文字の描画: 12 言語・20 以上のフォントで、約 10px までの読みやすいテキストを生成します
  • 世界知識の統合: 指定された都市の天気図など、実世界の情報に基づいたコンテンツを生成します
  • 指示に基づく編集: オブジェクト、スタイル、または領域を対象とした変更を加えて、最大 3 枚の参照画像を編集します
  • バッチ生成: 1 回の実行で 1~6 枚の画像を生成します

出力例

テキストから画像への生成。モデルがレイアウト、タイポグラフィ、構図を処理します: Qwen Image 3.0 Pro テキストから画像への生成例 指示に基づく画像編集。元の構造を保ったまま: Qwen Image 3.0 Pro 画像編集の例

ComfyUI で使用する

Qwen Image 3.0 Pro ワークフロー

ComfyUI でテキストから画像へのワークフローと画像編集ワークフローを、ローカルまたは Comfy Cloud で実行します