Skip to main content
FLUX 3 は、Black Forest Labs のマルチモーダル基盤モデルで、2026年7月23日に発表され、現在はアーリーアクセス中です。これは、Self-Flow を基盤とした統一アーキテクチャ内で、画像、ビデオ、オーディオから共同で学習します。Self-Flow は、同じモデル内でマルチモーダル生成と理解を整合させる彼らのアプローチです。各モダリティを個別に扱うのではなく、FLUX 3 は世界の共有表現を学習します。つまり、物体がどのように結びついているか、物事がどのように動くか、出来事がどのように聞こえるかです。機能と制限は、アーリーアクセスの展開中に変更される可能性があります。 ビデオに関して、FLUX 3 は1回の生成で、最大20秒のネイティブオーディオ付きの、非常に多様なクリップを作成します。すべての出力には、環境音、音声、エフェクトを含む同期オーディオ生成が付属します。テキストから動画への生成と画像から動画への生成をサポートしており、個々のクリップをより長いシーケンスへと連結するマルチショット出力と、柔軟なアスペクト比に対応しています。

FLUX 3 Video の得意分野

  • ネイティブオーディオ: すべてのビデオに同期されたオーディオが付属し、環境サウンド、音声、効果音が含まれます
  • 最大20秒: 1回のパスで長いクリップを生成します
  • テキストと画像の入力: テキストプロンプトからビデオを生成するか、開始フレームの画像から続きを生成します
  • 柔軟なフォーマット: 720pまたは1080pの解像度、24fps、9:16から21:9のアスペクト比に対応
  • マルチショット出力: 個々のクリップを連結して長いシーケンスにし、ストーリーテリングを拡張します

出力例

単一のプロンプトから、同期されたオーディオ、モーション、物理演算を伴うテキストから動画への生成: 開始フレームとテキストプロンプトからの画像から動画への生成:

ComfyUI で使用する

FLUX 3 Video ワークフロー

テキストから動画へのワークフローと画像から動画へのワークフローを、ComfyUI でローカルまたは Comfy Cloud 上で実行できます。