Skip to main content
Gemini Omni Flashは、Google DeepMindの高品質でコスト効率の高いビデオ生成および会話型編集モデルです。Google I/O 2026でGemini Omniファミリーの一部として初めて発表され、Geminiのマルチモーダル推論とネイティブビデオ作成を組み合わせ、開発者が自然な会話を通じてビデオを生成、編集、リミックスできるようにします。
APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「APIノードの概要」セクションをご参照ください。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

Gemini Omni Flashが得意なこと

  • 会話型ビデオ編集: 自然言語を使用してビデオを洗練・編集します。キャラクターの入れ替え、シーンの再照明、アングルの変更、オブジェクトの追加・削除が可能で、オリジナルのオーディオとビデオトラックは保持されます。
  • マルチモーダル入力: テキスト、画像、ビデオ入力を組み合わせて生成をガイドします。すべてのビデオ出力に同期されたオーディオをネイティブ生成します。
  • 世界知識とシミュレーション: 物理理解とGeminiの歴史、科学、文化的背景に関する知識を組み合わせ、フォトリアリズムを超えた意味のあるストーリーテリングを実現します。
  • テキストとアクションの同期: ビデオに直接読みやすいテキストやグラフィックスをレンダリングし、動きのあるタイポグラフィを画面上の動きと同期させます。
  • 料金: ビデオ出力1秒あたり0.10ドル。Veo 3.1 Fastと同じ料金設定です。

Gemini Omni Flashのワークフロー

テキストから動画へ、画像から動画へ、ビデオ編集のワークフローを、ローカルまたはComfy Cloud上のComfyUIで実行できます。