Skip to main content
Flux 3 是 Black Forest Labs 的多模态基础模型,于 2026 年 7 月 23 日发布,目前处于早期访问阶段。它在基于 Self-Flow 构建的统一架构中联合学习图像、视频和音频。Self-Flow 是他们在同一模型中实现多模态生成与理解对齐的方法。Flux 3 不会孤立地处理每种模态,而是学习对世界的共享表征:物体如何保持在一起、事物如何运动、事件如何发出声音。随着早期访问的推进,其功能和限制可能会发生变化。 在视频方面,Flux 3 可在单次生成中创建高度多样化的视频片段,并原生带有最长 20 秒的音频。所有输出均包含同步生成的音频,包括环境声音、语音和效果音。它支持文生视频和图生视频生成,提供多镜头输出,可将单个片段串联成更长的序列,并支持灵活的宽高比。

Flux 3 Video 的优势

  • 原生音频:每个视频都附带同步音频,包括环境音、语音和音效
  • 最长 20 秒:单次生成即可产出长片段
  • 文本和图像输入:根据文本提示生成视频,或从起始帧图像继续生成
  • 灵活格式:支持 720p 或 1080p 分辨率、24fps,以及 9:16 到 21:9 的宽高比
  • 多镜头输出:将单个片段串联成更长的序列,以支持更长的叙事

示例输出

通过单条提示词进行文生视频生成,包含同步音频、运动和物理效果: 从起始帧和文本提示词进行图生视频生成:

在 ComfyUI 中使用

Flux 3 Video 工作流

在本地或 Comfy Cloud 上,在 ComfyUI 中运行文生视频和图生视频工作流