Skip to main content
Seed Audio 1.0 是字节跳动的通用音频生成模型,现在作为 ComfyUI 的内置节点提供。与仅将文字读出的传统文本转语音系统不同,Seed Audio 理解完整的声音频谱:它可以仅凭一段文本提示生成语音、音乐、音效、环境氛围以及多说话人对话。

Seed Audio 1.0 擅长什么

  • 多模态音频生成:通过一条提示词生成语音、音乐、音效和环境音频。描述你听到的声音,Seed Audio 即可生成。
  • 语音克隆:从最多 3 个参考片段克隆语音(在提示词中标记为 @Audio1@Audio2@Audio3),用于多角色对话或一致的旁白。
  • 预设语音:无需参考片段,即可从内置 TTS 2.0 语音中选择,获得可靠、高质量的旁白。
  • 图像驱动语音:从角色图像中提取语音,使语气和风格与视觉主体相匹配。
  • 精细控制:独立调整每次生成的语速、音高、响度和采样率。
  • 多说话人对话:在提示词中直接命名角色,Seed Audio 会自动处理声音分配、轮流发言和情感表达。
  • 单次最长 2 分钟:生成适合旁白、播客片段、视频配音和声音设计的较长音频片段。
凭借这些能力,Seed Audio 1.0 可广泛应用于视频配音、多角色音频剧、产品演示、电子学习旁白、游戏音频原型制作和无障碍内容等场景。

在 ComfyUI 中使用

Seed Audio 1.0 工作流

在 ComfyUI 中运行文生音频、语音克隆和图像驱动音频工作流,可在本地或 Comfy Cloud 上运行。