工作流教程

Stable Audio 1.0 ComfyUI 工作流示例

本文介绍如何在 ComfyUI 中使用 Stability AI 的开源模型 Stable Audio 1.0 进行文本转音频生成。

Stable Audio 1.0 是 Stability AI 首个开源的音频生成模型。它接收文本提示词,生成一段音频片段。在 ComfyUI 中,它使用标准流水线:CLIP 编码提示词、KSampler 去噪潜空间、VAE 解码为音频。

相关链接

工作流

下载工作流

下载 JSON 或在模板库中搜索"Stable Audio 1.0"

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

Stable Audio 1.0 工作流

使用标准 ComfyUI 节点,无需自定义节点。加载 Stable Audio 1.0 检查点,CLIP 文本编码器编码提示词,KSampler 在潜空间中降噪,最后 VAE 解码为音频。

使用方法

  1. 加载模型CheckpointLoaderSimple 使用 stable-audio-open-1.0.safetensors
  2. 写提示词 — 在 CLIPTextEncode 节点输入描述(例如"heaven church electronic dance music")
  3. 设置时长 — 调整 EmptyLatentAudio 节点的长度值(默认 47.6 秒)
  4. 点击运行Ctrl/Cmd + Enter)生成音频。文件将保存在 ComfyUI/output/audio/

模型下载

加载工作流时,如果模型缺失,ComfyUI 会提示并提供对应下载链接。如需手动设置,请下载以下文件并放在正确目录。

检查点

stable-audio-open-1.0.safetensors

2.3GB。放入 models/checkpoints/

放在以下目录:

text
📂 ComfyUI/
├── 📂 models/
│   └── 📂 checkpoints/
│       └── stable-audio-open-1.0.safetensors

文本编码器

t5-base.safetensors

提示词处理的文本编码器。放入 models/text_encoders/

放在以下目录:

text
📂 ComfyUI/
├── 📂 models/
│   └── 📂 text_encoders/
│       └── t5-base.safetensors

放置完成后,在 ComfyUI 中按快捷键 R 刷新节点定义,即可使用最新加载的模型。

官方原文

本页来自 Comfy-Org 官方中文文档的固定版本,并转换为 xueai 静态页面。内容以官方持续更新的页面为准。

内容授权与修改

官方文档采用 GPL-3.0。本站保留许可证、固定提交号和修改说明,不代表 ComfyUI 或 Comfy-Org 对本站背书。

GPL-3.0来源和修改说明