内置节点参考
ByteDanceSeedAudio - ComfyUI Built-in Node Documentation
Complete documentation for the ByteDanceSeedAudio node in ComfyUI. Learn its inputs, outputs, parameters and usage.
使用单个提示词,通过字节跳动 Seed Audio 1.0 生成语音、音乐、音效和多说话人对话。在提示词中描述声音、情感、氛围、背景音乐和音效,并包含要朗读的台词。可选择内置预设语音,从最多 3 个参考片段(在提示词中标记为 @Audio1-3)克隆声音,或从角色图像中衍生声音。每次运行最多可生成 2 分钟音频。
## 输入
| 参数 | 描述 | 数据类型 | 是否必需 | 范围 |
|---|---|---|---|---|
text_prompt |
描述声音、情感、节奏、氛围、背景音乐和音效,并包含要朗读的台词(对话中可内联标注角色名称)。在“音频参考”模式下,按顺序引用连接的片段为 @Audio1、@Audio2、@Audio3。最多 3000 个字符。 | STRING | 是 | 1 到 3000 个字符 |
reference_mode |
如何控制声音:“仅文本”(在提示词中描述所有内容)、“音频参考”(克隆最多 3 个声音,标记为 @Audio1-3)、“图像参考”(从一张角色图像衍生声音)或“预设语音”(选择一个内置命名语音来朗读提示词)。 | COMBO | 是 | "text only" |
"audio reference" "image reference" "preset voice" | | reference_audio_1 | 用于声音克隆的参考片段,在提示词中标记为 @Audio1。最长 30 秒。仅当 reference_mode 为“audio reference”时可用。 | AUDIO | 否 | 最长 30 秒 | | reference_audio_2 | 在提示词中标记为 @Audio2 的参考片段。最长 30 秒。仅当 reference_mode 为“audio reference”时可用。 | AUDIO | 否 | 最长 30 秒 | | reference_audio_3 | 在提示词中标记为 @Audio3 的参考片段。最长 30 秒。仅当 reference_mode 为“audio reference”时可用。 | AUDIO | 否 | 最长 30 秒 | | reference_image | 一张角色图像;模型从中衍生声音。不能与参考音频结合使用。仅当 reference_mode 为“image reference”时可用。 | IMAGE | 否 | - | | preset_voice | 一个内置的 TTS 2.0 语音,用于朗读提示词。无需参考片段,且在此模式下不使用 @AudioN 标签。仅当 reference_mode 为“preset voice”时可用。 | COMBO | 否 | 多个选项可用(见描述) | | sample_rate | 输出采样率,单位为 Hz。(默认值:"24000") | COMBO | 是 | "8000" "16000" "24000" "32000" "44100" "48000" | | speech_rate | 语速。0 = 正常,100 = 2.0 倍,-50 = 0.5 倍。(默认值:0) | INT | 是 | -50 到 100 | | loudness_rate | 音量。0 = 正常,100 = 2.0 倍,-50 = 0.5 倍。(默认值:0) | INT | 是 | -50 到 100 | | pitch_rate | 音高偏移,单位为半音(-12 到 12)。(默认值:0) | INT | 是 | -12 到 12 | | seed | 种子控制节点是否应重新运行;无论种子如何,结果都是非确定性的。(默认值:42) | INT | 是 | 0 到 2147483647 |
参数约束
- 参考模式依赖关系:
reference_mode参数决定了哪些其他输入是必需的: - "text only":无需额外输入。提示词不得包含 @AudioN 标签。
- "audio reference":需要至少连接
reference_audio_1、reference_audio_2或reference_audio_3中的一个。参考片段必须按顺序连接,不能有间隔(例如,_1,然后 _2,然后 _3)。每个片段最长 30 秒。提示词必须使用 @Audio1、@Audio2、@Audio3 标签引用连接的片段。 - "image reference":需要连接
reference_image。提示词不得包含 @AudioN 标签。 - "preset voice":需要选择
preset_voice。提示词不得包含 @AudioN 标签(整个提示词将以所选语音朗读)。
- 音频参考排序:使用“audio reference”模式时,参考音频输入必须从
reference_audio_1开始顺序连接,不能有间隔。例如,可以连接 _1 和 _2,但不能在没有 _2 的情况下连接 _1 和 _3。
- 最大音频标签数:在“audio reference”模式下,提示词最多可引用 3 个音频片段(@Audio1、@Audio2、@Audio3)。编号最高的标签不得超过已连接的参考音频输入数量。
## 输出
| 输出名称 | 描述 | 数据类型 |
|---|---|---|
AUDIO |
字节跳动 Seed Audio 1.0 生成的音频输出,包含提示词中描述的语音、音乐、音效或多说话人对话。 | AUDIO |
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256): cefd5fca496b02c35022d25be3d99d3911c1304b6e3a751751b58841d5895ef7
官方原文
本页来自 Comfy-Org 官方中文文档的固定版本,并转换为 xueai 静态页面。内容以官方持续更新的页面为准。