内置节点参考

SyncTalkingImageNode - ComfyUI Built-in Node Documentation

Complete documentation for the SyncTalkingImageNode node in ComfyUI. Learn its inputs, outputs, parameters and usage.

使用 sync.so 的 sync-3 模型,将静态人像动画化为由语音音频驱动的说话视频。输出时长与音频时长一致,费用随输出时长增加而增加。

输入

参数 描述 数据类型 是否必需 范围
图像 一张面部清晰可见的图片,最高支持 4K(4096x2160)分辨率。 IMAGE 仅需一张图片
音频 驱动说话视频的语音音频;输出时长与之匹配。可在此处链接任意 TTS 节点,以通过文本驱动动画。 AUDIO 最大时长:600 秒
提示词 可选提示词,用于指导人像如何生动呈现,例如"让主体微笑并看向镜头"。留空则生成自然的说话动作。(默认值:"") STRING 多行文本
种子 种子控制节点是否应重新运行;无论种子如何,结果均具有非确定性。(默认值:0) INT 0 到 2147483647
模型 sync.so 生成模型。图片输入仅支持 sync-3。 COMBO "sync-3"
speaker_selection 当画面中出现多人时,选择对哪张面部进行动画化。default:让模型自行决定。coordinates:定位图片中像素坐标 (speaker_x, speaker_y) 处的面部。图片不支持自动检测。(默认值:"default") COMBO "default"
"coordinates"
speaker_x 说话者面部的 X 轴像素坐标。仅在 speaker_selection 设置为 'coordinates' 时使用。(默认值:0) INT 0 到 4096
speaker_y 说话者面部的 Y 轴像素坐标。仅在 speaker_selection 设置为 'coordinates' 时使用。(默认值:0) INT 0 到 4096
auto_downscale 若图片超过 4K(4096x2160)输入限制,自动降低分辨率;说话者坐标会相应缩放。禁用时,超尺寸图片将引发错误。(默认值:True) BOOLEAN True
False

注意: speaker_xspeaker_y 参数仅在 speaker_selection 设置为 "coordinates" 时使用。启用 auto_downscale 时,说话者坐标会自动缩放以匹配降低后的图片尺寸。

输出

输出名称 描述 数据类型
video 生成的说话视频,其中动画化的人像与输入音频同步。 VIDEO

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑


Source fingerprint (SHA-256): 21f722cdcc5ff017949887ed2252854feebb9b913034dc6a6c3ce196ad089468

官方原文

本页来自 Comfy-Org 官方中文文档的固定版本,并转换为 xueai 静态页面。内容以官方持续更新的页面为准。

内容授权与修改

官方文档采用 GPL-3.0。本站保留许可证、固定提交号和修改说明,不代表 ComfyUI 或 Comfy-Org 对本站背书。

GPL-3.0来源和修改说明