工作流教程

Wan Dancer:从音乐生成舞蹈视频

使用基于 Wan 2.2 构建的分层音频驱动框架 Wan Dancer,从音乐生成分钟级连贯的舞蹈视频。输入参考图像和音频,即可生成同步的舞蹈视频。

Wan Dancer 是一款基于 Wan万相 2.2 架构的音频驱动舞蹈视频生成模型。它采用分层框架,包含全局专家模型和局部专家模型,能够生成与输入音乐同步的连贯、富有表现力的舞蹈视频。

给定角色参考图像和音频轨道,Wan Dancer 会生成一段舞蹈视频,其中角色的动作与音乐的节奏和风格相匹配。全局模型捕捉整体舞蹈结构和身体协调性,局部模型则优化细粒度的动作细节,以实现自然、高质量的输出。

模型亮点

  • 音频驱动的舞蹈生成:直接从音乐生成舞蹈动作,无需手动关键帧或动作捕获
  • 分层框架:两阶段架构(全局+局部),实现连贯的身体运动和精细的动作优化
  • 音乐同步输出:舞蹈动作自然对齐到输入音频的节奏和速度
  • 风格控制:可配置的舞蹈风格和动作幅度,提供创意方向
  • 分钟级生成:生成长格式连贯舞蹈视频,全时段保持时空一致性

工作流总览

Wan万相 Dancer 工作流接受两个输入:角色参考图像和一个音频文件。它生成两个视频输出:一个全局输出预览,展示整体舞蹈结构;以及一个最终精炼输出,带有增强的动作细节。

Wan Dancer 工作流

1. 下载工作流文件

将 ComfyUI 更新至最新版本,然后下载工作流文件并拖入 ComfyUI,或通过 工作流浏览模板视频 在模板库中找到“Wan Dancer”。

在 Comfy Cloud 上运行

在 Comfy Cloud 中运行

下载工作流

下载 JSON 或在模板库中搜索 "Wan Dancer"

2. 下载输入素材

参考图像:blue_dancer.png

用于舞蹈生成的输入角色图像。下载使用此图像,或替换为你自己的图像。

参考音频

用于舞蹈同步的参考音频轨道。下载使用此音频,或替换为你自己的音乐。

3. 手动下载模型

扩散模型

LoRA

文本编码器

CLIP 视觉

VAE

text
ComfyUI/
├───📂 models/
│   ├───📂 diffusion_models/
│   │   ├─── wan2.2_dancer_14b_global_fp8_scaled.safetensors
│   │   └─── wan2.2_dancer_14b_local_fp8_scaled.safetensors
│   ├───📂 loras/
│   │   └─── lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
│   ├───📂 text_encoders/
│   │   └─── umt5_xxl_fp16.safetensors
│   ├───📂 clip_vision/
│   │   └─── clip_vision_h.safetensors
│   └───📂 vae/
│       └── Wan2_1_VAE_bf16.safetensors

4. 工作流说明

  1. 加载参考图像:使用“加载图像”节点上传角色图像。默认输入为 blue_dancer.png
  1. 加载音频文件:使用“加载音频”节点上传音乐或音频轨道。默认输入为 wan_dancer_reference_audio.mp3
  1. 配置舞蹈参数
  • dance_style:选择输出视频的舞蹈风格
  • motion_amplitude:控制舞蹈动作的强度
  • audio_duration:设置为与输入音频的时长匹配
  • final_duration:选择最终输出视频的时长
  1. 配置输出尺寸
  • widthheight:设置输出视频的分辨率。请根据 GPU 的可用显存选择合适的值。
  1. 验证模型路径:确保模型选择器指向正确的模型文件:
  • global_model:应加载 wan2.2_dancer_14b_global_fp8_scaled.safetensors
  • local_model:应加载 wan2.2_dancer_14b_local_fp8_scaled.safetensors
  • lightning_lora:应加载 lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
  • clip_vision:应加载 clip_vision_h.safetensors
  1. 运行生成:点击“运行”按钮或使用快捷键 Ctrl(Cmd) + Enter 执行视频生成。

5. 输出

工作流产生两个视频输出:

  • 全局输出预览:显示全局模型生成的舞蹈整体结构
  • 最终输出:经局部模型优化后的精细舞蹈视频

两个输出均通过 SaveVideo 节点自动保存。

模型信息

Wan Dancer 是一个基于 Apache 2.0 许可证发布的开源模型。模型权重可在 Hugging Face 上获取:

反馈问题

如果您遇到运行时错误或意外行为:

  • 确保 ComfyUI 已更新到最新版本
  • 检查所有必填模型是否已下载并放置在正确的目录中
  • 对于桌面/云端用户:更新跟随稳定版本发布,因此每夜支持的模型可能无法立即使用

反馈问题至:ComfyUI/issues

官方原文

本页来自 Comfy-Org 官方中文文档的固定版本,并转换为 xueai 静态页面。内容以官方持续更新的页面为准。

内容授权与修改

官方文档采用 GPL-3.0。本站保留许可证、固定提交号和修改说明,不代表 ComfyUI 或 Comfy-Org 对本站背书。

GPL-3.0来源和修改说明