工作流教程
LTX-2.3:ComfyUI 工作流示例
了解如何在 ComfyUI 中使用 LTX-2.3,包含文本转视频、图像转视频、FLF2V、音频驱动视频、IC-LoRA 控制和 ID-LoRA 个性化等原生工作流。
LTX-2.3 是 Lightricks 开源音视频生成模型的最新进化版本,现已原生支持 ComfyUI。在 LTX-2 的基础上,此版本在精细细节、人像视频、音频质量、图像到视频的一致性、提示理解和文本渲染方面带来了重大质量提升。
ComfyUI 为 LTX-2.3 提供了六个原生工作流,每个针对特定的生成模式:
- 文本转视频 (T2V):根据文本提示生成视频
- 图像转视频 (I2V):根据输入图像生成视频
- FLF2V:在起始和结束图像之间进行插值
- 图像音频转视频 (IA2V):从图像和音频生成唇形同步视频
- IC-LoRA 联合控制:使用深度、姿态或边缘引导控制视频生成
- ID-LoRA:从参考图像和音频片段生成带同步音频的个性化视频
主要特性
- 更精细的细节:新的潜在空间和更新的 VAE,带来更清晰的纹理、更干净的边缘和更精确的视觉效果
- 9:16 竖屏支持:大幅提升竖屏人像视频的质量
- 更优质的音频:更清晰的声音,减少噪音并增强对话效果
- 改进的图像转视频:更一致的动态和更少的伪影
- 更智能的提示理解:改进的文本编码器,实现更准确的语义理解
- 原生 ComfyUI 支持:所有工作流内置,无需自定义节点
快速开始
LTX-2.3 已原生支持 ComfyUI。要开始使用:
- 将 ComfyUI 更新到最新版本
- 转到 模板库 > 视频 > 选择任意 LTX-2.3 工作流
- 按照弹窗提示下载模型并运行工作流
ComfyUI 原生工作流
LTX-2.3 文本转视频 (T2V)
通过改进的提示理解和文本渲染,根据文本提示生成视频。
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索"LTX-2.3 T2V"
模型下载
检查点:ltx-2.3-22b-dev-fp8
放置到 <code>ComfyUI/models/checkpoints/</code>
LoRA:蒸馏版 1.1
放置到 <code>ComfyUI/models/loras/</code>
LoRA:gemma 去审查版
放置到 <code>ComfyUI/models/loras/</code>
文本编码器:gemma 12B
放置到 <code>ComfyUI/models/text_encoders/</code>
超分器:空间 x2
放置到 <code>ComfyUI/models/latent_upscale_models/</code>
模型存储
ComfyUI/
├── 📂 models/
│ ├── 📂 checkpoints/
│ │ └── ltx-2.3-22b-dev-fp8.safetensors
│ ├── 📂 loras/
│ │ ├── ltx_2.3_22b_distilled_1.1_lora_dynamic_fro09_avg_rank_111_bf16.safetensors
│ │ └── gemma-3-12b-it-abliterated_lora_rank64_bf16.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma_3_12B_it_fp4_mixed.safetensors
│ └── 📂 latent_upscale_models/
│ └── ltx-2.3-spatial-upscaler-x2-1.1.safetensors提示技巧
- 核心动作:按时间顺序描述事件和动作
- 视觉细节:描述视频中所有希望出现的视觉细节
- 音频:描述场景所需的音效和对话
LTX-2.3 图像转视频 (I2V)
根据输入图像生成视频,具有更一致的动态和更流畅的动画。
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索"LTX-2.3 I2V"
输入图像:egyptian_queen.png
下载默认输入图像,或使用您自己的图像。
模型下载
I2V 工作流使用与文本转视频相同的模型集。
检查点:ltx-2.3-22b-dev-fp8
放置到 <code>ComfyUI/models/checkpoints/</code>
LoRA:蒸馏版 1.1
放置到 <code>ComfyUI/models/loras/</code>
LoRA:gemma 去审查版
放置到 <code>ComfyUI/models/loras/</code>
文本编码器:gemma 12B
放置到 <code>ComfyUI/models/text_encoders/</code>
超分器:空间 x2
放置到 <code>ComfyUI/models/latent_upscale_models/</code>
模型存储
ComfyUI/
├── 📂 models/
│ ├── 📂 checkpoints/
│ │ └── ltx-2.3-22b-dev-fp8.safetensors
│ ├── 📂 loras/
│ │ ├── ltx_2.3_22b_distilled_1.1_lora_dynamic_fro09_avg_rank_111_bf16.safetensors
│ │ └── gemma-3-12b-it-abliterated_lora_rank64_bf16.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma_3_12B_it_fp4_mixed.safetensors
│ └── 📂 latent_upscale_models/
│ └── ltx-2.3-spatial-upscaler-x2-1.1.safetensorsLTX-2.3 FLF2V
在起始图像和结束图像之间进行插值,生成流畅的视频过渡。
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索"LTX-2.3 FLF2V"
起始图像:high_view_classic_car.png
视频的第一帧。
结束图像:low_view_classic_car.png
视频的最后一帧。
模型下载
FLF2V 工作流使用蒸馏版检查点而非开发版检查点。
检查点:ltx-2.3-22b-distilled-fp8
放置到 <code>ComfyUI/models/checkpoints/</code>
文本编码器:gemma 12B
放置到 <code>ComfyUI/models/text_encoders/</code>
模型存储
ComfyUI/
├── 📂 models/
│ ├── 📂 checkpoints/
│ │ └── ltx-2.3-22b-distilled-fp8.safetensors
│ └── 📂 text_encoders/
│ └── gemma_3_12B_it_fp4_mixed.safetensorsLTX-2.3 图像音频转视频 (IA2V)
上传图像和音频文件,生成具有同步唇部运动的高质量视频。
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索"LTX-2.3 IA2V"
输入图像:cactus_man.png
说话角色的参考图像。
参考音频:ltx_23_audio.mp3
用于唇形同步的音频轨道。
模型下载
IA2V 工作流使用与文本转视频相同的模型集。
检查点:ltx-2.3-22b-dev-fp8
放置到 <code>ComfyUI/models/checkpoints/</code>
LoRA:蒸馏版 1.1
放置到 <code>ComfyUI/models/loras/</code>
LoRA:gemma 去审查版
放置到 <code>ComfyUI/models/loras/</code>
文本编码器:gemma 12B
放置到 <code>ComfyUI/models/text_encoders/</code>
超分器:空间 x2
放置到 <code>ComfyUI/models/latent_upscale_models/</code>
模型存储
ComfyUI/
├── 📂 models/
│ ├── 📂 checkpoints/
│ │ └── ltx-2.3-22b-dev-fp8.safetensors
│ ├── 📂 loras/
│ │ ├── ltx_2.3_22b_distilled_1.1_lora_dynamic_fro09_avg_rank_111_bf16.safetensors
│ │ └── gemma-3-12b-it-abliterated_lora_rank64_bf16.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma_3_12B_it_fp4_mixed.safetensors
│ └── 📂 latent_upscale_models/
│ └── ltx-2.3-spatial-upscaler-x2-1.1.safetensorsLTX-2.3 IC-LoRA 联合控制
使用 IC-LoRA 结合对齐的控制输入(如深度、姿态或边缘)生成 LTX-2.3 视频。IC-LoRA 是基于 LTX-2.3 训练的情境内 LoRA,通过参考视频应用结构引导。它接受来自多种预处理器的控制信号,包括深度图、Canny 边缘和姿态骨架。此工作流使用子图实现模块化处理。

在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索"LTX-2.3 IC-LoRA"
了解子图
此工作流使用子图节点实现模块化处理。查阅子图文档,了解如何自定义和扩展工作流。
输入素材
控制视频:stone_ruins.mp4
用于控制信号提取的驱动视频。
参考图像:the_forgotten_gate.png
用于风格和内容的参考图像。
模型下载
检查点:ltx-2.3-22b-distilled-fp8
放置到 <code>ComfyUI/models/checkpoints/</code>
LoRA:IC-LoRA 联合控制
放置到 <code>ComfyUI/models/loras/</code>
LoRA:gemma 去审查版
放置到 <code>ComfyUI/models/loras/</code>
文本编码器:gemma 12B
放置到 <code>ComfyUI/models/text_encoders/</code>
几何估计:MoGe Normal
放置到 <code>ComfyUI/models/geometry_estimation/</code>
模型存储
ComfyUI/
├── 📂 models/
│ ├── 📂 checkpoints/
│ │ └── ltx-2.3-22b-distilled-fp8.safetensors
│ ├── 📂 loras/
│ │ ├── ltx-2.3-22b-ic-lora-union-control-ref0.5.safetensors
│ │ └── gemma-3-12b-it-abliterated_lora_rank64_bf16.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma_3_12B_it_fp4_mixed.safetensors
│ └── 📂 geometry_estimation/
│ └── moge_2_vitl_normal_fp16.safetensorsLTX-2.3 ID-LoRA
根据文本提示、参考图像和短音频片段,生成带同步音频的个性化视频。使用 ID-LoRA 在单个生成模型中适应人物的外貌和声音。
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索"LTX-2.3 ID-LoRA"
参考图像:vintage_thinker.png
角色外观的参考图像。
参考音频:ltx23_reference_audio.mp3
用于声音克隆和唇形同步的音频片段。
模型下载
检查点:ltx-2.3-22b-dev-fp8
放置到 <code>ComfyUI/models/checkpoints/</code>
LoRA:蒸馏版 1.1
放置到 <code>ComfyUI/models/loras/</code>
LoRA:ID-LoRA TalkVid
放置到 <code>ComfyUI/models/loras/</code>
文本编码器:gemma 12B
放置到 <code>ComfyUI/models/text_encoders/</code>
超分器:空间 x2
放置到 <code>ComfyUI/models/latent_upscale_models/</code>
模型存储
ComfyUI/
├── 📂 models/
│ ├── 📂 checkpoints/
│ │ └── ltx-2.3-22b-dev-fp8.safetensors
│ ├── 📂 loras/
│ │ ├── ltx_2.3_22b_distilled_1.1_lora_dynamic_fro09_avg_rank_111_bf16.safetensors
│ │ └── ltx-2.3-id-lora-talkvid-3k.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma_3_12B_it_fp4_mixed.safetensors
│ └── 📂 latent_upscale_models/
│ └── ltx-2.3-spatial-upscaler-x2-1.1.safetensors提示技巧
为 LTX-2.3 编写提示时,重点使用详细的、按时间顺序描述的动作和场景:
- 核心动作:按时间顺序描述事件和动作
- 视觉细节:描述视频中所有希望出现的视觉细节
- 音频:描述场景所需的音效和对话
资源
官方原文
本页来自 Comfy-Org 官方中文文档的固定版本,并转换为 xueai 静态页面。内容以官方持续更新的页面为准。