工作流教程

ComfyUI Depth Anything 3 官方示例

了解如何在 ComfyUI 中使用 Depth Anything 3 进行单目和多视角深度估计,支持图像和视频输入。

ComfyUI Depth Anything 3 简介

Depth Anything 3 (DA3) 来自字节跳动豆包团队,是一个视觉 Transformer,能够从任意视觉输入中恢复空间一致的几何信息,无论是否具有已知的相机位姿。单个 DINO 编码器和统一的深度-射线表示使得同一模型家族能够覆盖单目深度、多视角深度、相机位姿估计和 3D 重建。

主要能力:

  • 统一单目与多视角深度:从单张图像或多张图像估计深度
  • 相机位姿估计:从无序图像集合中恢复相机位置
  • 3D 重建:支持多视角输入
  • 视频深度估计:为视频输入生成逐帧深度序列
  • 多种模型变体:Small、Base、Mono/Metric Large

模型下载

下载 Depth Anything 3 的模型文件并将其保存到对应的 ComfyUI 文件夹:

text
ComfyUI/
├── models/
│   ├── geometry_estimation/
│   │   ├── depth_anything_3_small.safetensors
│   │   ├── depth_anything_3_base.safetensors
│   │   ├── depth_anything_3_mono_large.safetensors
│   │   └── depth_anything_3_metric_large.safetensors

示例工作流


1. 图像深度估计

功能说明: 上传一张图像,使用 Image Depth Estimation (Depth Anything 3) 生成深度图。结果在 Depth Preview 中显示,提供原始图像与深度输出的并排对比视图。

下载工作流

下载 JSON 或在模板库中搜索 "Depth Anything 3"

下载示例图片

获取此工作流的示例输入图片

图像深度估计输出 图像深度估计对比

运行步骤

  1. LoadImage — 加载输入图像
  2. LoadDA3Model — 选择 Depth Anything 3 变体
  3. 运行 — 点击 Queue 或使用 Cmd+Enter
  4. 工作流输出深度图和并排比较结果

了解子图

此工作流使用子图节点进行模块化处理。查看子图文档了解如何自定义和扩展工作流。


2. 视频深度估计

功能说明: 上传一个视频,运行 Video Depth Estimation (Depth Anything 3) 生成逐帧深度序列。在子图内部,GetVideoComponents 将输入视频拆分为帧,LoadDA3Model 加载模型,SetVideoComponents 将深度帧重新组合为视频输出。

下载工作流

下载 JSON 或在模板库中搜索 "Depth Anything 3"

在 Comfy Cloud 运行

在 Comfy Cloud 中打开

视频深度估计预览

运行步骤

  1. LoadVideo — 加载输入视频
  2. 选择模型 — 在 SmallBaseMono-LargeMetric-Large 中选择
  3. 运行 — 点击 Queue 或使用 Cmd+Enter
  4. 工作流输出逐帧深度图视频

了解子图

此工作流使用子图节点进行模块化处理。查看子图文档了解如何自定义和扩展工作流。

模型变体

变体 head_type 天空检测 置信度 相机解码 最佳用途
Small dualdpt 快速推理、移动/边缘设备
Base dualdpt 均衡性能
Mono-Large dpt 带天空检测的单目深度
Metric-Large dpt 物理度量深度(米级输出)
  • SmallBase 使用 dualdpt 头类型,支持置信度估计和相机解码器,适用于多视角应用。
  • Mono-LargeMetric-Large 使用 dpt 头类型,支持天空检测。Metric-Large 输出原始米级深度。

社区资源

官方原文

本页来自 Comfy-Org 官方中文文档的固定版本,并转换为 xueai 静态页面。内容以官方持续更新的页面为准。

内容授权与修改

官方文档采用 GPL-3.0。本站保留许可证、固定提交号和修改说明,不代表 ComfyUI 或 Comfy-Org 对本站背书。

GPL-3.0来源和修改说明