DDIM

DDIM

更快的扩散采样

亦作、亦称:Denoising Diffusion Implicit Models

Denoising Diffusion Implicit Models 用确定性或少步采样加速扩散模型生成,在质量与速度之间提供灵活权衡。

概述

Denoising Diffusion Implicit Models 用确定性或少步采样加速扩散模型生成,在质量与速度之间提供灵活权衡。

背景:DDPM 的速度瓶颈

DDPM 奠定了扩散模型基础,但极慢的马尔可夫链推理催生了对加速方法的迫切需求。

  • DDPM 定义为 T=1000 步的马尔可夫链,每步只能向前一个极小的时间步长
  • 完整推理一张图像通常耗时数分钟,远不满足实际应用需求
  • 直接减少步数会因离散化误差积累而显著降低图像质量
  • DDIM 的核心动机:能否在不重新训练的前提下,找到与 DDPM 等价但可大步跨越的采样路径

核心机制:非马尔可夫隐式过程

DDIM 构造了一族与 DDPM 训练目标等价、但前向过程为非马尔可夫的扩散过程。

  • 非马尔可夫前向过程:允许 $x_t$ 直接依赖 $x_0$,而非仅依赖前一步 $x_{t-1}$
  • 确定性反向公式:利用噪声预测网络同时估计「当前预测的原始样本」和「方向向量」,按比例组合后直接跳步
  • 子序列采样:只在时间步的稀疏子集(如从 1000 步中均匀选取 50 步)执行反向步骤
  • 参数 η:控制随机性系数;η=0 为完全确定性(标准 DDIM),η=1 退化为 DDPM 随机采样
  • 关键性质:上述过程是 DDPM 训练目标的严格推广,所有以噪声预测(ε-prediction)训练的模型均可直接使用

加速效果

DDIM 在保持图像质量的前提下,将推理步数从千级压缩至十至百级。

  • 采用 20–100 步 即可生成与 DDPM 1000 步相近质量的图像
  • 相比 DDPM,壁钟时间加速 10 倍至 50 倍(原论文数据)
  • 步数与质量可灵活权衡:步数越多,FID 越低,生成越精细
  • 极少步数(如 10 步)下仍能产出可辨内容,适用于草图预览等场景
  • Stable Diffusion 等系统将 DDIM 及其衍生采样器作为默认推理方案

潜在空间操作与图像编辑

确定性采样赋予 DDIM 可逆编码能力,使其成为图像编辑技术的重要基础组件。

  • DDIM 反演(Inversion):给定真实图像,沿确定性路径反向运行,将其编码回对应噪声向量
  • 语义插值:在两张图像的噪声向量之间线性插值,生成语义上平滑过渡的中间图像
  • 精确图像编辑基础:Prompt-to-Prompt、Null-text Inversion 等编辑方法均依赖 DDIM 反演作为核心步骤
  • 注意:受去噪网络近似误差影响,DDIM 反演并非完全精确,精细编辑场景需额外矫正方法

发展脉络

DDIM 是扩散模型加速采样研究的关键里程碑,推动了一系列后续工作。

  • 2020:宋佳明等人提出 DDIM,arXiv 预印本发布(arXiv:2010.02502)
  • 2021:DDIM 被 ICLR 2021 接收;Stable Diffusion 前身代码库集成 DDIM 采样器
  • 2022:DPM-Solver、PLMS 等高阶 ODE 求解器在 DDIM 框架基础上进一步提速,同等步数质量更优
  • 2022–2023:DDIM 反演成为 Prompt-to-Prompt、InstructPix2Pix 等图像编辑方法的标配组件
  • 2023–2024:流匹配(Flow Matching)被 Stable Diffusion 3、Flux 等新一代模型采用,可视为 DDIM 路径思路的进一步线性化;一致性模型(Consistency Models)探索 1–4 步极少步生成

与相邻概念的区别

DDIM 常与 DDPM 及其他采样器并列讨论,边界清晰有助于避免误用。

  • DDIM vs. DDPM:两者共用同一训练权重,区别仅在推理算法——DDPM 每步注入随机噪声,DDIM 默认无随机噪声
  • DDIM vs. DPM-Solver:DPM-Solver 利用高阶 ODE 求解器,同等步数下质量通常优于 DDIM,是更新的替代;DDIM 实现更简单,概念更易理解
  • DDIM vs. 一致性模型:一致性模型专为 1–4 步极少步生成设计,需单独蒸馏训练;DDIM 无需修改训练但极少步时质量更差
  • DDIM vs. 流匹配:流匹配以线性 ODE 路径定义前向过程,数学结构更简洁;两者推理逻辑高度相似但源于不同理论框架
  • DDIM 不是独立模型:它是采样算法,必须配合已训练的扩散模型权重使用

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「更快的扩散采样」
  • 「少走几步也能出图」
  • 「扩散模型加速方法」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    Diffusion 模型(一):原理与数学基础

    从加噪到去噪,理解扩散模型如何一步步生成高质量图像

  2. 2

    文本到图像生成:DALL-E, Imagen

    从文本描述到高质量图像,理解多模态生成的前沿技术

  3. 3

    LLM 推理加速技术全景(三):从推测解码到块扩散

    2026 年 4 月,LLM 推理加速领域迎来密集突破:DFlash 提出块扩散推测解码、DDTree 构建草稿树实现单次验证多路径、SpecGuard 引入验证感知步骤级校验、Parcae 用循环架构减半参数量。本文系统梳理 LLM 推理加速的技术栈,从算法层到架构层,帮你建立完整的知识框架。