DDPM

DDPM

一步步加噪再去噪

亦作、亦称:Denoising Diffusion Probabilistic Models

DDPM(去噪扩散概率模型,Denoising Diffusion Probabilistic Models)是由 Ho、Jain、Abbeel 于 2020 年在 UC Berkeley 提出并发表于 NeurIPS 的生成模型框架。它通过正向逐步加高斯噪声、再由神经网络学习反向去噪的方式建模数据分布,以训练稳定、样本质量高著称,奠定了现代扩散模型的核心范式,并直接催生了 Stable Diffusion 等主流生成系统。

概述

DDPM(去噪扩散概率模型,Denoising Diffusion Probabilistic Models)是由 Ho、Jain、Abbeel 于 2020 年在 UC Berkeley 提出并发表于 NeurIPS 的生成模型框架。它通过正向逐步加高斯噪声、再由神经网络学习反向去噪的方式建模数据分布,以训练稳定、样本质量高著称,奠定了现代扩散模型的核心范式,并直接催生了 Stable Diffusion 等主流生成系统。

核心思想

DDPM 将生成问题转化为「学会逐步撤销噪声」的去噪序列任务。

  • 正向扩散过程:固定的马尔可夫链,在 T 步(原论文取 T=1000)内向原始样本 x₀ 叠加高斯噪声,直到 xT 近似标准正态分布;因加噪核有闭合形式,任意时刻 xₜ 可从 x₀ 一步直接采样
  • 反向去噪过程:由参数化神经网络(U-Net)学习条件分布 p(xₜ₋₁|xₜ),逐步将噪声还原为清晰样本
  • 噪声预测目标:训练时让模型直接预测每步叠加的噪声 ε,损失为 MSE;Ho 等人证明这一简化形式在实践中效果优于完整的 ELBO 加权
  • 核心优势:训练无对抗博弈,不存在 GAN 的模式崩塌,覆盖率与多样性更好
  • 核心短板:原始采样需迭代约 1000 步,推理延迟高,是最主要的工程瓶颈

数学基础

DDPM 的理论根植于变分推断与非平衡热力学。

  • 前向核:q(xₜ|xₜ₋₁) = N(xₜ; √(1-βₜ)·xₜ₋₁, βₜI),βₜ 为预定义的噪声调度(线性或余弦)
  • 闭合采样:利用累积乘积 ᾱₜ = ∏(1-βₛ),可直接从 x₀ 一步采样 xₜ,无需逐步迭代,极大提升训练效率
  • 真实后验:q(xₜ₋₁|xₜ, x₀) 有解析表达式,为反向网络提供了可计算的监督信号
  • 简化损失:L_simple = E[‖ε − εθ(xₜ, t)‖²],形式极简,易于工程实现
  • 理论前驱:Sohl-Dickstein 等人于 2015 年在「Deep Unsupervised Learning using Nonequilibrium Thermodynamics」中首次将扩散过程引入生成模型,DDPM 在此基础上完成了实用化突破

网络架构

DDPM 采用时间条件化的 U-Net 作为去噪骨干网络。

  • U-Net 骨干:编码器—解码器结构配合残差跳跃连接,适合保留空间细节的逐步去噪任务
  • 时间步嵌入:将离散时间步 t 编码为正弦位置向量后注入各层,使网络在不同噪声级别下自适应行为
  • 自注意力模块:在中间及部分高分辨率层插入 Multi-Head Self-Attention,捕捉全局依赖
  • 归一化:使用 GroupNorm 替代 BatchNorm,保证小批量下的训练稳定性
  • 参数共享:所有时间步共用同一套网络权重,仅通过时间嵌入区分不同去噪阶段

发展脉络

扩散模型从热力学理论出发,经过短短数年快速演进为生成 AI 的主流范式。

  • 2015:Sohl-Dickstein 等人提出扩散生成模型的理论框架,首次将非平衡热力学扩散过程用于深度生成模型
  • 2019:Song & Ermon 提出基于分数匹配的 NCSN(SMLD),从去噪得分角度推导出类似框架
  • 2020:Ho、Jain、Abbeel(UC Berkeley)发表 DDPM,以噪声预测 MSE 简化目标,图像质量首次媲美 GAN,发表于 NeurIPS 2020
  • 2020:Song 等人提出 DDIM(去噪扩散隐式模型),在不重新训练的前提下将采样步数从 1000 步压缩至约 50 步
  • 2021:Dhariwal & Nichol 提出 Classifier Guidance 与 Improved DDPM,ImageNet 生成质量首次超越 GAN
  • 2022Stable Diffusion(基于潜在扩散模型 LDM)开源,将扩散模型带入大众视野
  • 2023 至今一致性模型(Consistency Models)、流匹配(Flow Matching)等进一步将采样压缩至单步或少步

主要变体与加速方法

原始 DDPM 采样慢的瓶颈催生了大量后续研究。

  • DDIM(Song et al., 2020):确定性非马尔可夫采样,步数可压缩至 50 步以内,共享 DDPM 的网络权重,同时支持隐空间插值
  • 潜在扩散模型 LDM(Rombach et al., 2022):把扩散过程迁移到 VAE 的低维潜在空间,大幅降低计算量;Stable Diffusion 即基于此架构
  • Classifier-Free Guidance(Ho & Salimans, 2022):无需额外分类器,直接在扩散网络内嵌入条件引导,成为文生图系统的标配技术
  • 一致性模型(Song et al., 2023):通过一致性函数将多步轨迹压缩至 1-4 步生成
  • 流匹配(Flow Matching):连续时间框架下以直线轨迹替代曲折扩散路径,训练与采样效率更高,与 DDPM 共享去噪思想

优势与局限

DDPM 在质量与可控性上的突破伴随着固有的效率代价。

  • 高质量多样性:生成保真度与多样性显著优于早期 GAN,训练稳定,无模式崩塌
  • 理论清晰:损失函数形式简洁,易于理解与实现,可解释性强于对抗训练
  • 慢采样:原始版本每次生成需约 1000 步迭代,推理延迟是 GAN 的数十倍
  • 像素空间开销:在原始像素空间操作高分辨率图像时,计算与显存消耗极大
  • 条件控制有限:原生 DDPM 对精确空间布局控制能力弱,工程上需 ControlNet、IP-Adapter 等额外机制补充

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「一步步加噪再去噪」
  • 「扩散模型基础论文」
  • 「预测噪声来生成图像」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    Diffusion 模型(一):原理与数学基础

    从加噪到去噪,理解扩散模型如何一步步生成高质量图像

  2. 2

    Stable Diffusion(二):从原理到实战

    从文本到图像,理解 Stable Diffusion 如何实现高质量图像生成

  3. 3

    神经网络基础:从感知机到多层网络

    理解神经元、激活函数、反向传播和梯度消失问题

外部参考

维基百科:查看「DDPM」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。