DDPM
DDPM一步步加噪再去噪
亦作、亦称:Denoising Diffusion Probabilistic Models
DDPM(去噪扩散概率模型,Denoising Diffusion Probabilistic Models)是由 Ho、Jain、Abbeel 于 2020 年在 UC Berkeley 提出并发表于 NeurIPS 的生成模型框架。它通过正向逐步加高斯噪声、再由神经网络学习反向去噪的方式建模数据分布,以训练稳定、样本质量高著称,奠定了现代扩散模型的核心范式,并直接催生了 Stable Diffusion 等主流生成系统。
概述
DDPM(去噪扩散概率模型,Denoising Diffusion Probabilistic Models)是由 Ho、Jain、Abbeel 于 2020 年在 UC Berkeley 提出并发表于 NeurIPS 的生成模型框架。它通过正向逐步加高斯噪声、再由神经网络学习反向去噪的方式建模数据分布,以训练稳定、样本质量高著称,奠定了现代扩散模型的核心范式,并直接催生了 Stable Diffusion 等主流生成系统。
核心思想
DDPM 将生成问题转化为「学会逐步撤销噪声」的去噪序列任务。
- 正向扩散过程:固定的马尔可夫链,在 T 步(原论文取 T=1000)内向原始样本 x₀ 叠加高斯噪声,直到 xT 近似标准正态分布;因加噪核有闭合形式,任意时刻 xₜ 可从 x₀ 一步直接采样
- 反向去噪过程:由参数化神经网络(U-Net)学习条件分布 p(xₜ₋₁|xₜ),逐步将噪声还原为清晰样本
- 噪声预测目标:训练时让模型直接预测每步叠加的噪声 ε,损失为 MSE;Ho 等人证明这一简化形式在实践中效果优于完整的 ELBO 加权
- 核心优势:训练无对抗博弈,不存在 GAN 的模式崩塌,覆盖率与多样性更好
- 核心短板:原始采样需迭代约 1000 步,推理延迟高,是最主要的工程瓶颈
数学基础
DDPM 的理论根植于变分推断与非平衡热力学。
- 前向核:q(xₜ|xₜ₋₁) = N(xₜ; √(1-βₜ)·xₜ₋₁, βₜI),βₜ 为预定义的噪声调度(线性或余弦)
- 闭合采样:利用累积乘积 ᾱₜ = ∏(1-βₛ),可直接从 x₀ 一步采样 xₜ,无需逐步迭代,极大提升训练效率
- 真实后验:q(xₜ₋₁|xₜ, x₀) 有解析表达式,为反向网络提供了可计算的监督信号
- 简化损失:L_simple = E[‖ε − εθ(xₜ, t)‖²],形式极简,易于工程实现
- 理论前驱:Sohl-Dickstein 等人于 2015 年在「Deep Unsupervised Learning using Nonequilibrium Thermodynamics」中首次将扩散过程引入生成模型,DDPM 在此基础上完成了实用化突破
网络架构
DDPM 采用时间条件化的 U-Net 作为去噪骨干网络。
- U-Net 骨干:编码器—解码器结构配合残差跳跃连接,适合保留空间细节的逐步去噪任务
- 时间步嵌入:将离散时间步 t 编码为正弦位置向量后注入各层,使网络在不同噪声级别下自适应行为
- 自注意力模块:在中间及部分高分辨率层插入 Multi-Head Self-Attention,捕捉全局依赖
- 归一化:使用 GroupNorm 替代 BatchNorm,保证小批量下的训练稳定性
- 参数共享:所有时间步共用同一套网络权重,仅通过时间嵌入区分不同去噪阶段
发展脉络
扩散模型从热力学理论出发,经过短短数年快速演进为生成 AI 的主流范式。
- 2015:Sohl-Dickstein 等人提出扩散生成模型的理论框架,首次将非平衡热力学扩散过程用于深度生成模型
- 2019:Song & Ermon 提出基于分数匹配的 NCSN(SMLD),从去噪得分角度推导出类似框架
- 2020:Ho、Jain、Abbeel(UC Berkeley)发表 DDPM,以噪声预测 MSE 简化目标,图像质量首次媲美 GAN,发表于 NeurIPS 2020
- 2020:Song 等人提出 DDIM(去噪扩散隐式模型),在不重新训练的前提下将采样步数从 1000 步压缩至约 50 步
- 2021:Dhariwal & Nichol 提出 Classifier Guidance 与 Improved DDPM,ImageNet 生成质量首次超越 GAN
- 2022:Stable Diffusion(基于潜在扩散模型 LDM)开源,将扩散模型带入大众视野
- 2023 至今:一致性模型(Consistency Models)、流匹配(Flow Matching)等进一步将采样压缩至单步或少步
主要变体与加速方法
原始 DDPM 采样慢的瓶颈催生了大量后续研究。
- DDIM(Song et al., 2020):确定性非马尔可夫采样,步数可压缩至 50 步以内,共享 DDPM 的网络权重,同时支持隐空间插值
- 潜在扩散模型 LDM(Rombach et al., 2022):把扩散过程迁移到 VAE 的低维潜在空间,大幅降低计算量;Stable Diffusion 即基于此架构
- Classifier-Free Guidance(Ho & Salimans, 2022):无需额外分类器,直接在扩散网络内嵌入条件引导,成为文生图系统的标配技术
- 一致性模型(Song et al., 2023):通过一致性函数将多步轨迹压缩至 1-4 步生成
- 流匹配(Flow Matching):连续时间框架下以直线轨迹替代曲折扩散路径,训练与采样效率更高,与 DDPM 共享去噪思想
优势与局限
DDPM 在质量与可控性上的突破伴随着固有的效率代价。
- 高质量多样性:生成保真度与多样性显著优于早期 GAN,训练稳定,无模式崩塌
- 理论清晰:损失函数形式简洁,易于理解与实现,可解释性强于对抗训练
- 慢采样:原始版本每次生成需约 1000 步迭代,推理延迟是 GAN 的数十倍
- 像素空间开销:在原始像素空间操作高分辨率图像时,计算与显存消耗极大
- 条件控制有限:原生 DDPM 对精确空间布局控制能力弱,工程上需 ControlNet、IP-Adapter 等额外机制补充
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「一步步加噪再去噪」
- 「扩散模型基础论文」
- 「预测噪声来生成图像」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
DDPM 与 DDIM 采样有什么区别?为什么 DDIM 更快?
DDPM 是随机马尔可夫逆过程需多步;DDIM 是确定性非马尔可夫,同一模型可跳步采样,步数大幅减少。
- 高级概念查看详解 →
自回归图像生成(如 VAR)与扩散模型有何区别?
自回归图像生成按 token/尺度序列预测(VAR 用 next-scale prediction),扩散用迭代去噪,二者路线不同。
- 高级概念查看详解 →
Flow Matching / Rectified Flow 与扩散模型有何关系?
Flow Matching 学习从噪声到数据的连续向量场(ODE);Rectified Flow 拉直路径实现少步采样,与扩散是连续视角的统一。
- 中级概念查看详解 →
扩散模型中的 U-Net 起什么作用?
编码器-解码器结构加跳跃连接,在每个时间步预测加入的噪声 ε,是扩散逆过程的去噪主干网络。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「DDPM」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
