核心要点

  • 前向/反向过程

  • GAN 对比

  • 条件生成(文生图)

简要回答

训练时学一个网络预测每一步加的噪声;生成时从纯噪声出发,迭代去噪 T 步得到清晰图像,文本条件通过 Cross-Attention 注入。

标准回答

一、先把结论讲清楚

前向扩散:x_0 → ... → x_T 纯高斯噪声,每步加小噪声。反向去噪:学 p(x_{t-1}|x_t),推理时从 x_T 采样逐步还原。

二、拆开机制和判断点

Stable Diffusion:在 latent 空间扩散降算力;U-Net 预测噪声;CLIP 文本编码器提供条件。优势:训练稳定、多样性好。

三、补上例子、边界和取舍

劣势:推理慢(需多步),可用 DDIM、Distillation 加速。对比 GAN:扩散质量高但慢;GAN 快但模式崩塌风险。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1什么是 Classifier-Free Guidance?

题库专题:扩散模型中的无分类器引导(Classifier-Free Guidance)是什么?

训练时随机丢弃条件(如文本 prompt),推理时用有条件与无条件预测差值放大条件影响:ε = ε_u + w(ε_c − ε_u)。w>1 加强 prompt 遵循,过大易过饱和、多样性下降。

题库延伸:与本追问相关的专题题 → 扩散模型中的无分类器引导(Classifier-Free Guidance)是什么?

追问 2Latent Diffusion 为何省算力?

题库专题:潜空间扩散(Latent Diffusion / Stable Diffusion)为什么更高效?

VAE 压缩后的低维 latent 空间做扩散,分辨率低、通道少,U-Net 计算量远小于像素空间扩散;解码器最后映射回图像,在质量与效率间取得平衡(Stable Diffusion)。

题库延伸:与本追问相关的专题题 → 潜空间扩散(Latent Diffusion / Stable Diffusion)为什么更高效?

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习