核心要点
前向/反向过程
与 GAN 对比
条件生成(文生图)
简要回答
训练时学一个网络预测每一步加的噪声;生成时从纯噪声出发,迭代去噪 T 步得到清晰图像,文本条件通过 Cross-Attention 注入。
标准回答
一、先把结论讲清楚
前向扩散:x_0 → ... → x_T 纯高斯噪声,每步加小噪声。反向去噪:学 p(x_{t-1}|x_t),推理时从 x_T 采样逐步还原。
二、拆开机制和判断点
Stable Diffusion:在 latent 空间扩散降算力;U-Net 预测噪声;CLIP 文本编码器提供条件。优势:训练稳定、多样性好。
三、补上例子、边界和取舍
劣势:推理慢(需多步),可用 DDIM、Distillation 加速。对比 GAN:扩散质量高但慢;GAN 快但模式崩塌风险。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:什么是 Classifier-Free Guidance?
题库专题:扩散模型中的无分类器引导(Classifier-Free Guidance)是什么?训练时随机丢弃条件(如文本 prompt),推理时用有条件与无条件预测差值放大条件影响:ε = ε_u + w(ε_c − ε_u)。w>1 加强 prompt 遵循,过大易过饱和、多样性下降。
题库延伸:与本追问相关的专题题 → 扩散模型中的无分类器引导(Classifier-Free Guidance)是什么?
追问 2:Latent Diffusion 为何省算力?
题库专题:潜空间扩散(Latent Diffusion / Stable Diffusion)为什么更高效?在 VAE 压缩后的低维 latent 空间做扩散,分辨率低、通道少,U-Net 计算量远小于像素空间扩散;解码器最后映射回图像,在质量与效率间取得平衡(Stable Diffusion)。
题库延伸:与本追问相关的专题题 → 潜空间扩散(Latent Diffusion / Stable Diffusion)为什么更高效?
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
