Stable Diffusion
Stable Diffusion开源文生图模型
亦作、亦称:SD · 潜空间扩散模型
Stable Diffusion 是一种基于潜空间扩散的开源文生图模型,由 CompVis、Runway ML 与 Stability AI 联合研发,于 2022 年 8 月正式公开发布。它将扩散去噪过程迁移至低维潜空间,使高质量图像生成可在消费级 GPU 上高效运行,并以完全开放权重的方式推动了全球最大开源图像生成生态的形成。
概述
Stable Diffusion 将扩散过程从像素空间压缩到低维潜空间,大幅降低计算成本,使消费级 GPU 也能运行。
- 潜空间扩散:先用 VAE 将图像编码为紧凑的潜向量,扩散与去噪均在此空间进行,最终再解码为像素图
- 文本条件:通过 CLIP 将文本提示编码为语义向量,经交叉注意力注入 U-Net,引导生成方向
- 开源生态:模型权重完全开放,催生了 LoRA、ControlNet、ComfyUI、Automatic1111 等庞大扩展社区
- 版本迭代:从 SD 1.x、SD 2.x 到 SDXL(2023),再到 SD3(2024),分辨率和画质持续提升
架构组成
Stable Diffusion 由三个核心模块协同完成「文字→图像」的转化流程,各司其职。
- VAE(变分自编码器):编码器将图像压入约 64×64 的潜空间,解码器将去噪后的潜向量还原为像素图像
- U-Net:在潜空间中迭代预测并去除噪声,通过残差连接与注意力模块捕捉多尺度特征
- CLIP 文本编码器:将用户输入的文本提示编码为向量,经交叉注意力层引导 U-Net 的去噪方向
- 调度器(Scheduler):控制加噪/去噪步骤序列,常见实现包括 DDIM、DPM-Solver++、Euler 等
工作原理
生成过程分为「加噪训练」与「去噪推理」两个阶段,核心组件协同完成。
- 前向扩散(训练):对真实图像的潜向量逐步叠加高斯噪声直至完全随机,训练 U-Net 预测每步噪声残差
- 反向去噪(推理):从纯噪声潜向量出发,U-Net 在文本语义引导下迭代去噪,默认 20-50 步即可收敛
- CFG(Classifier-Free Guidance):通过调节引导强度系数(通常 5-12),平衡文本贴合度与图像多样性
- VAE 解码:去噪完成后,VAE 解码器将潜向量还原为最终像素图像
发展脉络
从学术论文到全球最大开源图像生成生态,Stable Diffusion 的演进极为迅速。
- 2020:Ho 等发表 DDPM 论文,奠定像素空间扩散理论基础
- 2021 年 12 月:慕尼黑大学 Rombach 等在 arXiv 发布 LDM 预印本(arXiv:2112.10752),将扩散迁移至潜空间
- 2022 年 6 月:论文「High-Resolution Image Synthesis with Latent Diffusion Models」发表于 CVPR 2022
- 2022 年 8 月:Stability AI 联合 CompVis、Runway ML 正式公开发布 Stable Diffusion 1.x 权重,引发社区爆炸式增长
- 2022 年 10-11 月:RunwayML 发布 SD 1.5,Stability AI 发布 SD 2.0(换用新版文本编码器)
- 2023 年 7 月:SDXL 1.0 发布,分辨率升至 1024×1024,采用双编码器架构
- 2024 年:SD3 引入 Diffusion Transformer(DiT)与 Flow Matching,文字渲染和细节一致性取得突破
变体与扩展
围绕 Stable Diffusion 形成了极其丰富的模型谱系与工具生态。
- LoRA:低秩适配微调,仅需少量参数即可让模型学习特定画风或人物风格,是社区最流行的定制手段
- ControlNet:通过骨架、深度图、边缘图等结构条件精确控制生成图像的构图与姿态
- DreamBooth / Textual Inversion:个性化微调方法,可让模型学习用户自定义概念或特定对象
- Inpainting / Outpainting:局部重绘与画面外扩,广泛用于图像修复和创意合成
- ComfyUI / Automatic1111:主流图形化操作界面,支持节点式工作流与海量社区插件
应用场景
Stable Diffusion 已渗透到创意生产、工业设计、影视等多个领域。
- 艺术创作:插画师、设计师用于概念草图生成、风格探索与批量素材制作
- 影视与游戏:辅助场景概念图、角色设计与特效合成,缩短预生产周期
- 电商与广告:快速生成产品场景图与广告素材,替代部分摄影棚拍摄
- 医学影像研究:生成合成数据用于模型训练,缓解标注数据稀缺问题
- 个人创作:借助 ComfyUI、Automatic1111 等 WebUI,普通用户也能构建复杂图像生成工作流
局限与争议
使用 Stable Diffusion 时需注意其固有局限,避免常见误解。
- 手部与文字生成:早期版本对多指手部和嵌入文字的生成质量差,SD3 有所改善但仍未完全解决
- 文本对齐偏差:对复杂句式或多对象、多属性场景的理解能力有限,易产生混淆
- 版权与伦理争议:训练数据来自 LAION 数据集(网络抓取),涉及未授权艺术作品的版权问题
- 滥用风险:开放权重使得有害内容生成与深度伪造难以有效管控
- 本地运行门槛:全精度 SDXL 需 8GB+ 显存,量化或 CPU 推理可降低门槛但影响质量
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「开源文生图模型」
- 「本地跑图常说的 SD」
- 「潜空间扩散代表」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
潜空间扩散(Latent Diffusion / Stable Diffusion)为什么更高效?
把扩散搬到 VAE 压缩后的低维潜空间运行,分辨率大幅下降,算力与显存显著降低,Stable Diffusion 即此架构。
- 中级概念查看详解 →
ControlNet 如何为扩散模型加入可控条件?
复制 U-Net 编码器为可训练分支,接入边缘/姿态/深度等空间条件,经零卷积逐步注入主干,不破坏原模型。
- 高级概念查看详解 →
DDPM 与 DDIM 采样有什么区别?为什么 DDIM 更快?
DDPM 是随机马尔可夫逆过程需多步;DDIM 是确定性非马尔可夫,同一模型可跳步采样,步数大幅减少。
- 中级概念查看详解 →
扩散模型中的 U-Net 起什么作用?
编码器-解码器结构加跳跃连接,在每个时间步预测加入的噪声 ε,是扩散逆过程的去噪主干网络。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Stable Diffusion」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
