Stable Diffusion

Stable Diffusion

开源文生图模型

亦作、亦称:SD · 潜空间扩散模型

Stable Diffusion 是一种基于潜空间扩散的开源文生图模型,由 CompVis、Runway ML 与 Stability AI 联合研发,于 2022 年 8 月正式公开发布。它将扩散去噪过程迁移至低维潜空间,使高质量图像生成可在消费级 GPU 上高效运行,并以完全开放权重的方式推动了全球最大开源图像生成生态的形成。

概述

Stable Diffusion 将扩散过程从像素空间压缩到低维潜空间,大幅降低计算成本,使消费级 GPU 也能运行。

  • 潜空间扩散:先用 VAE 将图像编码为紧凑的潜向量,扩散与去噪均在此空间进行,最终再解码为像素图
  • 文本条件:通过 CLIP 将文本提示编码为语义向量,经交叉注意力注入 U-Net,引导生成方向
  • 开源生态:模型权重完全开放,催生了 LoRA、ControlNet、ComfyUI、Automatic1111 等庞大扩展社区
  • 版本迭代:从 SD 1.x、SD 2.x 到 SDXL(2023),再到 SD3(2024),分辨率和画质持续提升

架构组成

Stable Diffusion 由三个核心模块协同完成「文字→图像」的转化流程,各司其职。

  • VAE(变分自编码器):编码器将图像压入约 64×64 的潜空间,解码器将去噪后的潜向量还原为像素图像
  • U-Net:在潜空间中迭代预测并去除噪声,通过残差连接与注意力模块捕捉多尺度特征
  • CLIP 文本编码器:将用户输入的文本提示编码为向量,经交叉注意力层引导 U-Net 的去噪方向
  • 调度器(Scheduler):控制加噪/去噪步骤序列,常见实现包括 DDIM、DPM-Solver++、Euler 等

工作原理

生成过程分为「加噪训练」与「去噪推理」两个阶段,核心组件协同完成。

  • 前向扩散(训练):对真实图像的潜向量逐步叠加高斯噪声直至完全随机,训练 U-Net 预测每步噪声残差
  • 反向去噪(推理):从纯噪声潜向量出发,U-Net 在文本语义引导下迭代去噪,默认 20-50 步即可收敛
  • CFG(Classifier-Free Guidance):通过调节引导强度系数(通常 5-12),平衡文本贴合度与图像多样性
  • VAE 解码:去噪完成后,VAE 解码器将潜向量还原为最终像素图像

发展脉络

从学术论文到全球最大开源图像生成生态,Stable Diffusion 的演进极为迅速。

  • 2020:Ho 等发表 DDPM 论文,奠定像素空间扩散理论基础
  • 2021 年 12 月:慕尼黑大学 Rombach 等在 arXiv 发布 LDM 预印本(arXiv:2112.10752),将扩散迁移至潜空间
  • 2022 年 6 月:论文「High-Resolution Image Synthesis with Latent Diffusion Models」发表于 CVPR 2022
  • 2022 年 8 月:Stability AI 联合 CompVis、Runway ML 正式公开发布 Stable Diffusion 1.x 权重,引发社区爆炸式增长
  • 2022 年 10-11 月:RunwayML 发布 SD 1.5,Stability AI 发布 SD 2.0(换用新版文本编码器)
  • 2023 年 7 月SDXL 1.0 发布,分辨率升至 1024×1024,采用双编码器架构
  • 2024 年SD3 引入 Diffusion Transformer(DiT)与 Flow Matching,文字渲染和细节一致性取得突破

变体与扩展

围绕 Stable Diffusion 形成了极其丰富的模型谱系与工具生态。

  • LoRA:低秩适配微调,仅需少量参数即可让模型学习特定画风或人物风格,是社区最流行的定制手段
  • ControlNet:通过骨架、深度图、边缘图等结构条件精确控制生成图像的构图与姿态
  • DreamBooth / Textual Inversion:个性化微调方法,可让模型学习用户自定义概念或特定对象
  • Inpainting / Outpainting:局部重绘与画面外扩,广泛用于图像修复和创意合成
  • ComfyUI / Automatic1111:主流图形化操作界面,支持节点式工作流与海量社区插件

应用场景

Stable Diffusion 已渗透到创意生产、工业设计、影视等多个领域。

  • 艺术创作:插画师、设计师用于概念草图生成、风格探索与批量素材制作
  • 影视与游戏:辅助场景概念图、角色设计与特效合成,缩短预生产周期
  • 电商与广告:快速生成产品场景图与广告素材,替代部分摄影棚拍摄
  • 医学影像研究:生成合成数据用于模型训练,缓解标注数据稀缺问题
  • 个人创作:借助 ComfyUI、Automatic1111 等 WebUI,普通用户也能构建复杂图像生成工作流

局限与争议

使用 Stable Diffusion 时需注意其固有局限,避免常见误解。

  • 手部与文字生成:早期版本对多指手部和嵌入文字的生成质量差,SD3 有所改善但仍未完全解决
  • 文本对齐偏差:对复杂句式或多对象、多属性场景的理解能力有限,易产生混淆
  • 版权与伦理争议:训练数据来自 LAION 数据集(网络抓取),涉及未授权艺术作品的版权问题
  • 滥用风险:开放权重使得有害内容生成与深度伪造难以有效管控
  • 本地运行门槛:全精度 SDXL 需 8GB+ 显存,量化或 CPU 推理可降低门槛但影响质量

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「开源文生图模型」
  • 「本地跑图常说的 SD」
  • 「潜空间扩散代表」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    Diffusion 模型(一):原理与数学基础

    从加噪到去噪,理解扩散模型如何一步步生成高质量图像

  2. 2

    Stable Diffusion(二):从原理到实战

    从文本到图像,理解 Stable Diffusion 如何实现高质量图像生成

  3. 3

    文本到图像生成:DALL-E, Imagen

    从文本描述到高质量图像,理解多模态生成的前沿技术

外部参考

维基百科:查看「Stable Diffusion」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。