离散扩散模型(Discrete Diffusion Model)
离散扩散模型就是把扩散模型从连续空间搬到离散空间,专门用来生成文本
亦作、亦称:Discrete Diffusion Model · Discrete Diffusion · 离散扩散
离散扩散模型是一种在离散状态空间上进行的扩散过程,与在连续空间 ℝⁿ 上进行的传统扩散模型不同,它在离散集合 S 上操作,不使用高斯噪声,而是通过离散状态转移实现去噪,主要用于语言建模等文本生成任务。
与连续扩散的区别
传统扩散模型(如 Stable Diffusion、DDPM)在连续空间中进行,使用高斯噪声对数据进行加噪和去噪。图像可以看作连续空间中的点,像素值可以在 0-255 之间连续变化。
但文本本质上是离散的——词汇表中的每个 token 是一个独立的符号,无法定义「半个 token」或「无限接近的两个 token」。离散扩散模型通过定义离散状态之间的转移概率矩阵来解决这一问题。
在前向过程中,文本序列中的 token 逐步被替换为 [MASK] 或随机 token;在反向过程中,模型学习如何根据上下文恢复出原始 token。这种离散化的数学处理比连续扩散更加复杂,但更适合处理文本、代码等离散数据。
DiffusionGemma:首个开源离散扩散语言模型
2026 年 6 月,Google DeepMind 发布并开源了 DiffusionGemma,这是首个基于离散扩散原理的开源语言模型,标志着扩散技术从图像生成正式进入文本生成领域。
DiffusionGemma 基于 Gemma 4 架构,采用离散扩散范式,从一段全 [MASK] 的序列出发,通过多步去噪逐步恢复出连贯文本。其核心突破在于能够单次并行生成 256 个 token,打破了自 2018 年 GPT-2 以来自回归模型对语言生成的垄断。
自回归方式从左到右逐个 token 生成文本,生成过程是严格串行的,无法并行化;而扩散方式可以同时更新多个 token,实现并行生成。
在性能方面,DiffusionGemma 在 H100 GPU 上达到 1107 tok/s,约是 Gemma 4 的 4 倍;在消费级 RTX 5090 上达到 700+ tok/s,支持本地部署。这为语言模型推理速度的提升开辟了新路径。
应用场景与前景
离散扩散模型的主要应用场景是语言建模,包括文本生成、代码生成、机器翻译等。与自回归模型相比,离散扩散模型的核心优势在于并行生成能力,可以显著提升推理速度。这对于需要快速响应的应用场景(如实时对话、代码补全)尤为重要。
此外,离散扩散模型还可以用于文本编辑、文本修复等任务,通过部分加噪和去噪实现局部修改。尽管离散扩散模型在理论上具有优势,但目前仍处于早期阶段,面临一些挑战:训练成本较高、生成质量在某些任务上不如自回归模型、数学建模复杂等。
随着 Google 开源 DiffusionGemma,预计会有更多研究者和开发者探索离散扩散模型的潜力,推动这一领域的发展。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「就是把扩散模型从连续空间搬到离散空间,专门用来生成文本」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
TensorFlow 中的计算图是什么?
TensorFlow 计算图将运算表示为有向无环图中的节点,边表示张量依赖;1.x 需先建图再用 Session 执行,2.x 默认即时执行但可用 tf.function 编译为图。
- 中级概念查看详解 →
TensorFlow Lite 是什么?适用于哪些场景?
TensorFlow Lite 是 TensorFlow 的移动端与嵌入式推理引擎,通过转换与量化压缩模型,在 Android、iOS、树莓派等边缘设备上低延迟运行深度学习模型。
- 中级概念查看详解 →
TensorFlow 中的 Variable 是什么?有何重要性?
TensorFlow 的 tf.Variable 是可训练的可变张量,用于存储模型权重和偏置;优化器通过 apply_gradients 更新 Variable,是训练中被学习的参数载体。
- 中级概念查看详解 →
什么是深度学习?与传统机器学习方法有何区别?
深度学习是机器学习子集,用多层神经网络自动学习层次特征表示;区别于传统 ML 需手工特征,深度学习可端到端从原始数据学习,但依赖更多数据与算力。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「离散扩散模型」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
