推测解码(Speculative Decoding)
推测解码小模型猜、大模型验
亦作、亦称:Speculative Decoding · Spec Decode
推测解码是一种在不改变输出分布的前提下大幅提升大语言模型推理吞吐量的技术,核心思路是让轻量的「草稿模型」先快速生成候选 token 序列,再由目标大模型并行验证并依统计规则决定接受或拒绝,从而将多步串行解码压缩为一次并行前向传播,实现无损加速。
概述
推测解码是一种在不改变输出分布的前提下大幅提升大语言模型推理吞吐量的技术,核心思路是让轻量的「草稿模型」先快速生成候选 token 序列,再由目标大模型并行验证并依统计规则决定接受或拒绝,从而将多步串行解码压缩为一次并行前向传播,实现无损加速。
核心定义
推测解码将自回归生成拆分为「起草」与「验证」两阶段,实现无损加速。
- 草稿模型(draft model):参数量远小于目标模型的轻量语言模型,以低成本自回归方式连续生成 γ 个候选 token。
- 并行验证:目标大模型对草稿序列进行一次前向传播,同时计算所有位置的概率分布。
- 接受/拒绝采样:依据两模型在每个位置的概率比,按统计校正规则决定接受或拒绝,保证最终输出分布与单独使用大模型完全一致。
- 等价性保证:这是推测解码的核心优势,加速过程不牺牲任何生成质量,属于「无损」技术。
工作机制
每次解码迭代由起草与验证构成,若草稿 token 多数被接受,则一次迭代可产出多个有效 token。
- 起草阶段:草稿模型自回归生成长度为 γ 的候选序列(通常 γ = 4~8),计算成本极低。
- 联合前向传播:将当前上下文拼接候选序列一起输入目标模型,一次获得 γ+1 个位置的 logits。
- 逐位置校验:对第 i 个草稿 token,以概率 min(1, p_target / p_draft) 接受;若拒绝,则从修正分布中重采样并截断后续草稿。
- 接受率(acceptance rate):核心性能指标,表示每轮验证中平均被接受的草稿 token 数,直接决定实际加速比。
- 加速来源:大模型在 GPU 上的瓶颈是内存带宽而非纯算力,并行验证多 token 与验证单 token 的延迟差异极小。
接受率与收益分析
接受率是推测解码效果的关键变量,需根据任务场景和草稿模型质量综合权衡。
- 高接受率场景:代码补全、结构化输出(JSON/SQL)等分布集中的任务,草稿模型与目标模型分布高度一致,接受率高,加速效果显著(可达 2~4 倍)。
- 低接受率场景:创意写作、高随机性生成等任务中,接受率较低,频繁拒绝会引入额外开销,净加速可能接近零甚至为负。
- 草稿模型选择:通常选用同系列小版本(如同家族 7B 为 70B 起草)或专门蒸馏的微型草稿模型,使两者分布尽可能接近。
- γ 的权衡:γ 越大每次验证潜在收益越高,但若接受率低则浪费越多,需根据实际场景自适应调整。
主要变体
推测解码衍生出多种变体以适应不同场景与约束。
- 自推测解码(Self-Speculative):利用目标模型自身的早层输出或层跳过机制生成草稿,无需独立草稿模型,节省显存。
- 多预测头(Medusa):在目标模型顶部附加多个轻量预测头,并行生成多个候选 token,无需独立草稿模型。
- 树形并行验证(Tree Decoding):草稿阶段生成 token 树而非单条序列,目标模型一次验证多条候选路径,进一步提升接受率。
- 基于检索的草稿:从上下文或外部 n-gram 数据库复用片段作为草稿,适合高重复性场景。
- 批量推测解码:在批量服务场景下对草稿并行化,与连续批处理框架协同工作。
发展脉络
推测解码自 2022 年由 Google Research 正式提出后迅速演进为 LLM 推理加速的主流技术。
- 2022:Google Research(Leviathan、Kalman、Matias)发表 arXiv:2211.17192,正式提出基于拒绝采样的无损推测解码框架。
- 2023 上半年:论文正式公开,确立「起草 + 并行验证 + 拒绝采样修正」的标准范式;DeepMind 团队(Chen 等)同期发表独立相关工作。
- 2023 下半年:Medusa(多预测头)、SpecInfer(树形验证)等变体相继出现,进一步提升接受率与加速比。
- 2024:vLLM、SGLang、TensorRT-LLM、Hugging Face TGI 等主流推理框架内置推测解码支持,进入生产落地阶段。
- 2025 至今:自推测解码、端侧推测解码(SpecExec)等新方案持续演进,接受率预测与自适应 γ 策略成为研究热点。
局限与注意事项
推测解码并非在所有场景下都能带来收益,需了解其适用边界。
- 分布对齐依赖:草稿模型与目标模型的输出分布差异越大,接受率越低,净加速收益越小。
- 草稿模型本身有成本:草稿模型过大会抵消验证阶段的收益,需仔细权衡大小与接受率之间的平衡。
- 大批次收益减弱:大批次并行推理时 GPU 算力利用率已接近上限,推测解码的边际收益大幅降低。
- 短序列收益有限:草稿-验证流程有固定启动开销,对输出极短的请求可能得不偿失。
- 不提升模型能力:推测解码不能改善幻觉、推理质量等问题,仅加速推理过程。
与相关技术的关系
推测解码常与其他推理优化技术配合使用,构成完整加速体系。
- KV Cache:推测解码依赖 KV Cache 存储已验证 token 的键值对,两者协同才能发挥最大效果;与 PagedAttention / Flash Attention 兼容。
- 量化(Quantization):草稿模型常采用 INT4/INT8 量化进一步降低起草延迟,推测解码与量化正交,可叠加收益。
- 连续批处理(Continuous Batching):批量服务场景下需与动态序列管理兼容,是推测解码工程化落地的重要前提。
- 知识蒸馏(Distillation):专用草稿模型通常由目标模型蒸馏训练,使两者分布尽可能接近以提高接受率。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「小模型猜、大模型验」
- 「大模型圈高频词」
- 「跟 推测解码 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
投机解码(Speculative Decoding)是如何加速 LLM 推理的?
小草稿模型连续猜多个 token,大模型一次前向并行验证,接受的直接用、首个被拒处回退,输出分布与大模型一致。
- 高级系统设计查看详解 →
如何设计 Compute-Optimal 推理路由系统,在成本与质量间取得最优平衡?
按问题难度动态路由到轻量/标准/深度推理模型,结合 PRM 过程奖励模型做过思考检测、语义缓存命中复用、推理 token 预算控制,实现成本降 4 倍而质量不降。
- 高级系统设计高频查看详解 →
LLM 推理服务如何优化吞吐与延迟(vLLM / 批处理 / 量化)?
连续批处理提吞吐、PagedAttention 省显存、量化降成本、张量并行扩容量、投机解码降延迟。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「推测解码」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
