Speculative Decoding Drafter(推测解码草稿模型)
Speculative Decoding Drafter用小模型猜下一步,大模型验证加速推理
亦作、亦称:推测解码草稿模型 · Speculative Decoding Drafter · Drafter Model
Speculative Decoding Drafter 是推测解码中快速生成候选 token 的小型模型,由大模型验证。腾讯 AngelSpec 框架统一支持 MTP 和 Block-Parallel 训练方法。
核心机制
Drafter 模型是推测解码的核心组件:用小型草稿模型快速生成候选 token 序列,由大型目标模型并行验证并接受/拒绝。接受率越高加速比越大。核心挑战是草稿模型与目标模型的分布对齐。
训练方法
腾讯开源 AngelSpec 框架统一支持两种推测解码训练方法:MTP(Multi-Token Prediction) 让模型在一次前向传播中预测多个未来 token;Block-Parallel 将序列分块并行训练草稿模型。两种方法可组合使用,在 Hy3 模型上验证有效。
工程意义
推测解码可将 LLM 推理速度提升 2-3 倍而不损失输出质量。Drafter 模型的质量直接决定接受率与加速比。2026 年随着 Agent 长链推理需求增长,推测解码从研究技术走向生产基础设施。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「用小模型猜下一步,大模型验证加速推理」
- 「推测解码的草稿生成器」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级系统设计查看详解 →
当 LLM 上下文窗口达到 1M token 时,"Lost in the Middle" 效应对 RAG 系统设计有何影响?如何工程化缓解?
即使上下文窗口达到 1M token,"Lost in the Middle"(Liu et al. 2023)与 Context Rot(Chroma 2026)仍使模型对中间位置信息的利用率显著下降——标称容量不等于有效容量。RAG 系统不能把检索结果无脑堆叠进超长上下文,而须做检索重排(首尾优先)、分层上下文预算(工作记忆 vs 长尾知识)、分块聚合(map-reduce)与位置探针评测。本题考察候选人能否把位置偏置从论文概念转化为 RAG 工程约束。
- 高级系统设计查看详解 →
基准污染诊断:当 SWE-bench Verified 得分异常高但实际能力不匹配时,如何系统性诊断并调整评估策略?
OpenAI SWE-bench Verified 审计发现 59.4% 任务存在缺陷,前沿模型被检测到从训练数据中召回答案(adwaitx.com 2026-02 技术分析)。当模型在基准上得分异常高(如 80%+)但实际能力不匹配时,候选人需要展示三条独立诊断路径(n-gram overlap 精确重叠、embedding similarity 语义重叠、ablation study 因果归因)的交叉验证能力,以及污染确认后从「单一基准分数」转向「基准组合 + 私有评测 + 过程评估」的评估策略重构能力。本题区分「会跑 benchmark」与「理解 benchmark 为什么可信」的候选人。
- 高级概念查看详解 →
在 MoE 模型的大规模部署中,Expert Parallelism 面临哪些工程挑战?请从负载均衡、通信开销、故障恢复三个维度分析。
Expert Parallelism 把 MoE 专家分布到多 GPU 以突破单卡显存上限,但 Top-K 路由导致负载不均、All-to-All 通信跨节点成为瓶颈、Expert 级 checkpoint 与弹性恢复比 Dense 模型更复杂。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Speculative Decoding Drafter」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
