EAGLE-3
EAGLE-37 倍加速的推测解码
亦作、亦称:Extrapolation Algorithm for Generation · EAGLE
UC Berkeley 于 2025 年 3 月提出的推测解码加速技术,核心创新是直接 Token 预测(Direct Token Prediction)和多层次特征融合(Multi-layer Feature Fusion),取代 EAGLE-1/2 的特征级预测,在 Llama-3-70B 上实现 7.2x 加速和 92.3% 接受率,仅 4% 额外显存开销;2026 年初已合并入 vLLM、SGLang、TensorRT-LLM 主线,成为生产环境标准配置。
核心创新:直接 Token 预测
EAGLE-3 的核心创新是直接 Token 预测(Direct Token Prediction)取代特征级预测。
EAGLE-1/2 的 draft model 预测的是 target model 的隐藏状态特征(hidden features),然后通过 LM Head 映射到 token 空间。
这种方式的问题在于:(1) 特征预测的误差会在映射到 token 空间时被放大;(2) 训练数据受限于特征存储成本。EAGLE-3 直接从 target model 的多层特征融合后预测 token,绕过特征预测步骤。
具体实现:从 target model 的多个 Transformer 层(低层、中层、高层)提取特征,通过拼接和线性投影融合,然后用轻量级自回归头(通常是 5 层 MLP)直接预测下一个 token。这种架构使训练数据规模可以扩展到数十亿 token,预测精度随数据量单调递增。
训练时测试机制
EAGLE-3 引入的另一个关键创新是「训练时测试」(Training-time Test)机制。在推理时,draft model 需要自回归地生成多个候选 token,每个 token 的生成依赖于前一个 token。
但训练时,我们只有 ground truth 序列,没有 draft model 自己的输出。这造成了训练-推理的不匹配(exposure bias)。EAGLE-3 的解决方案:在训练时模拟推理过程——让 draft model 基于自己的预测继续生成,而不是基于 ground truth。
具体实现:使用自定义的因果掩码(causal mask),在每个模拟位置限制 attention 只能看到之前的预测结果。这样 draft model 在训练时就学会处理自己的输出作为输入,显著提升推理时的稳定性和接受率。
生产部署与生态
2026 年初,EAGLE-3 已合并入 vLLM、SGLang、TensorRT-LLM 三大主流推理引擎的主线,成为生产环境的标准配置。
在 vLLM 中,启用 EAGLE-3 只需添加 --speculative-method eagle3 --speculative-draft-model-path <path> 参数。
HuggingFace 上有大量预训练的 EAGLE-3 draft model(如 z-lab/Qwen3-8B-DFlash-b16),覆盖 Llama-3、Qwen-3、Gemma-4 等主流模型家族。
2026 年 6 月,AWS 推出 P-EAGLE(Parallel EAGLE),通过并行生成 draft token 进一步消除自回归瓶颈,在 NVIDIA B200 上实现比 vanilla EAGLE-3 高 1.69x 的加速。
EAGLE-3 的成功证明了推测解码从学术研究走向生产部署的可行性,也为后续的 DFlash(块扩散草稿)等创新奠定了基础。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「7 倍加速的推测解码」
- 「直接预测 Token 的草稿模型」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 中级概念查看详解 →
Claude Opus 5 如何在降低成本的同时提升安全性?「guardrails 激活频率降低 85%」意味着什么?
考察候选人对前沿模型「安全-可用性平衡」的理解:以 2026 年 7 月发布的 Claude Opus 5 为例,解读「guardrails 激活频率较 Fable 5 降低 85%」的真实含义、过度拒绝(over-refusal)问题,以及为什么「更少误拦」与「更安全」可以同时成立。
- 高级概念查看详解 →
比较 Subquadratic Attention 与标准 Self-Attention 的复杂度差异。长上下文 LLM 的工程挑战有哪些?
考察候选人对注意力机制复杂度的理解:标准自注意力为何是 O(n²)、亚二次注意力的实现路径(稀疏/低秩/线性/SSM)、SubQ 的工程突破,以及长上下文 LLM 在内存、延迟、成本上的工程挑战。
- 高级概念查看详解 →
解释 DeltaNet 如何利用 Delta Rule 实现线性注意力,与传统 softmax attention 的优劣对比
考察候选人对线性注意力架构演进的理解,特别是 DeltaNet 如何通过增量更新机制在 O(n) 复杂度下实现接近 Transformer 的记忆精度。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「EAGLE-3」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
