Attention Drift(注意力漂移)
Attention Drift草稿链越深,越容易跑偏
亦作、亦称:注意力漂移 · Attention Drift · 注意力偏移
Attention Drift(注意力漂移) 是推测解码中草稿链越深、草稿模型注意力模式越偏离目标模型、接受率下降的现象——EAGLE 3.1(2026-05 arXiv)首次命名并用归一化层 + attention realignment 修复,实现 2.03x token 吞吐提升。
机制:为什么草稿链越深越偏
推测解码的草稿模型逐 token 自回归生成候选,链越深,草稿模型的注意力模式就越偏离目标模型——它是在自己的(有误差的)上下文上继续外推,而不是在目标模型真实分布上采样。
核心表现:草稿链长度超过一定阈值后,接受率不升反降,长链优势被抵消。这正是 EAGLE 3.1 之前多步草稿方案普遍遇到的瓶颈。
EAGLE 3.1 的修复方案
EAGLE 3.1(2026-05 arXiv)首次命名 attention drift 并给出修复:在隐藏状态间添加归一化层,防止草稿模型特征信号幅值随深度失控;结合 attention realignment 机制,让草稿模型的注意力重新对齐目标模型。
官方数据:接受率提升、2.03x token 吞吐提升(news.skrew.ai 2026-05 报道)。
生产选型含义
attention drift 解释了为什么推测解码不是「草稿链越长越好」:链长与接受率存在拐点。
生产实践中要按目标模型与草稿模型的对齐程度选择链长,并监控接受率退化;EAGLE 3.1 的归一化 + realignment 是当前修复 attention drift 的主流手段。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「草稿链越深,越容易跑偏」
- 「小模型猜着猜着就猜歪了」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级系统设计查看详解 →
基准污染诊断:当 SWE-bench Verified 得分异常高但实际能力不匹配时,如何系统性诊断并调整评估策略?
OpenAI SWE-bench Verified 审计发现 59.4% 任务存在缺陷,前沿模型被检测到从训练数据中召回答案(adwaitx.com 2026-02 技术分析)。当模型在基准上得分异常高(如 80%+)但实际能力不匹配时,候选人需要展示三条独立诊断路径(n-gram overlap 精确重叠、embedding similarity 语义重叠、ablation study 因果归因)的交叉验证能力,以及污染确认后从「单一基准分数」转向「基准组合 + 私有评测 + 过程评估」的评估策略重构能力。本题区分「会跑 benchmark」与「理解 benchmark 为什么可信」的候选人。
- 高级概念查看详解 →
在 MoE 模型的大规模部署中,Expert Parallelism 面临哪些工程挑战?请从负载均衡、通信开销、故障恢复三个维度分析。
Expert Parallelism 把 MoE 专家分布到多 GPU 以突破单卡显存上限,但 Top-K 路由导致负载不均、All-to-All 通信跨节点成为瓶颈、Expert 级 checkpoint 与弹性恢复比 Dense 模型更复杂。
- 中级概念查看详解 →
Claude Opus 5 如何在降低成本的同时提升安全性?「guardrails 激活频率降低 85%」意味着什么?
考察候选人对前沿模型「安全-可用性平衡」的理解:以 2026 年 7 月发布的 Claude Opus 5 为例,解读「guardrails 激活频率较 Fable 5 降低 85%」的真实含义、过度拒绝(over-refusal)问题,以及为什么「更少误拦」与「更安全」可以同时成立。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Attention Drift」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
