Subquadratic Attention(亚二次注意力)
Subquadratic Attention突破 O(n²) 的注意力
亦作、亦称:亚二次注意力 · Subquadratic Attention · Sub-quadratic Attention · 稀疏注意力 · Sparse Attention
Subquadratic Attention 是复杂度低于标准自注意力 O(n²) 的注意力机制族,把长上下文开销降到 O(n log n) 或 O(n)。2026 年 SubQ 模型(poolId N5)以完全亚二次稀疏注意力实现 1200 万 token 研究上下文,是长上下文的架构级突破。
为什么标准注意力是 O(n²)
标准自注意力要让每个 token 关注序列中所有其他 token,需计算 n×n 的关系矩阵,因此计算与内存复杂度都是 O(n²)。
序列越长,开销越爆炸:上下文从 8K 扩到 128K,注意力开销增长约 256 倍。这是长上下文 LLM 的核心瓶颈——KV cache 内存、prefill 延迟、推理成本都随序列长度平方增长。亚二次注意力的目标就是打破这个平方律。
亚二次的实现路径
亚二次注意力的核心洞察是:标准注意力'浪费算力处理每对 token 关系,但只有极少数真正重要'。主要路径包括:
- 稀疏注意力:只计算局部窗口 + 少数全局 token 的关系(如 Longformer)
- 低秩近似:用低秩分解逼近注意力矩阵(如 Linformer)
- 核方法/线性注意力:重排计算使复杂度降到 O(n)(如 Performer)
- 状态空间/循环混合:用 SSM 或循环结构替代部分注意力
SubQ 采用完全亚二次稀疏注意力架构(SSA),智能识别并只计算真正重要的 token 关系。
SubQ 的突破与工程意义
2026 年 7 月 Subquadratic 公司发布 SubQ(poolId N5):首个完全亚二次稀疏注意力前沿模型,研究上下文 1200 万 token(约 10-12 本医学教科书)、生产 100 万 token。
据官方与第三方验证:在 100 万 token 处 prefill 比 FlashAttention 快 52 倍,成本低于 Claude Opus 的 5%,SWE-Bench Verified 得分 81.8。工程意义在于:长上下文不再是成本禁区——Agent 可一次推理整个代码库、合并数百个 PR、在数万文档中找模式。需注意官方坦承是 O(n) 而非 O(1),且早期未发技术报告,独立可复现性仍待观察。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「突破 O(n²) 的注意力」
- 「让超长上下文不再爆炸」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
比较 Subquadratic Attention 与标准 Self-Attention 的复杂度差异。长上下文 LLM 的工程挑战有哪些?
考察候选人对注意力机制复杂度的理解:标准自注意力为何是 O(n²)、亚二次注意力的实现路径(稀疏/低秩/线性/SSM)、SubQ 的工程突破,以及长上下文 LLM 在内存、延迟、成本上的工程挑战。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级概念查看详解 →
解释 DeltaNet 如何利用 Delta Rule 实现线性注意力,与传统 softmax attention 的优劣对比
考察候选人对线性注意力架构演进的理解,特别是 DeltaNet 如何通过增量更新机制在 O(n) 复杂度下实现接近 Transformer 的记忆精度。
- 高级系统设计查看详解 →
模型蒸馏服务的核心架构是什么?如何在成本和质量间权衡?
模型蒸馏服务(Model Distillation Service)是云端蒸馏即服务,允许开发者将大模型能力蒸馏到小模型而无需自建蒸馏流水线。2026 年 Google Gemini Distillation Service 和 World Model Optimizer 是代表。核心权衡:蒸馏后推理成本降低 5-10x,但能力损失 10-30%,需要根据任务复杂度选择合适策略。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Subquadratic Attention」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
