Grouped Query Attention(分组查询注意力)
Grouped Query Attention多头注意力的优化版
亦作、亦称:分组查询注意力 · GQA
GQA 让多个 Query Head 共享一组 Key/Value Head,在 LLaMA 2/3、Qwen 等模型中广泛采用,显著降低推理显存与带宽压力。
概述
将多个 Query Head 共享同一组 Key/Value Head,在保持模型质量的同时显著降低推理显存占用和 KV Cache 大小。 GQA 让多个 Query Head 共享一组 Key/Value Head,在 LLaMA 2/3、Qwen 等模型中广泛采用,显著降低推理显存与带宽压力。
工作原理
将多个 Query Head 共享同一组 Key/Value Head,在保持模型质量的同时显著降低推理显存占用和 KV Cache 大小。 GQA 让多个 Query Head 共享一组 Key/Value Head,在 LLaMA 2/3、Qwen 等模型中广泛采用,显著降低推理显存与带宽压力。
应用场景
Grouped Query Attention常见于:计算机视觉、语音识别、推荐系统与科学计算。实际选型需结合业务指标、数据规模与部署约束评估适用性。
局限与误区
围绕 Grouped Query Attention 的口语化说法(见「常见误解」)常过度简化。效果依赖数据质量、任务匹配与系统整体设计;生产环境应配合评测、监控与人工复核。
背景与发展
Grouped Query Attention随 AI 研究与工程实践持续演进,定义边界与最佳实践仍在更新。建议结合原始论文、官方文档与本站延伸阅读建立准确认知。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「多头注意力的优化版」
- 「多个 Q 共享 KV」
- 「省 KV Cache 的招」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级编码高频查看详解 →
手撕代码:实现多头注意力(Multi-Head Attention)
把 Q/K/V reshape 成 (B,H,L,d/H) 并行做多头注意力,concat 后经输出投影。
- 高级概念查看详解 →
多查询注意力(MQA)与分组查询注意力(GQA)解决了什么问题?
让多个 Query 头共享 K/V 头,缩小 KV-cache 显存与解码访存,MQA 共享到 1 组、GQA 折中分多组。
- 中级概念查看详解 →
自注意力、交叉注意力与因果注意力有什么区别?
自注意力 QKV 同源建模序列内关系,交叉注意力 Q 与 KV 异源做编解码交互,因果注意力掩盖未来位置。
- 中级概念高频查看详解 →
AI视频生成中的「拼接问题」(角色漂移/光照不一致)如何产生?原生生成如何解决?
传统AI视频生成将长视频拆为2-4秒短片段独立生成,拼接后出现角色外貌变化、光照跳变、动作不连贯等问题。Seedance 2.5 的多参考注入机制和原生30秒生成从根本上解决了拼接问题。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
注意力机制与 Transformer 架构
详解 Self-Attention、Multi-Head Attention 和 Transformer 的编码器-解码器结构
- 2
LLM 推理优化:量化、剪枝、蒸馏与推理加速实战
系统讲解大语言模型推理优化的四大核心技术——量化(Quantization)、剪枝(Pruning)、知识蒸馏(Knowledge Distillation)和推理引擎加速,覆盖从原理到实战的完整链路
- 3
LLM 上下文窗口扩展:RoPE、ALiBi 与长文本建模技术
大语言模型的上下文窗口大小决定了它能处理多长的输入和生成多长的输出。本文系统讲解上下文窗口扩展的核心技术——旋转位置编码 RoPE、注意力线性偏置 ALiBi、NTK 插值、YaRN 外推等方案,从原理到实战,帮助读者深入理解如何让模型突破训练时的长度限制,实现长文本的可靠建模。
