核心要点
自回归重复计算问题
KV Cache 内存开销
PagedAttention 等优化
常见误区
⚠️ 常见踩坑
只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:Prefill 和 Decode 阶段有何不同?
题库专题:LLM 推理的 Prefill 与 Decode 两阶段有什么区别?Prefill 并行处理整段 prompt,算力密集、可吃满 GPU;Decode 自回归逐 token 生成,内存带宽与 KV Cache 读写成为瓶颈,batch 小、延迟敏感。
题库延伸:与本追问相关的专题题 → LLM 推理的 Prefill 与 Decode 两阶段有什么区别?
追问 2:长上下文下 KV Cache 瓶颈如何解决?
题库专题:KV Cache 量化如何进一步降低显存占用?PagedAttention 分页管理 KV;MQA/GQA 减少 KV 头数;KV 量化;Prefix caching 复用相同前缀;滑动窗口/稀疏注意力;Prefill-Decode 分离部署。
题库延伸:与本追问相关的专题题 → KV Cache 量化如何进一步降低显存占用?
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
