RadixAttention
RadixAttentionSGLang 的前缀缓存技术
亦作、亦称:Radix Cache · 前缀缓存
SGLang 推理引擎的核心创新,通过基数树(Radix Tree)索引共享前缀的 KV Cache,在聊天机器人、RAG、多轮对话等前缀重叠率高的场景中,首 Token 延迟(TTFT)比 vLLM 低 30-50%。
技术架构
RadixAttention 的核心数据结构是基数树(Radix Tree),也称为压缩前缀树(Compressed Prefix Tree)。基数树的每个节点代表一个 Token 序列,边代表 Token,从根节点到任意节点的路径代表一个前缀。
当请求到达时,SGLang 的 Scheduler 调用 match_prefix 方法,在基数树中查找与请求前缀匹配的最长路径。如果找到匹配,Scheduler 从匹配点开始计算 KV Cache,而非从位置 0 开始。
基数树的插入和删除操作是 O(k) 复杂度(k 是前缀长度),远优于暴力匹配的 O(n*k)。RadixAttention 的缓存策略是 LRU(Least Recently Used),当显存不足时,淘汰最久未使用的缓存节点。
RadixAttention 是完全自动的——无需配置,无需手动标记前缀,SGLang 自动检测共享前缀并缓存。
性能基准
2026 年的基准测试显示,RadixAttention 在前缀重叠率高的场景中显著优于 vLLM 的 PagedAttention。Spheron 2026 年 5 月的测试:在聊天机器人场景(共享系统提示词 + 对话历史),SGLang 的 TTFT 比 vLLM 低 30-50%,吞吐量相当。
在 Agent 场景(共享系统提示词 + 工具定义 + 多轮对话),SGLang 的 TTFT 比 vLLM 低 5-10 倍,缓存命中率 75-95%。
Morph 2026 年 6 月的测试:SGLang v0.4.3 在 H100 上达到 16,200 tokens/s 吞吐量,与 LMDeploy 并列开源引擎最高水平。
RadixAttention 的局限:在前缀重叠率低的场景(如单次长文本生成),RadixAttention 的优势不明显,因为缓存命中率低。此时 vLLM 的 PagedAttention 更合适,因为 PagedAttention 专注于解决显存碎片问题,而非前缀重复计算。
与 PagedAttention 对比
RadixAttention 和 PagedAttention 是两种不同的 KV Cache 优化策略,解决不同的问题。
PagedAttention(vLLM 的核心创新)解决显存碎片问题:通过将 KV Cache 切分为固定大小的页(通常 16 Token 一页),使用页表映射到不连续的显存块,消除内部碎片和外部碎片,显存利用率从 20-40% 提升到 90%+。
RadixAttention(SGLang 的核心创新)解决前缀重复计算问题:通过基数树索引共享前缀的 KV Cache,避免重复计算相同前缀的 KV 激活,降低 TTFT。两者可以结合使用:SGLang 实际上同时使用了 RadixAttention 和分页管理。
选型建议:如果工作负载有大量共享前缀(RAG、多轮对话、Agent 系统),选择 SGLang(RadixAttention);如果工作负载是单次长文本生成(前缀重叠率低),选择 vLLM(PagedAttention);如果两者都有,SGLang 是更安全的选择,因为它同时支持两种优化。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「SGLang 的前缀缓存技术」
- 「用基数树优化 KV Cache」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是 AI Agent?它与大语言模型(LLM)的本质区别是什么?
AI Agent 是以 LLM 为大脑、能感知环境并自主规划、调用工具、多步执行并按反馈迭代以达成目标的系统;LLM 只是无状态的文本输入到输出函数。
- 中级概念查看详解 →
什么是 GPTCache?它如何帮助降低 AI 应用成本?
GPTCache 是面向 LLM 的语义缓存层,把"问题→回答"缓存,新请求先做语义相似度匹配,命中即返回缓存答案,从而省 token、降延迟、扛并发。
- 中级场景查看详解 →
智能工单分类系统中,AI 可参与哪些环节?技术选型思路是什么?
AI 可参与工单的自动分类打标、意图情绪识别、智能路由、相似聚合去重、知识推荐、回复草稿与 SLA 预警等环节。选型上高频固定类别用轻量分类模型、复杂少样本用 LLM,并可混合编排,配人工复核闭环。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
AI 推理引擎选型实战:vLLM vs SGLang vs TensorRT-LLM 2026 生产级深度对比
2026 年 LLM 推理引擎市场已形成三足鼎立格局:vLLM 以灵活性称王、SGLang 以 RadixAttention 前缀缓存称霸低延迟场景、TensorRT-LLM 以编译优化统治极限吞吐。本文基于 H100 80GB + Llama 3.3 70B Instruct FP8 基准测试,从架构原理、性能数据、部署复杂度、适用场景四个维度做生产级深度对比,附带完整选型决策树和代码示例。
- 2
本地大模型部署实战:Ollama + vLLM + 量化指南
系统掌握在本地和私有环境中部署大语言模型的完整方案。2026-06-15 更新:新增 vLLM v0.7.3 Blackwell GPU 支持、SGLang v0.4.3 前缀缓存对比、FP8 量化实战、NVIDIA NIM 容器化部署,以及 Ollama 4.0 的多模型并发管理能力。覆盖从模型量化到推理服务的全流程实践。
外部参考
维基百科:查看「RadixAttention」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
