vLLM
vLLM大模型推理加速框架
亦作、亦称:vLLM 推理框架
vLLM 是由加州大学伯克利分校 Sky Computing Lab 开源的高性能大语言模型推理与服务框架,以 PagedAttention 和连续批处理技术为核心,显著提升推理吞吐量并减少显存浪费。它已成为生产级 LLM 部署的主流选型之一。
概述
vLLM 是由加州大学伯克利分校 Sky Computing Lab 开源的高性能大语言模型推理与服务框架,以 PagedAttention 和连续批处理技术为核心,显著提升推理吞吐量并减少显存浪费。它已成为生产级 LLM 部署的主流选型之一。
背景与动机
传统 LLM 推理框架在显存管理上存在严重浪费,限制了并发服务能力。
- KV 缓存碎片化:早期框架为每条请求预分配固定连续显存块,序列长度不确定导致大量内部碎片和外部碎片
- 低吞吐瓶颈:显存利用率低,单卡可并发处理的请求数受限,GPU 算力大量闲置
- 静态批处理局限:传统静态批处理要求所有请求同时开始、同时结束,灵活性差
- 成本压力:A100 等高端 GPU 价格昂贵,低效的显存利用直接推高推理成本
核心机制:PagedAttention
PagedAttention 是 vLLM 的核心创新,借鉴操作系统虚拟内存与分页思想重新设计 KV 缓存管理。
- 分块存储:将每条序列的 KV 缓存切分为固定大小的「块」(block),块可存储在不连续的显存地址中
- 按需分配:仅在实际生成新 token 时才分配新块,避免预分配造成的浪费
- 块共享:对于相同前缀(如 system prompt)的多条请求,可共享同一批 KV 块,节省显存
- 显存利用率提升:相比 HuggingFace Transformers,vLLM 可将显存浪费从 60%–80% 降至 4% 以下
- 吞吐提升:在相同硬件上吞吐量最高可达 HuggingFace Transformers 的 24 倍
连续批处理
连续批处理(Continuous Batching)允许在同一个推理步骤中动态插入新请求,彻底改变了传统静态批处理模式。
- 动态插槽:某条请求生成结束后,其显存槽位立刻释放,新请求可在下一步骤即时加入批次
- 更高 GPU 利用率:GPU 几乎不再等待,每一步都在满负荷处理尽可能多的请求
- 延迟与吞吐平衡:通过调度策略兼顾首 token 延迟(TTFT)和每 token 生成速度(TPOT)
- 与 PagedAttention 协同:连续批处理依赖 PagedAttention 的灵活显存管理才能高效实现
进阶功能
除核心机制外,vLLM 持续扩展多项生产级功能。
- 推测解码(Speculative Decoding):用小模型草稿 + 大模型校验,实测可将生成速度提升最高 2.8 倍
- 前缀缓存(Prefix Caching):对相同提示前缀自动复用 KV 缓存,降低重复计算
- 分块预填充(Chunked Prefill):将长提示的预填充阶段切片处理,避免阻塞解码请求
- 结构化输出:支持 JSON Schema 等格式约束的引导式生成(Guided Decoding)
- 多后端支持:兼容 CUDA、ROCm(AMD GPU)、TPU 等多种硬件加速后端
发展脉络
vLLM 从学术论文快速成长为业界主流推理框架。
- 2023 年 6 月:vLLM 项目在 GitHub 首次开源,配套博客发布
- 2023 年 10 月:论文在 SOSP 2023 正式发表,PagedAttention 获学术认可
- 2024 年:新增推测解码、前缀缓存、分块预填充等功能,支持多模态模型
- 2025 年:引入解耦式预填充/解码(Disaggregated P/D)架构,进一步优化集群级吞吐
- 持续迭代:社区贡献活跃,成为与 TensorRT-LLM、SGLang 并列的主流推理框架
与同类框架对比
vLLM 在开源推理框架中占据重要位置,与其他框架各有侧重。
- vs TensorRT-LLM:TensorRT-LLM 由 NVIDIA 官方维护,深度优化 NVIDIA 硬件,编译期优化更激进;vLLM 部署更简便、跨硬件支持更广
- vs SGLang:SGLang 在结构化生成和多轮对话场景有特定优化;两者均借鉴了分页 KV 缓存思想
- vs TGI(Text Generation Inference):Hugging Face 出品,生态集成好;vLLM 在高并发吞吐上通常更优
- 生态地位:vLLM 凭借活跃的开源社区和简洁的 OpenAI 兼容 API,成为中小规模自托管部署的首选
部署与使用
vLLM 提供多种部署方式,对工程团队友好。
- OpenAI 兼容接口:内置与 OpenAI Chat Completions API 兼容的服务端,可无缝替换上层应用
- Python API:支持离线批量推理(
LLM类)和在线服务(AsyncLLMEngine)两种模式 - 容器化部署:官方提供 Docker 镜像,可直接部署至 Kubernetes 集群
- 模型兼容性:支持 Llama、Mistral、Qwen、Gemma、Yi 等主流开源模型以及多模态模型
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「大模型推理加速框架」
- 「PagedAttention 那套」
- 「线上 serving 常用」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级场景查看详解 →
离线批量推理如何高效跑大规模请求?
离线批量推理以吞吐为先:大 batch、连续批处理、按长度排序减 padding、多副本并行。
- 中级概念查看详解 →
连续批处理(Continuous Batching)为什么能提升 LLM 服务吞吐?
以迭代为粒度调度:每步把完成的序列换出、新请求即时填入,消除静态批里等齐木桶效应造成的 GPU 空转。
- 高级系统设计高频查看详解 →
LLM 推理服务如何优化吞吐与延迟(vLLM / 批处理 / 量化)?
连续批处理提吞吐、PagedAttention 省显存、量化降成本、张量并行扩容量、投机解码降延迟。
- 高级系统设计高频查看详解 →
如何设计支撑高并发的模型推理服务?
continuous batching + KV Cache + 量化 + 多副本自动扩缩 + 排队限流 + 多级缓存,围绕 TTFT/TPOT 这两个 SLO 优化。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
LLM 推理优化:量化、剪枝、蒸馏与推理加速实战
系统讲解大语言模型推理优化的四大核心技术——量化(Quantization)、剪枝(Pruning)、知识蒸馏(Knowledge Distillation)和推理引擎加速,覆盖从原理到实战的完整链路
- 2
LLM 推理加速(四):新范式从 Speculative Decoding 到 DFlash
2026 年 4 月,z-lab 开源的 DFlash(Block Diffusion for Flash Speculative Decoding)一周内突破 2,000 星,将推测解码技术推向了新的高度。从 2023 年的 SpecInfer 到 2024 年的 Medusa、Eagle,再到 2025 年的 Lookahead Decoding 和 2026 年的 DFlash,LLM 推理加速经历了从「验证单 Token」到「预测 Token 块」再到「扩散式生成」的范式跃迁。本文深度解析推测解码的完整技术演进路线,对比 5 种主流方法的原理与性能,提供完整的 Python 实现代码,并给出生产部署的实战指南。
- 3
认识 AI:从概念到实践的全景导览
全面介绍人工智能是什么、它能做什么、主流技术栈和工具生态,以及你应该如何系统学习 AI。这是你 AI 学习之旅的第一站。
外部参考
维基百科:查看「vLLM」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
