vLLM
高吞吐 LLM 推理引擎,77,418+ stars。采用 PagedAttention 显存优化技术,吞吐量比 HuggingFace Transformers 高 24 倍,是生产环境部署大模型推理的首选方案,支持 OpenAI 兼容 API
🎯适用场景:生产环境模型推理服务
#推理引擎#高性能#PagedAttention#生产部署
📊 仓库数据
Stars89,251
Forks20,800
语言Python
上线2023/2/9
更新2026/8/17
📈 Stars 变化 ↑16 小时 +58· 统计区间 8/17 02:46 → 8/17 18:46(16 小时)
✅ 优点
- •吞吐量行业领先(HF 的 24 倍)
- •PagedAttention 显存优化
- •OpenAI 兼容 API 无缝迁移
- •支持多种模型架构
⚠️ 限制
- •仅支持推理不支持训练
- •部分新模型适配有延迟
- •多 GPU 分布式推理配置复杂
