SGLang
高性能 LLM 和多模态模型服务框架,27K+ stars。采用 RadixAttention 等高效注意力实现,支持 DeepSeek、Llama、Qwen、GPT-OSS 等主流模型的高吞吐推理服务,是 vLLM 之外另一个生产级推理引擎选择
🎯适用场景:生产环境模型推理服务
#推理引擎#LLM 服务#多模态#高吞吐
📊 仓库数据
Stars32,299
Forks8,124
语言Python
协议Apache-2.0
更新2026/8/24
📈 Stars 变化 ↑3 天 +86· 统计区间 8/21 13:15 → 8/24 03:32(3 天)
✅ 优点
- •RadixAttention 高效注意力机制
- •支持 DeepSeek/Llama/Qwen 等主流模型
- •高吞吐低延迟推理
- •Apache-2.0 可商用
⚠️ 限制
- •相比 vLLM 生态较小
- •部分新模型适配有延迟
- •需要 GPU 环境
