GPUStack
GPU 集群管理器,支持统一配置和编排 vLLM、SGLang 等主流推理引擎,实现高性能 AI 模型在多 GPU 集群中的自动化部署和调度
🎯适用场景:多 GPU 集群推理引擎编排、DeepSeek 等大规模模型分布式部署
📥 收录于 2026/6/4
📊 仓库数据
📈 Stars 变化 ↑1 天 +2· 统计区间 7/17 20:11 → 7/18 23:22(1 天)
✅ 优点
- •支持 vLLM/SGLang 等多引擎统一编排,兼容 Ascend 和 CUDA
- •GPU 集群自动化管理降低运维复杂度
⚠️ 限制
- •需要一定规模的 GPU 硬件资源才能发挥效果
- •分布式部署调试排障门槛较高
🔗 相关工具
Semantic Router
github.com/vllm-project/semantic-router
vLLM 项目出品的系统级智能路由器,在云、数据中心和边缘实现 Mixture-of-Models 的智能路由。
🎯多模型智能路由与混合模型部署
vLLM
github.com/vllm-project/vllm
高吞吐 LLM 推理引擎,77,418+ stars。采用 PagedAttention 显存优化技术,吞吐量比 HuggingFace Transformers 高 24 倍,是生产环境部署大模型推理的首选方案,支持 OpenAI 兼容 API
🎯生产环境模型推理服务
SGLang
github.com/sgl-project/sglang
高性能 LLM 和多模态模型服务框架,27K+ stars。采用 RadixAttention 等高效注意力实现,支持 DeepSeek、Llama、Qwen、GPT-OSS 等主流模型的高吞吐推理服务,是 vLLM 之外另一个生产级推理引擎选择
🎯生产环境模型推理服务
TensorRT-LLM
github.com/NVIDIA/TensorRT-LLM
NVIDIA TensorRT-LLM 提供易用的 Python API 定义 LLM,支持最先进的推理优化,在 NVIDIA GPU 上实现极致推理性能
🎯在 NVIDIA GPU 上获得最优 LLM 推理性能
LMCache
github.com/LMCache/LMCache
LLM KV Cache 加速层,通过智能缓存机制显著提升大语言模型推理速度。兼容 vLLM 等主流推理框架,可将重复前缀场景的推理延迟降低数倍。8.3K+ stars。
🎯LLM 推理加速、重复前缀场景优化、多轮对话性能提升
OpenRLHF
github.com/OpenRLHF/OpenRLHF
可扩展的 Agentic RL 训练框架,9.6K+ stars。基于 Ray 构建,支持 PPO/DAPO/REINFORCE++ 等算法,集成 vLLM 加速推理
🎯LLM 对齐训练(RLHF/DPO)、Agent 强化学习
