DeepReasoning
高性能 LLM 推理 API 和聊天界面,集成 DeepSeek R1 的 CoT 推理链与 Claude,支持流式推理
🎯适用场景:高性能 LLM 推理服务集成 DeepSeek R1
📥 收录于 2026/6/11
📊 仓库数据
✅ 优点
- •Rust 高性能
- •支持 CoT 推理
- •API 友好
⚠️ 限制
- •相对较新项目
- •生态较小
🔗 相关工具
LMCache
github.com/LMCache/LMCache
LLM KV Cache 加速层,通过智能缓存机制显著提升大语言模型推理速度。兼容 vLLM 等主流推理框架,可将重复前缀场景的推理延迟降低数倍。8.3K+ stars。
🎯LLM 推理加速、重复前缀场景优化、多轮对话性能提升
DeepGEMM
github.com/deepseek-ai/DeepGEMM
DeepGEMM 是 DeepSeek 开源的高性能 FP8 GEMM(通用矩阵乘法)内核库,周增 605 stars,当前 6,998 stars。它专为 FP8 精度的大模型推理和训练设计,提供细粒度缩放(Fine-grained Scaling)的 GEMM 内核实现。与 vLLM 等推理引擎不同,DeepGEMM 聚焦在底层的 GEMM 计算优化层面——它是 FP8 量化推理的基础设施。在 FP8 已成为大模型推理主流精度格式的今天,DeepGEMM 提供了从 CUDA 内核层面优化 FP8 计算的关键能力,是高性能 LLM 推理栈中不可或缺的一环。
🎯大模型推理 GEMM 内核加速、GPU 矩阵运算优化
vLLM
github.com/vllm-project/vllm
高吞吐 LLM 推理引擎,77,418+ stars。采用 PagedAttention 显存优化技术,吞吐量比 HuggingFace Transformers 高 24 倍,是生产环境部署大模型推理的首选方案,支持 OpenAI 兼容 API
🎯生产环境模型推理服务
SGLang
github.com/sgl-project/sglang
高性能 LLM 和多模态模型服务框架,27K+ stars。采用 RadixAttention 等高效注意力实现,支持 DeepSeek、Llama、Qwen、GPT-OSS 等主流模型的高吞吐推理服务,是 vLLM 之外另一个生产级推理引擎选择
🎯生产环境模型推理服务
Harbor
github.com/av/harbor
一键部署完整的 LLM 技术栈。一条命令即可启动预配置的本地 LLM 环境,内置数百种服务可探索
🎯快速搭建本地 LLM 开发环境、AI 工具探索
TensorRT-LLM
github.com/NVIDIA/TensorRT-LLM
NVIDIA TensorRT-LLM 提供易用的 Python API 定义 LLM,支持最先进的推理优化,在 NVIDIA GPU 上实现极致推理性能
🎯在 NVIDIA GPU 上获得最优 LLM 推理性能