llama.cpp
高性能 C++ LLM 推理引擎,支持在 CPU/GPU 上运行各种开源大语言模型,GGUF 量化格式首创者,本地 AI 生态核心基础设施
🎯适用场景:本地 LLM 部署、端侧 AI 推理、离线 AI 应用、模型量化和格式转换
#推理#大语言模型#本地 AI#gguf#量化
📥 收录于 2026/6/6
📊 仓库数据
Stars124,290
Forks21,801
语言C++
更新2026/8/17
📈 Stars 变化 ↑16 小时 +124· 统计区间 8/17 02:46 → 8/17 18:46(16 小时)
✅ 优点
- •跨平台支持 CPU/GPU/Metal/CUDA
- •GGUF 格式成为行业标准
- •社区活跃、兼容绝大多数开源模型
⚠️ 限制
- •CPU 推理速度受限需大内存
- •GPU 加速需要编译配置
- •非开箱即用需一定技术基础
