ExllamaV3
优化的量化和推理库,用于在现代消费级 GPU 上本地运行 LLM。新 EXL3 量化格式基于 QTIP,支持灵活的张量并行和专家并行推理。
🎯适用场景:在消费级 GPU 上本地运行大语言模型,通过高效量化降低显存需求
#quantization#inference#local-llm#gpu#consumer-hardware
📥 收录于 2026/8/16
📊 仓库数据
Stars1,138
Forks89
语言Python
协议MIT
上线2025/4/6
更新2026/8/16
✅ 优点
- •ExllamaV2 继承者,社区认可度高
- •新 EXL3 量化格式(QTIP)压缩效率更高
- •支持张量并行和专家并行,消费级 GPU 可用
⚠️ 限制
- •项目较新(2025-04 创建),生态仍在成长
- •需要一定 GPU 硬件基础,纯 CPU 用户不适用
