NVIDIA Model Optimizer
英伟达统一模型优化库,集成量化、蒸馏、剪枝、神经架构搜索与投机解码等 SOTA 模型压缩技术,帮助降低推理成本。
🎯适用场景:对大模型进行量化、蒸馏与剪枝,降低部署与推理成本
#nvidia#quantization#distillation#model-compression#inference
📥 收录于 2026/7/22
📊 仓库数据
Stars3,285
Forks508
语言Python
协议Apache-2.0
上线2024/2/1
更新2026/7/22
✅ 优点
- •NVIDIA 官方维护,与 TensorRT 生态深度集成
- •覆盖量化/蒸馏/剪枝/NAS 全栈优化
- •支持投机解码等前沿推理加速
⚠️ 限制
- •主要面向 NVIDIA GPU 生态
- •部分高级特性需要 CUDA 环境配置
