kvpress

开源LLM 运行时 › 本地运行时⭐ 1.1k

KVPress 是 NVIDIA 开源的 KV Cache 压缩工具，通过智能压缩技术减少大语言模型推理时的显存占用。支持多种压缩算法，显著提升长上下文处理能力。

🎯适用场景：LLM 推理优化、KV Cache 压缩、长上下文处理

#推理#KV 缓存#Kv-cache-compression#大语言模型

📥 收录于 2026/6/3

访问工具

📊 仓库数据

Stars1,139

Forks160

语言Python

更新2026/7/17

✅ 优点

•NVIDIA 官方出品质量高
•显著提升推理吞吐量
•多种压缩算法可选

⚠️ 限制

•压缩可能影响模型精度
•仅支持部分模型架构

🔗 相关工具

llama.cpp

开源⭐ 121k↑+131

github.com/ggml-org/llama.cpp

高性能 C++ LLM 推理引擎，支持在 CPU/GPU 上运行各种开源大语言模型，GGUF 量化格式首创者，本地 AI 生态核心基础设施

🎯本地 LLM 部署、端侧 AI 推理、离线 AI 应用、模型量化和格式转换

#推理#大语言模型#本地 AI#gguf+1

语言C++

🍴 Forks20,727

🔄 更新2026/7/18

📥 收录2026/6/6

DeepSeek-V3

开源⭐ 104k↑+7

github.com/deepseek-ai/DeepSeek-V3

深度求索开源 MoE 架构大语言模型，671B 参数但仅激活 37B，推理成本低且性能对标 GPT-4 级别，支持多语言

🎯高性价比 LLM 部署、中文场景优化、MoE 架构研究

#moe#大语言模型#open-weight#chinese+1

语言Python

🍴 Forks16,713

🔄 更新2026/7/18

📥 收录2026/6/6

GPT4All

开源⭐ 77k↑+5

github.com/nomic-ai/gpt4all

开源本地 LLM 聊天应用和推理框架，提供一键安装的桌面应用和 Python 生态，支持多种开源模型本地运行

🎯本地 AI 聊天、隐私敏感的文档问答、离线 AI 助手

#chat#本地 AI#大语言模型#桌面端+1

语言C++

🍴 Forks8,303

🔄 更新2026/7/18

📥 收录2026/6/6

llamafile

开源⭐ 25k↑+21

github.com/mozilla-ai/llamafile

用单个可执行文件分发和运行大型语言模型，支持跨平台本地推理的轻量级方案，无需复杂环境配置即可快速启动 AI 模型

🎯本地运行 LLM 的轻量级方案

#本地 LLM#推理#跨平台#gguf

语言C++

🍴 Forks1,508

🔄 更新2026/7/18

📥 收录2026/5/31

Runanywhere SDKs

开源⭐ 10k↓-1

github.com/RunanywhereAI/runanywhere-sdks

跨平台 AI 推理工具包，支持在 Android/iOS/Web/Flutter 等端侧运行扩散模型、LLM、VLM 等多模态模型，主打本地推理。

🎯移动端/端侧 AI 推理、离线 AI 应用开发、边缘计算场景

#端侧 AI#边缘计算#推理#多模态+1

语言C++

🍴 Forks364

🔄 更新2026/7/18

📥 收录2026/5/31

Mixture of Recursions

开源⭐ 577

github.com/raymin0223/mixture_of_recursions

结合自适应计算和早期退出的递归 Transformer 架构，优化 LLM 推理效率和精度。

🎯LLM 架构研究、推理效率优化、Transformer 改进

#大语言模型

语言Python

🍴 Forks84

🔄 更新2026/7/12

📥 收录2026/6/4

← 浏览全部 1318 个工具