Headroom

LLM 上下文压缩工具,可自动压缩工具输出、日志、文件和 RAG 分块,在发送到 LLM 前将 token 消耗降低 60%。12K+ stars。

🎯适用场景:LLM 上下文压缩、Token 成本优化、RAG 系统输出预处理

#context-compression#llm-optimization#token-reduction#rag

📥 收录于 2026/6/5

📊 仓库数据

Stars60,401
Forks4,523
语言Python
更新2026/7/20

📈 Stars 变化 2 天 +609· 统计区间 7/18 23:22 → 7/20 11:41(2 天)

优点

  • 降低 60% token 消耗
  • 支持多种压缩策略
  • RAG 场景特别有效

⚠️ 限制

  • 压缩可能丢失部分信息
  • 需要调整压缩参数

🔗 相关工具

Ollama

开源176k+90

github.com/ollama/ollama

本地运行开源大语言模型的最简方案,支持 Llama、Qwen、DeepSeek 等主流模型,一键安装、自动下载模型、提供 OpenAI 兼容 API,是 AI 开发者本地部署的首选工具

🎯生产环境模型推理服务

#本地部署#开源模型#API
语言Go
🍴 Forks17,034
📅 上线2023/6/27
🔄 更新2026/7/20
📥 收录2026/4/13

llama.cpp

开源121k+172

github.com/ggml-org/llama.cpp

高性能 C++ LLM 推理引擎,支持在 CPU/GPU 上运行各种开源大语言模型,GGUF 量化格式首创者,本地 AI 生态核心基础设施

🎯本地 LLM 部署、端侧 AI 推理、离线 AI 应用、模型量化和格式转换

#推理#大语言模型#本地 AI#gguf+1
语言C++
🍴 Forks20,781
🔄 更新2026/7/20
📥 收录2026/6/6

DeepSeek-V3

开源104k+11

github.com/deepseek-ai/DeepSeek-V3

深度求索开源 MoE 架构大语言模型,671B 参数但仅激活 37B,推理成本低且性能对标 GPT-4 级别,支持多语言

🎯高性价比 LLM 部署、中文场景优化、MoE 架构研究

#moe#大语言模型#open-weight#chinese+1
语言Python
🍴 Forks16,711
🔄 更新2026/7/20
📥 收录2026/6/6

GPT4All

开源77k-1

github.com/nomic-ai/gpt4all

开源本地 LLM 聊天应用和推理框架,提供一键安装的桌面应用和 Python 生态,支持多种开源模型本地运行

🎯本地 AI 聊天、隐私敏感的文档问答、离线 AI 助手

#chat#本地 AI#大语言模型#桌面端+1
语言C++
🍴 Forks8,302
🔄 更新2026/7/20
📥 收录2026/6/6

GPT4Free

开源66k

github.com/xtekky/gpt4free

多模型免费访问平台,66,037+ stars。提供多种大语言模型的免费访问接口,包括 GPT-4、Claude、Gemini 等主流模型的聚合调用方案

🎯本地模型运行与推理服务

#免费模型#API聚合#多模型#开源
语言Python
🍴 Forks13,532
📅 上线2023/3/30
🔄 更新2026/7/20
📥 收录2026/4/20

Open Notebook

开源36k+54

github.com/lfnovo/open-notebook

开源的 NotebookLM 替代品,支持 18+ AI 提供商(OpenAI/Anthropic/Ollama/Qwen 等),支持播客生成、内容转换、完整 REST API,支持 Docker 本地部署

🎯私人 AI 学习笔记、播客内容生成、多模型学习助手

#notebook#ai-assistant#podcast-generation#开源+1
语言TypeScript
🍴 Forks4,060
🔄 更新2026/7/20
📥 收录2026/6/7