Colibri

纯 C 零依赖推理引擎,可在 25GB RAM 消费级机器上运行 GLM-5.2 744B MoE 模型。通过 per-layer LRU cache 从磁盘流式加载 21,504 个路由专家(~370GB),仅保持密集部分(~9.9GB int4)在内存中。Apple M5 Max 128GB 可达 ~1 tok/s。Apache 2.0 许可。

🎯适用场景:在消费级硬件上本地运行 744B 参数 MoE 模型——无需 GPU 集群

#推理引擎#GLM-5.2#MoE#纯C#零依赖#消费级硬件#Apache 2.0

📥 收录于 2026/7/21

📊 仓库数据

Stars17,103
Forks1,579
语言C
协议Apache-2.0
更新2026/7/21

优点

  • 纯 C 零依赖
  • 25GB RAM 即可运行 744B 模型
  • 磁盘流式加载创新架构
  • Apache 2.0 开源

⚠️ 限制

  • 冷启动 0.05-0.1 tok/s 较慢
  • 需要快速 NVMe SSD
  • 新项目生态待建设

🔗 相关工具

Shimmy

开源5.7k+1

github.com/Michael-A-Kuykendall/shimmy

纯 Rust 编写的 WebGPU 推理引擎,兼容 OpenAI API,原生支持 GGUF 格式。零 Python 依赖,单二进制文件,可在任意 GPU 上运行

🎯本地 LLM 推理、边缘部署、无需 Python 的推理服务

#Rust#WebGPU#推理引擎#GGUF+1
语言Rust
🍴 Forks545
🔄 更新2026/7/21
📥 收录2026/6/8

Tensorflow

开源196k+24

github.com/tensorflow/tensorflow

全球最流行的机器学习框架之一,195K+ stars。Google 开源的端到端 ML 平台,支持 TensorFlow、Keras 等多种 API,覆盖深度学习、强化学习、移动端部署等全场景,是 AI 工程师的必备工具

🎯深度学习模型训练、移动端 AI 部署、生产环境 ML 推理服务

#深度学习#deep-neural-networks#分布式#机器学习+1
语言C++
🍴 Forks75,633
🔄 更新2026/7/21
📥 收录2026/4/11

Prometheus

开源65k+7

github.com/prometheus/prometheus

开源监控系统和时序数据库,CNCF 毕业项目。采用多维数据模型和 PromQL 查询语言,是云原生和 AI 基础设施监控的事实标准,可与 Grafana 无缝集成。

🎯AI 服务 GPU 使用率监控、模型推理延迟追踪、Kubernetes 集群资源监控

#监控#告警#指标#时序数据+1
语言Go
🍴 Forks10,668
🔄 更新2026/7/21
📥 收录2026/5/27

Ray

开源43k+8

github.com/ray-project/ray

AI 分布式计算引擎,42K+ stars。提供核心分布式运行时和一套 AI 库,加速 ML 工作负载——包括超参数搜索、强化学习、LLM 推理服务等,是大规模 AI 训练和推理的事实标准基础设施

🎯分布式 ML 训练与推理调度、超参数搜索与强化学习

#分布式计算#ML 加速#超参数优化#LLM 服务
语言Python
🍴 Forks7,809
🔄 更新2026/7/21
📥 收录2026/5/19

LLM Action

开源25k+6

github.com/liguodongiot/llm-action

生成式 AI 指南,4.9K+ stars。生成式 AI 研究更新、工具和资源的一站式资源库,涵盖最新进展和实用工具

🎯生成式 AI 技术学习、LLM 训练/推理/部署实践参考

#大语言模型#llm-inference#llm-serving#llm-training+1
语言HTML
🍴 Forks2,826
📅 上线2023/5/23
🔄 更新2026/7/21
📥 收录2026/5/20

ncnn

开源24k+2

github.com/Tencent/ncnn

高性能神经网络推理框架,4.6K+ stars。针对移动端优化的高性能神经网络推理框架,腾讯开源的移动端深度学习推理方案

🎯移动端/嵌入式高性能神经网络推理部署

#android#arm-neon#人工智能#caffe+1
语言C++
🍴 Forks4,463
📅 上线2017/6/30
🔄 更新2026/7/21
📥 收录2026/5/20