FreeToken
边缘原生 MoE 推理引擎,在消费级硬件上运行 290B+ 前沿开源模型。RTX 4060 可跑 Qwen3.6-35B(39.3 tok/s),RTX 5090 可跑 DeepSeek-V4-Flash 284B,单工作站 GPU 可跑 GLM-5.2 753B。带宽自适应 CPU-GPU 协同执行、语义感知缓存、弹性显存管理,支持 RTX 30/40/50 系列。UC Berkeley/MIT 论文 arXiv:2608.16157,Apache 2.0 许可。
🎯适用场景:在消费级 GPU 上本地运行前沿 MoE 大模型——从笔记本到工作站
#推理引擎#MoE#边缘推理#消费级硬件#UC Berkeley#MIT#Apache 2.0
📊 仓库数据
Stars2,496
Forks233
语言Python
协议Apache-2.0
更新2026/8/23
✅ 优点
- •带宽自适应 CPU-GPU 协同执行
- •语义感知缓存避免重复计算
- •弹性显存管理无需重启引擎
- •支持 20+ MoE 模型和多种量化格式
⚠️ 限制
- •仅支持 NVIDIA RTX 30/40/50 系列
- •新项目生态待建设
- •需要 CUDA 13 和 r580+ 驱动
