Pulsar
NEW面向超大规模 MoE 模型的 SSD 流式推理引擎,用 Rust + CUDA 实现,可在消费级双 GPU 上以 SSD 流式方式运行 743B 级模型(GLM 5.2 约 2 tok/s)。适合低显存场景部署巨型模型。59 stars。
🎯适用场景:在显存有限的消费级硬件上部署 700B+ 级 MoE 模型
#moe#inference-engine#ssd-streaming#rust#cuda
📊 仓库数据
Stars59
Forks8
语言Rust
协议NOASSERTION
上线2026/7/13
更新2026/7/23
✅ 优点
- •消费级 GPU 跑超大 MoE
- •SSD 流式省显存
- •Rust+CUDA 实现
⚠️ 限制
- •项目极新
- •stars 较少
- •吞吐受 SSD 带宽限制
