Liquid AI LFM2.5-DSpark 推测解码草稿模型
2026 年 8 月 24 日,Liquid AI 发布 LFM2.5-DSpark。
事件背景
推测解码通过草稿模型快速生成候选 token,主模型并行验证,接受正确部分,从而加速自回归生成。DSpark 是 LFM2.5 系列的专用草稿模型。
关键事实
| 项目 | 详情 |
|---|---|
| 模型规模 | ~300M 参数(3 个检查点) |
| 加速比 | H100: 3.18x, M4 Max: 2.87x |
| 输出一致性 | 与原始模型完全一致 |
| 格式 | Safetensors + GGUF |
| 许可证 | lfm1.0 |
技术机制
草稿模型在单步生成多个候选 token,主模型通过并行解码验证。接受正确前缀,拒绝错误部分,从新位置重新开始。DSpark 专为 LFM2.5 架构优化,在保持输出质量的同时显著降低延迟。
影响与意义
对端侧推理: M4 Max 上 2.87x 加速对 Mac 端侧部署有直接价值。结合 MacPaw 合作(8 月 5 日宣布),Liquid AI 正在构建完整的端侧推理栈。
对开发者: GGUF 格式支持 llama.cpp,便于集成到现有应用。3 个检查点提供不同尺寸选择。
对行业: 推测解码从研究走向生产,成为端侧推理的标准优化手段。
风险与边界
- lfm1.0 许可证非标准开源,需审查条款
- 草稿模型需与对应主模型配对,不能跨系列使用
- 加速效果依赖硬件和工作负载特征
AI Master 解读
核心事件
Liquid AI 发布 LFM2.5-DSpark 推测解码草稿模型。
行业影响
为什么重要: 推测解码(Speculative Decoding)是大模型推理加速的关键技术。草稿模型(draft model)快速生成候选 token,主模型并行验证,接受正确部分。DSpark 将这一技术带到 LFM2.5 端侧模型,在 M4 Max 上实现 2.87x 加速,对 Mac 端侧推理有直接意义。
影响分析:
| 维度 | 影响 |
|---|---|
| 推理性能 | H100 3.18x、M4 Max 2.87x 加速 |
| 输出质量 | 与原始模型完全一致(无损) |
| 部署格式 | Safetensors + GGUF,支持 llama.cpp |
| 许可证 | lfm1.0(非标准开源) |
风险边界: lfm1.0 许可证条款需审查;草稿模型需与对应主模型配对使用;加速效果依赖硬件和工作负载。
AI Master 建议
评估 DSpark 在 Mac 端侧 LFM2.5 部署中的加速效果;检查 lfm1.0 许可证是否符合项目需求;关注 Liquid AI 后续是否开放更多尺寸的草稿模型。 **来源:** Liquid AI Blog / Hugging Face **链接:** https://www.liquid.ai/blog/lfm2.5-dspark
