Liquid AI 发布 DSpark 推测解码:端侧推理提速 3.2 倍
2026 年 8 月 21 日,Liquid AI 在官方博客发布 DSpark 推测解码方案,为 LFM2.5 系列模型提供最高 3.2 倍的推理加速。
事件背景
LLM 推理的解码阶段传统上受内存带宽限制——大部分延迟来自将权重从 DRAM 搬运到 SRAM,而非计算本身。推测解码通过轻量草稿模型生成候选 token,再由目标模型验证,在保持输出分布不变的前提下降低延迟。Liquid AI 将这一思路落地为 DSpark 方案,并发布配套的约 300M 参数草稿模型。
关键事实与数据
- 草稿模型规模:约 300M 参数
- 最高提速:LFM2.5-2.6B 在 M4 Max MacBook 上最高 3.2 倍
- 多工具场景:LFM2.5-2.6B 平均延迟降低 57%
- 其他模型:LFM2.5-1.2B-Instruct 提速因数据分布而异(最高 52%),LFM2.5-8B-A1B 平均提速 18%
- 部署条件:SGLang 需 DSpark 支持(PR #31041),端侧用 llama.cpp + Metal 的 FP16 GGUF
技术机制
DSpark 结合了三种组件:草稿模型生成候选序列,目标模型以贪婪解码验证;被拒绝的 token 由目标模型自己的输出替代,因此生成序列与基线贪婪解码完全一致。加速收益来自"一次验证多个草稿 token"的并行化:每个草稿 token 的验证成本远低于从头解码。
在不同模型上的收益差异明显:2.6B 端侧模型收益最大(57% 延迟降低),因为其解码本身受带宽限制最严重;而 8B MoE 模型在 llama.cpp 的 Metal 后端受 MoE 实现限制,收益只有 18%。
影响与意义
对端侧 AI 而言,DSpark 把交互式 Agent 的响应速度提升到了接近云端体验的水平(约 140 tok/s 量级)。对开发者来说,这意味着本地部署的模型可以承担更多实时交互任务;对推理优化生态而言,推测解码方案(EAGLE-3、DFlash、DSpark)的竞争将推动更成熟的工具链出现。
风险边界
- 收益高度依赖模型规模与部署后端,MoE 模型的收益明显更低
- DSpark 需要特定 SGLang 构建,迁移成本需评估
- 不同数据分布下收益波动大(1.2B 模型最高 52% 差异)
- 基准为官方自测,尚未有第三方独立复现
后续观察
- DSpark 是否被主流推理框架默认集成
- 在真实 Agent 多工具负载下的端到端收益
- 与 EAGLE-3、DFlash 在同等条件下的对比评测
AI Master 解读
核心事件
Liquid AI 发布 DSpark 推测解码方案,LFM2.5 推理最高提速 3.2 倍。
行业影响
为什么重要: 推理阶段的解码过程受内存带宽限制,推测解码通过小模型草稿 + 大模型验证的方式,在不改变输出分布的前提下显著降低延迟。DSpark 把这一技术带到端侧,让边缘设备上的 Agent 交互达到接近云端的响应速度。
影响分析: 该方案对端侧 AI 部署具有直接价值:更快的解码速度意味着本地 Agent 可以承担更复杂的多工具任务。对开发者而言,DSpark 需要与 SGLang 的特定构建配合,集成成本需纳入评估;对行业而言,推测解码正在成为推理优化的事实标准,与 EAGLE-3、DFlash 等方案形成竞争格局。
AI Master 建议
建立模型路由层,保留 2 周小流量对比评测后再切换生产流量。
