Inco AI 发布 DFlash 2 并行推测解码
2026 年 8 月 18 日,Inco AI 官方博客。
事件背景
DFlash 是 Inco AI 开发的推测解码算法,通过 block diffusion 实现并行 drafting,显著提升 LLM 推理速度。DFlash 2 是该系列的最新版本,进一步优化了并行 drafting 的效率。
关键事实
- 发布时间: 2026 年 8 月 18 日
- 核心改进: 平均接受长度提升 21%
- 推理加速: 基准测试显示 16-25% 速度提升
- 延迟增加: 约 1% 循环延迟
- 质量保持: 输出 provably unchanged
- 已支持模型: Qwen3.8-27B、Meta Muse Glimmer
技术机制
DFlash 2 的核心改进在于并行 drafting——在每次验证通过中,模型可以同时处理多个 draft token,而不是逐个验证。这使得每次验证通过能产出 20% 以上的有效 token,从而在几乎不增加延迟的情况下提升整体吞吐量。
与原始 DFlash 相比,DFlash 2 的平均接受长度(average acceptance length)提升 21%,这意味着模型在每次验证中能接受更多 draft token,减少验证轮次。
影响与意义
DFlash 2 对推理加速的意义在于:
- 消费级硬件友好: 在 DGX Spark 等消费级系统上可实现接近 3× 的加速
- 质量无损: 输出质量 provably unchanged,适用于对质量要求严格的场景
- 生态扩展: 已在 Qwen3.8-27B 和 Muse Glimmer 上发布配套 draft 模型
- 生产就绪: 1% 的延迟增加在大多数场景中可忽略
风险边界
- 加速效果因模型和任务类型而异
- 需要配套的 draft 模型,目前仅支持少数模型
- 与主流推理框架(vLLM、TensorRT-LLM)的集成进展待观察
- Inco AI 作为初创公司,长期维护和社区支持存在不确定性
后续观察
- DFlash 2 在更多模型上的适配进展
- 与 vLLM、TensorRT-LLM 等推理框架的集成
- 在生产环境中的实际部署案例
- 与其他推测解码方法(如 Medusa、EAGLE)的性能对比
AI Master 解读
核心事件
Inco AI 发布 DFlash 2 并行推测解码算法。
行业影响
为什么重要: 推测解码(Speculative Decoding)是当前 LLM 推理加速的核心技术之一。DFlash 2 通过并行 drafting 进一步提升效率,在几乎不增加延迟的情况下获得 16-25% 的推理加速。这对消费级硬件(如 DGX Spark)和大规模推理服务都有直接价值。
影响分析:
| 维度 | 影响 |
|---|---|
| 推理效率 | 16-25% 加速,接近 3× 自回归解码速度 |
| 质量保持 | 输出 provably unchanged |
| 硬件友好 | 消费级 GPU 可受益 |
| 生态扩展 | Qwen3.8-27B、Muse Glimmer 已支持 |
AI Master 建议
评估 DFlash 2 在你的推理场景的适用性;关注与 vLLM、TensorRT-LLM 等推理框架的集成进展;跟踪在更多模型上的适配情况。
