Inco AI 发布 DFlash 2:推测解码并行起草长度提升 21%,MacBook Pro 达 70 tokens/s
Inco AI 于 8 月 20 日发布 DFlash 2,在 DFlash 基础上将并行起草的接受 token 长度提升 21%,仅增加 1.3% 周期延迟,输出质量可证明不变。已在 Qwen3.8-27B + Apple M5 Max (oMLX) 上验证,MacBook Pro 可达 70 tokens/s(4.6x 加速)。HuggingFace 已发布 incoai/Qwen3.8-27B-DFlash2 草稿模型。
Inco AI 发布 DFlash 2
2026 年 8 月 20 日,Inco AI 官方博客 + HuggingFace。
技术背景
推测解码(Speculative Decoding)是一种加速大模型推理的技术:用小模型(草稿模型)快速生成多个候选 token,再由大模型(目标模型)并行验证。如果候选被接受,一次推理就能输出多个 token,从而摊薄大模型的推理成本。
DFlash 是 Inco AI 此前发布的推测解码方案,基于块扩散(Block Diffusion)机制。DFlash 2 在此基础上进一步优化。
DFlash 2 核心改进
| 指标 | DFlash | DFlash 2 | 改进 |
|---|---|---|---|
| 平均接受长度 | 基准 | +21% | 并行起草更多 token |
| 周期延迟增加 | - | 1.3% | 几乎可忽略 |
| 输出质量 | 无损 | 无损 | 可证明不变 |
DFlash 2 的关键突破在于:在保持输出质量完全不变的前提下,通过更高效的并行起草策略,让每次验证能接受更多 token。
实测性能
在 Qwen3.8-27B + Apple M5 Max (oMLX) 上的实测:
- 推理速度:70 tokens/s
- 加速比:4.6x(对比自回归解码)
- 硬件:MacBook Pro(消费级)
这意味着在普通笔记本电脑上运行 27B 参数模型,能达到接近实时交互的速度。
生态与可用性
- HuggingFace 模型:incoai/Qwen3.8-27B-DFlash2(草稿模型)
- 支持框架:oMLX (Apple Silicon)、Transformers
- 开源协议:与 Qwen3.8 一致
产业意义
- 边缘推理:消费级硬件运行大模型达到实用速度
- 成本优化:本地推理降低 API 调用成本
- 隐私场景:敏感数据无需上传云端
- 开源生态:草稿模型开源,社区可复现和优化
风险边界
- DFlash 2 需要目标模型和草稿模型配合,不是所有模型组合都有效
- 当前验证主要在 Qwen3.8-27B 上,其他模型的效果待验证
- Apple Silicon 优化路径与 CUDA 路径不同,跨平台兼容性需关注
后续观察
- DFlash 2 在其他模型(Llama、Mistral 等)上的效果
- CUDA 平台的性能表现
- 与 PFlash、Eagle 等其他推测解码方案的对比
AI Master 解读
核心事件
Inco AI 发布 DFlash 2 推测解码技术,并行起草长度提升 21%。
行业影响
为什么重要: 推测解码(Speculative Decoding)是让大模型推理加速的关键技术之一。DFlash 2 在保持输出质量不变的前提下,通过并行起草更多 token 显著提升推理速度,且在消费级硬件(MacBook Pro M5 Max)上实现 70 tokens/s,使本地运行 27B 参数模型达到实用水平。这对边缘推理、隐私敏感场景和降低 API 成本都有直接意义。
影响分析:
| 维度 | 影响 |
|---|---|
| 推理速度 | 70 tokens/s(MacBook Pro M5 Max) |
| 加速比 | 4.6x(vs 自回归解码) |
| 质量损失 | 0%(可证明不变) |
| 硬件门槛 | 消费级 GPU / Apple Silicon |
| 生态 | HuggingFace 草稿模型已发布 |
AI Master 建议
关注推测解码在本地推理场景的应用;评估 DFlash 2 对 Qwen3.8-27B 等开源模型的加速效果;跟踪 Apple Silicon 上的 LLM 推理优化进展。
