大语言模型2026-06-27·DeepSeek官方博客

DeepSeek联合北大开源DSpark推理加速框架,单用户生成速度提升60-85%

2026年6月27日,DeepSeek联合北京大学正式发布DSpark推理加速框架,通过半自回归生成与置信度动态调度技术,在不增加硬件成本的前提下将大模型生成速度提升60%-85%。该框架已集成至DeepSeek-V4-Flash与V4-Pro预览版引擎,高并发场景下有效吞吐量翻4倍。相关代码与模型已在GitHub开源,同步发布推测解码训练代码仓库DeepSpec。

DeepSeek DSpark推理加速框架要点

核心技术

  • 半自回归生成架构: 融合高吞吐并行生成与轻量级串行校验
  • 置信度调度验证机制: 根据系统负载动态调整验证长度
  • 无需额外硬件: 纯算法优化,不增加硬件成本

性能提升

场景 提升幅度
单用户生成速度 60%-85%
高并发有效吞吐量 翻4倍
Qwen3-4B可接受Token长度 +30.9%
Qwen3-8B可接受Token长度 +26.7%
Qwen3-14B可接受Token长度 +30%

开源内容

  • DSpark模型权重
  • DeepSpec推测解码训练代码仓库
  • 已集成至DeepSeek-V4-Flash与V4-Pro预览版

行业意义

大模型竞争焦点从'拼参数'转向'拼推理效率',推理基础设施优化成为核心竞争力。

AI Master 解读

核心事件

DeepSeek开源DSpark推理加速框架,单用户生成速度提升60-85%,高并发吞吐量翻4倍。

行业影响

影响分析: DSpark采用半自回归架构,融合高吞吐并行生成与轻量级串行校验,引入置信度调度验证机制,可根据系统负载动态调整验证长度。在Qwen3-4B/8B/14B上测试显示,相比自回归草稿模型,单轮可接受Token长度分别提升30.9%/26.7%/30%。这意味着大模型竞争焦点从'拼参数'转向'拼推理效率',谁能更便宜、更快速地输出结果,谁就占据优势。

AI Master 建议

关注推测解码技术在生产环境的应用,DSpark开源代码可直接用于优化自有模型推理性能。