DeepSeek V4 Flash 消费级推理突破
2026 年 7 月 28 日,lucebox.com 技术博客实测,DeepSeek V4 Flash 在 AMD Ryzen AI MAX+ 395 达到 32 tok/s。
性能数据
| 指标 | 数值 |
|---|---|
| 模型 | DeepSeek V4 Flash |
| 硬件 | AMD Ryzen AI MAX+ 395 (Strix Halo) |
| 速度 | 32 tokens/s |
技术意义
- 消费级可用:笔记本可运行高质量大模型
- 隐私保护:本地推理无需上传数据
- 成本优势:无需云端 API 费用
核心判断
- 本地推理从实验走向实用
- 消费级硬件已具备运行大模型的能力
AI Master 解读
核心事件
DeepSeek V4 Flash 在 AMD Ryzen AI MAX+ 395 达到 32 tok/s 推理速度。
行业影响
为什么重要: 这是消费级硬件运行大模型的里程碑。32 tok/s 已达到可用的交互速度,意味着用户可以在本地笔记本上运行高质量的大模型,无需依赖云端 API。这对隐私保护、离线使用和成本控制都有重要意义。结合 HotPin 24GB RAM 跑 120B MoE 的方案,本地推理正在成为可行选择。
AI Master 建议
评估 DeepSeek V4 Flash 在消费级硬件的部署场景;关注 AMD Strix Halo 等 AI 优化硬件的发展。
