开源模型昨天·Bloomberg / TechTimes
DeepSeek V4 Flash 公开测试版发布:Agent 能力全面超越旗舰 Pro-Preview
DeepSeek 于 7 月 31 日发布 V4-Flash 官方 API 公测版(0731 构建),同一 284B 参数 MoE 架构经重训练后在 9 项 Agent 和编码基准全面超越 V4-Pro-Preview,Terminal Bench 2.1 得分 82.7%,DeepSWE 54.4%,Cybergym 76.7%。API 定价不变($0.14/M 输入,$0.28/M 输出),原生支持 Responses API 格式并适配 Codex。
DeepSeek V4 Flash 0731 公测版
2026 年 7 月 31 日,Bloomberg/TechTimes 报道。
核心基准数据
| 基准 | 得分 |
|---|---|
| Terminal Bench 2.1 | 82.7% |
| Cybergym | 76.7% |
| Toolathlon Verified | 70.3% |
| DSBench-FullStack | 68.7% |
| DeepSWE | 54.4% |
| NL2Repo | 54.2% |
| SWE-bench Verified (Flash Max) | 79.0% |
| LiveCodeBench (Flash Max) | 91.6% |
关键信息
- 架构: 284B 参数 MoE,13B 活跃参数(与 Pro-Preview 相同)
- 定价: $0.14/M 输入,$0.28/M 输出(不变)
- 上下文窗口: 100 万 Token
- 输出速度: 118.2 tokens/s
- 升级方式: 仅后训练迭代,无架构变化
行业信号
- 后训练优化在 Agent 场景的杠杆效应被验证
- 低价模型与前沿模型差距持续缩小
- 中国 AI 价格战进一步加剧
AI Master 解读
核心事件
DeepSeek V4 Flash 0731 版本公测发布,Agent 能力全面超越旗舰 Pro-Preview。
行业影响
为什么重要: 同一架构仅通过重训练(post-training)就实现全面性能跃升,且价格不变。这证明后训练优化在 Agent 场景的杠杆效应,对 Agentic AI 开发者的成本结构有直接影响。
影响分析: V4 Flash 以极低成本提供接近前沿的 Agent 能力,将进一步挤压高定价模型的利润空间。Terminal Bench 2.1 82.7% 的成绩已接近 Anthropic Opus 4.8 水平。
AI Master 建议
评估 V4 Flash 作为 Agent 工作负载的默认模型选项,尤其适合多步骤代码任务和工具调用场景。
