DeepSeek 发布 V4 Pro 0813:1.6T MoE 架构,Agent 基准测试接近 Claude Fable 5
DeepSeek 8 月 13 日北京时间 11pm 发布 DeepSeek-V4-Pro-0813,1.6T MoE 架构,Terminal-Bench 2.1 得分 87.9,API 定价 $0.435/1M token。这是 V4 Pro 的正式 GA 版本,在多个 Agent 基准测试中接近 Claude Fable 5 水平,但价格仅为后者 1/57。SCMP、Simon Willison、RankLLMs 报道。
DeepSeek 发布 V4 Pro 0813:1.6T MoE 架构,Agent 基准测试接近 Claude Fable 5
2026 年 8 月 13 日,DeepSeek 发布 DeepSeek-V4-Pro-0813,1.6T MoE 架构,Terminal-Bench 2.1 得分 87.9,API 定价 $0.435/1M token。SCMP、Simon Willison、RankLLMs 报道。
事件与背景
DeepSeek V4 Pro 0813 是 V4 Pro 的正式 GA 版本(此前为 4 月底的 preview),在多个 Agent 基准测试中接近 Claude Fable 5 水平,但价格仅为后者 1/57。这是中国 AI 公司在前沿模型领域的又一次价格-性能突破。
关键事实
| 项目 | 详情 |
|---|---|
| 架构 | 1.6T MoE(Mixture of Experts) |
| 性能 | Terminal-Bench 2.1: 87.9,接近 Claude Fable 5 |
| 定价 | $0.435/1M token(Fable 5 的 1/57) |
| 定位 | Agent 任务(代码、工具调用、多步推理) |
| 争议 | 基准测试与实际应用差距;中国 AI 公司的可持续性 |
技术/机制解释
MoE(Mixture of Experts)架构:
- 原理:模型包含多个"专家"子网络,每次推理只激活部分专家
- 优势:总参数量大(1.6T),但推理成本低(只激活部分参数)
- 挑战:负载均衡、专家路由、训练稳定性
Agent 基准测试:
- Terminal-Bench 2.1:测试代码生成、工具调用、多步推理
- 得分 87.9:接近 Claude Fable 5,但 SCMP 报道"struggles on benchmarks"
- 实际应用差距:基准测试高分 ≠ 实际任务可靠性(幻觉、工具调用失败率)
影响与意义
对中国 AI 行业,在芯片限制下仍能推出前沿模型,验证技术能力;对全球 AI 市场,价格-性能突破可能冲击现有定价体系;对开发者,低成本 Agent 模型可能降低应用门槛;对 AI 安全,中国前沿模型的快速发展引发监管关注。
风险与边界
基准测试与实际应用差距(SCMP 报道"struggles on benchmarks");中国 AI 公司在芯片限制下的可持续性(资金、芯片限制);MoE 架构的实际推理成本(vs dense 模型);Agent 任务的可靠性(幻觉、工具调用失败率)。
后续观察
跟踪实际 Agent 任务表现(非仅基准测试);评估中国 AI 公司在芯片限制下的可持续性;观察 MoE 架构在推理成本上的实际优势;关注 DeepSeek 的开源策略(是否开放权重)。
AI Master 解读
核心事件
DeepSeek 发布 V4 Pro 0813,1.6T MoE 架构,Agent 基准测试接近 Claude Fable 5。
行业影响
为什么重要: DeepSeek V4 Pro 0813 是 V4 Pro 的正式 GA 版本(此前为 4 月底的 preview),在 Terminal-Bench 2.1 得分 87.9,多个 Agent 基准测试接近 Claude Fable 5,但 API 定价仅 $0.435/1M token,约为 Fable 5 的 1/57。这是中国 AI 公司在前沿模型领域的又一次价格-性能突破。
影响分析:
| 维度 | 影响 |
|---|---|
| 架构 | 1.6T MoE(Mixture of Experts) |
| 性能 | Terminal-Bench 2.1: 87.9,接近 Claude Fable 5 |
| 定价 | $0.435/1M token(Fable 5 的 1/57) |
| 定位 | Agent 任务(代码、工具调用、多步推理) |
| 争议 | 基准测试与实际应用差距;中国 AI 公司的可持续性 |
风险边界: 基准测试与实际应用差距(SCMP 报道"struggles on benchmarks");中国 AI 公司在前沿模型领域的可持续性(资金、芯片限制);MoE 架构的实际推理成本(vs dense 模型);Agent 任务的可靠性(幻觉、工具调用失败率)。
AI Master 建议
跟踪实际 Agent 任务表现(非仅基准测试);评估中国 AI 公司在芯片限制下的可持续性;观察 MoE 架构在推理成本上的实际优势;关注 DeepSeek 的开源策略(是否开放权重)。 **来源:** SCMP / Simon Willison / RankLLMs **链接:** https://www.scmp.com/tech/big-tech/article/3363895/deepseeks-updated-v4-pro-ai-model-struggles-benchmarks-shines-cybersecurity
