💡

文章摘要

2026 年 8 月 13 日,DeepSeek 官宣对 V4 Flash 与 V4 Pro 引入峰谷分时计费,最高涨幅出现在 V4 Pro 的缓存命中输入 token——峰时单价从 RMB 0.025 涨至 0.30/M(12 倍),新价格于 8 月 17 日 00:00(北京时间)生效。这是中国模型价格战发起者首次主动上调 API 价格,且采用「峰谷 + 缓存感知」的复杂定价结构而非简单涨价。文章拆解新计费机制的三个层次(时段判定、token 类型拆分、缓存命中优惠),量化三类 token 的不对称涨幅(cache-hit 最高 12 倍、cache-miss 约 3 倍、输出约 4.5 倍),结合 BenchLM 对 V4 Pro 0813 的独立评测(总分 61.16/100、知识类第 17 名、编码类第 74 名)分析这次调价的底气与短板,并为依赖低价 API 的开发者给出成本模型重构、时段调度与缓存优化的可执行清单。

一、事件:价格战发起者第一次主动涨价

2026 年 8 月 13 日,DeepSeek 官方宣布对 V4 Flash 与 V4 Pro 全面引入峰谷分时计费,新价格于 8 月 17 日 00:00(北京时间,即 8 月 16 日 16:00 UTC)生效。 官方定价页在保留现行价格的同时,直接列出了切换后的谷时与峰时两套费率,并把后端版本标注为 DeepSeek-V4-Flash-0731 与 DeepSeek-V4-Pro-0813。这意味着这不是一次「试水公告」,而是已经写入官方文档的确定性价格调整。

这次调价的标志性意义在于「谁在涨」。 DeepSeek 是 2026 年上半年中国模型价格战的主要发起者——V4 Flash 直接 API 价格约 $0.14/M 输入、$0.28/M 输出,被 Reuters 援引 Artificial Analysis 数据称为最便宜的已知模型之一;V4 Pro 以 $0.435/M 输入、$0.87/M 输出的定价,加上官方强调的 1M 上下文窗口,把「高性能 + 低成本」的组合做到了行业极端。一个以「极致低价」抢占市场份额的厂商突然上调 API 价格,且不是简单提价,而是引入结构复杂的峰谷计费,这在中国模型厂商中尚属首次。

最抓眼球的数字是 12 倍,但它只发生在一种 token 上。 V4 Pro 的缓存命中(cache-hit)输入 token,峰时价格从 RMB 0.025 涨至 RMB 0.30/M——正好 12 倍;谷时也涨到 RMB 0.15/M,即 6 倍。而同一模型的其他 token 类别涨幅要温和得多:cache-miss 输入峰时约 3 倍、输出峰时约 4.5 倍。用单个「12 倍」概括这次涨价,会严重高估真实账单的增幅;反过来,忽略 cache-hit 的 12 倍,又会严重低估对高缓存命中工作负载的影响。

本次调价不涉及模型名称或端点变更。 官方模型表把 deepseek-v4-pro 映射到后端 DeepSeek-V4-Pro-0813,已有集成无需更换 model ID 或 base URL;上下文窗口保持 1M、最大输出 384K,thinking / non-thinking 模式、工具调用、Responses API 与 Anthropic API 兼容均保留。官方 FAQ 明确回答:现有集成不需要任何迁移动作,涨价只发生在账单层面。对生产团队而言,这意味着影响是「立刻可计算的成本变化」,而不是「需要重新适配的技术变更」。

为什么这件事值得单独写一篇技术分析,而不是当作一条新闻转发? 因为峰谷计费改变了 LLM 成本优化的基本假设。过去优化 API 成本只有两个旋钮:减少 token 总量、提高缓存命中率。现在多了一个时间维度旋钮——同一请求在一天内不同时段发出,单价可以相差一倍。这个变化对批处理任务、Agent 长会话、RAG 系统的架构决策都有直接影响,值得开发者重新审视自己的流量画像。

二、峰谷计费机制:请求如何被定价

新的计费机制由三层判定叠加而成:时段(峰/谷)→ token 类型(cache-hit / cache-miss / 输出)→ 单价。 理解这三层,才能算出自己的真实账单增幅,而不是被「12 倍」或「50%-1100%」这类单个数字误导。

第一层是时段。 峰时窗口为北京时间 09:00-12:00 与 14:00-18:00(UTC 01:00-04:00 与 06:00-10:00),其余所有小时为谷时。谷时价格为峰时的一半——这是一个「削峰填谷」的经典电力定价模型:DeepSeek 把全天算力需求最集中的两个窗口定成高价,引导批处理、非交互任务迁移到低价时段。值得注意的是,这两个峰时窗口恰好覆盖了中国大陆工作日的上午与下午黄金时段,与「中国开发者工作日交互最密集」的假设高度吻合,说明这套时段划分经过了需求建模而非随意设定。

第二层是 token 类型。 输入被拆成缓存命中(cache-hit)与缓存未命中(cache-miss)两档。命中档是单价最低、涨幅最高的一档;未命中的输入档居中;输出档绝对单价最高、涨幅居中。官方定价页给出的切换后费率如下表——同一模型、同一 token 类型,峰时与谷时相差一倍,而这只是时段维度的差异;再加上 token 类型维度,实际共有六个费率档位。

第三层才是最终账单。 实际费用 = 各档 token 数 × 对应单价之和。由于 cache-hit 输入在绝大多数应用中占比最大(长上下文、多轮会话、Agent 场景尤其如此),这一档的 6 倍(谷时)到 12 倍(峰时)涨幅会直接放大到总账单上;而如果应用命中率低、以 cache-miss 和输出为主,账单增幅可能只有 3-4 倍甚至更低。

这套三层结构本身,就是 DeepSeek 对客户结构的再定价。 它同时实现了三个目标:把弹性任务推向低谷时段、鼓励开发者提高 prompt 前缀复用(从而降低真实算力负载)、以及对占用峰值算力的交互型工作负载收取溢价。

图表加载中…
token 类型8/16 前谷时(8/17 起)峰时(8/17 起)峰时涨幅

v4-pro · cache-hit 输入

$0.003625

$0.022

$0.044

12.1×

v4-pro · cache-miss 输入

$0.435

$0.66

$1.32

3.0×

v4-pro · 输出

$0.87

$1.98

$3.96

4.6×

v4-flash · cache-hit 输入

$0.0028

$0.007

$0.014

5.0×

v4-flash · cache-miss 输入

$0.14

$0.22

$0.44

3.1×

v4-flash · 输出

$0.28

$0.66

$1.32

4.7×

三、涨幅不对称:12 倍只属于缓存命中档

把 V4 Pro 的三类 token 并排看,涨幅分布极不均匀:cache-hit 输入 12 倍(峰时)、cache-miss 输入约 3 倍、输出约 4.6 倍。 这种不对称是理解这次涨价意图的关键,也是开发者制定应对策略的起点。

cache-hit 涨幅最大,恰恰说明 DeepSeek 想动的是「便宜占得最多」的那部分流量。 此前 V4 Pro 的 cache-hit 输入仅 $0.003625/M,比 cache-miss 低约 120 倍,几乎是免费的。对依赖长上下文prompt 前缀高度复用的应用(RAG、Agent、代码补全、多轮对话),命中率可以做到 80%-90% 以上,真实成本被压得极低。DeepSeek 现在对这一档收取 6-12 倍溢价,本质是把「缓存经济」带来的成本红利收回一部分,同时仍把命中档定价在远低于未命中档的水平(峰时 0.044 vs 1.32,仍差 30 倍)。

cache-miss 和输出档的温和涨幅(约 3 倍 / 4.6 倍)说明 DeepSeek 并不想吓跑真正的付费主力。 输出 token 是模型厂商毛利最高的部分,也是多数 LLM 应用账单的大头;只涨 4.6 倍、且谷时仅 2.3 倍,意味着对「一次性生成型」工作负载(翻译、摘要、写作)的冲击被刻意控制在较低水平。这种「选择性涨价」显示出 DeepSeek 对自身客户结构的精确把握:它知道哪些流量是被低价吸引来的弹性流量,哪些是离不开它的刚性流量。

Reuters 报道中的「50%-1100%」区间,正是对这种不对称的另一种表述。 最低 50% 对应谷时 cache-miss 输入(0.435→0.66,约 1.5 倍),最高 1100% 对应峰时 cache-hit 输入(0.003625→0.044,约 12.1 倍)。任何用单一数字描述这次涨价的报道,都必须追问:它指的是哪一档?峰时还是谷时?否则「12 倍涨价」和「1.5 倍涨价」这两个同时成立的描述,会被读者误读成同一个事实。

用一个具体例子说明影响差异。 假设一个 RAG 应用每月消耗 1 亿 token 输入、5000 万 token 输出,其中 90% 输入为 cache-hit:如果全部请求落在峰时,输入成本中 cache-hit 部分从 $0.003625/M 变成 $0.044/M(涨 12 倍)、cache-miss 部分从 $0.435/M 变成 $1.32/M(涨 3 倍)、输出从 $0.87/M 变成 $3.96/M(涨 4.6 倍),总账单增幅在 5-10 倍之间,具体取决于三类 token 的比例。如果同一工作负载迁移到谷时,总增幅会收窄到 2.5-5 倍。这个量级差异,就是「时段调度」价值的最直接体现。

图表加载中…

四、为什么是现在:缓存经济、算力成本与能力底气

涨价时机的选择,可以从供给侧与能力侧两个角度解读。

供给侧:缓存经济红利开始兑现,但算力成本压力在上升。 DeepSeek 的 1M 上下文与超长 Agent 会话场景(官方明确以 Terminal-Bench 2.1 87.9%、HLE w/ tools 60.0% 等 max-effort Agent 指标宣传 0813 版本)会带来极高的缓存复用率。当 cache-hit 流量占比足够高时,维持「命中档近乎免费」的定价就不再是获客手段,而是对自身算力利润的侵蚀。与此同时,2026 年 HBM 与先进封装产能持续紧张、云厂商集体涨价(AWS 涨 15%、阿里云最高涨 34%)的大背景,让推理成本曲线不再单向下降。DeepSeek 选择在 8 月、也就是 V4 系列发布数月后、客户粘性已建立的时间点提价,是把「补贴获客」切换到「成本回收」的理性节奏。

能力侧:BenchLM 的独立评测显示,V4 Pro 0813 的底气在知识类、短板在编码类。 根据 BenchLM 2026-08-15 抓取的 34 条可溯源基准数据,V4 Pro 0813 总分 61.16/100、排名 #52/218;其中知识类(HLE 42.7%、MMLU-Pro 87.5%、GPQA 90.1%、SimpleQA 57.9%)排名第 17/57(77/100),表现最强;编码类(SWE-bench Verified 80.6%、SWE-bench Pro 55.4%、Terminal-Bench 2.0 67.9%)排名第 74/135(49.5/100),是明显短板;Agent 类(Terminal-Bench 2.1 87.9%、CyberGym 83.3%、MCP Atlas 73.6%)排名第 60/130(49.3/100)。LiveCodeBench Pass@1-COT 93.5% 与 Codeforces 3206 是 BenchLM 榜单上「最佳已验证」成绩——编码竞技类强、工程落地类弱,是这次涨价的微妙信号:厂商在为「知识密集型 + Agent 长会话」场景提价,而这些场景恰恰是其优势区。

但涨价不等于价值跃升。 同一个 BenchLM 页面上,总分 61.16 在所有 218 个模型中仅列第 52,编码类第 74 名的位置意味着在编程工具链场景,同价位或更低价位存在更强的替代选择。DeepSeek 的能力分布决定了这次涨价只对其优势场景成立,而非对全部场景成立。一个在编码场景被涨价「惩罚」的团队,完全可以切换到编码类排名更高的模型,且质量损失有限——这正是 DeepSeek 必须把编码类涨幅控制在 3-4 倍的原因之一:它不是没有竞争压力,而是选择性涨价。

还有一个不可忽视的时机因素:DeepSeek-V4(非 Pro)即将发布。 官方新闻稿末尾明确预告「DeepSeek-V4 将很快发布」。在旗舰 Pro 档位提价的同时准备发布中端 V4,说明 DeepSeek 的产品矩阵正在走向分层定价:Pro 档服务高端客户、承担毛利目标,V4 档继续承担走量获客的职能。如果这个判断成立,那么这次涨价就不是「价格战的终结」,而是「价格战从单一档位转向分层战场」的预演。

五、开发者应对:成本模型重构与时段调度

对依赖低价 DeepSeek API 的团队,这次调价的正确反应不是立刻迁移,而是先重构成本模型。 旧的「单一口径 token 均价」估算方式已经失效——现在必须按 时段 × token 类型 拆成六格(或十二格)分别估算。

第一步:拆分流量画像。 用官方账单或代理层日志,把最近 30 天的 token 消耗按 cache-hit 输入 / cache-miss 输入 / 输出三列拆分,再按北京时间峰谷窗口拆分。绝大多数团队会发现自己的真实增幅远低于 12 倍,但也有些团队(高缓存命中的 RAG / Agent 会话)会发现增幅接近 12 倍。这一步是后续所有决策的基础,跳过它直接做迁移判断是最大的常见错误。

第二步:把弹性任务调度到谷时。 峰时窗口(09:00-12:00、14:00-18:00)只占全天三分之一,谷时价格是峰时的一半。夜间批量任务、定时重试、离线索引更新等非交互工作负载,迁移到谷时后账单直接减半。对批处理密集的团队,这一步通常能抵消 60%-80% 的涨价影响,远大于模型迁移的收益。

第三步:提高缓存命中率,把流量压回命中档。 尽管命中档涨了 6-12 倍,它与未命中档的价差仍高达约 30 倍(峰时 0.044 vs 1.32)。稳定复用 prompt 前缀(系统提示、Few-shot 示例、工具定义放最前)、保持多轮会话上下文连续、避免随机打乱 prompt 顺序,都能显著提升命中率——这在涨价后价值更大。对 Agent 场景,尽量复用同一会话而非每次新建,是成本优化收益最显著的动作之一。

第四步:用「两档预算」做风险对冲。 如果团队无法接受最坏情形(峰值 12 倍),就应把不可调度、不可缓存的核心流量保留在 DeepSeek,同时通过 OpenRouter 这类路由层把可替代流量(尤其是编码类任务)按价格/延迟路由到其他模型。DeepSeek 的编码类短板(BenchLM 第 74 名)意味着这条替代路径在质量上损失可控。两档预算的本质是承认:这次涨价对不同工作负载的影响差异太大,单一决策无法覆盖全部流量。

路由层的价值在这次涨价中被重新定价。 DEVGEEK 在 8 月 14 日的分析中给出了一个很有说服力的观察OpenRouter 目录中 deepseek/deepseek-v4-pro 的现行价($0.435 输入 / $0.87 输出)与 DeepSeek 官方价格一致,但切换模型只改一行 model ID。对已经在用路由层的团队,这次涨价只是「把请求改指向另一个模型」的成本;对直连 DeepSeek 官方 API 的团队,则需要新增一层抽象才能获得同样的灵活性。这个差异就是路由层的「保险溢价」——平时看似多余的抽象层,在厂商定价突变时变成了免迁移的逃生通道。值得注意的是,路由层并不能完全消除涨价影响:OpenRouter 的模型价格由上游厂商决定,DeepSeek 涨价后路由层价格大概率同步跟进;它的价值在于「切换」而非「豁免」。

不要做的三件事: 不要在没拆分流量画像前就按 12 倍重估全部预算;不要为省成本把所有请求压到谷时而牺牲交互产品的响应体验;不要因为 headline 涨价就立刻迁移全部流量——DeepSeek 命中档相对未命中档仍有 30 倍价差,重度缓存场景下它依然可能是最便宜的选择。

图表加载中…

六、中国模型价格战是否终结?

答案是否定的——但它的形态正在改变。 把这次涨价放在 2026 年上半年的时间线上看,它更像「价格战的第二阶段」,而非价格战的结束。

第一阶段是绝对低价竞争。 DeepSeek V4 系列以 1/10 价格的姿态逼近头部模型性能,把「每百万 token 几分钱」变成行业标准,迫使竞争对手跟进降价。这一阶段的核心逻辑是:用亏损换份额、用低价教育市场。V4 Flash 的 $0.14/M 输入价就是这个阶段的标志性数字。

第二阶段(现在)是结构化定价。 当客户基础足够大、缓存经济足够成熟后,低价策略的边际收益下降,厂商开始用峰谷、缓存感知等复杂结构重新划分客户价值。这次调价表明 DeepSeek 认为自己的需求已经具备足够的价格弹性空间——对核心优势场景(知识、Agent 长会话)提价 3-12 倍仍能留住客户。这个判断本身,就是「市场已经从纯价格竞争转向质量 + 价格竞争」的证据。

但几个「尚未终结」的信号同样明显: 其一,即使峰时 12 倍后,V4 Pro cache-hit 输入 $0.044/M 的绝对价格依然远低于任何头部闭源模型的同类档位——绝对低价的时代没有结束,只是「近乎免费」的档位消失了;其二,DeepSeek 的编码短板(BenchLM 第 74 名)决定了它没有能力在全部场景同时提价,价格战在中低端推理与长尾场景仍会继续;其三,同周内 GLM-5.3(BenchLM Terminal-Bench 2.1 榜首领跑 88.2%)等国产模型的密集发布,说明国产模型之间的能力竞争仍在升级,价格只是竞争维度之一。

对开发者的判断框架: 把 DeepSeek 从「默认最便宜的底座」改记为「分时计价、缓存友好、知识/Agent 优势、编码短板」的组合——它在你的流量画像中是否仍是最优解,取决于前三步拆分的结果,而不是任何单一 headline。这次涨价真正的长期影响,可能不是 DeepSeek 一家定价的变化,而是它验证了「中国模型厂商可以主动提价而不失去客户」这一命题——一旦这个命题被市场接受,其他厂商的跟进涨价只是时间问题。对开发者而言,应对涨价最好的方式不是抱怨或仓促迁移,而是把「多模型路由 + 成本可观测性」变成基础设施的一部分,让任何单一厂商的定价变化都不再成为风险源。

最后,回到文章开头的问题:这对中国模型生态意味着什么? 一个务实的答案是:价格战没有结束,但「免费午餐」结束了。DeepSeek 用 12 倍涨幅划出了一条清晰的界线——低价曾经是它撬动市场的杠杆,现在它开始把杠杆收回,换成更精细的定价结构。对开发者,这意味着选择模型的标准要从「谁最便宜」升级为「谁的成本模型最适合我的流量画像」;对观察者,这意味着中国模型市场正在从「以低价论英雄」走向「以成本结构论英雄」的新阶段。

七、参考资料

🎯 相关面试题

结合本篇技术观点,备战 AI 岗位面试。