💡

文章摘要

2022 到 2026 年,大模型推理单价下降了 99.7%,但企业的 AI 账单不降反升。本文从经济学原理出发,拆解 Agentic AI 工作流中 token 放大的五个结构性来源,给出预算建模的三层框架和治理路径。

一、你将带走什么:一个反直觉的成本陷阱

场景: 你的团队在 2024 年用 GPT-4 做了一个客服机器人,每月账单 $5,000。2026 年,你换成了更便宜的模型,单 token 价格降了 100 倍。但月底一看,账单变成了 $15,000。

这不是幻觉。据 Gartner 2026 年 8 月预测(2026-08-17),到 2028 年,每个 Agentic AI 工作流的推理成本将增长 5 倍以上——尽管单 token 价格同期会再降 90%。

为什么会这样? 因为 AI 的使用模式发生了质变:从「一问一答」的聊天,变成了「自主规划-执行-反思」的 Agent 工作流。一个聊天请求消耗 200-2000 个 token,而一个 Agent 任务消耗数万乃至数百万 token单价下降的速度,追不上用量增长的速度。

这就是 AI 时代的 Jevons 悖论(杰文斯悖论):当某项资源的利用效率提升时,该资源的总消耗量反而增加。1865 年,英国经济学家 William Stanley Jevons 发现蒸汽机效率提升后,煤炭消耗不降反升。160 年后,同样的规律正在 AI 推理领域精确重演。

这个问题的本质是什么? 不是模型定价的问题,而是工作范式的转变。聊天模式下,成本是线性的——用户问一个问题,模型回答一次。但 Agent 模式下,成本是指数级的——一个任务可能需要几十轮推理、数百次工具调用、持续的上下文维护。即使每次推理的成本下降 90%,如果推理次数增长 1000 倍,总成本仍然会上升。

读完本文你将获得:

第一,token 放大的五个结构性来源。 不是简单的「多问了几次」,而是架构层面的乘数效应。理解这些来源,才能定位成本失控的根因。

第二,预算建模的三层框架。 从 CPM(每百万 token 价格)到 CPT(每任务成本)再到 TCO(总拥有成本),建立正确的度量体系。

第三,治理路径的四个阶段。 从可观测性到预算分配,从智能路由到架构优化,给出可执行的落地步骤。

图表加载中…

💡 一句话理解

单价下降 ≠ 总成本下降。评估 AI 成本必须以「任务级总消耗」为单位,而非「每百万 token 价格」。

⚠️ 常见踩坑

不要用 2024 年的预算模型预测 2026 年的 AI 支出。Agent 工作流的乘数效应会让旧模型严重失真。

二、Jevons 悖论:1865 年的煤炭警告如何在 AI 时代重演

Jevons 悖论的核心逻辑: 效率提升 → 成本下降 → 需求释放 → 总消耗增加。

1865 年,英国经济学家 William Stanley Jevons 发现了一个反直觉的现象:蒸汽机效率从 1% 提升到 15%,但英国的煤炭消耗反而增长了 10 倍。原因很简单——效率提升降低了使用成本,创造了更多需求,总消耗量不降反升

这个规律在历史上反复验证。20 世纪 70 年代,汽车燃油效率提升了 50%,但美国的汽油消耗增长了 80%。21 世纪初,LED 照明比白炽灯节能 80%,但全球照明用电量反而增加了——因为更低的成本让人们在更多地方安装了更多灯具。

160 年后,同样的悖论正在 AI 行业精确重演。

AI 行业的 Jevons 悖论数据:

从 2022 年到 2026 年,AI 推理成本下降了超过 99.7%(从 GPT-4 的 $120/百万 Token 到 MiMo 1T 的 $0.30/百万 Token)。但全球 AI 用电量从 ~20 TWh/年 增长到 ~500 TWh/年——增长了 25 倍。

三个回弹效应:

  1. 直接回弹(30-50%): 现有 AI 应用用量暴增。ChatGPT 从日均 1 亿次对话增长到 20 亿次。企业不再把 AI 用于「实验性项目」,而是部署到核心业务流程。
  2. 间接回弹(200-500%): 低成本催生全新应用品类。AI 浏览器、AI 游戏 NPC、AI 视频生成——这些在 2022 年因成本过高而不存在的应用,现在成为主流。更关键的是,Agentic AI 的兴起让单次任务的 Token 消耗从几百个膨胀到几百万个。
  3. 系统性回弹(不可量化): 软件从「一次性编写」变成「持续 AI 增强」,开发、测试、运行、维护全阶段消耗 Token。代码审查、文档生成、性能优化——每个环节都嵌入 AI,总消耗量呈指数级增长。

一个具体案例: 某电商公司在 2024 年用 GPT-4 做客服机器人,每月账单 $5,000。2026 年换成更便宜的模型后,单 Token 价格降了 100 倍。但公司把 AI 扩展到产品描述生成、个性化推荐、库存预测、营销文案优化等 12 个场景,月底账单变成了 $15,000。单价下降 100 倍,总账单上升 3 倍。

对企业的启示: 仅靠技术进步无法解决 AI 的成本问题。效率提升本身会创造更多需求,总消耗量不降反升。真正有效的是:技术 + 治理 + 预算约束的组合拳

图表加载中…

💡 一句话理解

Jevons 悖论意味着:效率提升本身无法减少 AI 的总成本。需要技术 + 政策 + 预算约束的组合拳。

⚠️ 常见踩坑

不要假设「模型降价 = 账单下降」。在 Jevons 悖论作用下,降价会被用量增长吞噬。

三、Agentic AI 的 token 放大效应:五个结构性来源

为什么 Agent 的 token 消耗是聊天的 50-500 倍? 这不是简单的「多问了几次」,而是架构层面的结构性差异。

乘数来源一:多轮推理链(超线性增长)。

一个 Agent 完成任务不是单次推理,而是「规划 → 执行 → 观察 → 反思 → 再规划」的循环。每轮循环都携带完整上下文,而上下文在累积——第 5 轮的输入 token 包含了前 4 轮的全部输出。这意味着 token 消耗随推理深度超线性增长

乘数来源二:Agent 间通信(N² 消息爆炸)。

多 Agent 系统中,每个 Agent 发出的消息对其他 Agent 而言都是 token 成本。一个 5-Agent 协作系统,每轮内部通信就可能产生 5×5=25 条消息,每条消息携带完整上下文。

乘数来源三:工具调用与检索增强(辅助 token)。

Agent 每次调用外部工具(搜索引擎、代码解释器、数据库查询)都需要构造结构化 prompt 并解析返回结果,这些「辅助 token」往往比核心推理消耗更多。

乘数来源四:重试与纠错(+30-80%)。

生产环境中 Agent 的输出需要验证,失败后重试。据 Spheron 2026 年推理成本报告(2026-06),重试和纠错可额外增加 30-80% 的 token 消耗。

乘数来源五:状态维护(序列化开销)。

长时运行的 Agent(运行数天甚至数周)需要持续维护状态——对话历史、中间结果、检查点。这些状态的序列化和恢复本身就是巨大的 token 开销。

五个乘数叠加的实际效果: 一个「简单」的长时推理任务——比如自动化代码审查——从初始输入的 2K token 膨胀到实际消耗的 500K-2M token,乘数达到 250-1000 倍。

独立证据印证:NavyaAI 2026 年成本报告(2026-06),Agent 工作流的令牌消耗是简单聊天交互的 50-500 倍,且 72% 的生产 AI 成本隐藏在模型账单之外,分布在编排、检索、重试和可观测性环节。Sail Research(2026-06)在其长时推理基础设施报告中指出,一个典型的代码审查 Agent 从初始 2K token 输入膨胀到实际 500K-2M token 消耗,乘数达 250-1000 倍。这些数据来自不同机构的独立测量,结论高度一致。

为什么这些乘数是结构性的,而不是可以简单优化掉的?

关键原因在于:Agent 的工作方式与聊天有本质区别。聊天是「一问一答」——用户提出问题,模型给出答案,交互结束。而 Agent 是「自主规划-执行-反思」的循环——它需要理解目标、分解任务、调用工具、观察结果、判断是否需要修正、再执行下一步。每一步都需要携带完整的上下文(包括之前所有步骤的输出),这使得 Token 消耗随推理深度超线性增长

一个直观的类比:聊天像打乒乓球,一个来回就结束;Agent 像下围棋,每一步都要考虑之前所有的落子和未来的可能性。棋局的复杂度随步数指数级增长,Agent 的 Token 消耗也遵循类似的规律。

Gartner 2026 年 8 月预测的数据印证了这一点: 到 2028 年,每个 Agentic AI 工作流的推理成本将增长 5 倍以上——尽管单 Token 价格同期会再降 90%。这意味着 Token 用量的增长速度将远超价格下降的速度,Jevons 悖论在 AI 推理领域将持续发挥作用。

图表加载中…

💡 一句话理解

设计 Agent 系统时,必须为每个乘数来源建立独立的成本追踪点,否则无法定位成本失控的根因。

⚠️ 常见踩坑

乘数效应是结构性的,不是 bug。不能通过「优化 prompt 长度」根本解决,需要从架构层面重新设计。

四、预算建模的三层框架:从 CPM 到 TCO

要管理 Agent 成本,首先需要建立正确的度量体系。传统的「每百万 token 价格(CPM)」只是冰山一角,完整的度量需要覆盖三个层次。

第一层:CPM(Cost Per Million Tokens)——模型层。

这是最直观的指标,表示每处理一百万个 token 的费用。不同模型的 CPM 差异巨大:开源模型(如 Llama 3 70B)自托管可低至 $0.15/M token,而前沿闭源模型(如 Claude Opus 4.7)可达 $15/M token。但 CPM 只是起点,不是终点。

第二层:CPT(Cost Per Task)——任务层。

一个 Agent 完成某个任务实际花了多少钱?这需要把 token 消耗乘数纳入计算。假设一个客服 Agent 平均需要 12 轮工具调用、3 次自我纠错、每次上下文窗口 8K token,那么一个「简单」的客服任务实际消耗约 120K token,即使用 $1/M token 的模型,单任务成本也有 $0.12——看似便宜,但乘以日均 10 万次调用就是 $12,000/天。

第三层:TCO(Total Cost of Ownership)——系统层。

据 NavyaAI 2026 年成本报告(2026-06),72% 的生产 AI 成本在模型账单之外,包括:向量数据库的检索成本、编排引擎的计算成本、失败重试的冗余成本、日志与可观测性的存储成本、以及工程团队的人力成本。只看模型 CPM 就像只看冰山露出水面的部分。

度量层 指标 典型范围 适用场景
模型层 CPM($/M token $0.15 - $15 模型选型对比
任务层 CPT($/task) $0.01 - $5 工作流经济性评估
系统层 TCO($/月) $10K - $1M+ 企业预算与治理

关键洞察: 企业决策者往往只关注 CPM,但真正决定账单的是 CPT × 任务量。一个 CPM 低但 token 消耗极高的架构,可能比 CPM 高但极精简的架构更贵。

一个真实的预算陷阱: 某金融公司 2024 年用 GPT-4 做合同审查,CPM 约 $30/M token,每月处理 1000 份合同,账单 $8,000。2026 年换成开源模型自托管,CPM 降至 $0.5/M token(降 60 倍)。但同一时期,公司将 AI 扩展到合规检查、风险评估、客户沟通等 8 个场景,且每个场景都采用多轮推理的 Agent 架构。结果:每月处理量增长到 50,000 份等效任务,总 token 消耗增长 200 倍,账单反而达到 $12,000。

为什么 CPM 会误导决策? 因为它假设任务复杂度不变。但现实中,当成本下降时,组织会倾向于让 AI 处理更复杂的任务、覆盖更多场景、进行更深入的推理。这就是 Jevons 悖论在微观层面的体现:单价下降刺激了用量增长,最终总成本上升。

正确的预算方法: 以 CPT 为核心指标,结合任务量预测来估算月度支出。例如:客服场景 CPT $0.12 × 日均 10 万次 = $12,000/天。如果计划扩展到 5 个场景,总预算应为 $60,000/天。这种自下而上的估算方式,比基于 CPM 的粗略推算准确得多。

💡 一句话理解

建立成本看板时,三层度量缺一不可。CPM 用于选型,CPT 用于预算,TCO 用于治理。

⚠️ 常见踩坑

不要用 CPM 直接推算月度预算。Agent 工作流的 token 乘数会让实际成本偏离 CPM 估算 10-100 倍。

五、治理路径的四个阶段:从可观测性到架构优化

理论框架落地需要可执行的治理机制。以下是一套经过实践验证的企业 Agent 成本治理框架,分为四个阶段。

阶段一:可观测性建设(第 1-2 周)。

部署 token 使用追踪系统,覆盖所有模型调用点。关键指标:每任务 token 消耗、每团队月度 token 预算执行率、重试率。工具选择:Amnic(多云归因)或开源方案(Langfuse + 自定义 dashboard)。建立基线数据,为后续优化提供依据和参考点。

阶段二:基线建立与预算分配(第 3-4 周)。

基于可观测性数据,建立各业务线的 token 消耗基线。按「任务类型 × 模型层级」矩阵分配月度预算。核心原则:预算按任务级(CPT)而非模型级(CPM)分配

阶段三:智能路由部署(第 5-8 周)。

实施任务-模型匹配策略。部署路由层:简单任务(分类、提取)→ 小模型;中等任务(摘要、翻译)→ 中模型;复杂任务(推理、规划)→ 前沿模型。预期效果:模型层成本降低 60-80%。

阶段四:架构优化(第 9-16 周)。

基于用量数据,评估推理引擎选型(自建 vs 云 API vs 混合)。部署连续批处理KV Cache 优化、量化部署等运行时优化。对于稳定高用量场景,评估长期合约或自建 GPU 集群

关键成功因素: 成本治理不是技术项目,而是组织项目。需要 CFO 办公室参与预算审批、工程团队配合路由策略、产品团队理解 token 成本对功能经济性的影响。据 The Economist 报道(2026-06-14),AI Agent 正在推高企业成本,「企业正在争相管理 spiralling bills」——没有治理框架的企业将在这场成本竞赛中落后。

💡 一句话理解

治理框架的核心不是省钱,而是让每一美元的 AI 支出都产生可衡量的业务价值。

⚠️ 常见踩坑

不要试图一步到位。四阶段框架的价值在于渐进式推进,每阶段都有可验证的成果。

六、趋势预判:2026-2028 年的成本演化

基于当前技术演进和资本流向,我们对 Agent 成本的未来做出以下判断。

判断一:推理引擎将从「延迟竞赛」转向「吞吐竞赛」。

2024-2025 年的基准测试聚焦于「谁的首 token 延迟最低」,2026-2027 年将转向「谁的每美元 token 总量最高」。Sail Research 的融资成功($80M,Sequoia + Kleiner Perkins)标志着资本已经押注这个方向。

判断二:Token 成本归因将成为企业标配。

正如 2018-2020 年云成本归因(Cloud FinOps)成为企业标配,2026-2027 年 token 成本归因将经历同样的普及曲线。Linux Foundation Tokenomics Foundation 的成立是标志性事件。

判断三:「有状态沙箱」将成为 Agent 基础设施的标准组件。

长时运行的 Agent 需要持久化状态、检查点恢复、跨会话记忆。Sail Research 的有状态沙箱、Detail.dev 的编排引擎都在解决这个需求。预计到 2027 年,所有主流 Agent 平台都将内置状态管理。

判断四:成本优化将催生「模型即服务」的新定价模式。

当前的按 token 计费模式不适合 Agent 场景——它鼓励供应商增加不必要的 token 消耗。预计将出现「按任务计费」「按结果计费」等新定价模式,将成本风险从买方转移到卖方。

对企业的建议: 现在就开始建设 token 成本治理能力——可观测性、预算机制、路由策略。不要等到 Agent 大规模部署后才补课,那时成本已经失控。正如 FinOps Foundation 的经验所示,成本纪律的建设永远比成本失控的补救更便宜

💡 一句话理解

现在投入 token 成本治理的企业,在 Agent 大规模普及时将拥有结构性成本优势。

⚠️ 常见踩坑

趋势预判基于当前信息,具体时间节点可能因技术突破或监管变化而偏移。保持每季度重新评估。

七、12 步可执行清单:从今天开始治理

可观测性建设(第 1-2 周)

  1. 部署 token 追踪系统,覆盖所有模型调用点
  2. 建立每任务 token 消耗的基线数据
  3. 设置预算告警阈值(建议 80% 预警、100% 硬限)

预算分配(第 3-4 周)

  1. 按「任务类型 × 模型层级」矩阵分配月度预算
  2. 预算按任务级(CPT)而非模型级(CPM)分配
  3. 建立跨部门的 AI 成本治理委员会

智能路由(第 5-8 周)

  1. 实施任务-模型匹配策略
  2. 部署路由层:简单任务 → 小模型,复杂任务 → 前沿模型
  3. 监控路由效果,动态调整匹配规则

架构优化(第 9-16 周)

  1. 评估推理引擎选型(自建 vs 云 API vs 混合)
  2. 部署运行时优化(连续批处理KV Cache、量化)
  3. 对稳定高用量场景评估长期合约或自建 GPU 集群

持续治理(长期)

  • 建立月度成本审查机制
  • 定期评估新模型的成本效益比
  • 参与行业标准建设(Linux Foundation Tokenomics Foundation)

关键原则: 成本治理不是技术项目,而是组织项目。需要 CFO 办公室、工程团队、产品团队三方协同。

参考资料:

💡 一句话理解

12 步清单的价值在于渐进式推进,每阶段都有可验证的成果。

⚠️ 常见踩坑

不要跳过可观测性建设直接做架构优化。没有数据支撑的决策会偏离实际。

🎯 相关面试题

巩固本篇知识点,备战 AI 岗位面试。