文章摘要
2022 到 2026 年,大模型推理单价下降了 99.7%,但企业的 AI 账单不降反升。本文从经济学原理出发,拆解 Agentic AI 工作流中 token 放大的五个结构性来源,给出预算建模的三层框架和治理路径。
一、你将带走什么:一个反直觉的成本陷阱
场景: 你的团队在 2024 年用 GPT-4 做了一个客服机器人,每月账单 $5,000。2026 年,你换成了更便宜的模型,单 token 价格降了 100 倍。但月底一看,账单变成了 $15,000。
这不是幻觉。据 Gartner 2026 年 8 月预测(2026-08-17),到 2028 年,每个 Agentic AI 工作流的推理成本将增长 5 倍以上——尽管单 token 价格同期会再降 90%。
为什么会这样? 因为 AI 的使用模式发生了质变:从「一问一答」的聊天,变成了「自主规划-执行-反思」的 Agent 工作流。一个聊天请求消耗 200-2000 个 token,而一个 Agent 任务消耗数万乃至数百万 token。单价下降的速度,追不上用量增长的速度。
这就是 AI 时代的 Jevons 悖论(杰文斯悖论):当某项资源的利用效率提升时,该资源的总消耗量反而增加。1865 年,英国经济学家 William Stanley Jevons 发现蒸汽机效率提升后,煤炭消耗不降反升。160 年后,同样的规律正在 AI 推理领域精确重演。
这个问题的本质是什么? 不是模型定价的问题,而是工作范式的转变。聊天模式下,成本是线性的——用户问一个问题,模型回答一次。但 Agent 模式下,成本是指数级的——一个任务可能需要几十轮推理、数百次工具调用、持续的上下文维护。即使每次推理的成本下降 90%,如果推理次数增长 1000 倍,总成本仍然会上升。
读完本文你将获得:
第一,token 放大的五个结构性来源。 不是简单的「多问了几次」,而是架构层面的乘数效应。理解这些来源,才能定位成本失控的根因。
第二,预算建模的三层框架。 从 CPM(每百万 token 价格)到 CPT(每任务成本)再到 TCO(总拥有成本),建立正确的度量体系。
第三,治理路径的四个阶段。 从可观测性到预算分配,从智能路由到架构优化,给出可执行的落地步骤。
💡 一句话理解
单价下降 ≠ 总成本下降。评估 AI 成本必须以「任务级总消耗」为单位,而非「每百万 token 价格」。
⚠️ 常见踩坑
不要用 2024 年的预算模型预测 2026 年的 AI 支出。Agent 工作流的乘数效应会让旧模型严重失真。
二、Jevons 悖论:1865 年的煤炭警告如何在 AI 时代重演
Jevons 悖论的核心逻辑: 效率提升 → 成本下降 → 需求释放 → 总消耗增加。
1865 年,英国经济学家 William Stanley Jevons 发现了一个反直觉的现象:蒸汽机效率从 1% 提升到 15%,但英国的煤炭消耗反而增长了 10 倍。原因很简单——效率提升降低了使用成本,创造了更多需求,总消耗量不降反升。
这个规律在历史上反复验证。20 世纪 70 年代,汽车燃油效率提升了 50%,但美国的汽油消耗增长了 80%。21 世纪初,LED 照明比白炽灯节能 80%,但全球照明用电量反而增加了——因为更低的成本让人们在更多地方安装了更多灯具。
160 年后,同样的悖论正在 AI 行业精确重演。
AI 行业的 Jevons 悖论数据:
从 2022 年到 2026 年,AI 推理成本下降了超过 99.7%(从 GPT-4 的 $120/百万 Token 到 MiMo 1T 的 $0.30/百万 Token)。但全球 AI 用电量从 ~20 TWh/年 增长到 ~500 TWh/年——增长了 25 倍。
三个回弹效应:
- 直接回弹(30-50%): 现有 AI 应用用量暴增。ChatGPT 从日均 1 亿次对话增长到 20 亿次。企业不再把 AI 用于「实验性项目」,而是部署到核心业务流程。
- 间接回弹(200-500%): 低成本催生全新应用品类。AI 浏览器、AI 游戏 NPC、AI 视频生成——这些在 2022 年因成本过高而不存在的应用,现在成为主流。更关键的是,Agentic AI 的兴起让单次任务的 Token 消耗从几百个膨胀到几百万个。
- 系统性回弹(不可量化): 软件从「一次性编写」变成「持续 AI 增强」,开发、测试、运行、维护全阶段消耗 Token。代码审查、文档生成、性能优化——每个环节都嵌入 AI,总消耗量呈指数级增长。
一个具体案例: 某电商公司在 2024 年用 GPT-4 做客服机器人,每月账单 $5,000。2026 年换成更便宜的模型后,单 Token 价格降了 100 倍。但公司把 AI 扩展到产品描述生成、个性化推荐、库存预测、营销文案优化等 12 个场景,月底账单变成了 $15,000。单价下降 100 倍,总账单上升 3 倍。
对企业的启示: 仅靠技术进步无法解决 AI 的成本问题。效率提升本身会创造更多需求,总消耗量不降反升。真正有效的是:技术 + 治理 + 预算约束的组合拳。
💡 一句话理解
Jevons 悖论意味着:效率提升本身无法减少 AI 的总成本。需要技术 + 政策 + 预算约束的组合拳。
⚠️ 常见踩坑
不要假设「模型降价 = 账单下降」。在 Jevons 悖论作用下,降价会被用量增长吞噬。
三、Agentic AI 的 token 放大效应:五个结构性来源
为什么 Agent 的 token 消耗是聊天的 50-500 倍? 这不是简单的「多问了几次」,而是架构层面的结构性差异。
乘数来源一:多轮推理链(超线性增长)。
一个 Agent 完成任务不是单次推理,而是「规划 → 执行 → 观察 → 反思 → 再规划」的循环。每轮循环都携带完整上下文,而上下文在累积——第 5 轮的输入 token 包含了前 4 轮的全部输出。这意味着 token 消耗随推理深度超线性增长。
乘数来源二:Agent 间通信(N² 消息爆炸)。
多 Agent 系统中,每个 Agent 发出的消息对其他 Agent 而言都是 token 成本。一个 5-Agent 协作系统,每轮内部通信就可能产生 5×5=25 条消息,每条消息携带完整上下文。
Agent 每次调用外部工具(搜索引擎、代码解释器、数据库查询)都需要构造结构化 prompt 并解析返回结果,这些「辅助 token」往往比核心推理消耗更多。
乘数来源四:重试与纠错(+30-80%)。
生产环境中 Agent 的输出需要验证,失败后重试。据 Spheron 2026 年推理成本报告(2026-06),重试和纠错可额外增加 30-80% 的 token 消耗。
乘数来源五:状态维护(序列化开销)。
长时运行的 Agent(运行数天甚至数周)需要持续维护状态——对话历史、中间结果、检查点。这些状态的序列化和恢复本身就是巨大的 token 开销。
五个乘数叠加的实际效果: 一个「简单」的长时推理任务——比如自动化代码审查——从初始输入的 2K token 膨胀到实际消耗的 500K-2M token,乘数达到 250-1000 倍。
独立证据印证: 据 NavyaAI 2026 年成本报告(2026-06),Agent 工作流的令牌消耗是简单聊天交互的 50-500 倍,且 72% 的生产 AI 成本隐藏在模型账单之外,分布在编排、检索、重试和可观测性环节。Sail Research(2026-06)在其长时推理基础设施报告中指出,一个典型的代码审查 Agent 从初始 2K token 输入膨胀到实际 500K-2M token 消耗,乘数达 250-1000 倍。这些数据来自不同机构的独立测量,结论高度一致。
为什么这些乘数是结构性的,而不是可以简单优化掉的?
关键原因在于:Agent 的工作方式与聊天有本质区别。聊天是「一问一答」——用户提出问题,模型给出答案,交互结束。而 Agent 是「自主规划-执行-反思」的循环——它需要理解目标、分解任务、调用工具、观察结果、判断是否需要修正、再执行下一步。每一步都需要携带完整的上下文(包括之前所有步骤的输出),这使得 Token 消耗随推理深度超线性增长。
一个直观的类比:聊天像打乒乓球,一个来回就结束;Agent 像下围棋,每一步都要考虑之前所有的落子和未来的可能性。棋局的复杂度随步数指数级增长,Agent 的 Token 消耗也遵循类似的规律。
Gartner 2026 年 8 月预测的数据印证了这一点: 到 2028 年,每个 Agentic AI 工作流的推理成本将增长 5 倍以上——尽管单 Token 价格同期会再降 90%。这意味着 Token 用量的增长速度将远超价格下降的速度,Jevons 悖论在 AI 推理领域将持续发挥作用。
💡 一句话理解
设计 Agent 系统时,必须为每个乘数来源建立独立的成本追踪点,否则无法定位成本失控的根因。
⚠️ 常见踩坑
乘数效应是结构性的,不是 bug。不能通过「优化 prompt 长度」根本解决,需要从架构层面重新设计。
四、预算建模的三层框架:从 CPM 到 TCO
要管理 Agent 成本,首先需要建立正确的度量体系。传统的「每百万 token 价格(CPM)」只是冰山一角,完整的度量需要覆盖三个层次。
第一层:CPM(Cost Per Million Tokens)——模型层。
这是最直观的指标,表示每处理一百万个 token 的费用。不同模型的 CPM 差异巨大:开源模型(如 Llama 3 70B)自托管可低至 $0.15/M token,而前沿闭源模型(如 Claude Opus 4.7)可达 $15/M token。但 CPM 只是起点,不是终点。
第二层:CPT(Cost Per Task)——任务层。
一个 Agent 完成某个任务实际花了多少钱?这需要把 token 消耗乘数纳入计算。假设一个客服 Agent 平均需要 12 轮工具调用、3 次自我纠错、每次上下文窗口 8K token,那么一个「简单」的客服任务实际消耗约 120K token,即使用 $1/M token 的模型,单任务成本也有 $0.12——看似便宜,但乘以日均 10 万次调用就是 $12,000/天。
第三层:TCO(Total Cost of Ownership)——系统层。
据 NavyaAI 2026 年成本报告(2026-06),72% 的生产 AI 成本在模型账单之外,包括:向量数据库的检索成本、编排引擎的计算成本、失败重试的冗余成本、日志与可观测性的存储成本、以及工程团队的人力成本。只看模型 CPM 就像只看冰山露出水面的部分。
| 度量层 | 指标 | 典型范围 | 适用场景 |
|---|---|---|---|
| 模型层 | CPM($/M token) | $0.15 - $15 | 模型选型对比 |
| 任务层 | CPT($/task) | $0.01 - $5 | 工作流经济性评估 |
| 系统层 | TCO($/月) | $10K - $1M+ | 企业预算与治理 |
关键洞察: 企业决策者往往只关注 CPM,但真正决定账单的是 CPT × 任务量。一个 CPM 低但 token 消耗极高的架构,可能比 CPM 高但极精简的架构更贵。
一个真实的预算陷阱: 某金融公司 2024 年用 GPT-4 做合同审查,CPM 约 $30/M token,每月处理 1000 份合同,账单 $8,000。2026 年换成开源模型自托管,CPM 降至 $0.5/M token(降 60 倍)。但同一时期,公司将 AI 扩展到合规检查、风险评估、客户沟通等 8 个场景,且每个场景都采用多轮推理的 Agent 架构。结果:每月处理量增长到 50,000 份等效任务,总 token 消耗增长 200 倍,账单反而达到 $12,000。
为什么 CPM 会误导决策? 因为它假设任务复杂度不变。但现实中,当成本下降时,组织会倾向于让 AI 处理更复杂的任务、覆盖更多场景、进行更深入的推理。这就是 Jevons 悖论在微观层面的体现:单价下降刺激了用量增长,最终总成本上升。
正确的预算方法: 以 CPT 为核心指标,结合任务量预测来估算月度支出。例如:客服场景 CPT $0.12 × 日均 10 万次 = $12,000/天。如果计划扩展到 5 个场景,总预算应为 $60,000/天。这种自下而上的估算方式,比基于 CPM 的粗略推算准确得多。
💡 一句话理解
建立成本看板时,三层度量缺一不可。CPM 用于选型,CPT 用于预算,TCO 用于治理。
⚠️ 常见踩坑
不要用 CPM 直接推算月度预算。Agent 工作流的 token 乘数会让实际成本偏离 CPM 估算 10-100 倍。
五、治理路径的四个阶段:从可观测性到架构优化
理论框架落地需要可执行的治理机制。以下是一套经过实践验证的企业 Agent 成本治理框架,分为四个阶段。
阶段一:可观测性建设(第 1-2 周)。
部署 token 使用追踪系统,覆盖所有模型调用点。关键指标:每任务 token 消耗、每团队月度 token 预算执行率、重试率。工具选择:Amnic(多云归因)或开源方案(Langfuse + 自定义 dashboard)。建立基线数据,为后续优化提供依据和参考点。
阶段二:基线建立与预算分配(第 3-4 周)。
基于可观测性数据,建立各业务线的 token 消耗基线。按「任务类型 × 模型层级」矩阵分配月度预算。核心原则:预算按任务级(CPT)而非模型级(CPM)分配。
阶段三:智能路由部署(第 5-8 周)。
实施任务-模型匹配策略。部署路由层:简单任务(分类、提取)→ 小模型;中等任务(摘要、翻译)→ 中模型;复杂任务(推理、规划)→ 前沿模型。预期效果:模型层成本降低 60-80%。
阶段四:架构优化(第 9-16 周)。
基于用量数据,评估推理引擎选型(自建 vs 云 API vs 混合)。部署连续批处理、KV Cache 优化、量化部署等运行时优化。对于稳定高用量场景,评估长期合约或自建 GPU 集群。
关键成功因素: 成本治理不是技术项目,而是组织项目。需要 CFO 办公室参与预算审批、工程团队配合路由策略、产品团队理解 token 成本对功能经济性的影响。据 The Economist 报道(2026-06-14),AI Agent 正在推高企业成本,「企业正在争相管理 spiralling bills」——没有治理框架的企业将在这场成本竞赛中落后。
💡 一句话理解
治理框架的核心不是省钱,而是让每一美元的 AI 支出都产生可衡量的业务价值。
⚠️ 常见踩坑
不要试图一步到位。四阶段框架的价值在于渐进式推进,每阶段都有可验证的成果。
六、趋势预判:2026-2028 年的成本演化
基于当前技术演进和资本流向,我们对 Agent 成本的未来做出以下判断。
判断一:推理引擎将从「延迟竞赛」转向「吞吐竞赛」。
2024-2025 年的基准测试聚焦于「谁的首 token 延迟最低」,2026-2027 年将转向「谁的每美元 token 总量最高」。Sail Research 的融资成功($80M,Sequoia + Kleiner Perkins)标志着资本已经押注这个方向。
判断二:Token 成本归因将成为企业标配。
正如 2018-2020 年云成本归因(Cloud FinOps)成为企业标配,2026-2027 年 token 成本归因将经历同样的普及曲线。Linux Foundation Tokenomics Foundation 的成立是标志性事件。
判断三:「有状态沙箱」将成为 Agent 基础设施的标准组件。
长时运行的 Agent 需要持久化状态、检查点恢复、跨会话记忆。Sail Research 的有状态沙箱、Detail.dev 的编排引擎都在解决这个需求。预计到 2027 年,所有主流 Agent 平台都将内置状态管理。
判断四:成本优化将催生「模型即服务」的新定价模式。
当前的按 token 计费模式不适合 Agent 场景——它鼓励供应商增加不必要的 token 消耗。预计将出现「按任务计费」「按结果计费」等新定价模式,将成本风险从买方转移到卖方。
对企业的建议: 现在就开始建设 token 成本治理能力——可观测性、预算机制、路由策略。不要等到 Agent 大规模部署后才补课,那时成本已经失控。正如 FinOps Foundation 的经验所示,成本纪律的建设永远比成本失控的补救更便宜。
💡 一句话理解
现在投入 token 成本治理的企业,在 Agent 大规模普及时将拥有结构性成本优势。
⚠️ 常见踩坑
趋势预判基于当前信息,具体时间节点可能因技术突破或监管变化而偏移。保持每季度重新评估。
七、12 步可执行清单:从今天开始治理
可观测性建设(第 1-2 周)
预算分配(第 3-4 周)
- 按「任务类型 × 模型层级」矩阵分配月度预算
- 预算按任务级(CPT)而非模型级(CPM)分配
- 建立跨部门的 AI 成本治理委员会
智能路由(第 5-8 周)
- 实施任务-模型匹配策略
- 部署路由层:简单任务 → 小模型,复杂任务 → 前沿模型
- 监控路由效果,动态调整匹配规则
架构优化(第 9-16 周)
持续治理(长期)
- 建立月度成本审查机制
- 定期评估新模型的成本效益比
- 参与行业标准建设(Linux Foundation Tokenomics Foundation)
关键原则: 成本治理不是技术项目,而是组织项目。需要 CFO 办公室、工程团队、产品团队三方协同。
参考资料:
💡 一句话理解
12 步清单的价值在于渐进式推进,每阶段都有可验证的成果。
⚠️ 常见踩坑
不要跳过可观测性建设直接做架构优化。没有数据支撑的决策会偏离实际。
🎯 相关面试题
巩固本篇知识点,备战 AI 岗位面试。
- 高级系统设计查看详解 →
在预算约束下,如何综合 Artificial Analysis Intelligence Index、$/token 价格与上下文窗口做模型选型?给出决策框架与真实对照案例
2026 年模型 API 选型不再是「选最强的」,而是「在预算约束下选最合适的」。本题考察候选人能否建立「能力(AA Intelligence Index)× 成本($/百万 token)× 上下文(窗口长度)」三轴决策框架,并用 Grok 4.6 平价追平(Index 61 vs $2/$6)与 Claude Sonnet 5 介绍价永久化($2/$10,news-7693)等真实案例做对照。与 agent-cost-engineering-001(Agent 成本工程)互补:后者解决「已经选了模型之后如何降本」,本题解决「选模型阶段如何权衡」。
- 初级场景高频查看详解 →
如何估算一个 AI 功能的成本?Token 账怎么算?
成本=(输入token×输入价+输出token×输出价)×调用量;估清上下文长度与 QPS,再用小模型/缓存/缩 prompt 降本。
- 高级系统设计查看详解 →
如何为 Agentic AI 工作流建立成本模型,避免"推理悖论"导致预算失控?
Gartner 2026-08-17 预测每个 Agentic Workflow 的推理成本到 2028 年将增长超过 5 倍——这是"推理悖论"(Inference Paradox)的量化体现:单 token 价格持续下降,但 Agentic 工作流的总成本因 token 用量放大而上升。本题考察候选人能否跳出"优化单价"的思维定式,从 token 放大机制、多步推理成本累积、预算约束设计三个维度建立系统性的成本建模能力。
- 高级系统设计查看详解 →
生产 RAG 系统中如何选择 Reranker 架构?延迟-成本-精度三角如何权衡?
Reranker 选型不是「精度越高越好」,而是在延迟-成本-精度三角里按 SLA 约束做分级决策:Cross-Encoder 精度高但延迟 50-200ms、成本约 $0.0002-0.002/query;ColBERT 延迟低(10-30ms)但要专用索引(10-50× bi-encoder);LLM-as-Reranker 零样本强但延迟 1-5s、成本 $0.05-0.15/query。三层决策框架:简单 FAQ 跳过 rerank、中等复杂度用 cross-encoder、高难度推理用 LLM-as-Reranker + 级联过滤。
