Vision Token Budget(视觉 Token 预算)
Vision Token BudgetVLM 看图要花多少 token
亦作、亦称:视觉 Token 预算 · Vision Token Budget · Vision Token Cost · 视觉 Token 成本
Vision Token Budget 是 VLM 推理成本工程的核心约束——图像经 patch 切分映射为 token,数量由分辨率平方与 patch size 决定,是 API 账单与延迟的主要来源。
核心定义
Vision Token Budget 是 VLM 推理中对图像输入所消耗 token 数量的成本预算约束。
VLM 将图像切分为固定大小的 patch(如 14×14 或 28×28 像素),每个 patch 映射为一个 token;token 总数 ≈ (H×W)/(patch_size²)。
- 1024×1024 图像在 patch_size=14 下约产生 5,300 token
- 同样图像在 patch_size=28 下约 1,340 token
- patch size 翻倍,token 数降为 1/4
工程控制手段
三层控制手段:
- 分辨率分层:根据任务需求选择 thumbnail(~100 token)/standard(~1,000 token)/high-res(~5,000+ token)三级输入,避免无差别使用最高分辨率
- 预处理管线:去重(相同图像不重复计费)、裁剪(只保留 ROI 区域)、OCR 前置(文本区域直接提取文本而非作为图像输入)
- 多层缓存:pHash 精确匹配、CLIP 语义匹配、任务级缓存,避免相同或相似图像重复推理
三层叠加可将生产环境 vision token 成本降低 3-10 倍(arXiv 2608.07427)。
与文本 token 的边界
文本 token 数量与输入长度线性相关(1,000 字 ≈ 1,300 token,可预测)。
vision token 数量与图像分辨率平方成正比:
- 1080p vs 480p 可达 5-9 倍差异
- 不同模型计算规则不同(OpenAI/Anthropic/Google 各异)
- 同一张图像在不同 API 上可能产生 2-5 倍的 token 差异
因此 vision-token-budget 是跨模型选型和生产成本控制的核心变量,而非模型能力的固定属性。
与 context-window 的边界:context-window 是模型能处理的最大 token 数(能力上限),vision-token-budget 是在成本约束下主动分配的 vision token 配额(成本决策)。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「VLM 看图要花多少 token」
- 「图像分辨率换来的推理账单」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 中级概念查看详解 →
Claude Opus 5 如何在降低成本的同时提升安全性?「guardrails 激活频率降低 85%」意味着什么?
考察候选人对前沿模型「安全-可用性平衡」的理解:以 2026 年 7 月发布的 Claude Opus 5 为例,解读「guardrails 激活频率较 Fable 5 降低 85%」的真实含义、过度拒绝(over-refusal)问题,以及为什么「更少误拦」与「更安全」可以同时成立。
- 高级概念查看详解 →
比较 Subquadratic Attention 与标准 Self-Attention 的复杂度差异。长上下文 LLM 的工程挑战有哪些?
考察候选人对注意力机制复杂度的理解:标准自注意力为何是 O(n²)、亚二次注意力的实现路径(稀疏/低秩/线性/SSM)、SubQ 的工程突破,以及长上下文 LLM 在内存、延迟、成本上的工程挑战。
- 高级概念查看详解 →
解释 DeltaNet 如何利用 Delta Rule 实现线性注意力,与传统 softmax attention 的优劣对比
考察候选人对线性注意力架构演进的理解,特别是 DeltaNet 如何通过增量更新机制在 O(n) 复杂度下实现接近 Transformer 的记忆精度。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Vision Token Budget」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
