Model Routing(模型路由)
Model Routing根据问题难度自动选模型
亦作、亦称:模型路由 · LLM Routing · 智能路由
Model Routing 是一种 AI 推理成本优化策略,根据输入任务的复杂度、延迟要求和成本约束,动态将请求路由到最合适的模型进行处理——简单任务路由到小模型(如 GPT-4o-mini),复杂任务路由到大模型(如 GPT-4 Opus),目标是在保持输出质量的前提下最大化每美元 Token 创造的业务价值。
路由策略分类
Model Routing 主要有三种策略。第一是基于规则的路由(Rule-based Routing):根据预定义规则匹配模型,如「代码生成用 Claude Sonnet」「简单问答用 GPT-4o-mini」「数学推理用 o1」。实现简单但灵活性有限。
第二是基于分类器的路由(Classifier-based Routing):训练一个轻量分类器评估输入任务的复杂度或领域,自动选择最优模型。分类器可以是微调的小模型或传统 ML 模型。第三是基于语义相似度的路由:将新任务与历史任务库进行语义匹配,根据相似任务的历史表现选择模型。
这种策略能捕捉到规则难以表达的复杂模式。
与 MoE 的关系
Model Routing 与混合专家模型(Mixture of Experts, MoE)在理念上高度相似——都是根据输入动态选择最合适的计算路径。区别在于:MoE 的路由发生在模型内部,选择的是同一模型内的不同专家子网络;Model Routing 发生在模型外部,选择的是完全不同的模型实例。
两者可以结合使用:外部路由选择模型(如 GPT-4 vs GPT-4o-mini),内部 MoE 路由选择专家。这种「外层路由 + 内层路由」的分层架构可能是 2026-2027 年企业 AI 基础设施的演进方向。
企业实践案例
Uber 在 2026 年 4 月烧光全年 AI 预算后实施的治理措施是 Model Routing 的典型企业案例。
具体措施包括:分级支出上限(基础 $1,500/月/工具,高级需审批)、取消 Tokenmaxxing 排行榜(避免员工为刷排名消耗无意义 Token)、要求 AI 使用与可量化业务产出关联。
更先进的实践包括:语义缓存(Semantic Caching)——对语义相似的请求直接返回缓存结果,避免重复调用模型;投机路由(Speculative Routing)——先用小模型生成草稿,如果质量不达标再路由到大模型重新生成。
Gartner 预测 2026-2027 年模型路由将成为企业 AI 基础设施的标配组件。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「根据问题难度自动选模型」
- 「简单问题用小模型,难题用大模型」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级系统设计高频查看详解 →
当企业AI支出失控时,如何设计一个AI成本优化网关,实现按任务自动路由到最优性价比模型?
2026年7月,Claude Fable 5($15/M输入)、GPT-5.6 Sol($12/M输入)、Grok 4.5($8/M输入)三款旗舰模型per-task成本差异达1.5-2倍。Uber在2026年前四个月烧光全年AI预算的教训表明:企业AI支出失控不是技术问题,是架构问题。设计一个AI成本优化网关,根据任务复杂度、质量要求和成本约束自动路由到最优模型,成为企业AI基础设施的刚需。
- 高级系统设计高频查看详解 →
如何设计一个支持多档位模型的统一 API 网关?以 GPT-5.6 Sol/Terra/Luna 为例
GPT-5.6引入Sol/Terra/Luna三级定价,要求API网关根据任务复杂度自动选择档位。考察点:路由策略、成本控制、降级机制、统一接口抽象。
