Model Routing(模型路由)

Model Routing

根据问题难度自动选模型

亦作、亦称:模型路由 · LLM Routing · 智能路由

Model Routing 是一种 AI 推理成本优化策略,根据输入任务的复杂度、延迟要求和成本约束,动态将请求路由到最合适的模型进行处理——简单任务路由到小模型(如 GPT-4o-mini),复杂任务路由到大模型(如 GPT-4 Opus),目标是在保持输出质量的前提下最大化每美元 Token 创造的业务价值。

路由策略分类

Model Routing 主要有三种策略。第一是基于规则的路由(Rule-based Routing):根据预定义规则匹配模型,如「代码生成用 Claude Sonnet」「简单问答用 GPT-4o-mini」「数学推理用 o1」。实现简单但灵活性有限。

第二是基于分类器的路由(Classifier-based Routing):训练一个轻量分类器评估输入任务的复杂度或领域,自动选择最优模型。分类器可以是微调的小模型或传统 ML 模型。第三是基于语义相似度的路由:将新任务与历史任务库进行语义匹配,根据相似任务的历史表现选择模型。

这种策略能捕捉到规则难以表达的复杂模式。

与 MoE 的关系

Model Routing 与混合专家模型(Mixture of Experts, MoE)在理念上高度相似——都是根据输入动态选择最合适的计算路径。区别在于:MoE 的路由发生在模型内部,选择的是同一模型内的不同专家子网络;Model Routing 发生在模型外部,选择的是完全不同的模型实例。

两者可以结合使用:外部路由选择模型(如 GPT-4 vs GPT-4o-mini),内部 MoE 路由选择专家。这种「外层路由 + 内层路由」的分层架构可能是 2026-2027 年企业 AI 基础设施的演进方向。

企业实践案例

Uber 在 2026 年 4 月烧光全年 AI 预算后实施的治理措施是 Model Routing 的典型企业案例。

具体措施包括:分级支出上限(基础 $1,500/月/工具,高级需审批)、取消 Tokenmaxxing 排行榜(避免员工为刷排名消耗无意义 Token)、要求 AI 使用与可量化业务产出关联。

更先进的实践包括:语义缓存(Semantic Caching)——对语义相似的请求直接返回缓存结果,避免重复调用模型;投机路由(Speculative Routing)——先用小模型生成草稿,如果质量不达标再路由到大模型重新生成。

Gartner 预测 2026-2027 年模型路由将成为企业 AI 基础设施的标配组件。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「根据问题难度自动选模型」
  • 「简单问题用小模型,难题用大模型」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。