模型路由(Model Router)
模型路由自动选最便宜的模型
亦作、亦称:Model Router · Model Routing · AI Router · LLM Router
位于应用与多个 LLM 之间的智能调度器,根据请求复杂度、成本预算、延迟要求和质量目标,动态将每个请求路由到最合适的模型。Microsoft Foundry 将其定义为「一个经过训练的语言模型,智能地将提示实时路由到最合适的大语言模型」。
三代路由技术演进
模型路由经历了快速的技术迭代。第一代(2023-2024)是静态规则路由:基于成本阈值(如「超过 $0.01 的请求转给便宜模型」)、延迟阈值(如「超过 2 秒切换到更快模型」)或简单轮询。代表产品包括早期 OpenRouter 和 LiteLLM。
第二代(2024-2025)引入内容感知:路由器对请求做分类(代码生成、文本摘要、翻译、对话),然后按类别分配最适合的模型。例如,代码生成任务路由到 Claude 4 Sonnet,简单问答路由到 GPT-4o-mini。
第三代(2025-2026)是学习型路由:训练一个小型分类模型(通常 100M-1B 参数),输入请求特征,输出每个候选模型的预测质量分数和成本,选择帕累托最优解。Microsoft Foundry Model Router 和 Not Diamond 是这一代的代表。
路由模式与最佳实践
常见的路由模式包括:
- 级联路由(Cascade)——先尝试便宜模型,如果置信度低于阈值则升级到更强模型,适合客服场景(80% 问题用轻量模型解决)
- 并行路由(Parallel)——同一请求发给多个模型,取最优结果,适合高风险场景(医疗、法律)
- 粘性路由(Sticky)——同一用户/会话固定使用同一模型,保证一致性,适合长期对话场景
- A/B 路由——按比例分流到不同模型,用于持续评估新模型。最佳实践:始终设置 fallback(当主模型不可用时自动切换);监控路由决策的分布(避免 90% 请求都路由到最贵模型);定期用最新评测数据更新路由策略
2026 年主要产品对比
主要模型路由产品对比:
- Microsoft Foundry Model Router——内置于 Azure AI Foundry,支持 Balanced/Cost/Quality 三种模式,自动路由到 Azure 上部署的 OpenAI/Meta/Mistral 模型
- OpenRouter——统一 API 访问 200+ LLM,支持按价格、速度、质量排序,社区驱动
- LiteLLM——开源代理,支持 100+ 模型格式转换(OpenAI/Anthropic/Bedrock/Vertex),可自托管
- Vercel AI Gateway——面向前端开发者,支持条件路由和 A/B 测试,原生集成 AI SDK
- Not Diamond——ML 驱动的智能路由,自动学习最优分配策略,支持持续评估。选择建议:企业级选 Microsoft Foundry 或 Vercel AI Gateway(合规和支持);初创团队选 OpenRouter 或 LiteLLM(快速集成和低成本)
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「自动选最便宜的模型」
- 「智能分配请求到不同模型」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级系统设计高频查看详解 →
当企业AI支出失控时,如何设计一个AI成本优化网关,实现按任务自动路由到最优性价比模型?
2026年7月,Claude Fable 5($15/M输入)、GPT-5.6 Sol($12/M输入)、Grok 4.5($8/M输入)三款旗舰模型per-task成本差异达1.5-2倍。Uber在2026年前四个月烧光全年AI预算的教训表明:企业AI支出失控不是技术问题,是架构问题。设计一个AI成本优化网关,根据任务复杂度、质量要求和成本约束自动路由到最优模型,成为企业AI基础设施的刚需。
- 高级系统设计高频查看详解 →
如何设计一个支持多档位模型的统一 API 网关?以 GPT-5.6 Sol/Terra/Luna 为例
GPT-5.6引入Sol/Terra/Luna三级定价,要求API网关根据任务复杂度自动选择档位。考察点:路由策略、成本控制、降级机制、统一接口抽象。
- 高级系统设计高频查看详解 →
GPT-5.6 三模型(Sol/Terra/Luna)发布后,如何设计一个能根据任务特征自动选择最优模型的路由系统?
GPT-5.6 的 Sol/Terra/Luna 三模型矩阵标志着"一个模型打天下"时代结束。设计一个能根据任务特征自动选择最优模型的路由系统,成为企业 AI 基础设施的核心能力。
- 高级系统设计高频查看详解 →
如何设计企业级 AI Token 预算管理与模型路由系统?
按"质量-成本-延迟"三角,用分级预算上限+轻量分类器路由+语义缓存+流式降感知延迟,守住质量底线的同时大幅降本。
外部参考
维基百科:查看「模型路由」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
