MoE Expert Routing(专家路由)
MoE Expert Routing每个 token 自己挑几个专家来干活
亦作、亦称:专家路由 · MoE Expert Routing · Expert Routing · Top-K 路由 · token 路由
MoE Expert Routing(专家路由) 决定每个 token 走哪几个专家:门控网络打分、Top-K 选择、加权求和输出——与模型间的 Model Routing 不是一个层级,负载均衡是核心工程难点。
机制:每个 token 的一次分诊
专家路由发生在每一个 MoE 层。每个 token 经过三步:
- 打分:门控网络(通常是一个线性层)为该 token 对全部专家各算一个得分
- 选择:挑出得分最高的 Top-K 个专家(Mixtral 取 K=2,Switch Transformer 取 K=1)
- 加权求和:对 K 个得分做 Softmax 归一,用归一后的权重把各专家输出加权求和
这正是 MoE「参数大、计算省」的来源:总参数包含全部专家,每个 token 却只激活其中一小部分——GLM-5.2 总参数 744B,每次推理仅激活 40B。
边界:专家路由 vs 模型路由
两个「路由」发生在完全不同的层面,容易混淆:
- MoE 专家路由(模型内):为每个 token 决定走同一个模型里的哪几个专家;由门控网络完成,随模型一起训练,部署方不可见
- 模型路由 Model Routing(模型间):为每个请求决定发给哪个模型(便宜小模型还是昂贵大模型);由成本与难度策略决定,工程团队在推理服务上配置
记忆要点:专家路由回答「这个 token 走哪部分参数」,模型路由回答「这个请求走哪个模型」。二者在本站术语表中是两个独立条目(本条与 model-routing)。
稳定性:路由震荡与专家坍塌
路由决策是离散的,训练中容易出现两种退化:
- 专家坍塌(expert collapse) :门控总选同几个专家,其余专家拿不到梯度、参数停滞,等于白训练
- 路由震荡: 相似 token 被分给不同专家,输出不一致、训练难收敛
常用工程手段:加入辅助负载均衡损失惩罚专家使用不均;引入router z-loss 167(Switch Transformer)抑制门控 logits 过大;设置专家容量(expert capacity)限制单个专家接收的 token 上限,超出的 token 丢弃或溢出。
部署:路由分布决定专家并行效率
推理时,路由分布直接变成资源分布:
- 专家并行(Expert Parallelism):不同专家放在不同 GPU 上,token 要送到目标专家所在的卡;路由不均意味着部分 GPU 排队、其余闲置
- 通信开销:跨卡 all-to-all 通信量与 token 的跨卡移动量成正比,路由越集中通信越倾斜
- 监控指标:专家利用率分布直方图,基尼系数大于 0.5 说明严重不均;部署中发现就要回查训练时的负载均衡损失权重与门控温度
因此路由不只是训练问题,也是推理成本问题。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「每个 token 自己挑几个专家来干活」
- 「同一个模型,不同 token 走不同参数」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级系统设计查看详解 →
当 LLM 上下文窗口达到 1M token 时,"Lost in the Middle" 效应对 RAG 系统设计有何影响?如何工程化缓解?
即使上下文窗口达到 1M token,"Lost in the Middle"(Liu et al. 2023)与 Context Rot(Chroma 2026)仍使模型对中间位置信息的利用率显著下降——标称容量不等于有效容量。RAG 系统不能把检索结果无脑堆叠进超长上下文,而须做检索重排(首尾优先)、分层上下文预算(工作记忆 vs 长尾知识)、分块聚合(map-reduce)与位置探针评测。本题考察候选人能否把位置偏置从论文概念转化为 RAG 工程约束。
- 高级系统设计查看详解 →
基准污染诊断:当 SWE-bench Verified 得分异常高但实际能力不匹配时,如何系统性诊断并调整评估策略?
OpenAI SWE-bench Verified 审计发现 59.4% 任务存在缺陷,前沿模型被检测到从训练数据中召回答案(adwaitx.com 2026-02 技术分析)。当模型在基准上得分异常高(如 80%+)但实际能力不匹配时,候选人需要展示三条独立诊断路径(n-gram overlap 精确重叠、embedding similarity 语义重叠、ablation study 因果归因)的交叉验证能力,以及污染确认后从「单一基准分数」转向「基准组合 + 私有评测 + 过程评估」的评估策略重构能力。本题区分「会跑 benchmark」与「理解 benchmark 为什么可信」的候选人。
- 高级概念查看详解 →
在 MoE 模型的大规模部署中,Expert Parallelism 面临哪些工程挑战?请从负载均衡、通信开销、故障恢复三个维度分析。
Expert Parallelism 把 MoE 专家分布到多 GPU 以突破单卡显存上限,但 Top-K 路由导致负载不均、All-to-All 通信跨节点成为瓶颈、Expert 级 checkpoint 与弹性恢复比 Dense 模型更复杂。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「MoE Expert Routing」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
