Mixture of Experts(MoE,混合专家)
Mixture of Experts很多小模型拼一个大模型
亦作、亦称:MoE,混合专家 · MoE · 混合专家模型 · Mixture of Experts
一种机器学习架构技术,将模型分为多个专家网络(Expert Networks),通过门控网络(Gating Network)动态选择最相关的专家处理输入,实现大规模参数空间与低推理成本的平衡。维基百科将其定义为「多个专家网络分工协作、由门控函数动态选择的机器学习技术」。
技术架构
MoE 的架构由三个核心组件构成。
(1) 专家网络(Expert Networks):多个独立的子网络,每个专家专注于处理特定类型的输入或任务。在 Transformer 架构中,专家通常位于 FFN(Feed-Forward Network)层,每个专家是一个独立的 FFN。
(2) 门控网络(Gating Network):根据输入动态决定激活哪些专家。典型的门控机制是 Top-K 选择——对每个输入,门控网络计算所有专家的得分,选择得分最高的 K 个专家。Mixtral 8x7B 采用 Top-2 门控(8 个专家中选 2 个)。
(3) 负载均衡机制(Load Balancing):确保所有专家被均匀使用。如果某些专家被过度使用(热门专家),而其他专家闲置(冷门专家),模型效率会下降。MoE 训练时通常加入负载均衡损失(Load Balancing Loss),惩罚专家使用不均匀的情况。
发展历程
MoE 的发展可分为三个阶段。
(1) 理论奠基(1991-2016):1991 年 Jacobs 等人提出「Adaptive Mixtures of Local Experts」,奠定 MoE 理论基础。2016 年 Google 的「Outrageously Large Neural Networks」首次将 MoE 扩展到深度神经网络,提出稀疏混合专家(Sparsely-Gated MoE)架构。
(2) 大模型时代(2021-2023):2021 年 Google 的 Switch Transformer 将 MoE 扩展到 1.6T 参数模型。2022 年 DeepMind 的 GShard 在翻译任务上验证 MoE 的有效性。2023 年 Mistral AI 发布 Mixtral 8x7B,首个开源高质量 MoE 模型,8 个专家各 7B 参数,每次激活 2 个专家,性能接近 Llama 2 70B 但推理成本仅为其 1/6。
(3) 工业化部署(2024-2026):2024 年 GPT-4 估计采用 8×220B 参数的 MoE 架构。2026 年,GLM-5.2(744B 总参数,40B 激活)、MiniMax M3(428B 总参数,23B 激活)均采用 MoE 架构。MoE 已成为大模型的标准范式。
2026 年产业实践
2026 年,MoE 已成为大语言模型的主流架构。
代表模型:GLM-5.2(智谱 AI,744B 总参数,40B 激活,100 万 Token 上下文);MiniMax M3(428B 总参数,23B 激活,编程能力超越海外主流模型);GPT-5.6 系列(OpenAI,估计采用 MoE 架构);Mixtral 8x22B(Mistral AI,8 个专家各 22B 参数)。
推理优化:MoE 的推理成本由激活参数量决定,而非总参数量。GLM-5.2 的 744B 总参数模型,每次推理仅激活 40B 参数,推理成本接近 40B 密集模型。这使得端侧部署成为可能——iPhone 17 Pro 的统一内存为 12GB,可运行 23B 激活参数的 MoE 模型。
训练挑战:MoE 的训练比密集模型更复杂,需要解决负载均衡、专家坍塌(Expert Collapse,某些专家完全不被使用)、通信开销(分布式训练中专家间的通信)等问题。NVIDIA Megatron-LM 和 DeepSpeed 提供了 MoE 训练的标准化框架。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「很多小模型拼一个大模型」
- 「大模型圈高频词」
- 「跟 MoE 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
混合专家模型(MoE)的原理和优势是什么?
MoE 用门控网络把每个 token 路由到少数专家 FFN,稀疏激活让总参数巨大而单 token 计算量很低,兼顾容量与效率。
- 高级系统设计查看详解 →
如何设计信息流(Feed)排序系统?
Feed 排序的核心是多目标:点击/时长/互动/完播等多个预估目标用 MMOE 等共享建模,再融合成综合分排序并兼顾多样性。
- 高级概念查看详解 →
推荐多任务学习(MMoE / PLE)如何缓解任务冲突?
MMoE 用多专家 + 每任务独立门控软共享;PLE 进一步分共享专家与任务专属专家,缓解负迁移与跷跷板。
- 中级开放高频查看详解 →
分析 Kimi K3 的开源策略对全球 AI 竞争格局的影响
2026 年 7 月 Moonshot AI 发布 Kimi K3 — 2.8T 参数全球最大开源 MoE 模型,Frontend Code Arena 排名第一。其开源策略(承诺 7/27 公开权重)和中美 AI 竞争格局(Moonshot 估值 $31.5B vs OpenAI $300B)使其成为 2026 年最具地缘政治意义的 AI 发布之一。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Mixture of Experts」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
