Mixture of Experts(MoE,混合专家)

Mixture of Experts

很多小模型拼一个大模型

亦作、亦称:MoE,混合专家 · MoE · 混合专家模型 · Mixture of Experts

一种机器学习架构技术,将模型分为多个专家网络(Expert Networks),通过门控网络(Gating Network)动态选择最相关的专家处理输入,实现大规模参数空间与低推理成本的平衡。维基百科将其定义为「多个专家网络分工协作、由门控函数动态选择的机器学习技术」。

技术架构

MoE 的架构由三个核心组件构成。

(1) 专家网络(Expert Networks):多个独立的子网络,每个专家专注于处理特定类型的输入或任务。在 Transformer 架构中,专家通常位于 FFN(Feed-Forward Network)层,每个专家是一个独立的 FFN。

(2) 门控网络(Gating Network):根据输入动态决定激活哪些专家。典型的门控机制是 Top-K 选择——对每个输入,门控网络计算所有专家的得分,选择得分最高的 K 个专家。Mixtral 8x7B 采用 Top-2 门控(8 个专家中选 2 个)。

(3) 负载均衡机制(Load Balancing):确保所有专家被均匀使用。如果某些专家被过度使用(热门专家),而其他专家闲置(冷门专家),模型效率会下降。MoE 训练时通常加入负载均衡损失(Load Balancing Loss),惩罚专家使用不均匀的情况。

发展历程

MoE 的发展可分为三个阶段。

(1) 理论奠基(1991-2016):1991 年 Jacobs 等人提出「Adaptive Mixtures of Local Experts」,奠定 MoE 理论基础。2016 年 Google 的「Outrageously Large Neural Networks」首次将 MoE 扩展到深度神经网络,提出稀疏混合专家(Sparsely-Gated MoE)架构。

(2) 大模型时代(2021-2023):2021 年 Google 的 Switch Transformer 将 MoE 扩展到 1.6T 参数模型。2022 年 DeepMind 的 GShard 在翻译任务上验证 MoE 的有效性。2023 年 Mistral AI 发布 Mixtral 8x7B,首个开源高质量 MoE 模型,8 个专家各 7B 参数,每次激活 2 个专家,性能接近 Llama 2 70B 但推理成本仅为其 1/6。

(3) 工业化部署(2024-2026):2024 年 GPT-4 估计采用 8×220B 参数的 MoE 架构。2026 年,GLM-5.2(744B 总参数,40B 激活)、MiniMax M3(428B 总参数,23B 激活)均采用 MoE 架构。MoE 已成为大模型的标准范式。

2026 年产业实践

2026 年,MoE 已成为大语言模型的主流架构。

代表模型GLM-5.2(智谱 AI,744B 总参数,40B 激活,100 万 Token 上下文);MiniMax M3(428B 总参数,23B 激活,编程能力超越海外主流模型);GPT-5.6 系列(OpenAI,估计采用 MoE 架构);Mixtral 8x22B(Mistral AI,8 个专家各 22B 参数)。

推理优化:MoE 的推理成本由激活参数量决定,而非总参数量。GLM-5.2 的 744B 总参数模型,每次推理仅激活 40B 参数,推理成本接近 40B 密集模型。这使得端侧部署成为可能——iPhone 17 Pro 的统一内存为 12GB,可运行 23B 激活参数的 MoE 模型。

训练挑战:MoE 的训练比密集模型更复杂,需要解决负载均衡、专家坍塌(Expert Collapse,某些专家完全不被使用)、通信开销(分布式训练中专家间的通信)等问题。NVIDIA Megatron-LM 和 DeepSpeed 提供了 MoE 训练的标准化框架。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「很多小模型拼一个大模型」
  • 「大模型圈高频词」
  • 「跟 MoE 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    Mixture of Experts(MoE)(二):大模型的稀疏化架构

    深入解析 Mixture of Experts 架构的设计原理、路由机制、训练挑战,以及 Mixtral、DeepSeek-V3、Kimi K2、Llama 4 等前沿模型中的工程实践

  2. 2

    注意力机制与 Transformer 架构

    详解 Self-Attention、Multi-Head Attention 和 Transformer 的编码器-解码器结构

外部参考

维基百科:查看「Mixture of Experts」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。