Expert Parallelism(专家并行)
Expert ParallelismMoE 模型跨 GPU 分发专家的通信策略
亦作、亦称:专家并行 · Expert Parallelism · EP · MoE 专家并行
Expert Parallelism(EP)是 MoE 模型将不同专家分布到不同 GPU 的并行策略。MoonEP 库提供完美平衡的通信优化,是 Kimi K3 训练配套基础设施。
核心
见 glossary.ts 同名条目。Expert Parallelism 是 MoE 训练的关键通信优化,MoonEP 提供完美平衡的专家并行通信库。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「MoE 模型跨 GPU 分发专家的通信策略」
- 「让 MoE 训练不卡在通信上」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
在 MoE 模型的大规模部署中,Expert Parallelism 面临哪些工程挑战?请从负载均衡、通信开销、故障恢复三个维度分析。
Expert Parallelism 把 MoE 专家分布到多 GPU 以突破单卡显存上限,但 Top-K 路由导致负载不均、All-to-All 通信跨节点成为瓶颈、Expert 级 checkpoint 与弹性恢复比 Dense 模型更复杂。
- 初级系统设计查看详解 →
如何处理系统设计面试题?
先澄清功能与非功能需求并估算 QPS/存储;再给高层架构;然后深入关键路径(数据模型、缓存、一致性);全程沟通 trade-off 与扩展方案。
- 高级系统设计查看详解 →
生产 RAG 系统中如何选择 Reranker 架构?延迟-成本-精度三角如何权衡?
Reranker 选型不是「精度越高越好」,而是在延迟-成本-精度三角里按 SLA 约束做分级决策:Cross-Encoder 精度高但延迟 50-200ms、成本约 $0.0002-0.002/query;ColBERT 延迟低(10-30ms)但要专用索引(10-50× bi-encoder);LLM-as-Reranker 零样本强但延迟 1-5s、成本 $0.05-0.15/query。三层决策框架:简单 FAQ 跳过 rerank、中等复杂度用 cross-encoder、高难度推理用 LLM-as-Reranker + 级联过滤。
- 高级系统设计查看详解 →
当 RAG 系统从单次检索演进为 Agentic 多轮循环时,如何设计控制循环避免不收敛、评估器漂移和上下文爆炸?
Agentic RAG 把固定流水线升级为多轮「检索-评估-反思」循环,但生产环境必须解决三类失败模式:循环不收敛(无限重试)、评估器漂移(误判质量)、上下文爆炸(Token 超限)。工程治理方案包括:最大轮数+提前终止条件、评估器校准+滑动窗口阈值、分层上下文预算(摘要/片段/历史三级压缩)。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Expert Parallelism」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
