Prefill-Decode Disaggregation(PD 分离)
Prefill-Decode Disaggregation把推理的两个阶段拆到不同 GPU
亦作、亦称:PD 分离 · PD Disaggregation · Prefill-Decode Separation · 推理阶段分离 · DistServe · Disaggregated Inference
Prefill-Decode Disaggregation(PD 分离)将 LLM 推理的预填充(Prefill,计算密集)与解码(Decode,带宽密集)拆到不同 GPU 集群,减少两阶段互相干扰,DistServe(OSDI'24)首次系统验证可显著提升吞吐与 SLO 达成率。
动机
混合部署时 Prefill 与 Decode 争用算力与带宽,导致 TTFT 与 TPOT 无法同时最优。分离后可按阶段选配 A100/H100 等不同硬件画像。
工程挑战
需解决速率匹配、KV 跨节点传输、缓存路由与弹性伸缩。NVIDIA MLSys 2026 指出四项齐备才有 TCO 收益,否则可能不如统一调度。
生态采纳
2026 年 vLLM、SGLang、NVIDIA Dynamo、Ray Serve LLM 等均支持 PD 分离;Meta 等报告生产环境 15–25% TCO 降幅(视负载而定)。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「把推理的两个阶段拆到不同 GPU」
- 「2026 年大规模推理部署的标准架构」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
MLOps 生命周期包含哪些关键阶段?
MLOps 生命周期:问题定义 → 数据工程 → 实验/训练 → 评估验证 → 部署 → 监控 → (触发)再训练,形成持续改进闭环。
- 高级概念查看详解 →
实验追踪在 MLOps 中有何意义?
实验跟踪系统化记录每次训练的参数、指标、代码版本与产出 artifact,是可复现、对比与协作的基础,避免「记不清哪组参数最好」。
- 高级概念查看详解 →
MLOps 中的环境可复现性是什么?有哪些挑战?
环境可复现要求依赖、系统库、CUDA、随机种子与硬件行为被锁定;挑战来自「在我机器上能跑」、隐式依赖与 GPU 非确定性。
- 中级概念查看详解 →
容器化与虚拟化如何支撑 MLOps 实践?
容器(Docker)打包 ML 依赖与代码为可移植镜像;Kubernetes 编排调度、扩缩容与 GPU 共享,实现环境一致与弹性 serving。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
LLM 推理优化 2026:从 Prefill-Decode 分离到投机解码的全栈技术指南
2026 年,LLM 推理优化已经从单一的模型量化发展为涵盖架构设计、调度策略、内存管理、硬件协同的全栈工程。本文系统梳理 LLM 推理优化的完整技术图谱:Prefill-Decode 分离架构(PD Separation)、投机解码(Speculative Decoding)、PagedAttention v2、动态批处理、KV Cache 压缩、以及 vLLM/TensorRT-LLM/SGLang 三大推理引擎的深度对比与选型指南。
- 2
LLM 推理服务架构 2026:从单机部署到分布式推理的完整技术体系
2026 年,LLM 推理服务已成为 AI 基础设施的核心组件。本文系统讲解 LLM 推理服务的架构演进,从单机部署到分布式推理,深入 KV Cache 管理、PagedAttention、推测解码、量化部署等核心技术,帮助工程师构建高性能、低成本的推理服务系统。
外部参考
维基百科:查看「Prefill-Decode Disaggregation」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
