Prefill-Decode Disaggregation(PD 分离)

Prefill-Decode Disaggregation

把推理的两个阶段拆到不同 GPU

亦作、亦称:PD 分离 · PD Disaggregation · Prefill-Decode Separation · 推理阶段分离 · DistServe · Disaggregated Inference

Prefill-Decode Disaggregation(PD 分离)将 LLM 推理的预填充(Prefill,计算密集)与解码(Decode,带宽密集)拆到不同 GPU 集群,减少两阶段互相干扰,DistServe(OSDI'24)首次系统验证可显著提升吞吐与 SLO 达成率。

动机

混合部署时 Prefill 与 Decode 争用算力与带宽,导致 TTFT 与 TPOT 无法同时最优。分离后可按阶段选配 A100/H100 等不同硬件画像。

工程挑战

需解决速率匹配、KV 跨节点传输、缓存路由与弹性伸缩。NVIDIA MLSys 2026 指出四项齐备才有 TCO 收益,否则可能不如统一调度。

生态采纳

2026 年 vLLM、SGLang、NVIDIA Dynamo、Ray Serve LLM 等均支持 PD 分离;Meta 等报告生产环境 15–25% TCO 降幅(视负载而定)。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「把推理的两个阶段拆到不同 GPU」
  • 「2026 年大规模推理部署的标准架构」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    LLM 推理优化 2026:从 Prefill-Decode 分离到投机解码的全栈技术指南

    2026 年,LLM 推理优化已经从单一的模型量化发展为涵盖架构设计、调度策略、内存管理、硬件协同的全栈工程。本文系统梳理 LLM 推理优化的完整技术图谱:Prefill-Decode 分离架构(PD Separation)、投机解码(Speculative Decoding)、PagedAttention v2、动态批处理、KV Cache 压缩、以及 vLLM/TensorRT-LLM/SGLang 三大推理引擎的深度对比与选型指南。

  2. 2

    LLM 推理服务架构 2026:从单机部署到分布式推理的完整技术体系

    2026 年,LLM 推理服务已成为 AI 基础设施的核心组件。本文系统讲解 LLM 推理服务的架构演进,从单机部署到分布式推理,深入 KV Cache 管理、PagedAttention、推测解码、量化部署等核心技术,帮助工程师构建高性能、低成本的推理服务系统。

外部参考

维基百科:查看「Prefill-Decode Disaggregation」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。