核心要点
TPOT 的联合建模:TPOT = Prefill 计算延迟 + KV Cache 传输延迟 + Decode 单 token 延迟。分离架构下三者解耦可独立优化,但传输延迟是新瓶颈——128K 上下文 + 70B 模型的 KV Cache 可达数十 GB,100GB/s 网络下传输延迟可达数百毫秒。
约束条件的物理含义:Prefill 算力利用率 >80% 意味着 Prefill 池接近算力上限,无法通过加 GPU 降低计算延迟;Decode 内存利用率 <70% 意味着 Decode 池有内存余量,可承接更多请求或更大 KV Cache;网络带宽 100GB/s 是硬约束,传输延迟与 KV Cache 大小成正比。
调度策略三件套:(1) 请求级路由——把请求的 Prefill 阶段分配到负载最低的 Prefill 节点;(2) 动态伸缩——Prefill 与 Decode 池按各自利用率独立扩缩容;(3) KV Cache 感知调度——把长序列请求优先分配到互连近的节点对,最小化传输延迟。
TPOT 最小化的关键杠杆:在给定约束下,TPOT 的主要瓶颈是 KV Cache 传输延迟。最小化策略:(1) KV Cache 压缩/量化(如 FP8、INT4)减少传输量;(2) 请求调度感知网络拓扑,把长序列请求路由到 NVLink/InfiniBand 互连的节点对;(3) Prefill 阶段流水线化,边计算边传输(overlap compute and transfer)。
Co-located 回退判据:(1) 流量规模不足(日均 token <10 亿)——架构复杂度成本超过硬件优化收益;(2) 互连带宽受限(无 NVLink/InfiniBand)——KV 传输延迟吃掉分离收益;(3) 序列长度极短——两阶段互相干扰小,分离收益有限;(4) 运维能力不足——缺乏跨阶段编排与异构硬件运维能力。
简要回答
在给定约束下(Prefill 算力利用率 >80%、Decode 内存利用率 <70%、网络带宽 100GB/s),TPOT 的主要瓶颈是 KV Cache 传输延迟。最小化策略分三层:(1) KV Cache 压缩/量化(FP8/INT4)减少传输量;(2) 请求调度感知网络拓扑,把长序列请求路由到 NVLink/InfiniBand 互连的节点对;(3) Prefill 阶段流水线化,边计算边传输(overlap compute and transfer)。调度器需实现三件套:请求级路由(Prefill 节点负载均衡)、动态伸缩(两池独立扩缩容)、KV Cache 感知路由(最小化传输延迟)。回退到 co-located 的判据:流量规模不足(日均 token <10 亿)、互连带宽受限(无高速互连)、序列长度极短、运维能力不足。
标准回答
一、TPOT 的联合建模与瓶颈识别
PD 分离架构下 TPOT(token 间延迟)由三部分组成:Prefill 计算延迟(处理输入 prompt)、KV Cache 传输延迟(跨节点传输)、Decode 单 token 延迟(逐 token 生成)。分离的核心收益是三者解耦可独立优化,但传输延迟是新瓶颈——128K 上下文 + 70B 模型的 KV Cache 可达数十 GB,100GB/s 网络下传输延迟可达数百毫秒,直接吃掉分离收益。
给定约束条件的物理含义:Prefill 算力利用率 >80% 意味着 Prefill 池接近算力上限,无法通过加 GPU 降低计算延迟(已无余量);Decode 内存利用率 <70% 意味着 Decode 池有内存余量,可承接更多请求或更大 KV Cache;网络带宽 100GB/s 是硬约束,传输延迟与 KV Cache 大小成正比。
二、调度策略设计:三件套
调度器需实现三个核心能力:(1) 请求级路由——把请求的 Prefill 阶段分配到负载最低的 Prefill 节点,避免热点;(2) 动态伸缩——Prefill 与 Decode 池按各自利用率独立扩缩容(Prefill 看算力利用率,Decode 看内存利用率);(3) KV Cache 感知调度——调度器感知网络拓扑与传输延迟,把长序列请求优先分配到 NVLink/InfiniBand 互连的节点对,最小化传输延迟。
速率匹配是关键:Prefill 节点生成 KV Cache 的速率必须与 Decode 节点消费的速率匹配,否则要么 Decode 节点饿死(等待 KV)、要么 Prefill 节点堆积(内存溢出)。实战做法是 Decode 节点维护 KV 接收队列,调度器按队列深度动态调整 Prefill 节点的请求分配速率。
三、TPOT 最小化的关键杠杆
在给定约束下,TPOT 的主要瓶颈是 KV Cache 传输延迟(Prefill 算力已满、Decode 内存有余、网络带宽固定)。最小化策略分三层:
(1) KV Cache 压缩/量化:用 FP8 或 INT4 量化 KV Cache,传输量减少 2-4 倍,传输延迟同比下降。vLLM 在 GLM-5.2 部署中采用 NVFP4(NVIDIA FP4)量化,是 TPOT 从 40ms 降至 17ms 的关键因素之一。
(2) 网络拓扑感知调度:调度器感知节点间的互连带宽(NVLink > InfiniBand > RoCE v2 > TCP/IP),把长序列请求优先路由到高带宽节点对。短序列请求可容忍较低带宽,路由到跨机架节点。
(3) 流水线化(overlap compute and transfer):Prefill 阶段边计算边传输——计算完一层 Transformer 的 KV 后立即开始传输,同时计算下一层。传输延迟被计算延迟掩盖,TPOT 接近纯 Decode 延迟。
四、约束冲突检测与回退判据
给定约束可能存在冲突:如果 Prefill 算力利用率 >80% 且网络带宽 100GB/s 不足以支撑 KV 传输速率,TPOT 会被传输延迟主导,分离收益消失。此时应回退到 co-located 架构。
回退判据有四:(1) 流量规模不足——日均 token 量 <10 亿时,分离的架构复杂度(KV 传输、编排层、异构运维)成本超过硬件优化收益;(2) 互连带宽受限——没有 NVLink/InfiniBand 等高速互连时,KV 传输延迟吃掉分离收益;(3) 序列长度极短——短 prompt + 短输出场景两阶段互相干扰小,分离收益有限;(4) 运维能力不足——缺乏跨阶段编排与异构硬件运维能力时,分离的运维成本可能超过收益。
关键判据是流量规模、互连带宽、序列长度分布、运维成熟度四者的组合——任何一项不满足都应考虑回退。
常见误区
误区一:认为 PD 分离总是优于 co-located。分离增加架构复杂度(KV 传输、编排层、异构运维),小规模场景(日均 token <10 亿)的架构成本可能超过硬件优化收益。关键判据是流量规模与互连带宽,不是「分离一定更好」。
误区二:忽略 KV Cache 传输延迟。很多候选人只优化 Prefill 计算与 Decode 生成,忽略传输延迟是分离架构的新瓶颈。128K 上下文 + 70B 模型的 KV Cache 可达数十 GB,100GB/s 网络下传输延迟可达数百毫秒,直接吃掉分离收益。必须用 KV 压缩、拓扑感知调度、流水线化三件套应对。
误区三:认为约束条件可以独立优化。Prefill 算力利用率 >80%、Decode 内存利用率 <70%、网络带宽 100GB/s 三者相互耦合——Prefill 算力满了无法通过加 GPU 降低延迟,只能靠流水线化掩盖传输延迟;Decode 内存有余量可承接更多请求,但受限于网络带宽的传输速率。调度策略必须联合建模三者,不能单独优化。
误区四:认为速率匹配是静态配置。速率匹配是动态过程——Prefill 与 Decode 的请求到达率、序列长度分布都在变化,调度器必须实时监控两池的利用率与队列深度,动态调整请求分配速率。静态配置会导致热点或饿死。
追问
追问 1:KV Cache 压缩/量化(如 FP8、INT4)会不会影响模型精度?在什么场景下可以接受精度损失?
KV Cache 量化会引入精度损失,但损失大小取决于量化方法、模型架构与任务类型。FP8 量化:精度损失极小(<0.5%),几乎所有场景可接受,是 vLLM GLM-5.2 部署的默认选择。INT4 量化:精度损失较大(1-3%),在长文本生成、代码生成等需要高精度的任务上可能出现质量问题,但在对话、摘要等容错率高的任务上可接受。精度损失的容忍度取决于业务场景:(1) 内部工具、草稿生成可接受 INT4;(2) 面向用户的产品默认 FP8,用户反馈质量问题时回退到 FP16;(3) 高价值场景(法律、医疗、金融)必须用 FP16,不量化。实战做法是 A/B 测试:同一任务在 FP16/FP8/INT4 上跑分,质量下降 <1% 的量化档位可上线。
追问 2:如果网络带宽从 100GB/s 升级到 400GB/s(如从 InfiniBand 升级到 NVLink),调度策略需要怎么调整?收益有多大?
网络带宽升级会显著改变 TPOT 的瓶颈分布。100GB/s 下传输延迟是主要瓶颈,400GB/s 下传输延迟被压缩到接近计算延迟,瓶颈转移到 Prefill 算力与 Decode 内存。调度策略调整:(1) 网络拓扑感知调度的优先级下降——400GB/s 下跨机架与机架内的传输延迟差异缩小,调度器可更关注算力与内存的负载均衡;(2) KV Cache 压缩的必要性下降——400GB/s 下 FP16 的传输延迟已可接受,可回退到 FP16 避免精度损失;(3) 流水线化的收益下降——传输延迟被计算延迟掩盖,流水线化的边际收益缩小。收益评估:400GB/s 相比 100GB/s,TPOT 可再降 30-50%(取决于序列长度与模型维度),但收益随带宽升级边际递减——从 100GB/s 到 400GB/s 收益大,从 400GB/s 到 1TB/s 收益小。关键判据是业务对 TPOT 的 SLA 要求:如果 100GB/s 已满足 SLA,升级到 400GB/s 的 ROI 不高。
追问 3:如何监控 PD 分离架构的健康状态?哪些指标异常时应触发告警或自动回退?
PD 分离架构的监控需覆盖三个维度:Prefill 池、Decode 池、传输层。Prefill 池指标:算力利用率(GPU SM 利用率)、请求队列深度、Prefill 延迟 P50/P99。Decode 池指标:内存利用率(HBM 使用率)、KV Cache 接收队列深度、TPOT P50/P99。传输层指标:KV Cache 传输延迟 P50/P99、网络带宽利用率、传输失败率。告警阈值:(1) Prefill 算力利用率 >95% 持续 5 分钟——Prefill 池过载,需扩容或限流;(2) Decode 内存利用率 >85%——Decode 池内存不足,需扩容或驱逐低优先级 KV;(3) KV 传输延迟 P99 >200ms——传输层瓶颈,需检查网络拓扑或启用 KV 压缩;(4) 传输失败率 >1%——网络故障,需切换备用路径。自动回退:当传输延迟 P99 持续 >500ms 且 KV 压缩已启用时,调度器可自动把新请求路由到 co-located 节点(如果有混合部署),避免分离架构的传输瓶颈拖累整体 TPOT。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
