核心要点

  • Prefill 阶段:处理用户 prompt 转化为 KV Cache,计算密集型(大量矩阵运算),延迟容忍宽松,适合高 FLOPS 硬件

  • Decode 阶段:逐 token 生成输出,内存密集型+延迟敏感型(需读取完整 KV Cache),适合高带宽低延迟硬件

  • 分离收益:各阶段用最合适硬件,避免通用 GPU 两阶段都不最优的妥协;总成本可降 30-50%

  • 硬件阵营:NVIDIA GPU+LPU、AMD+Cerebras 晶圆级、Intel 编排层、OLIX DX-1 专用 decode 芯片

  • 选型权衡:分离增加系统复杂度(网络/编排),需评估流量规模是否足以证明架构投入

简要回答

Disaggregated InferenceLLM 推理的 prefill 和 decode 两阶段分配到不同类型硬件:prefill 用高 FLOPS 硬件(GPU/LPU),decode 用高带宽低延迟硬件(HBM/LPU)。核心原因是两阶段的物理特性截然不同——prefill 计算密集但延迟容忍宽松,decode 内存密集且延迟敏感。分离后各阶段用最合适硬件,避免通用 GPU 的妥协设计。Forbes 2026-07 将其定义为 AI 推理硬件的结构性分化。

标准回答

一、LLM 推理的两阶段物理特性

LLM 推理分两阶段:Prefill 将用户 prompt 转化为 KV Cache,需要大量矩阵运算(计算密集型),但用户此时还没看到输出所以延迟容忍宽松;Decode 逐 token 生成输出,每个 token 都需读取完整 KV Cache(内存密集型),且用户期望流式输出所以延迟极度敏感。

二、通用 GPU 的妥协困境

通用 GPU 对两阶段都不最优:高 FLOPS 设计对 decode 浪费算力,高带宽设计对 prefill 不够快。Disaggregated Inference 将两阶段分到不同硬件:prefill 用 NVIDIA H100/B200 等高 FLOPS GPU 或 Groq LPU,decode 用 OLIX DX-1 等高带宽低延迟芯片。

三、产业格局与资本验证

产业格局已形成四大阵营:NVIDIA GPU+LPU 配对、AMD+Cerebras 晶圆级解码、Intel 聚焦编排层、OLIX $312M B 轮押注专用 decode 芯片。NVIDIA+SK Hynix $500B 内存协议也服务于 decode 阶段的 HBM 需求。Gartner 2026 Cloud AI 基础设施象限进一步确认了这一分化趋势。

四、选型权衡与适用边界

分离增加系统复杂度(跨阶段网络传输、编排层开发),需评估流量规模是否足以证明架构投入。小规模场景(日均 <1 亿 token)统一 GPU 更简单;大规模推理服务(日均 10 亿+ token)分离收益显著。关键判据:流量规模、延迟 SLA、硬件运维能力。

常见误区

⚠️ 常见踩坑

误区一:认为 Disaggregated Inference 只是"用更多的 GPU"。实际是异构硬件选型,不是同构扩展——prefill 和 decode 用不同类型的硬件。

误区二:忽略编排层复杂度。分离后需要编排层管理 prefill→decode 的 KV Cache 传输,这是新的工程挑战,涉及网络带宽、序列化格式和故障恢复。

误区三:认为所有场景都适合分离。小规模推理服务(日均 <1 亿 token)分离的架构成本可能超过硬件优化收益,应先用统一 GPU 方案。

追问

追问 1OLIX DX-1 的 Token Factory 思维与传统 GPU 推理有什么本质区别?

Token Factory 思维:把数据中心视为 token 工厂,按 decode 阶段的内存带宽+低延迟特性优化硬件设计,而非通用 GPU 的 FLOPS 特性。硬件设计取舍:DX-1 专用 decode 芯片牺牲通用计算能力换取更高的内存带宽(>10TB/s)和更低的 token 生成延迟(<10ms),单位 token 成本可降 50%+。商业模式差异:传统 GPU 卖通用算力(按 FLOPS 定价),DX-1 卖专用 token 产能(按 token 吞吐量定价),更接近云服务的计量模式。

追问 2如何评估一个推理服务是否适合采用 Disaggregated Inference 架构?

流量规模判据:日均 token 量 >10 亿时分离收益显著(硬件优化收益 > 架构复杂度成本),<1 亿 token 时统一 GPU 更简单。延迟 SLA 判据:首 token 延迟 <100ms + 流式输出要求高时,分离架构可独立优化 prefill(降低首 token 延迟)和 decode(提升流式吞吐)。运维能力判据:需具备跨阶段编排(KV Cache 传输、故障恢复)和异构硬件运维能力,否则分离的运维成本可能超过硬件优化收益。

延伸学习

按主题分类的相关资源,便于系统复习