简要回答
Disaggregated Inference 将 LLM 推理的 prefill 和 decode 两阶段分配到不同类型硬件:prefill 用高 FLOPS 硬件(GPU/LPU),decode 用高带宽低延迟硬件(HBM/LPU)。核心原因是两阶段的物理特性截然不同——prefill 计算密集但延迟容忍宽松,decode 内存密集且延迟敏感。分离后各阶段用最合适硬件,避免通用 GPU 的妥协设计。Forbes 2026-07 将其定义为 AI 推理硬件的结构性分化。
标准回答
一、LLM 推理的两阶段物理特性
LLM 推理分两阶段:Prefill 将用户 prompt 转化为 KV Cache,需要大量矩阵运算(计算密集型),但用户此时还没看到输出所以延迟容忍宽松;Decode 逐 token 生成输出,每个 token 都需读取完整 KV Cache(内存密集型),且用户期望流式输出所以延迟极度敏感。
二、通用 GPU 的妥协困境
通用 GPU 对两阶段都不最优:高 FLOPS 设计对 decode 浪费算力,高带宽设计对 prefill 不够快。Disaggregated Inference 将两阶段分到不同硬件:prefill 用 NVIDIA H100/B200 等高 FLOPS GPU 或 Groq LPU,decode 用 OLIX DX-1 等高带宽低延迟芯片。
三、产业格局与资本验证
产业格局已形成四大阵营:NVIDIA GPU+LPU 配对、AMD+Cerebras 晶圆级解码、Intel 聚焦编排层、OLIX $312M B 轮押注专用 decode 芯片。NVIDIA+SK Hynix $500B 内存协议也服务于 decode 阶段的 HBM 需求。Gartner 2026 Cloud AI 基础设施象限进一步确认了这一分化趋势。
四、选型权衡与适用边界
分离增加系统复杂度(跨阶段网络传输、编排层开发),需评估流量规模是否足以证明架构投入。小规模场景(日均 <1 亿 token)统一 GPU 更简单;大规模推理服务(日均 10 亿+ token)分离收益显著。关键判据:流量规模、延迟 SLA、硬件运维能力。
常见误区
⚠️ 常见踩坑
误区一:认为 Disaggregated Inference 只是"用更多的 GPU"。实际是异构硬件选型,不是同构扩展——prefill 和 decode 用不同类型的硬件。
误区二:忽略编排层复杂度。分离后需要编排层管理 prefill→decode 的 KV Cache 传输,这是新的工程挑战,涉及网络带宽、序列化格式和故障恢复。
误区三:认为所有场景都适合分离。小规模推理服务(日均 <1 亿 token)分离的架构成本可能超过硬件优化收益,应先用统一 GPU 方案。
追问
追问 1:OLIX DX-1 的 Token Factory 思维与传统 GPU 推理有什么本质区别?
Token Factory 思维:把数据中心视为 token 工厂,按 decode 阶段的内存带宽+低延迟特性优化硬件设计,而非通用 GPU 的 FLOPS 特性。硬件设计取舍:DX-1 专用 decode 芯片牺牲通用计算能力换取更高的内存带宽(>10TB/s)和更低的 token 生成延迟(<10ms),单位 token 成本可降 50%+。商业模式差异:传统 GPU 卖通用算力(按 FLOPS 定价),DX-1 卖专用 token 产能(按 token 吞吐量定价),更接近云服务的计量模式。
追问 2:如何评估一个推理服务是否适合采用 Disaggregated Inference 架构?
流量规模判据:日均 token 量 >10 亿时分离收益显著(硬件优化收益 > 架构复杂度成本),<1 亿 token 时统一 GPU 更简单。延迟 SLA 判据:首 token 延迟 <100ms + 流式输出要求高时,分离架构可独立优化 prefill(降低首 token 延迟)和 decode(提升流式吞吐)。运维能力判据:需具备跨阶段编排(KV Cache 传输、故障恢复)和异构硬件运维能力,否则分离的运维成本可能超过硬件优化收益。
延伸学习
按主题分类的相关资源,便于系统复习
