Disaggregated Inference(分离式推理)
Disaggregated Inference把 prefill 和 decode 分到不同硬件
亦作、亦称:分离式推理 · Disaggregated Inference · Prefill-Decode Separation
Disaggregated Inference 将 prefill 与 decode 分到不同硬件执行——AI 推理从单一加速器走向结构性分裂(poolId P-312)。
核心
Prefill 是计算密集型,Decode 是内存密集型+延迟敏感型。分离后 prefill 用高 FLOPS 硬件,decode 用高带宽低延迟硬件。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「把 prefill 和 decode 分到不同硬件」
- 「推理硬件的结构性分裂」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级系统设计查看详解 →
解释 Disaggregated Inference 的 prefill/decode 分离原理及硬件选型权衡
Disaggregated Inference 将 LLM 推理的 prefill(计算密集型)和 decode(内存密集型+延迟敏感型)分配到不同硬件。Prefill 用高 FLOPS 硬件(GPU/LPU),decode 用高带宽低延迟硬件(HBM/LPU)。OLIX DX-1 $312M B 轮验证专用 decode 芯片商业可行性。
- 初级系统设计查看详解 →
如何处理系统设计面试题?
先澄清功能与非功能需求并估算 QPS/存储;再给高层架构;然后深入关键路径(数据模型、缓存、一致性);全程沟通 trade-off 与扩展方案。
- 中级系统设计查看详解 →
比较 Vector RAG 和 GraphRAG 的适用场景,给出选型决策树
GraphRAG 使用图结构(知识图谱/实体关系图)替代纯向量检索。ICLR 2026 基准验证:多跳推理、实体关系查询场景 GraphRAG 优于 Vector RAG,简单语义相似度场景 Vector RAG 更优。选型判据:数据是否有明确的实体关系结构、是否需要多跳推理。
- 中级概念查看详解 →
JetBrains KotlinLLM 的 Smart Macros 如何把「运行时 LLM 调用」变成「一次性代码生成」?适用与不适用的边界在哪?
KotlinLLM(2026-07-28 开源,Apache 2.0)用 Smart macros 把 LLM 从永久服务依赖重定位为一次性编译器:首次遇到新场景时生成 Kotlin 源码、持久化落盘、JDI 热重载,之后同场景执行纯 Kotlin,零模型调用。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
Disaggregated Inference:AI 推理硬件的预填充与解码分离革命
2026 年 7-8 月,AI 推理基础设施正经历一场结构性分化:Disaggregated Inference(分离式推理)从学术概念走向产业主流。其核心思想是将推理的两个物理阶段——计算密集的预填充(prefill)和延迟敏感的解码(decode)——分配到不同类型的硬件上执行。NVIDIA 将 GPU 与 LPU 配对,AMD 与 Cerebras 结合高吞吐系统与晶圆级解码,Intel 聚焦编排层,而初创公司 OLIX 以 $312M B 轮融资押注专用 decode 芯片 DX-1。本文从架构原理、硬件选型权衡、产业格局、对中国 AI 基础设施的启示四个维度系统分析这场推理革命。
- 2
企业级 LLM 推理基础设施架构:从 Netflix 自研实践到推理系统设计原则
当企业从'调用第三方 API'走向'自研推理服务',一套企业级 LLM 推理基础设施就成了核心竞争力。本文以 Netflix 公开披露的自研 LLM 推理服务为切入点,系统讲解企业级推理基础设施的分层架构、核心技术(连续批处理、KV Cache、推测解码)、容量规划与成本优化,以及自建 vs 托管的决策框架。
外部参考
维基百科:查看「Disaggregated Inference」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
