文章摘要
2026 年 7-8 月,AI 推理基础设施正经历一场结构性分化:Disaggregated Inference(分离式推理)从学术概念走向产业主流。其核心思想是将推理的两个物理阶段——计算密集的预填充(prefill)和延迟敏感的解码(decode)——分配到不同类型的硬件上执行。NVIDIA 将 GPU 与 LPU 配对,AMD 与 Cerebras 结合高吞吐系统与晶圆级解码,Intel 聚焦编排层,而初创公司 OLIX 以 $312M B 轮融资押注专用 decode 芯片 DX-1。本文从架构原理、硬件选型权衡、产业格局、对中国 AI 基础设施的启示四个维度系统分析这场推理革命。
1为什么 AI 推理硬件正在分裂
2026 年 7 月,Forbes 刊文《Disaggregated Inference Is Splitting AI Hardware in Two》,将一场正在发生的架构变革推到聚光灯下。 文章的核心判断是:AI 推理正在从"单一加速器处理全部流程"走向"预填充与解码分离执行"——这不是渐进式优化,而是推理硬件的结构性分裂。
为什么是现在? 答案藏在推理工作负载的物理特性里。大语言模型的推理过程分为两个截然不同的阶段:
预填充(Prefill):处理用户输入的 prompt,将其转化为 KV Cache。这个阶段是计算密集型的——需要大量矩阵运算,对算力(FLOPS)要求极高,但对延迟容忍度相对宽松。一个 10 万 token 的 prompt,预填充可能需要数秒,但用户不会因此感到卡顿,因为此时还没有开始生成响应。
解码(Decode):基于 KV Cache 逐 token 生成输出。这个阶段是内存密集型+延迟敏感型的——每个 token 的生成都需要读取完整的 KV Cache,对内存带宽(GB/s)要求极高,同时对延迟极度敏感,因为用户期望看到"流式输出"的即时反馈。
关键洞察:这两个阶段的物理瓶颈完全不同。预填充需要算力,解码需要内存带宽。用同一块硬件同时处理两个阶段,就像用一辆卡车既拉货又载人——卡车可以完成两个任务,但都不是最优解。预填充需要的是高算力 GPU(如 NVIDIA H100/B200),解码需要的是高内存带宽加速器(如 Groq LPU 或专用 decode 芯片)。
Disaggregated Inference 的核心思想:把预填充和解码分到不同的硬件上,让每块硬件专注于自己最擅长的阶段。收益是三重的:更高的硬件利用率、更低的单 token 成本、更快的用户响应时间。
来源:Forbes(Karl Freund,2026-07-29)
2两大硬件阵营:NVIDIA+LPU vs AMD+Cerebras
Forbes 文章将当前的 Disaggregated Inference 硬件格局归纳为两大阵营,外加两个独立玩家。
2.1 阵营一:NVIDIA + LPU
NVIDIA 的策略是保持 GPU 作为通用 prefill 引擎,同时与 LPU(Language Processing Unit)配对接码层。LPU 是 Groq 开发的专用推理加速器,其核心设计是高内存带宽和低延迟 token 输出。
逻辑很清晰:保留 CUDA 生态的广泛兼容性,同时把内存瓶颈问题交给专用加速器。NVIDIA 的 Dynamo 编排框架负责在 GPU 和 LPU 之间调度工作负载。
优势:
风险:
2.2 阵营二:AMD + Cerebras
AMD 与 Cerebras 的组合走的是另一条路:高吞吐系统(AMD Instinct MI300X)+ 晶圆级解码(Cerebras WSE-3)。
Cerebras 的晶圆级引擎(Wafer-Scale Engine, WSE)是一块完整的晶圆制成的单一芯片,拥有 4 万亿个晶体管和 48GB 片上内存。其设计哲学是:把整个模型放在一块芯片上,消除芯片间通信开销。在 Disaggregated Inference 架构下,Cerebras 专注于 decode 阶段——其巨大的片上内存可以容纳完整的 KV Cache,实现极高的内存带宽。
优势:
- 片上内存消除芯片间通信瓶颈
- 晶圆级内存带宽远超传统 GPU
- 适合超大模型的 decode 场景
风险:
- 晶圆级芯片制造成本高、良率挑战大
- 生态封闭,软件栈不兼容 CUDA
- 主要面向超大规模部署,中小企业难以触及
2.3 独立玩家:Intel 与 Google
Intel 的策略聚焦在编排层而非专用加速器。其 Crescent Island GPU 和 Fractile 架构更关注如何在异构硬件间高效调度推理工作负载,而非与 NVIDIA 正面竞争算力。
Google 则在内部优化 TPU 的推理性能,通过 Pathways 软件栈实现 prefill/decode 分离,但不对外销售独立硬件。
2.4 硬件阵营对比
| 维度 | NVIDIA + LPU | AMD + Cerebras | Intel | |
|---|---|---|---|---|
Prefill 硬件 | GPU (H100/B200) | Instinct MI300X | Crescent Island | TPU v5e |
Decode 硬件 | Groq LPU | Cerebras WSE-3 | Fractile | TPU v5e (内部) |
编排框架 | Dynamo | 自研 | oneAPI | Pathways |
生态兼容性 | CUDA 保留 | 不兼容 CUDA | 部分兼容 | 仅限 GCP |
适用场景 | 通用推理 | 超大模型 | 企业部署 | 内部工作负载 |
商业化程度 | 已量产 | 已量产 | 2H26 出货 | 内部使用 |
3OLIX DX-1:专用 Decode 芯片的极端赌注
2026 年 8 月 4 日,英国初创公司 OLIX 宣布完成 $312M B 轮融资,用于开发其首款 AI 芯片 DX-1——一块专门为 decode 阶段设计的专用加速器。 这是 Disaggregated Inference 理念在创业领域最激进的实践。
3.1 DX-1 的设计哲学
OLIX 的核心主张是:标准 GPU 用于 AI 推理是低效且浪费的。DX-1 的设计从第一性原理出发,专门为"生成下一个 token"这个任务优化。
具体来说,DX-1 做了三件事:
第一,重新设计数据流动路径。传统 GPU 的内存层级是为通用计算设计的,而 DX-1 采用更便宜、更快的内存方案,结合光子互联(photonics)和商用现成硬件(commodity hardware),降低系统复杂度。
第二,模型完全展开(fully unrolled)。OLIX 官方表述是:"在 OLIX 的 X-1 平台中,模型完全展开跨大量芯片,创建一条生产线,允许每块芯片专注于模型的一个部分。" 这是流水线(pipeline)思维在芯片设计中的应用——每块芯片只做一件事,整体构成一条 token 生产线。
第三,不追求通用性。DX-1 不做 prefill,不做训练,只做 decode。这种极端专注使其可以在特定任务上做到极致优化,但也意味着它必须作为分离式推理架构的一部分才能发挥作用。
3.2 融资逻辑与目标市场
$312M B 轮在 AI 芯片赛道并非天文数字,但 OLIX 的融资逻辑有其独特性:
军事与政府市场。OLIX 在公开材料中强调其系统"基于使用专用芯片处理 token 生产各阶段的信念,将解锁 AI 性能的阶跃变化"。更关键的是,DX-1 的设计简化了 AI 芯片的复杂性,使其"有望创造一种独特的方式来处理军事和政府所需的昂贵且复杂的 AI 交互"。
成本优势叙事。OLIX 的核心论点是:标准 GPU 用于推理是"低效且浪费的",而"更简单的 AI 优先芯片可以帮助降低基础设施成本"。这个叙事对面临推理成本压力的云厂商和 AI 公司有天然吸引力。
3.3 风险与挑战
OLIX 的赌注同样面临严峻挑战:
制造与良率。DX-1 的设计依赖特殊内存和光子互联,这些技术的量产成熟度存疑。
生态锁定。作为专用 decode 芯片,DX-1 必须与 prefill 硬件(如 NVIDIA GPU)配合使用,其编排接口的标准化程度决定了对客户的吸引力。
竞争格局。Groq LPU 已经在 decode 加速领域建立了先发优势,Cerebras 的晶圆级方案也在争夺超大模型 decode 市场。OLIX 需要在性能和成本上证明其差异化价值。
来源:Resilience Media(2026-08-04)
4产业信号:NVIDIA+SK Hynix $500B 内存协议与 Gartner 象限
Disaggregated Inference 的兴起,正在重塑整个 AI 基础设施产业链。两则最新进展印证了这一趋势的产业深度。
4.1 NVIDIA + SK Hynix $500B 内存协议
2026 年 8 月 3 日,Tech Insider 报道 NVIDIA 与 SK Hynix 签署价值 $500B 的内存协议,用于支持 Vera Rubin 平台在 2H26 的出货。这份协议的背景是:AI 推理(尤其是 decode 阶段)对内存带宽的需求呈指数增长,而 HBM(High Bandwidth Memory)是当前满足这一需求的关键技术。
与 Disaggregated Inference 的关联:在分离式推理架构下,decode 硬件对内存带宽的需求更为集中和极端。SK Hynix 的 HBM 供应能力,直接决定了 NVIDIA 及其合作伙伴能否规模化部署 decode 加速方案。$500B 的协议规模,反映了内存已成为 AI 推理基础设施的战略瓶颈。
4.2 Gartner 2026 Cloud AI 基础设施象限
2026 年 7 月 29 日,CRN 报道 Gartner 发布 2026 Cloud AI 基础设施象限,AWS、Google、Oracle、Microsoft 位列领导者象限,同时特别点名 Nscale、Nebius 和华为 Ascend 作为新兴挑战者。
与 Disaggregated Inference 的关联:云厂商是分离式推理架构的主要部署者。Gartner 象限的评估维度中,"推理性能"和"成本效率"权重持续上升,这迫使云厂商采纳 Disaggregated Inference 等架构创新。华为 Ascend 的入围,说明中国厂商在 AI 推理基础设施领域也在快速跟进。
4.3 Intel Crescent Island 与推理交叉点
2026 年 7 月 30 日,EE News Europe 报道 Intel 在"AI 推理交叉点"的布局:Crescent Island GPU、Fractile 架构,以及与 Hailo、Microchip 等边缘推理厂商的合作。
与 Disaggregated Inference 的关联:Intel 的策略不是正面对抗 NVIDIA 的算力优势,而是在编排层和边缘推理寻找差异化。Fractile 架构的设计目标是灵活调度异构硬件,天然适配分离式推理的编排需求。
4.4 产业格局总览
| 层级 | 关键玩家 | 核心能力 | 与 Disaggregated Inference 的关系 |
|---|---|---|---|
| 芯片设计 | NVIDIA, AMD, Intel, Groq, Cerebras, OLIX | GPU, LPU, WSE, 专用 ASIC | 提供 prefill/decode 专用硬件 |
| 内存供应 | SK Hynix, Samsung, Micron | HBM, DDR5 | 满足 decode 阶段的内存带宽需求 |
| 云部署 | AWS, Google, Azure, Oracle | 推理即服务 | 采纳分离式架构降低推理成本 |
| 编排软件 | NVIDIA Dynamo, Intel oneAPI, Google Pathways | 工作负载调度 | 管理 prefill/decode 的硬件分配 |
| 边缘推理 | Hailo, Microchip, Qualcomm | 低功耗推理 | 端侧 decode 加速 |
| 层级 | 关键玩家 | 核心能力 | 与 Disaggregated Inference 的关系 |
|---|---|---|---|
芯片设计 | NVIDIA, AMD, Intel, Groq, Cerebras, OLIX | GPU, LPU, WSE, 专用 ASIC | 提供 prefill/decode 专用硬件 |
内存供应 | SK Hynix, Samsung, Micron | HBM, DDR5 | 满足 decode 阶段的内存带宽需求 |
云部署 | AWS, Google, Azure, Oracle | 推理即服务 | 采纳分离式架构降低推理成本 |
编排软件 | NVIDIA Dynamo, Intel oneAPI, Google Pathways | 工作负载调度 | 管理 prefill/decode 的硬件分配 |
边缘推理 | Hailo, Microchip, Qualcomm | 低功耗推理 | 端侧 decode 加速 |
5硬件选型的工程权衡
Disaggregated Inference 不是免费的午餐。工程团队在采纳这一架构时,必须面对一系列权衡。
5.1 收益量化
根据 Forbes 文章和行业公开数据,分离式推理的收益可以量化为三个维度:
硬件利用率提升。传统单一硬件架构下,GPU 在 decode 阶段的利用率通常只有 30-50%(因为 decode 是内存瓶颈而非算力瓶颈)。分离后,prefill GPU 可以保持 80%+ 利用率,decode 硬件可以保持 70%+ 利用率。
单 token 成本下降。Groq 公开声称其 LPU 的 token 成本比 NVIDIA H100 低 10 倍以上(特定场景)。OLIX 的 DX-1 声称可以进一步降低这一数字。保守估计,分离式架构可以将整体推理成本降低 3-5 倍。
响应延迟降低。用户感知的"首 token 延迟"(Time to First Token, TTFT)和"token 间延迟"(Inter-Token Latency, ITL)在分离式架构下可以分别优化。Prefill 硬件专注于快速处理 prompt,decode 硬件专注于快速生成 token,两者不互相干扰。
5.2 成本与复杂度
但分离式架构也引入了新的成本和复杂度:
硬件异构性。管理两种不同类型的硬件(prefill GPU + decode 加速器),比管理单一硬件更复杂。需要专门的编排软件来调度工作负载、监控健康状态、处理故障转移。
互联开销。Prefill 硬件和 decode 硬件之间需要通过高速互联传输 KV Cache。如果互联带宽不足,会成为新的瓶颈。NVIDIA 的 NVLink、Groq 的专有互联、OLIX 的光子互联,都是为了解决这个问题。
软件栈成熟度。分离式推理的软件栈仍在快速演进。NVIDIA Dynamo 相对成熟,但其他方案(如 OLIX 的软件栈)还需要时间验证。工程团队需要评估软件栈的稳定性、可维护性和长期支持。
5.3 决策框架
下面的决策树帮助工程团队判断是否应该采纳 Disaggregated Inference:
5.4 关键权衡总结
| 维度 | 收益 | 成本 |
|---|---|---|
硬件利用率 | Prefill GPU 80%+, Decode 硬件 70%+ | 需要管理两种硬件类型 |
单 token 成本 | 降低 3-5 倍(保守估计) | 互联开销、编排软件成本 |
响应延迟 | TTFT 和 ITL 分别优化 | KV Cache 传输可能成为瓶颈 |
扩展性 | Prefill 和 Decode 可独立扩展 | 需要精确预测两者的比例 |
生态兼容性 | NVIDIA 方案保留 CUDA 生态 | 非 NVIDIA 方案可能需要重写代码 |
6对中国 AI 基础设施的启示
Disaggregated Inference 的兴起,对中国 AI 基础设施有三重启示。
6.1 华为 Ascend 的机遇与挑战
Gartner 2026 象限将华为 Ascend 列为新兴挑战者,说明中国厂商在 AI 推理硬件领域并非缺席。但在 Disaggregated Inference 架构下,华为面临的挑战是:
Prefill 侧:Ascend 910B/910C 的算力与 NVIDIA H100/B200 仍有差距,但差距在缩小。如果分离式架构成为主流,华为可以专注于提升 Ascend 的 prefill 性能,而不必在 decode 阶段与 Groq/Cerebras 正面竞争。
Decode 侧:华为是否有计划开发专用 decode 加速器?如果没有,可能需要与第三方(如 Groq)合作,或者在 Ascend 内部实现 prefill/decode 的动态切换。
编排层:华为的 CANN(Compute Architecture for Neural Networks)需要支持分离式推理的编排,这是一个软件工程挑战。
6.2 云厂商的推理成本压力
阿里云、腾讯云、百度云等中国云厂商面临与 AWS、Google 相同的推理成本压力。Disaggregated Inference 提供了一条降低推理成本的路径,但采纳这一架构需要:
硬件采购。获取 NVIDIA GPU + Groq LPU(或类似 decode 加速器)的组合,可能面临地缘政治限制。
软件栈。NVIDIA Dynamo 是否对中国云厂商开放?如果不开放,需要自研编排软件。
人才储备。分离式推理的架构设计、部署优化、故障排查,需要专门的工程能力。
6.3 初创公司的机会
OLIX 的 $312M B 轮融资说明,专用 decode 芯片在资本市场有吸引力。中国是否有类似的创业机会?
市场空间。中国 AI 推理市场正在快速增长,对低成本推理方案的需求强烈。
技术路径。光子互联、先进封装、专用 ASIC 等技术路径,中国都有研究基础。
政策支持。中国政策对 AI 芯片自主可控有强烈支持,专用 decode 芯片可能获得政策红利。
但挑战同样明显:制造良率、生态构建、与 prefill 硬件的兼容性,都是需要跨越的门槛。
7结论:推理硬件的分化时代
Disaggregated Inference 不是又一个 AI buzzword,而是推理硬件的结构性变革。 它的驱动力是物理层面的——prefill 和 decode 的不同瓶颈,决定了单一硬件无法同时最优地处理两个阶段。
7.1 核心要点回顾
架构原理:Prefill 是计算密集型,Decode 是内存密集型+延迟敏感型。分离执行可以让每块硬件专注于自己最擅长的阶段。
硬件阵营:NVIDIA+LPU 保留 CUDA 生态,AMD+Cerebras 走晶圆级路线,Intel 聚焦编排,OLIX 押注专用 decode 芯片。
产业信号:NVIDIA+SK Hynix $500B 内存协议、Gartner 象限、OLIX $312M B 轮,都指向同一方向——推理硬件正在分化。
工程权衡:收益是硬件利用率提升、成本下降、延迟降低;成本是硬件异构性、互联开销、软件栈成熟度。
中国启示:华为 Ascend 需要明确 prefill/decode 策略,云厂商需要评估采纳路径,初创公司有机会进入专用 decode 芯片赛道。
7.2 6 个月后依然可读的判断
Disaggregated Inference 的具体硬件方案会迭代(NVIDIA Vera Rubin、OLIX DX-1 量产、Cerebras 下一代 WSE),但架构分化的趋势不会逆转。原因有三:
第一,物理瓶颈不会消失。Prefill 和 decode 的不同特性,是 Transformer 架构的固有属性。除非模型架构发生根本性变革(如状态空间模型完全取代 Transformer),否则分离式推理将持续适用。
第二,成本压力不会减轻。AI 推理成本是 AI 公司最大的运营支出之一。任何能显著降低推理成本的架构创新,都会被快速采纳。
第三,产业投资已经启动。NVIDIA、AMD、Intel、OLIX 等玩家已经投入大量资源。这些投资不会轻易转向,会持续推动分离式推理的成熟。
7.3 给工程团队的行动建议
短期(3 个月内):评估自己的推理工作负载,计算 prefill 和 decode 的资源消耗比例。如果比例严重失衡(如 decode 占用 70% 资源但只产生 30% 价值),开始调研分离式推理方案。
中期(6 个月内):如果决定采纳,选择合适的硬件组合和编排框架。NVIDIA Dynamo 是目前最成熟的选择,但需要评估 Groq LPU 的可用性。对于超大规模部署,可以关注 Cerebras 和 OLIX 的进展。
长期(12 个月内):建立分离式推理的工程能力,包括架构设计、性能调优、故障排查。这一能力将成为 AI 基础设施团队的核心竞争力。
来源:Forbes · Resilience Media · CRN · EE News Europe
🎯 相关面试题
巩固本篇知识点,备战 AI 岗位面试。
- 高级系统设计查看详解 →
解释 Disaggregated Inference 的 prefill/decode 分离原理及硬件选型权衡
Disaggregated Inference 将 LLM 推理的 prefill(计算密集型)和 decode(内存密集型+延迟敏感型)分配到不同硬件。Prefill 用高 FLOPS 硬件(GPU/LPU),decode 用高带宽低延迟硬件(HBM/LPU)。OLIX DX-1 $312M B 轮验证专用 decode 芯片商业可行性。
- 中级概念查看详解 →
LLM 推理的 Prefill 与 Decode 两阶段有什么区别?
Prefill 并行处理整段 prompt、算力受限、决定首 token 延迟;Decode 逐 token 串行、访存受限、决定吐字速度。
- 高级系统设计高频查看详解 →
如何从零设计一个类 ChatGPT 的对话产品?
从对齐后的模型、低延迟推理服务、会话与上下文管理、安全护栏到评测飞轮的端到端对话产品设计。
- 中级系统设计查看详解 →
比较 Vector RAG 和 GraphRAG 的适用场景,给出选型决策树
GraphRAG 使用图结构(知识图谱/实体关系图)替代纯向量检索。ICLR 2026 基准验证:多跳推理、实体关系查询场景 GraphRAG 优于 Vector RAG,简单语义相似度场景 Vector RAG 更优。选型判据:数据是否有明确的实体关系结构、是否需要多跳推理。
