LPU(语言处理单元)

LPU

Groq 造的那个超快推理芯片

亦作、亦称:语言处理单元 · Language Processing Unit · Groq LPU · Tensor Streaming Processor · TSP

LPU(Language Processing Unit,语言处理单元)是 Groq 公司开发的 AI 推理加速器 ASIC,最初称为张量流处理器(Tensor Streaming Processor, TSP),2023 年 ChatGPT 爆发后更名为 LPU。其核心创新是「功能切片微架构」——内存单元与向量/矩阵计算单元交替排列,利用数据流局部性实现确定性低延迟推理,Llama 2 70B 推理速度可达 300 tokens/s 以上。

功能切片微架构

LPU 的核心创新是功能切片微架构(Functionally Sliced Microarchitecture)。传统 AI 加速器将计算单元和内存单元分开——计算单元需要通过网络或总线访问内存,形成所谓的「内存墙」。

LPU 将内存单元与向量/矩阵计算单元交替排列在同一芯片上,数据在计算单元之间像流水线一样流动。这种设计充分利用了 AI 计算图中的数据流局部性(Dataflow Locality),使每次计算都能以最低延迟获取所需数据。

LPU 不使用 HBM,而是依赖片上 SRAM——虽然容量较小(每颗约 230MB),但访问速度极快且确定性高。对于大参数模型,需要将模型分布到多颗 LPU 上协同工作。

推理性能与优势

LPU 在推理延迟方面具有显著优势。由于片上 SRAM 的访问速度远超 HBM,且功能切片架构消除了内存访问的不确定性,LPU 的推理延迟极低且高度可预测。在 Llama 2 70B 推理测试中,Groq 系统达到 300+ tokens/s 的速度——远超同等 GPU 方案。

这种超低延迟对实时对话、代码补全等场景尤为重要。但 LPU 的局限性在于片上 SRAM 容量有限,大模型需要分布在多颗 LPU 上,系统复杂度和成本随模型规模增长较快。

Nvidia 收购与行业影响

2025 年 12 月,Nvidia 和 Groq 宣布一项约 200 亿美元的协议,Nvidia 将授权 Groq 的 AI 推理技术并接收数名高级 Groq 高管。这笔交易标志着 LPU 架构的价值得到了行业龙头的认可,也反映了 Nvidia 在推理市场面临的竞争压力。

LPU 的数据流设计理念正在影响整个 AI 芯片行业——Google TPU 的脉动阵列、Cerebras 的晶圆级架构、以及 Groq 的功能切片架构,都在探索如何突破传统 GPU 的 SIMT 架构限制,为 AI 推理提供更高效的硬件方案。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「Groq 造的那个超快推理芯片」
  • 「比 GPU 快十倍的 AI 芯片」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

外部参考

维基百科:查看「LPU」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。