Ironwood(Google TPU v7)
IronwoodGoogle 最新的 TPU
亦作、亦称:Google TPU v7 · TPU v7 · TPU7x · Google Ironwood
Ironwood 是 Google 第七代张量处理单元(TPU),2025 年 11 月达到通用可用性,是 Google 首款明确定位为「推理优先」的 TPU 芯片,基于台积电 N3E 工艺,每颗芯片 4.6 petaFLOPS,9216 颗芯片组成的超级 Pod 可达 42.5 exaFLOPS,配备 192GB HBM3E,使用光学电路交换技术实现超大规模互连。
架构设计
Ironwood 每颗芯片集成两个 TensorCore 和四个 SparseCore。
TensorCore 负责高密度矩阵乘法运算(INT8/FP8/FP16),是推理计算的主力;SparseCore 处理稀疏计算任务如嵌入查找(Embedding Lookup),这在推荐系统和大语言模型的词表映射中至关重要。
192GB HBM3E 提供约 4.8 TB/s 的内存带宽,足以支撑大参数模型的推理需求。
光学电路交换互连是 Ironwood 区别于竞品的核心优势——相比 NVIDIA NVLink/NVSwitch 的电信号互连,光学互连具有更低延迟、更高带宽和更远距离的优势,使 9216 颗芯片能像一个巨大的处理器一样协同工作。
市场地位与竞争格局
Google 是唯一同时拥有世界级 AI 芯片(TPU)和顶级 AI 模型(Gemini)的公司,实现了「TPU + Gemini + Google Cloud」三位一体的全栈整合。
Anthropic 已承诺部署多达 100 万颗 TPU 芯片(超过 1GW 算力)用于训练未来 Claude 模型,据媒体报道 Meta 也在就 2027 年起采购数十亿美元 Google AI 芯片进行谈判。
这意味着 Ironwood 不仅服务 Google 内部需求,还正在成为外部客户的重要算力供应商。在推理芯片市场,Ironwood 的主要竞争者包括 NVIDIA Blackwell 系列、Amazon Trainium 3、OpenAI Jalapeno 和 Groq LPU。
TPU 家族演进史
TPU 的历史可追溯到 2013 年 Google 招募 Amir Salek 建立定制芯片开发团队。2015 年第一代 TPU 投入使用(推理用),2017 年 TPU v2 成为业界首款量产深度学习训练芯片,此后每代都在训练和推理性能上大幅提升。
v3 引入液冷,v4 大幅提升互连带宽,v5e 优化成本效率,v6e(Trillium)进一步提升性能。2026 年的 Ironwood(v7)是首款推理优先设计。
Jonathan Ross——TPU 原始设计团队成员之一——后来创立了 Groq,其 LPU 架构在某种程度上是 TPU 数据流理念的延伸。Google 的 TPU 编程基于 JAX/MaxText 框架,与主流 CUDA 生态不兼容,迁移成本约 2-8 周工程量。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「Google 最新的 TPU」
- 「第七代张量处理单元」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
外部参考
维基百科:查看「Ironwood」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
