Trainium(AWS 自研 AI 芯片)
Trainium亚马逊自己造的 AI 芯片
亦作、亦称:AWS 自研 AI 芯片 · Amazon Trainium · AWS Trainium · Trn1
Trainium 是 Amazon 旗下 Annapurna Labs 开发的 AI 训练与推理加速器系列,目前已迭代至第三代。Trainium 2 驱动 Project Rainier 超级集群,已部署数十万颗;Trainium 3 基于台积电 N3P 工艺,约 1250 亿晶体管,配备 144GB HBM3E,内存带宽 4.9 TB/s,每美元吞吐量比 H100 高约 60%。
资本绑定策略
Trainium 的独特之处在于 Amazon 的资本绑定策略。Amazon 向 Anthropic 投资 80 亿美元,换来 Claude 在 Trainium 上训练的市场验证。同时 OpenAI 也宣布使用 2GW 的 AWS Trainium 算力。
这种「投资 AI 公司 → AI 公司使用自家芯片」的循环融资模式已成为行业常态——没有任何一家 AI 实验室能承受将所有赌注押在单一供应商身上。
Amazon 还通过这种方式将 Trainium 从内部使用推向外部市场,2026 年 6 月高管 Peter DeSantis 证实正在与企业洽谈直接销售自研芯片。
技术规格对比
Trainium 3 与竞品的核心规格对比:基于台积电 N3P 工艺,约 1250 亿晶体管,144GB HBM3E,内存带宽 4.9 TB/s。在 Llama 3 70B 推理测试中达到 12,000 tokens/s/芯片,每美元吞吐量比 H100 高 60%。
与 Google Ironwood 相比,Trainium 3 在单芯片内存容量上更大(144GB vs 192GB 各有优势),但 Ironwood 的系统级互连(9216 颗芯片光学互连超级 Pod)规模更大。
与 OpenAI Jalapeno 相比,Trainium 3 部署更早、生态更成熟,但 Jalapeno 在能效比上声称更优(6.8 vs 约 5 TOPS/W)。
Project Rainier 与部署规模
Project Rainier 是 AWS 基于 Trainium 2 构建的超大规模 AI 集群,被描述为世界上最大的 AI 集群之一,Amazon 在该项目上投入 110 亿美元。该集群已部署数十万颗 Trainium 2 芯片,为 Anthropic Claude 模型的训练提供算力。
Trainium 3 的部署规模预计将更大。AWS 的独特优势在于其全球基础设施——可以在多个区域快速部署 Trainium 集群,为企业提供低延迟的推理服务。98% 的 AWS 前 1000 大客户已在运行 Graviton 实例,这为 Trainium 的市场推广奠定了基础。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「亚马逊自己造的 AI 芯片」
- 「AWS 的自研加速器」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
外部参考
维基百科:查看「Trainium」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
