AMD 发布 Instinct MI455X:首款机架级 AI GPU,CDNA5 架构 + Helios 整机柜方案
据 Chips and Cheese 报道,AMD 在 Advancing AI 活动上发布 Instinct MI455X,取代 MI355X 成为其 AI 产品线新旗舰。这是 AMD 首款面向机架级(rack-scale)部署设计的 GPU,基于全新 CDNA5 架构,并配套 Helios 整机柜方案,单 pod 可扩展至 72 颗 GPU(上一代为 8 颗),采用基于 UALink over Ethernet 的容错 scale-up 网络。
AMD Instinct MI455X:从单卡到机架级的范式跃迁
据 Chips and Cheese 在 AMD Advancing AI 活动上的报道,AMD 正式发布 Instinct MI455X,取代 MI355X 登顶其 AI 产品栈。
核心规格
| 维度 | 说明 |
|---|---|
| 架构 | 全新 CDNA5 |
| 定位 | AMD 首款机架级(rack-scale)AI GPU |
| 配套方案 | Helios 整机柜 |
| 单 pod 扩展 | 72 颗 GPU(上一代 MI355X 为 8 颗) |
| scale-up 网络 | 基于 UALink over Ethernet(UAEoL) 的容错网络 |
| 封装 | TSMC CoWoS-L |
| 内部结构 | 256 个 WGP,跨 8 个 XCD |
机架级意味着什么
- 竞争单位从「单颗 GPU」升级为「整个机架」
- Helios 实现机架内单跳全互联(all-to-all)
- 容错 scale-up 网络提升大规模集群可靠性
对标英伟达
- 正面回应 NVLink / NVL72 建立的整机柜壁垒
- 用「开放网络标准(UALink/以太网)+ 整机柜」组合拳出击
- 瞄准超大规模 AI 训练集群市场
核心判断
- 万亿参数时代,瓶颈从单卡算力转向集群协同效率
- 内存容量/带宽与互联网络成为机架级 GPU 的关键
- AMD 试图以开放标准撼动英伟达在超大规模集群的统治
AI Master 解读
核心事件
AMD 发布 Instinct MI455X,首款机架级 AI GPU,基于 CDNA5 架构并配套 Helios 整机柜方案,单 pod 扩展至 72 GPU。
行业影响
MI455X 最大的转变不在单卡性能,而在「尺度」——AMD 第一次把竞争单位从「单颗 GPU」提升到「整个机架」。Helios 方案把单 pod 的 GPU 数量从上一代的 8 颗直接拉到 72 颗,并采用基于 UALink over Ethernet(UAEoL)的容错 scale-up 网络,实现机架内单跳全互联。这正面回应了英伟达 NVLink/NVL72 建立的整机柜壁垒:在万亿参数模型训练时代,单卡算力再强也不够,真正的瓶颈是「如何把成百上千颗芯片像一颗芯片一样协同」。CDNA5 架构在计算单元和 SoC 层面的大改、更大的内存容量与带宽、以及 TSMC CoWoS-L 封装,都是为了支撑这种机架级协同。AMD 正试图用「开放网络标准(UALink/以太网)+ 整机柜方案」组合拳,撼动英伟达在超大规模 AI 集群的统治地位。
AI Master 建议
关注 AI 算力竞争从「单卡」转向「机架/集群级」的范式迁移;评估 UALink over Ethernet 等开放互联标准对打破供应商锁定的意义;超大规模训练选型应将整机柜的网络、容错与扩展性纳入核心考量。
