Hot Chips 2026 Day 2:NVIDIA Vera Rubin NVL72 架构详解,30x 吞吐量/兆瓦提升
NVIDIA 在 Hot Chips 2026 Day 2(8 月 25 日)详解 Vera Rubin NVL72 架构。SemiAnalysis AgentX 工作负载实测显示,Vera Rubin NVL72 在 agentic 工作负载上每兆瓦吞吐量比 GB300 NVL72 高 30x。架构涵盖七芯片平台(Vera CPU、Rubin GPU、BlueField-4、Spectrum-6、Groq LPU、NVLink 6 Switch、ConnectX-9),支持 NVFP4 自适应稀疏、分布式 KV 缓存和 45°C 液冷无风扇计算托盘。
NVIDIA Vera Rubin NVL72 架构详解
2026 年 8 月 26 日,NVIDIA 在 Hot Chips 2026 Day 2(8 月 25 日)详解 Vera Rubin NVL72 架构。
事件与背景
Hot Chips 是半导体行业顶级技术会议。NVIDIA 此次详解 Vera Rubin NVL72 全栈 AI 工厂平台,首次公开系统级性能数据。SemiAnalysis 使用 AgentX 工作负载实测显示,Vera Rubin NVL72 在 agentic 工作负载上每兆瓦吞吐量比 GB300 NVL72 高 30x。
核心性能数据
| 指标 | 数据 |
|---|---|
| 吞吐量/兆瓦 | 比 GB300 NVL72 高 30x(SemiAnalysis AgentX) |
| 平台规模 | 七芯片、五机架 |
| 推理精度 | NVFP4(4-bit) |
| 液冷温度 | 45°C(无冷水机) |
| 计算托盘 | 无风扇、无电缆、热插拔 |
七芯片平台
Vera Rubin 是全栈 AI 工厂平台,包含:
- Vera CPU:工具调用和子代理调度
- Rubin GPU:第五代 Tensor Core + 第三代 Transformer Engine
- BlueField-4 DPU:AI 工厂操作系统
- Spectrum-6 SPX:AI 优化网络
- Groq 3 LPU:超快 token 生成
- NVLink 6 Switch:3.6 TB/s GPU 互联
- ConnectX-9 SuperNIC:1.6T 网络
关键技术突破
自适应稀疏(Adaptive Sparsity)
- 2:4 稀疏格式,比 NVFP4 更通用
- 适用于 QKV、注意力投影和 MLP 层
- 无需模型修改或微调,运行时标志启用
- 稀疏注意力路径使 SoftMax 和 BMM2 快 2x
分布式推理优化
- NVLink 6 提供 3.6 TB/s 全对全带宽
- 比以太网替代方案延迟低 10x
- 支持大规模专家并行和分布式 KV 缓存
散热与功率
- 45°C 液冷,无需冷水机
- 功率平滑减少 13% 峰值功耗
- 相同功率预算下可多部署 40% GPU
影响分析
| 维度 | 影响 |
|---|---|
| AI 工厂效率 | 30x 吞吐量/兆瓦改变 TCO 计算 |
| Agentic AI | 专为长上下文、工具调用优化 |
| 散热设计 | 45°C 液冷简化设施 |
| 平台完整性 | 七芯片全栈集成 |
| 竞争格局 | 与 AMD Helios 形成差异化 |
风险边界与后续观察
- 实际部署:30x 数据基于 SemiAnalysis 工作负载,实际场景需验证
- 供应链:七芯片平台的制造复杂度
- 成本:全栈平台的初始投资
- 软件生态:需要适配新架构特性
AI Master 解读
核心事件
NVIDIA 在 Hot Chips 2026 Day 2 详解 Vera Rubin NVL72 全栈架构。
行业影响
为什么重要: 这是 NVIDIA 首次公开 Vera Rubin 平台的完整系统级性能数据。30x 吞吐量/兆瓦的提升意味着相同能源预算下可完成 30 倍更多 agentic 工作,对电力受限的 AI 工厂具有决定性意义。
影响分析:
| 维度 | 影响 |
|---|---|
| AI 工厂效率 | 30x 吞吐量/兆瓦改变 TCO 计算 |
| Agentic AI | 专为长上下文、工具调用优化 |
| 散热设计 | 45°C 液冷无需冷水机 |
| 平台完整性 | 七芯片全栈集成 |
AI Master 建议
关注 Vera Rubin NVL72 的实际部署案例和与 GB300 的 TCO 对比。Agentic AI 工作负载的系统级优化比单芯片性能更重要。 **来源:** NVIDIA Blog / ServeTheHome **链接:** https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/
