NVIDIA Groq 3 LPX 正式量产
2026 年 8 月 24 日,NVIDIA 在 Hot Chips 2026 宣布。
事件背景
NVIDIA Groq 3 LPX 是专为 agentic AI 推理优化的加速器,扩展 Vera Rubin 平台。Groq 3 LPX 专注于 token 生成阶段(generation phase),这是决定 AI 系统响应速度的关键环节。
关键事实
| 项目 | 详情 |
|---|---|
| 产品定位 | Vera Rubin 平台的推理加速器扩展 |
| 架构 | 每机架 256 个 LPU 加速器 |
| 片上内存 | 128 GB SRAM |
| 横向扩展带宽 | 640 TB/s |
| 冷却方式 | 100% 液冷,NVIDIA MGX 机架架构 |
| 首家采用者 | Nebius(通过 Token Factory 平台) |
| 后续采用者 | Groq(计划成为早期采用者) |
性能数据
- Gemma 4 31B 基准测试: 单用户 3,400 output tokens/s(Artificial Analysis 记录的最快性能)
- 2T 参数模型: 长上下文低延迟推理吞吐量比 GB200 NVL72 高 35x/兆瓦
- Vera Rubin NVL72 组合: 与 Vera Rubin NVL72 配合,显著提升推理性能
Nebius Token Factory 集成
Nebius 计划将 Groq 3 LPX 集成到 Token Factory 生产推理平台:
- 开发者无需迁移到新栈,使用相同的 API 和平台
- 支持自动扩缩、可观测性、函数调用、结构化输出
- 为多 agent 系统提供亚秒级延迟目标
- 添加 Groq 3 LPX 是模型选择变更,而非迁移
影响分析
| 维度 | 影响 |
|---|---|
| Agentic AI | 超低延迟 token 生成提升 agent 响应速度 |
| 推理云 | Nebius Token Factory 首家采用,Groq 计划跟进 |
| 架构创新 | LPU + Vera Rubin NVL72 混合推理架构 |
| 性能对比 | 2T 参数模型长上下文推理吞吐量比 GB200 NVL72 高 35x/兆瓦 |
风险边界与后续观察
- 实际部署效果: 基准测试数据需在真实生产环境验证
- 软件栈成熟度: 开发者需评估 Token Factory 平台的模型支持范围
- 成本效益: 35x/兆瓦的性能提升需结合实际 TCO 分析
- 竞争格局: 其他推理优化方案(如 Dynamo)的对比
AI Master 解读
核心事件
NVIDIA Groq 3 LPX 推理加速器正式量产,Nebius 首家采用。
行业影响
为什么重要: Groq 3 LPX 是 NVIDIA 针对 agentic AI 推理优化的专用加速器,扩展 Vera Rubin 平台。每个 LPX 机架耦合 256 个 LPU 加速器,配备 128 GB 片上 SRAM 和 640 TB/s 横向扩展带宽。在 Artificial Analysis 基准测试中,运行 Gemma 4 31B 达到单用户 3,400 output tokens/s,创下该模型最快记录。
影响分析:
| 维度 | 影响 |
|---|---|
| Agentic AI | 超低延迟 token 生成提升 agent 响应速度 |
| 推理云 | Nebius Token Factory 首家采用,Groq 计划跟进 |
| 架构创新 | LPU + Vera Rubin NVL72 混合推理架构 |
| 性能对比 | 2T 参数模型长上下文推理吞吐量比 GB200 NVL72 高 35x/兆瓦 |
AI Master 建议
关注 Groq 3 LPX 在生产环境的实际部署效果。LPU 架构与 GPU 的混合推理可能成为 agentic AI 的新标准。
