---
格式版本: 2
标题: "深入解析 Nvidia AI 系统路线图"
原文链接: "https://www.nextplatform.com/compute/2026/03/19/driving-down-the-ai-system-roadmap-with-nvidia/5210195"
发布日期: "2026-03-19"
发现时间: "2026-03-19T00:00:00+08:00"
入库时间: "2026-05-28T02:39:38+08:00"
来源平台: "历史资料迁移"
搜索渠道: "legacy_migration"
搜索词: "url-index.json 迁移、The Next Platform RSS"
匹配关键词:
  - "AI Rack"
  - "CPO"
  - "高速互联子系统"
  - "HBM"
  - "url-index.json 迁移"
  - "The Next Platform RSS"
  - "待定数据"
  - "厂家"
  - "Nvidia"
  - "TNP"
  - "19.md"
相关厂家:
  - "NVIDIA"
相关专家:
  []
内容类型: "网页"
抓取工具: "历史采集"
清洗工具: "历史资料原文保留 + LLM 正文裁剪"
关联判断: "待人工确认"
关联置信度: 0
关联理由: "历史资料迁移，未重新调用模型判定"
AI优质: "是"
AI打分: 96
AI分档: "高置信优质"
AI质检状态: "通过"
AI打分理由: "深度解析NVIDIA 2026-2028 AI系统路线图，涵盖Oberon/Kyber机柜架构、Vera-Rubin/Feynman芯片规格、NVLink/CPO演进及HBM参数，技术细节详实，来源权威，具明确量产与部署规划，高度契合超节…"
AI质检模型: "qwen3.6-plus"
AI质检时间: "2026-06-03T10:34:54+08:00"
AI主题相关性: 20
AI来源权威性: 14
AI新颖性: 19
AI技术细节: 20
AI商业部署信号: 13
AI完整性: 10
采集批次: "2026年5月28日2点39分33秒"
采集批次ID: "legacy-migration-20260528023933"
去重键: "https://www.nextplatform.com/compute/2026/03/19/driving-down-the-ai-system-roadmap-with-nvidia/5210195"
人工更新时间: "2026-06-03T09:31:30+08:00"
---

### 背景：Nvidia 路线图的重要性
在 GPU 加速应用性能的早期（2012 年"Kepler"数据中心 GPU 至 2017 年"Volta"），Nvidia 很擅长发布路线图。但在 2021 年之前，公司将路线图"折叠在 Jensen Huang 皮夹克左前内袋里"。随着 GenAI 热潮从化学反应变为核反应，公司正确判断所有人都需要一份真实路线图——延伸数年，以便协调资金、土地、电力、冷却和系统，共同支撑迄今最大规模的 IT 基础设施建设。
第一份新时代路线图于 2023 年底在一份财务演示中发布（而非 Huang 的 GTC 大会幻灯片），我们对其进行了大量编辑以添加缺失组件。这份 2026 年最新路线图在 Huang 的 GTC 主题演讲中展示。
### 2026 年路线图：Vera-Rubin 与 Oberon 机架
本次 GTC，Huang 在 2026 至 2028 年间增加了更多细节，但未提及未来可能推出的"Feynman Ultra"GPU，以及更新的 ConnectX-10 SmartNIC。
路线图明确标注了 Oberon 和 Kyber 机架的演进，与计算引擎和网络引擎的迭代并列呈现。值得注意的是，路线图未提及 Quantum InfiniBand——这不是因为 Nvidia 停止了 InfiniBand 开发，而是 Nvidia 认为 AI 工厂不会部署 InfiniBand（尽管 HPC 中心运行较小集群或部分 AI 中心仍可能选用）。
Vera-Rubin 系统已确认于 2026 年下半年量产出货：
- **Vera ARM 服务器 CPU**：88 个定制 Nvidia "Olympus" 核心，双线程，1.8 TB/sec NVLink 芯片间互联
- **Rubin R200 GPU**：一对视网膜尺寸 GPU 芯片通过 NVLink C2C 连接，288 GB HBM4 内存，FP4 算力 50 petaflops（相比 Blackwell B200 的 10 petaflops、B300 的 15 petaflops）
- **Oberon 机架（NVL72）**：72 个 GPU socket + 36 个 CPU socket，与 Blackwell 代 NVL72 配置相同
### Groq LPU：Oberon ETL256 配置
与 Vera 和 Rubin 并行，Groq LP30 将内置于专用机架中，采用常规 Spectrum 以太网背板（有时称为背板）。该机架被称为 Oberon ETL256 配置，意味着可将 256 个 Vera CPU 或 256 个 Groq LPU 连接到这一背板。
Groq LP30 托盘每托盘 8 个，四个 socket，一个 Groq 3 LPX 机架包含 32 个托盘，总计：
- 315 petaflops FP8 推理算力
- 256 芯片共 128 GB SRAM
- 40 PB/sec 聚合 SRAM 带宽
- 640 TB/sec 聚合 scale-up 带宽（通过 Spectrum ETL 背板）
### 2027 年路线图：Rubin Ultra 与 Kyber 机架
Rubin Ultra（预计命名为 R300）是对 Rubin socket 内 GPU 芯片数量的翻倍：从 2 个到 4 个，FP4 算力翻倍至 100 petaflops。新"Kyber"机架将 socket 数量翻倍至 144 个，并引入铜质 midplane 取代大量铜缆交叉连接。
HBM 规格：16 组 HBM4E 内存，每 socket 1 TB 容量，32 TB/sec 带宽（理论峰值为 64 TB/sec，推测降速原因为功耗与散热限制）。
NVLink 6 端口带宽相比 NVLink 5 翻倍，达 3,600 GB/sec；Rubin Ultra 的 NVLink 端口带宽将再翻一倍。
Spectrum-6 以太网 ASIC 将引入 CPO，这一代 102.4 Tb/sec 交换机也将支持 Rubin Ultra 系统的 scale-out 网络需求。
在 Rubin Ultra 代，Groq LP35 芯片将获得 NVFP4 格式的 FP4 浮点运算支持，与 Blackwell 和 Rubin GPU 精度对齐。
### 2028 年路线图：Rosa-Feynman 与 NVLink 8 CPO
Rosa-Feynman 系统（2028 年）中，Groq LP40 计算引擎将加入 NVLink 端口，使其与 Rosa ARM 服务器 CPU（以诺贝尔奖得主 Rosalyn Sussman Yalow 命名）和 Feynman GPU（以物理学家 Richard Feynman 命名）实现内存一致性。
NVLink 8 端口将引入 CPO，NVSwitch ASIC 端也将同步支持 CPO。这将允许快速、高带宽的双层 NVSwitch 网络为更大 GPU 计算内存域服务。
以 NVSwitch 域扩展为例：
- Hopper 代：官方 8 GPU 内存域，非官方可扩展至 256 GPU（双层网络）
- Blackwell 代：官方 72 GPU，多层 NVSwitch 理论可扩展至 576 GPU
- Kyber 机架（NVLink 8 CPO）：单机架 144 GPU，双层网络下扩展至 1,152 GPU
### Feynman GPU 架构推测
Feynman GPU 将采用 2nm 或更小工艺（需要 GAA 晶体管和 High NA EUV），最大光刻面积从 858 mm² 缩至 429 mm²。预计每 socket 包含至少 8 个 GPU 芯片（相比 Rubin Ultra 的 4 个）。Nvidia 表示 Feynman 将采用芯片堆叠（die stacking）——可能是 SRAM 缓存堆叠，也可能是计算与 SRAM 同时堆叠。
### 结语
Nvidia 通过 CPO 技术战略，既保障了大规模 AI 系统的带宽需求，也在为更低功耗的光学互联铺路。正如数十年前 Cray 超级计算机机架内使用铜质背板、机架间使用光纤链路一样，"能用铜就用铜，不得不用光才用光"的经济与技术原则始终适用——直到 AI 推理工作负载将 CPO 推向足够大的出货量，让单价降低，造福整个行业。
## 原文链接
https://www.nextplatform.com/compute/2026/03/19/driving-down-the-ai-system-roadmap-with-nvidia/5210195
