---
格式版本: 2
标题: "老张公开课：超节点基础知识视频讲解"
原文链接: "https://www.bilibili.com/video/BV159AjzwEee"
发布日期: "2026-03-20"
发现时间: "2026-03-20T00:00:00+08:00"
入库时间: "2026-05-28T02:39:37+08:00"
来源平台: "历史资料迁移"
搜索渠道: "legacy_migration"
搜索词: "url-index.json 迁移"
匹配关键词:
  - "url-index.json 迁移"
  - "待定数据"
  - "关键字"
  - "Bilibili"
  - "超节点"
  - "HBM"
  - "高速互联子系统"
  - "20.md"
相关厂家:
  - "华为"
  - "阿里"
  - "曙光"
相关专家:
  []
内容类型: "视频"
抓取工具: "历史采集"
清洗工具: "历史资料原文保留 + LLM 正文裁剪"
关联判断: "待人工确认"
关联置信度: 0
关联理由: "历史资料迁移，未重新调用模型判定"
AI优质: "否"
AI打分: 73
AI分档: "召回候选"
AI质检状态: "不通过"
AI打分理由: "内容深度解析超节点架构（NVL72/华为CM384/阿里128卡），技术细节丰富，涵盖互联拓扑、供电散热与Scale-up机制。但来源为个人B站科普视频，非官方/一手信源，缺乏量产部署与商业落地数据，且结尾截断，综合评为召回候选。"
AI质检模型: "qwen3.6-plus"
AI质检时间: "2026-06-03T10:34:22+08:00"
AI主题相关性: 19
AI来源权威性: 8
AI新颖性: 14
AI技术细节: 18
AI商业部署信号: 7
AI完整性: 7
采集批次: "2026年5月28日2点39分33秒"
采集批次ID: "legacy-migration-20260528023933"
去重键: "https://www.bilibili.com/video/BV159AjzwEee"
人工更新时间: "2026-06-03T09:31:29+08:00"
---

## 视频简介

本期视频PPT，可前往我的公众号“老张 IT智习社”3月20日的文章中获取下载链接。

## 字幕全文

**[00:00:00]** 哈喽大家好

**[00:00:01]** 我是老张

**[00:00:02]** 今天的老张公开课呢跟大家来聊一聊

**[00:00:05]** 那么超节点相关的一些内容啊

**[00:00:07]** 主要围绕啊超节点的一种定义出现的背景

**[00:00:11]** 以及呢呃主流的这种超节点产品的

**[00:00:15]** 这种呃架构组成啊

**[00:00:17]** 以及未来的这个超节点的一些发展趋势啊

**[00:00:20]** 呃因为在前几天呢

**[00:00:22]** 也是受邀参加了一个超接点内容的一个分享

**[00:00:25]** 我整理了一些资料

**[00:00:26]** 呃今天的话呢我主要是精简了一下

**[00:00:29]** 选择了大概20多页

**[00:00:31]** 我认为比较核心的资料啊

![关键帧 00:00:31](./assets/20260424_BV159AjzwEee_31s.jpg)

> 视觉分析：普通人怎么理解“超节点”？介绍“超节点”概念，并列举基本特征：高性能互联、数据交互的高吞吐量和低延迟、适配超级运算的基础硬件设施。

**[00:00:33]** 给大家去做一个分享

**[00:00:35]** 呃

**[00:00:35]** 视频的话呢

**[00:00:36]** 我会同步放放在这个

**[00:00:39]** 我的视频号和公众号当中呃

**[00:00:42]** 那么PPT下载方式呢

**[00:00:43]** 就今天的这个更新后的PPT呢

**[00:00:45]** 会放在呃今天的这个呃

**[00:00:48]** 就今天这个时间的这个公众号的

**[00:00:51]** 这个文章当中啊

**[00:00:52]** 大家感兴趣可以去下载呃

**[00:00:54]** 视频的时间的话大概在十几分钟啊

**[00:00:56]** 不会超过20分钟

**[00:00:57]** 首先呢我们看一个呃超级点的概念啊

**[00:01:00]** 就是呃怎么来去理解超节点

**[00:01:03]** 那么很多同学呢可能在呃服务器领域

**[00:01:06]** 或者说在算力相关领域当中啊

**[00:01:08]** 那么对超节点呢有些陌生

**[00:01:09]** 那么普通人怎么去理解呢

**[00:01:11]** 这里呢我把这个超接点的三个字呢

**[00:01:13]** 做一个拆分呃

**[00:01:15]** 节点是什么意思呢

**[00:01:16]** 就是在it领域当中

**[00:01:17]** 节点我们一般指的是单台服务器的意思啊

**[00:01:20]** 就一个节点

**[00:01:21]** 就一台服务器

**[00:01:22]** 而超字怎么理解呢

**[00:01:24]** 哎超字可以去组合对吧

**[00:01:26]** 那么我可以理解成超多超快啊

**[00:01:28]** 超密呃

**[00:01:29]** 超多怎么理解呢

**[00:01:31]** 哎我们超多的话呢

**[00:01:32]** 其实就是通过把芯片数量的增多

**[00:01:36]** 实现算力规模的扩大啊

**[00:01:38]** 超接点我们先说超多啊

**[00:01:40]** 就是相当于这个呃通过互联技术啊

**[00:01:43]** 将单台服务器或集群啊

**[00:01:45]** 那么这个呃实现规模上的扩大对吧

**[00:01:49]** 而超节点的话呢

**[00:01:50]** 它主要是通过这种我们叫scale up的这种方式

**[00:01:53]** 那么通过比如说像av link啊

**[00:01:56]** 华为的领取等技术实现单系统内啊

**[00:02:00]** 这个算力节点也就是算力呃

**[00:02:03]** 卡也就是说我们所说的AI芯片

**[00:02:04]** GPU卡啊的数量的一个额数量上的增多啊

**[00:02:08]** 这是第一个超多

![关键帧 00:02:08](./assets/20260424_BV159AjzwEee_128s.jpg)

> 视觉分析：内容重复，强调相同的超节点概念与特征。

**[00:02:09]** 那么怎么理解超快呢

**[00:02:11]** 啊现在的话呢大家知道对于数据传输的效率

**[00:02:14]** 带宽延时啊等等等有新的更高的要求对吧

**[00:02:17]** 那么它呢能够通过啊

**[00:02:20]** 就是前面提到的像华为的这个领取啊

**[00:02:22]** 这个英威英伟达的这个nv link等等

**[00:02:24]** 它能够实现这个比传统的PCIE更快数倍

**[00:02:29]** 甚至十几倍的这种效率

**[00:02:31]** 能够实现呃

**[00:02:32]** 这个GPU或者AI芯片间的更高速的这种传输

**[00:02:36]** 还有呢就是超密呃

**[00:02:38]** 超密的概念呢

**[00:02:39]** 其实主要是针对于传统的服务机构

**[00:02:41]** 它的密度并不高

**[00:02:42]** 而超节点的话呢

**[00:02:43]** 一般我们把会把它塞满啊

**[00:02:45]** 比如说像这个NVL72

**[00:02:47]** 那么它一台一套这个一套机柜当中呢

**[00:02:50]** 我们就可以部署72颗GPU

**[00:02:52]** 当然配套的会有这个呃

**[00:02:55]** 计算的这种计算的TRA对吧

**[00:02:57]** 交换的TRA包括这种嗯

**[00:02:59]** 呃配套的这种对应的这种规划啊

**[00:03:03]** 那么这个就是对应的设计

**[00:03:05]** 这个就是在超密的后面

**[00:03:06]** 我们也会去展开分享

**[00:03:07]** 这个呢就跟大家去从呃理解超级点的角度啊

**[00:03:11]** 超大额超多超快超密

**[00:03:13]** 那么呃有没有定义呢

**[00:03:15]** 这里呢我去从华为这个发布的这个

**[00:03:19]** 白皮书当中啊

**[00:03:20]** 其实找到了华为针对超级点的定义啊

**[00:03:23]** 以及它的一些特点分析

**[00:03:24]** 那么所谓超节点呢

**[00:03:26]** 华为是这么去定义的

**[00:03:27]** 它指的是AI计算节点

**[00:03:29]** 就是服务器这套复习当中啊

**[00:03:31]** 这一套所谓的复习当中

**[00:03:33]** 通过了这种高速互联的协议

**[00:03:34]** 这是啊这是条件之一啊

**[00:03:37]** 组成的什么呢

**[00:03:38]** 更大内存空间的AI系统

**[00:03:40]** 就是我们这一套这个计算平台

**[00:03:42]** 那么超节点呢

**[00:03:43]** 一般说说超节点一般指的是什么呢

**[00:03:46]** 指的是32或以上数量的AI芯片组成的啊

**[00:03:50]** 那么AI芯片呢到交换芯片单呃

**[00:03:53]** 之间呢不不小于400G啊

**[00:03:55]** 当然这个呢是属于华为定义的啊

**[00:03:56]** 一般呢会超过了400G

**[00:03:58]** 比如像英伟达的呢

**[00:03:59]** 他占有多少呢

**[00:04:00]** 比如说这个呃1.8个T啊

**[00:04:03]** 到3.6个T

**[00:04:04]** 最新的robin是3.6个T对吧啊

**[00:04:06]** 交换的这种时延的话呢也是比较小的

**[00:04:09]** 还有他的特点呢是这里呢提出了两个

**[00:04:12]** 一个就是说DI芯片的话呢

**[00:04:15]** 支持内存的统一编制啊

**[00:04:17]** 不仅是大带宽低延时

**[00:04:18]** 还支持内存统一编制

**[00:04:20]** 这个是什么意思呢

**[00:04:21]** 也就是说我们是使用这一套超节点啊

**[00:04:24]** 你可以把它理解成一套

**[00:04:26]** 就是一个大的服务器系统

**[00:04:27]** 或者一个大的GPU或者大的AI芯片啊

**[00:04:30]** 之间芯片之间的这种交互呢

**[00:04:33]** 就是它的内存是共享的啊

**[00:04:34]** 内存统一编制的

**[00:04:35]** 也就是数据在呃在模型训练啊或推理过程当中

**[00:04:38]** 它的效率会更高啊

**[00:04:39]** 还有呢扩展属性是什么呢

**[00:04:41]** 就是多级缓存

**[00:04:42]** 大家知道现在这个HBM也非常贵对吧

**[00:04:45]** 那么可以通显存内存存储的方式呢

**[00:04:48]** 它可以做分级的这种设计

**[00:04:50]** 当然大家可以看到最新的这个英伟达的robin

![关键帧 00:04:50](./assets/20260424_BV159AjzwEee_290s.jpg)

> 视觉分析：什么是超节点？华为定义与特征分析：基础特征（大带宽、低时延、内存统一编址）；扩展特性（多级拓扑优化、资源灵活分配）。

**[00:04:52]** 的时候

**[00:04:52]** 他也老黄呢

**[00:04:54]** 也发布了一些这种分级存储或分级缓存的

**[00:04:56]** 这种呃产品设计的思路出来啊

**[00:05:00]** OK这是超级的定义以及它的特点

**[00:05:02]** 核心特点就是内存统一编制啊

**[00:05:06]** 以及呢通过呃这种高速互联的技术来实现的

**[00:05:10]** 那么为什么会出现超接点呢

**[00:05:13]** 这个呢我从两个非维度来看

**[00:05:15]** 一个就是呃大模型产品的产品的加速迭代

**[00:05:19]** 大家应该都有一个感受

**[00:05:20]** 就是这个呃

**[00:05:22]** 每隔啊那么一两周时间都会有这种新的这种

**[00:05:26]** 怎么说呢

**[00:05:27]** 这种更性能更好啊

**[00:05:29]** 参数量更大

**[00:05:30]** 或者说是更给我们更多的这种冲击的

**[00:05:33]** 这种相关的这种AI应用产品的

**[00:05:35]** 这种AI的相关产品出现啊

**[00:05:36]** 比如像这个呃之前的这个这个鸡蛋X2.0

**[00:05:40]** 包括像这个最近火爆的这个龙虾啊

**[00:05:44]** 还有呢就是我们所说的这个

**[00:05:45]** 经常我们提到的这个大模型的

**[00:05:48]** 基模的一种发展啊等等

**[00:05:49]** 这个呢非常发展非常快啊

**[00:05:51]** 朝着什么呢

**[00:05:52]** 智能化更高

**[00:05:53]** 我参数量更大啊

**[00:05:54]** 包括一些这个呃更加灵活的方向去发展

**[00:05:58]** 那么这里呢有一个思考

**[00:05:59]** 这是我个人去总结的

**[00:06:00]** 就是用户测

**[00:06:01]** 对于我们使用方而言

**[00:06:03]** 他对于模型的功能性能其实追求越来越高

**[00:06:06]** 为什么呢

**[00:06:06]** 我们总是希望什么呢

**[00:06:08]** 呃白嫖白嫖的话

**[00:06:09]** 要不就是摸屏是免费的

**[00:06:11]** 那么对于算力的需求呢肯定是越低越好

**[00:06:13]** 现在是token时代了对吧

**[00:06:14]** 也就是说我们干相同的事

**[00:06:16]** 所需要消耗的token量越小越好

**[00:06:19]** 那么单位的token量价格越低越好

**[00:06:21]** 那么这样的情况下

**[00:06:22]** 他势必会倒逼我们算力基础设施的一些演进啊

**[00:06:26]** 那么换句话说

**[00:06:27]** 怎么在算力规模情况一定的情况下来

**[00:06:30]** 去压榨出更多的性能呢

**[00:06:33]** 唉有分两个方面

**[00:06:34]** 一个是软件调优啊

**[00:06:35]** 模型测试调优

**[00:06:36]** 还有一方面呢是硬件工程化的创新

**[00:06:39]** 那超接点就是一个呃

**[00:06:41]** 这个通过重新组合硬件的这种互联方式

**[00:06:44]** 来实现的

**[00:06:45]** 这个性能的提升的一个呃典型的代表啊

**[00:06:48]** 另外一个维度呢就是我们超级点啊

**[00:06:50]** 超级点的出现呢

**[00:06:52]** 其实它更多的是解决了传统集群当中啊

**[00:06:55]** 啊遇到的一些瓶颈问题

**[00:06:57]** 这里呢啊三个维度

**[00:06:58]** 这是华为它材料当中啊

**[00:07:00]** 我做的一些提炼

**[00:07:01]** 第一个呢所谓的通信强什么意思呢

**[00:07:03]** 我们知道传统的服务器呢

**[00:07:05]** 更多的是基于通用的互联协议

**[00:07:07]** PCIE去互联对吧

**[00:07:08]** 那么它的互联协议呢就是发展比较久了

**[00:07:11]** 通用性很好

**[00:07:12]** 但是它的效率会很低啊

**[00:07:14]** 但是他的这个带宽会很低啊

**[00:07:16]** 那么如果说现在这个我们用它去互联的话呢

**[00:07:19]** 它会是一个瓶颈啊

**[00:07:20]** 就是说呃对于这个千亿或万亿以上达模型

**[00:07:24]** 训练的时候呢

**[00:07:25]** 它会带来一个瓶颈的这种问题

**[00:07:28]** 而超节点的话呢

**[00:07:29]** 我们可以通过更大带宽的这种互联方式

**[00:07:32]** 来去实现这个节点

**[00:07:34]** 就是呃GPU卡或者AI芯片间的这种互联

**[00:07:37]** 第二个就是功耗强

**[00:07:38]** 所谓功耗强呢指的是这种密度

**[00:07:41]** 算力密度的提升

**[00:07:42]** 那么它对于散热的要求会更高啊

**[00:07:45]** 比如单机柜现在轻松就突破了这个100啊

**[00:07:48]** 100千瓦

**[00:07:49]** 或者说几百千瓦

**[00:07:50]** 300千瓦以上

**[00:07:51]** 那么这种情况下呢

**[00:07:52]** 我们如何来通过这种比如说液冷啊

**[00:07:56]** 包括括一些这个这个散热设计

**[00:07:58]** 来实现更高的这种散热效果啊

**[00:08:01]** 那么这个是功耗强面临的一些问题

**[00:08:03]** 还有就是复杂度强

**[00:08:04]** 复杂度强呢主要指的是什么呢

**[00:08:06]** 在一些这个传统的集群当中

**[00:08:08]** 它的效率

**[00:08:09]** 它的故障率会很高

**[00:08:11]** 我们知道大家组这个千卡集群

**[00:08:12]** 不管是H100

**[00:08:13]** H200也好

**[00:08:14]** 其他的故障率很高的对吧

**[00:08:16]** 如果再怎么来去解决呃

**[00:08:18]** 超级点也会面临这种故障率的问题

**[00:08:20]** 就是通过可靠性的设计来实现

**[00:08:22]** 一是故障率的降低

**[00:08:24]** 二呢出现故障之后

**[00:08:25]** 对于系统呃

**[00:08:26]** 对于整个这种呃作业啊任务的这种影响啊

**[00:08:30]** 怎么降到最低

**[00:08:31]** 那简单总结来讲就是呃超接点带来的挑战呢

**[00:08:35]** 就是说本身就是算力规模的扩张

**[00:08:37]** 与基础设施能力的配套的不匹配

**[00:08:39]** 主要是现有基础设施的这种算力

**[00:08:41]** 基础设施的配套对吧

**[00:08:43]** 那么超节点的话呢

**[00:08:44]** 就是相对这个集群而言啊

**[00:08:46]** 他的这种核心优势就是性能呃

**[00:08:49]** 性能强啊

**[00:08:50]** 效率高啊

**[00:08:50]** 这个包括它的这种复杂度啊

**[00:08:53]** 散热方面都有很大的一个提升

**[00:08:56]** 哎那么超节点和其他产品啊有什么区别呢

**[00:08:59]** 这里的话呢

**[00:09:00]** 也是我沿用了这个网上公开的资料啊

**[00:09:02]** 那么他是24年啊

**[00:09:04]** 之前的124年的时候发布一个资料

**[00:09:06]** 他呢就是把超节点作为一个服务器形态的

**[00:09:10]** 一个创新啊

**[00:09:11]** 和前面我们所经常看到的

**[00:09:12]** 像2U双路的通用服务器

**[00:09:15]** 还有这种PCIE标准的

**[00:09:16]** 像409055090这种标准

**[00:09:18]** PCIE服务器就是通用的

**[00:09:19]** 还有就是HBI的这种高带宽互联的

**[00:09:22]** 像啊这个我们所说的H呃HGX啊

**[00:09:26]** 这种呃H200的这种产品啊

**[00:09:28]** 这就属于第三种

**[00:09:29]** 那么超节点相对于前面三种

**[00:09:32]** 它的核心区别是什么呢

**[00:09:33]** 这里呢我们才能看啊

**[00:09:34]** 第一个就是工作负载上

**[00:09:35]** 它面向于超大规模

**[00:09:37]** 大规模超大规模的训练和推理

**[00:09:39]** 它效率会非常高啊

**[00:09:40]** 怎么去理解这个效率呢

**[00:09:42]** 就是我比如说啊

**[00:09:43]** 我们在用千卡集群做训练的时候呢

**[00:09:46]** 呃正常的集群我们可能是需要千卡对吧

**[00:09:50]** 那么弄超级点的话呢

**[00:09:51]** 用它效率提升

**[00:09:52]** 可能这个缩短时间会更短

**[00:09:55]** 效率会更高

**[00:09:56]** 换个角度来讲

**[00:09:57]** 那么比如说我同样是这个1000卡

**[00:10:00]** 那么呃通用的集群的话呢

**[00:10:02]** 他的这种算力的发挥可能在30~60之间

**[00:10:05]** 30%到60之间

![关键帧 00:10:05](./assets/20260424_BV159AjzwEee_605s.jpg)

> 视觉分析：超节点与其他服务器产品的综合对比：对比工作负载、资源配比、性能指标、单位成本及能效。

**[00:10:06]** 而超级点的话呢

**[00:10:07]** 能够去达到80%以上的效率

**[00:10:09]** 也就是说同样少的芯片

**[00:10:12]** 它能够发挥更大的算力啊

**[00:10:13]** 另外就客户类型方面

**[00:10:15]** 它主要是聚焦在互联网和这个运营商

**[00:10:18]** 而其他的产品形态的话呢

**[00:10:20]** 面向所有的企业

**[00:10:21]** 而外观方面的话呢

**[00:10:22]** 一般是机柜级的啊

**[00:10:24]** CPU的话呢一般是配套GPU数量去出现的

**[00:10:27]** 一般是额这个AI芯片的数量除以二

**[00:10:30]** 比如像ARNML72

**[00:10:32]** 它是什么呢

**[00:10:33]** 它是36颗对吧

**[00:10:34]** 像华为的话也是这个呃

**[00:10:36]** 384的话呢是这个94克啊

**[00:10:39]** 呃96克还是93

**[00:10:41]** 也是除以二的关系啊

**[00:10:42]** 那么加速器这块的数量也会比较多

**[00:10:44]** 那网卡的话呢一般是用这种呃

**[00:10:47]** 这个都是用最新的

**[00:10:48]** 比如400G或800G或以上的啊

**[00:10:50]** 那么散热方式的话呢

**[00:10:52]** 统一呢升级为了液冷啊

**[00:10:54]** 除了曙光用这个金墨之外

**[00:10:55]** 目前看到的超级电都是用的是冷板啊

**[00:10:58]** 单轨的功率的话呢

**[00:11:00]** 也就轻松突破了这个100千瓦以上啊

**[00:11:03]** 这是它超低点产品

**[00:11:05]** 相对于这个传统的几种服务器形态

**[00:11:08]** 它的一些变化

**[00:11:09]** 这个是把超级电当成一个新形态的服务器啊

**[00:11:12]** 来做的一个对比

**[00:11:14]** 哎这里的话呢我比较这个图是我画的啊

**[00:11:17]** 这个是我们从这个很多朋友会去纠结

**[00:11:20]** 这个什么是sky up呀

**[00:11:22]** 什么是sky out呀

**[00:11:23]** 对吧

**[00:11:23]** 这里的图呢非常形象的给大家去做了一个展示

![关键帧 00:11:23](./assets/20260424_BV159AjzwEee_683s.jpg)

> 视觉分析：超节点与服务器集群的区别，Scale-up与Scale-out：分别针对资源集中的纵向扩展与计算节点的横向扩展。

**[00:11:25]** art up呢是变高变大还是一个系统

**[00:11:29]** 还是一台设备

**[00:11:30]** 它会变高变大

**[00:11:31]** 而Scout的话呢是通过扩展集群扩展的方式

**[00:11:34]** 把单台设备给它变多

**[00:11:36]** 横向扩展

**[00:11:37]** 一个是纵向扩展

**[00:11:38]** up是纵向扩展啊

**[00:11:40]** out是横向扩展

**[00:11:41]** 那这里的话呢我们做了个对比啊

**[00:11:43]** 通过五个方面

**[00:11:43]** 一个就是算力规模上

**[00:11:45]** 目前来看啊

**[00:11:46]** 这个呃scale up的话

**[00:11:48]** 因为他这个互联效率

**[00:11:50]** 它要求的是点对点互联对吧

**[00:11:52]** 高速互联它的效率

**[00:11:53]** 它的这个规模来讲

**[00:11:54]** 还是这个要小于这个集群互联的

**[00:11:57]** 因为集群互联的话

**[00:11:58]** 国外已经达到10万卡或几10万卡了

**[00:12:00]** 目前的话超级点的话呢

**[00:12:01]** 也就华为发布的这个8192将近万卡

**[00:12:04]** 它的规模上是额小于这个传统集群的

**[00:12:08]** 另外就是资源利用率方面

**[00:12:09]** 前面提到目前公开数据显示

**[00:12:11]** 超级点的这个算力利用率的话呢

**[00:12:14]** 理论上能够达到八80%以上

**[00:12:16]** 而传统的集群的话呢

**[00:12:17]** 大概在30~60的百分比百分点啊

**[00:12:20]** 在通信延迟方面的话呢

**[00:12:22]** 这个超级点是纳秒级别的

**[00:12:23]** 而这个集群的话呢是微秒级别的

**[00:12:26]** 在内存访问方面的话呢

**[00:12:28]** 这个集群的话呢

**[00:12:29]** 是每台设备就是独立的一个内存空间对吧

**[00:12:32]** 而这个超节点的话呢是所有的芯片

**[00:12:34]** 通过互联技术实现的

**[00:12:36]** 统一的大的那个内存空间啊

**[00:12:38]** 统一编制啊

**[00:12:39]** 它的效率会更高

**[00:12:40]** 当然这里头有一些这个厂商啊

**[00:12:42]** 比如说超级电子厂商会比较多啊

**[00:12:45]** 而采用全液冷

**[00:12:46]** 而这个呃集群的话呢一般是风冷为主啊

**[00:12:48]** 但超算上会有一些这个液冷呃

**[00:12:51]** 还有一些目前的话

**[00:12:52]** 国产化的一些液冷也会比较多了啊

**[00:12:54]** 那么这是这个超算和集群的这种区别上

**[00:12:57]** 简单做了一个分析

**[00:12:59]** 究竟贵在哪里呢

**[00:13:00]** 这个片子呢其实我讲过很多次了

**[00:13:02]** 在之前的视频当中也分享过

**[00:13:04]** 很多朋友会问啊

**[00:13:05]** 我这个呃H200组IB集群哦

**[00:13:09]** 每张每台这个服务器

**[00:13:10]** 八张400G网卡加起来也就三点对吧

**[00:13:13]** 483.2T我感觉已经很快了呀

**[00:13:15]** 为什么还这个IB啊

**[00:13:17]** 和IB的这种组网到底快在哪呢

**[00:13:19]** 这里的话其实大家有个误区

**[00:13:20]** 就是什么误区呢

**[00:13:21]** 就是大B和小B的这种概念

**[00:13:22]** 我们来看啊

**[00:13:23]** 这个NVL72的超接点呢

**[00:13:25]** 它是采用把72颗B200或B300

**[00:13:29]** 用NVLINK全互联

**[00:13:30]** 达到的速率是什么呢

**[00:13:32]** 达到最终效果是卡卡之间1.8个T

![关键帧 00:13:32](./assets/20260424_BV159AjzwEee_812s.jpg)

> 视觉分析：超节点与主流IB集群到底“快”在哪里？分析H200 SXM结构及实现优化，强调数据互联性能显著提升。

**[00:13:34]** 这是大比啊双向的

**[00:13:36]** 而H100或H200的服务器的话呢

**[00:13:39]** 它是IB组网

**[00:13:40]** 机器内部的话呢

**[00:13:41]** 卡间互联是900G

**[00:13:42]** 这个没问题

**[00:13:43]** 大家都很清楚

**[00:13:44]** 而机器间的话呢是八张IB卡

**[00:13:46]** 单向的是这个400G小B

**[00:13:48]** 那么转换成大B的话

**[00:13:50]** 那就是50G

**[00:13:50]** 双向的话就是100G对吧

**[00:13:52]** 那么八张卡的话呢就是八十八百G双向

**[00:13:55]** 那么大家会发现一个问题啊

**[00:13:57]** 也就是说机器内部是一点呃

**[00:13:59]** 是九九百G

**[00:14:00]** 而八张卡和集群外的其他几点

**[00:14:04]** 互联的是其他节点

**[00:14:05]** 互联时候八展卡总共速率才800G

**[00:14:07]** 那么他的这种瓶颈啊其实非常明显的

**[00:14:10]** 我们网络当中有个词叫收敛啊

**[00:14:12]** 收敛会比较小

**[00:14:13]** 收敛的这个收敛

**[00:14:14]** 这个收敛会把这个大带宽收敛成这个800G

**[00:14:17]** 去做理论的一个互联啊

**[00:14:19]** 大家可以看到啊

**[00:14:20]** 一个是呃这个通过这两个数字啊

**[00:14:22]** 大家都能看到到底快在哪里

**[00:14:26]** 那么内部是是如何呃设计的呢

**[00:14:29]** 这个呢我们可以看一下啊

**[00:14:31]** 拿这个最经典的英伟达NVL72举例

![关键帧 00:14:31](./assets/20260424_BV159AjzwEee_871s.jpg)

> 视觉分析：超节点产品分析：英伟达NVL72，包括GB200计算节点和NVlink结构细节。

**[00:14:34]** 这个呢是在24年3月份

**[00:14:36]** 这个英伟达gt gt t大会上

**[00:14:38]** 老黄发布了这个black veil之的

**[00:14:41]** 同时呢也推出了超级点

**[00:14:43]** 那么它呢是由这个呃计算TRA啊

**[00:14:46]** 包括这个switch tra去做的这种

**[00:14:49]** 大家可以看到啊

**[00:14:50]** 这个十个18个这个计算tr

**[00:14:53]** 包括只有个switch tra对吧

**[00:14:54]** 那么进行的互联

**[00:14:55]** 每个每个每个计算税之间的里边呢

**[00:14:59]** 包括了两个GB200

**[00:15:00]** 而每个GB200又包括了一个CPU加两个B200啊

**[00:15:04]** 那么九个nv switch tree

**[00:15:05]** 每个里边包括了每个switch节点当中包括了两个啊

**[00:15:09]** nvlink switch这种4.0的芯片啊

**[00:15:11]** 这个是内部的一个情况

**[00:15:12]** 我们再把它放大一下啊

**[00:15:14]** 那么GB200的话呢

**[00:15:15]** 前面提到了它包括两个GB

**[00:15:17]** 200就是一个计算trip当中包括了两个这种单元

**[00:15:20]** 一个单元里面包括了这个一个CPU加两个GPU啊

**[00:15:24]** 大家可以看到呃

**[00:15:25]** 两个颜色

**[00:15:26]** 蓝色的话呢是NVLINK到交换机之间的啊

**[00:15:29]** 他是用的这个满血的这个n m link

**[00:15:30]** 5.0是1.8TB啊

**[00:15:32]** 而橙色部分的话呢是CPU到GPU互联

**[00:15:35]** 他用的是900G的

**[00:15:36]** 这个叫啊c to c的这个技术

**[00:15:38]** 为什么不用1.8

**[00:15:40]** 是因为他做不到吗

**[00:15:41]** 不是做不到

**[00:15:41]** 是因为什么呢

**[00:15:42]** GPU之间需要带宽更大

**[00:15:44]** 而CPU和GPU之间

**[00:15:45]** 他的这种传输用不到特别大的带宽

**[00:15:48]** 我个人认为个人是这么认为的啊

**[00:15:50]** 所以他用的是900G

**[00:15:52]** 那么他是如何来去把这个内部的互联拓扑

**[00:15:56]** 把这个72个芯片

**[00:15:57]** 通过它通过n v switch的这种芯片

**[00:16:00]** 把这个72颗AI芯片做互联的呢

**[00:16:03]** 这个图呢就给大家去呃

**[00:16:04]** 很直观的去展示了一下

**[00:16:06]** 我呢其实比较研究它这个细节啊

**[00:16:08]** 就九个nv switch芯片

**[00:16:09]** 它是什么呢

**[00:16:10]** 呃九个n a switch的这种train啊

**[00:16:13]** 它包括了18个switch芯片对吧

**[00:16:15]** 那么它正好将72颗GPU

**[00:16:17]** 互联成一个逻辑的大GPU

**[00:16:19]** 那么我们知道每一颗GPU芯片啊

**[00:16:21]** B200的或B300

**[00:16:22]** 他有18个mv link的这种接口

**[00:16:24]** 18个是多少呢

**[00:16:26]** 72颗就是嗯1296对吧

**[00:16:29]** 那么每个switch的芯片的话呢

**[00:16:31]** 它能够提供72个接口

**[00:16:33]** 那么一除的话呢呃正好是得到九台啊

**[00:16:36]** 就每台switch tra

**[00:16:37]** 能够提供144个NVLINK接口

**[00:16:39]** 那么正好需要九台

**[00:16:40]** 为什么英伟达是这么设计的呢

**[00:16:42]** 就是说他把这个计算和这个互联啊

**[00:16:45]** 做了这个统一的这种就是解耦的这种分解耦

**[00:16:49]** 解耦的这种设计啊

**[00:16:50]** 就一层的这种NV4witch

**[00:16:52]** 就能实现72克这种最优的这种互联方式呃

**[00:16:56]** 我们可以看到啊

**[00:16:57]** 就是从每一个芯片的角度

**[00:16:58]** 它有18个接口呃

**[00:16:59]** 十呃它有这个72个接口

**[00:17:01]** 它就能够连到每一个

**[00:17:03]** 它就和72颗AI芯片都做互联了

**[00:17:05]** 同样从芯片的角度呢

**[00:17:07]** 我都和72科啊

**[00:17:10]** 都和呃这个18个芯片

**[00:17:13]** 因为他18个接口嘛

**[00:17:14]** 都和18个芯片做互联

**[00:17:15]** 也就是说它可以通过18个switch芯片

**[00:17:18]** 和任意这个超级点内的呃AI芯片啊

**[00:17:23]** 做全互联啊

**[00:17:24]** 这是他的一个厉害的一个地方

**[00:17:25]** 大家可以仔细琢磨一下

**[00:17:28]** 那华为升腾的话呢

**[00:17:29]** 他这个也是国内啊

**[00:17:31]** 华为384啊

**[00:17:32]** 这少了一个四

**[00:17:33]** 少了一个四

**[00:17:34]** 我把它补上

**[00:17:40]** 啊那华为384的话

**[00:17:41]** 去年的话也是非常的火爆啊

**[00:17:43]** 在去年很多场景的场场合当中

**[00:17:45]** 我们都看到了他的一个样机的展示

**[00:17:48]** 那么华为这块呢在国内也是属于我个人认为啊

**[00:17:51]** 也是属于非常领先的啊

**[00:17:52]** 那么它呢内部的组网图呢

**[00:17:54]** 这个图片给大家展示了一下华为的地方

**[00:17:57]** 华为呢这也是用他的一个零渠啊

**[00:17:59]** 叫UB对吧

**[00:18:00]** 把384代表的是384个数

**[00:18:03]** 这个AI芯片的数量

**[00:18:05]** 华为呢它叫ASIC架构

**[00:18:06]** 它叫NPU对吧

**[00:18:08]** 他把这个384个NPU

**[00:18:10]** 加192颗CPU呢通过领取的方式互联

**[00:18:14]** 大家看到它是两层的这种组网逻辑啊

**[00:18:16]** 比如说level1层的话呢

**[00:18:17]** 就是把呃这是一台设备对吧

**[00:18:20]** 四个CPU啊

**[00:18:21]** 八张NPU啊

**[00:18:22]** 那么他通过这个把这个通过领取的网络

**[00:18:25]** 连到第一层的switch的这种UB网络当中

![关键帧 00:18:25](./assets/20260424_BV159AjzwEee_1105s.jpg)

> 视觉分析：超节点产品分析：华为昇腾CM384，强调其支持Scale Up及Scale Out架构并提供详细资源配置图。

**[00:18:31]** 啊那么通过呃UB网络的话

**[00:18:34]** 它是属于内部算力

**[00:18:36]** 那就是内部sky up的这种网络啊

**[00:18:38]** 它是实现规模扩大的这种方式

**[00:18:40]** 而对外啊

**[00:18:42]** 或者说比如多套超级点之间啊

**[00:18:44]** 那么它是采依然是采用这种这种SKYOUT的

**[00:18:47]** 这种方式啊

**[00:18:48]** 我们可以看到啊

**[00:18:49]** 这个是最大是实现了384个NPU

**[00:18:52]** 加1129个CPU

**[00:18:53]** 每一个节点的话呢是八个NPU加四个CPU

**[00:18:57]** 它是这样的一个内部的这样一个扩展的

**[00:19:00]** SKR的扩展的

**[00:19:00]** 而超级点它的性能也是有上限的对吧

**[00:19:05]** 如果我不够的情况下怎么办呢

**[00:19:06]** 那可以通过SKYE

**[00:19:07]** 还是通过原有嗯这种RDMAIB也好

**[00:19:11]** rookie也好

**[00:19:11]** 这种方式去做互联啊

**[00:19:13]** 这是它内部的一个组成架构

**[00:19:14]** 打这个还有一个比较关注的点是什么呢

**[00:19:16]** 就是CPUCPU一样

**[00:19:17]** 他也把CPU呢连到了这个呃

**[00:19:20]** 领取的这个网络当中啊

**[00:19:22]** 这样的话呢他就是说在访问的时候呢

**[00:19:25]** 就是CPU和GPU之间NPU之间的话呢

**[00:19:27]** 他的这个其实从显存呃

**[00:19:29]** 从内存的角度的话

**[00:19:30]** 实现了这个统一的这种访问啊

**[00:19:34]** 那这个是其实这个图呢我拿过来啊

**[00:19:36]** 其实很多朋友会有一个疑问

**[00:19:38]** 那我有有了超节点了

**[00:19:39]** 是不是还需要其他的这种呃地方吗

**[00:19:42]** 超节点的位置呢

**[00:19:44]** 它其实替代了传统的算力集群的位置

**[00:19:48]** 那么你原有的存储网络呀

**[00:19:50]** 存储集群呀

**[00:19:51]** 管理网络呀等等都是需要呃需要的啊

**[00:19:55]** 就是他不是说敲击键全都搞定

**[00:19:57]** 你该配存储配存储对吧

**[00:19:59]** 该走组网走组网

**[00:20:00]** 该用这个业务网络怎么规划

**[00:20:01]** 怎么规划对吧

**[00:20:02]** 还有就是系统管理平台怎么样

**[00:20:04]** 它是只是说代替了你原来

**[00:20:07]** 计算集群的那个部分啊

**[00:20:09]** 其他部分呢你该怎么做

**[00:20:10]** 还需要怎么做啊

**[00:20:11]** 这个是从呃华为这384

**[00:20:13]** 这个这个他的一个资料当中啊

**[00:20:15]** 我截取一个图

**[00:20:16]** 大家可以了解一下

**[00:20:19]** 那么华为的话呢

**[00:20:20]** 其实前段时间就前些天啊

**[00:20:22]** 其实他发布了一个950950

**[00:20:24]** 就是910C的下一代嘛

**[00:20:25]** 就是他的一个最大呢能够提供8192

![关键帧 00:20:25](./assets/20260424_BV159AjzwEee_1225s.jpg)

> 视觉分析：超节点产品分析：华为新一代Atlas 950超节点与英伟达NVL144的核心参数和竞争对比。

**[00:20:29]** 将近1万卡

**[00:20:30]** 就8000多卡的这样一个超级点的产品

**[00:20:32]** 那这个呢也是非常的火爆啊

**[00:20:34]** 前段时间大家都在去讨论

**[00:20:35]** 那么它的核心参数是什么呢

**[00:20:37]** 除了数量比较多之外

**[00:20:38]** 而且他从这个算力精度上已经去丰富到了

**[00:20:41]** FP8和FP4

**[00:20:43]** 那这个的话呢对于模型推理而言

**[00:20:45]** 它的这个效率的提升会非常的明显

**[00:20:48]** 因为大家知道除了卷单卡的算力之外啊

**[00:20:51]** 卷卷这个超级点规模之外

**[00:20:53]** 很多厂商呢芯片它在都在卷什么呢

**[00:20:55]** 卷对于这个芯片呃

**[00:20:58]** 算力精度的这种支持

**[00:20:59]** 当然模型也是一样啊

**[00:21:01]** 它也是支持更小更小数字的精度

**[00:21:03]** 互联带宽的话呢

**[00:21:05]** 这个指的是什么呢

**[00:21:06]** 指个指指的指的总的这个总的这种互联带宽啊

**[00:21:10]** 达到了领取的这种达到了16个PB每秒啊

**[00:21:14]** 这个呢是呃显存的话

**[00:21:15]** 达到了是这个也是PB级别的啊

**[00:21:17]** 右侧这个图呢是华为官方给出的

**[00:21:20]** 相对于这个华呃

**[00:21:23]** 这个英伟达即将发布的NVL144144

**[00:21:26]** 就是一百一百四十四克对吧

**[00:21:27]** 那华为的话呢用8000多克啊

**[00:21:30]** 对比这个

**[00:21:31]** 因为单芯片的性能差距

**[00:21:33]** 肯定是还有还是存在还是蛮大的

**[00:21:35]** 那么华为的话呢

**[00:21:36]** 通过这种超节点的这种方案设计

**[00:21:38]** 那么实现了这个8000多克这种呃

**[00:21:42]** NPO的这种超节点

**[00:21:44]** 内部的这种SKYP的这种互联啊

**[00:21:46]** 这里的话呢大家简单做个了解啊

**[00:21:47]** 就是从数量上

**[00:21:50]** 华为能够实现更大规模的超级电互联

**[00:21:52]** 从算力的话的话也是要是他的N倍啊

**[00:21:55]** 是它的6.7倍啊

**[00:21:56]** 包括内存容量啊

**[00:21:58]** 互联效率等等

**[00:21:59]** 都是要比这个即将发布的英伟达的这种NVL

**[00:22:02]** 72robin架构的NVL

**[00:22:04]** 7144的这种robin架构的这个平台的

**[00:22:07]** 这个算力的规模要啊有一个优势啊

**[00:22:10]** 我们再来简单看一下其他国内的这种

**[00:22:13]** 比较优秀的这种超级奶的这种产品啊

**[00:22:15]** 这个呢图呢是我在去年阿里云栖大会上

**[00:22:18]** 去现场拍的一个图片啊

**[00:22:19]** 大家可以看到它呢和传统机柜有明显的不同

**[00:22:23]** 一是密度比较高

**[00:22:23]** 二呢它是有一个非对称的这种设计啊

**[00:22:26]** 这个呢是阿里超级铁一个定义啊

**[00:22:28]** 就是密度会比较高

**[00:22:29]** 单柜的的话能够支持到128卡

**[00:22:31]** 目前是128卡

**[00:22:32]** 它的设计的话呢达到144卡

**[00:22:35]** 它是采用双scale up的域

**[00:22:36]** 也就是说他理论上是呃呃严格意义上讲

**[00:22:39]** 它是两套啊

**[00:22:40]** 64节点的超级两套

**[00:22:42]** 64节点的这种超节点啊

**[00:22:44]** 还有就是它采用这种CPU和GPU

**[00:22:46]** 算力分离的这种方式

**[00:22:48]** 也就是模块化的设计

**[00:22:49]** 它能够支持什么呢

**[00:22:50]** 它里有个直接的定义

**[00:22:51]** 就是说你CPU升级也好

**[00:22:53]** GPU升级也好

**[00:22:54]** 他们相互之间的影响啊降到最小啊

**[00:22:57]** 还有就是正交架构的设计

**[00:22:58]** 能够去实现运维效率的一个提升啊

**[00:23:01]** 以及它这个链路损耗的一个缩小啊

**[00:23:04]** 这个呢我们再来看这个呢就比较清楚了啊

**[00:23:07]** 比如说前视图

**[00:23:07]** 后视图大家看到这边是呃

![关键帧 00:23:07](./assets/20260424_BV159AjzwEee_1387s.jpg)

> 视觉分析：超节点产品分析：阿里盘久AI Infra2.0 128，介绍其GPU计算资源与集群特性，强调灵活利用与扩展能力。

**[00:23:09]** 这个呃怎么说呢

**[00:23:11]** 这是GPU节点区域

**[00:23:12]** 这个呢是我们看到的这个可以看到这里啊

**[00:23:14]** 有计算机成GPU

**[00:23:15]** 有供电

**[00:23:16]** 还有这个这个包括液冷相关的一些部分啊

**[00:23:19]** 在这一侧啊

**[00:23:21]** 这是后视图

**[00:23:22]** 这是后视图

**[00:23:22]** 这是前视图呃

**[00:23:24]** 简单的从几个方面来看啊

**[00:23:26]** 就是说它是采用啊单柜的呃

**[00:23:29]** 双柜是怎么说呢

**[00:23:30]** 就一套里边的话

**[00:23:32]** 它是双宽机柜的这种方式

**[00:23:34]** 但是它采用非对称的这种方式啊

**[00:23:36]** 最大是144的设计

**[00:23:37]** 但是目前是128啊

**[00:23:39]** 从目前来看公开的参数来看的话呢

**[00:23:41]** 它是最高支持到350千瓦的这种供电能力

**[00:23:45]** 散热方面的话呢

**[00:23:46]** 它是按照500千瓦去设计的啊

**[00:23:49]** 支持的话呢CGPU的话呢达到2千瓦啊

**[00:23:52]** 这种848的这种柜内供电的这种呃

**[00:23:55]** 这种模块化的这种设计啊

**[00:23:56]** 另外就是从这个解耦的方面

**[00:23:58]** 前面也提到了

**[00:23:59]** CPU和GPU节点是解耦的对吧

**[00:24:01]** 那GPU节点与这个呃

**[00:24:03]** 这个a link就是就类似于这个华为的这个林奇和

**[00:24:07]** 阿里的和这个英伟达的nv link啊

**[00:24:10]** 他是解耦的

**[00:24:11]** 那么算力这点之间和供电也是解耦的

**[00:24:13]** 那么这样的话呢对于后续的升级

**[00:24:15]** 每一个模块都可以单独升级演进对吧

**[00:24:17]** 另外就是正交呃的这种设计啊

**[00:24:20]** 就是说他怎么是正交呢

**[00:24:21]** 这是横横插的

**[00:24:22]** 这是竖叉的

**[00:24:23]** 这种正交的设计呢

**[00:24:24]** 可以减少它的一些布线上的一些呃故障点啊

**[00:24:28]** 就是中它中间的少了嘛对吧

**[00:24:31]** 少了之后中间他需要的这种机点少了

**[00:24:33]** 那么它对应的它这种呃

**[00:24:35]** 维护起来的这种效率会更高

**[00:24:37]** 那运营稳可靠性也会更高啊

**[00:24:39]** 另外就是他的这种呃A叫ua link

**[00:24:44]** Ua link

**[00:24:45]** 它的这种方式呢也是其实就是超节点

**[00:24:48]** 无外乎AI芯片和这个互联技术

**[00:24:50]** 大家其实可以看到目前能够发布超节点的

**[00:24:54]** 其实主要是什么呢

**[00:24:55]** 其实主要还是在这个能够做AI芯片的厂商

**[00:24:58]** 英伟达就不用说了

**[00:24:59]** 华为对吧

**[00:25:00]** 阿里啊

**[00:25:02]** 包括像这个这个后面我们看到的啊

**[00:25:05]** 这个曙光对吧

**[00:25:06]** 曙光也一样啊

**[00:25:07]** 他有自己的这个CPU加这个d cu对吧

**[00:25:10]** 呃曙光这个呢其实目前来看

**[00:25:12]** 他因为他是做超算啊

**[00:25:14]** 功底比较深

**[00:25:15]** 所以在液冷领域当中

**[00:25:16]** 他用的是目前行业当中唯一一个用呃

**[00:25:19]** 这个浸墨的啊

**[00:25:20]** 而且是相片浸墨的

**[00:25:21]** 它是采用这种一拖二

**[00:25:23]** 中间是这个怎么说呢

**[00:25:24]** 中间是这个呃液冷的这种供电啊

**[00:25:27]** 方式的这种设计

**[00:25:29]** 而两侧的话呢是用的这个算力节点啊

**[00:25:32]** 那么它呢就是单套能够提供640张

**[00:25:35]** 它的密度是非常大的啊

**[00:25:37]** 但是很多细节没有公开啊

**[00:25:39]** 我们简单去做一个了解

**[00:25:41]** 这里的话呢把三个呃

**[00:25:43]** 这个目前比较主流的这种超级点

**[00:25:45]** 做了一个做了个对比分析啊

**[00:25:47]** 就是从核心架构到性能到互联方式

**[00:25:49]** 到关键技术达到再到POE

![关键帧 00:25:49](./assets/20260424_BV159AjzwEee_1549s.jpg)

> 视觉分析：超节点产品对比：NVL72、华为CM384、曙光640的性能与效率指标。

**[00:25:51]** 这个是这个关呃

**[00:25:53]** 这个是应该是曙光他们那个去主导去做的

**[00:25:56]** 这样一个分析

**[00:25:57]** 目前来看的话

**[00:25:58]** 它几个维度啊

**[00:25:59]** 有些厂商呢就是华为和这个英伟达的全能搞

**[00:26:02]** 都是自己的

**[00:26:03]** 而现在的话

**[00:26:04]** 大家知道现在国产芯片的这种多元性

**[00:26:06]** 就比较比较丰富哈

**[00:26:08]** 就品牌比较多

**[00:26:10]** 那么呃曙光的话呢去宣称支持这种什么呢

**[00:26:14]** 就是多个芯片的这种兼容啊

**[00:26:16]** 当然你可以用多张其他品牌的GPU卡

**[00:26:19]** 也你只要按照他的规范去设计

**[00:26:21]** 也可以支持的

**[00:26:22]** 还有呢就是在一些这个呃开开源

**[00:26:24]** 开放的角度来讲啊

**[00:26:26]** 呃那么呃大家做了一些对比

**[00:26:28]** 质量我就不说谁好谁不好了啊

**[00:26:30]** 这个大家客观的去评价一下就OK

**[00:26:32]** 另外就是从这个散热方面

**[00:26:34]** 用英伟达的话呢和这个华为都是用的冷板

**[00:26:36]** 冷板的这种这种设计

**[00:26:39]** 而这个曙光的话呢用的是静默

**[00:26:41]** 所以说呢从理论上来讲

**[00:26:43]** 这个曙光的这个效率是更高的啊

**[00:26:45]** 就是说它的密度会更高

**[00:26:47]** 散热效率会更高

**[00:26:48]** 嗯再来看这个目前已经公布的这个超节点

**[00:26:53]** 在伊朗方面的一些进展啊

**[00:26:55]** 那么英伟达呢这个robin平台的NL72

**[00:26:58]** 它是用的是全液冷

**[00:27:00]** 全液冷什么概念啊

**[00:27:01]** 就是这个图呢大家非常直观

**[00:27:03]** 上一代的black k vo的这种B300啊

**[00:27:05]** GB300的超级点

**[00:27:06]** 他是用的这种

**[00:27:07]** 还是采用这种风冷加液冷液冷的方式

**[00:27:10]** 液冷为主

**[00:27:10]** 风冷辅助的方式

**[00:27:11]** 而现在这一代的话呢

**[00:27:12]** 大家看到他这个就是全用模块化的设计

**[00:27:15]** 全覆盖了啊

**[00:27:16]** 那么它的效率会更高

**[00:27:18]** 而且从维护角度来讲会更便捷

**[00:27:21]** 另外的话它支持的这种散热的

**[00:27:22]** 这个这个上限也会更大啊

**[00:27:25]** 这里呢大家简单做一个了解

**[00:27:27]** 还有呢就是微通道

**[00:27:28]** 微通道的这种方式呢

**[00:27:29]** 主要是这个呃工艺对工艺的要求啊

**[00:27:32]** 就是对对于那个散热板的要求会更更大

**[00:27:35]** 他的这个效率会更高啊

**[00:27:37]** 也就是怎么去理解呢

**[00:27:38]** 就是传统的话呢我们可能通过一些血管

**[00:27:40]** 大血管去做

**[00:27:41]** 而微通道的话类似于种毛细血管

**[00:27:43]** 他的这种呃覆盖的这种

**[00:27:46]** 覆盖的这种效果会更好啊

**[00:27:48]** 啊这个更细更好啊

**[00:27:50]** 这个呢我因为我不是做专门做这方面

**[00:27:52]** 这个呃不是专门研究这个领域的

**[00:27:55]** 大家可以简单这么理解啊

**[00:27:56]** 就是他对于这个效果的提升是非常大的

**[00:27:59]** 但是这个的核心就在于

**[00:28:01]** 你怎么去保证它的这个工艺啊

**[00:28:03]** 生产的这种工艺啊

**[00:28:04]** 但他这价格可能也会更贵

**[00:28:06]** 嗯还有一点就是它的这个温水啊

**[00:28:08]** 热呃温呃

**[00:28:09]** 就是更高温度的这种进水温度啊

**[00:28:11]** 它降低了这个对于传统IDC的这种要求啊

**[00:28:14]** 这是好的一方面

**[00:28:16]** 但是呢他对于这个你内部的这种设计啊

**[00:28:18]** 你比如说CDU啊

**[00:28:19]** 包括内部的这种这种设计的要求还是很高的啊

**[00:28:23]** 你要呃你高进高出嘛对吧

**[00:28:26]** 高进高出的话呢

**[00:28:26]** 它相对于传统而言

**[00:28:27]** 你低进高出

**[00:28:28]** 它那个对于设备要设备侧的设计

**[00:28:31]** 要讲要求小一些

**[00:28:31]** 而这个的话呢你高进啊相对45度近

**[00:28:34]** 可能有50多度出它

**[00:28:36]** 它或者说升高一两度出

**[00:28:38]** 他对于你的这个系统的这种设计

**[00:28:40]** 要求会很高的啊

**[00:28:42]** 这个呢我们就不展开说了啊

**[00:28:44]** 那么四大方向这个从互联架构的角度

**[00:28:46]** 为什么呢

**[00:28:47]** 因为超节点的发展

**[00:28:48]** 其实核心呢就是芯片加互联技术对吧

**[00:28:51]** 那么GPU互联技术的话呢

**[00:28:53]** 目前来看几个方向

**[00:28:54]** 就是肯定是要比PCIE要更高

**[00:28:57]** 第二呢就是设备的IO互联

![关键帧 00:28:57](./assets/20260424_BV159AjzwEee_1737s.jpg)

> 视觉分析：趋势：超节点GPU互连技术发展的四大方向，包括突破PC性能瓶颈、重塑设备设计方式、简化网络结构部署、迈向光互连新时代方向分析。

**[00:28:59]** 不不仅仅是呃这个AI芯片

**[00:29:01]** 像这个CPU啊

**[00:29:03]** 这个存储啊

**[00:29:04]** 包括配套的一些网卡等等

**[00:29:05]** 都可以去做一个统一的这种池化

**[00:29:08]** 统一的这种打通

**[00:29:09]** 另外就是简化网络拓扑啊

**[00:29:11]** 那么尽尽可能的去在呃之间啊互联之间啊

**[00:29:14]** 减少冗余啊

**[00:29:15]** 那么提高它的这种这种带宽和这种效率

**[00:29:18]** 另外就是像迈向光互联

**[00:29:20]** 这个呢就是呃一个方向啊

**[00:29:23]** 应该从最新的这个GT大会上大家也能看到啊

**[00:29:26]** 那么这个CPU这个CPU的这种交换机

**[00:29:29]** 以及这种光互联技术的应用

**[00:29:30]** 已经目前来讲

**[00:29:31]** 已经进入到真正实战落地的一个角度

**[00:29:34]** 实战落地的一个阶段

**[00:29:36]** OK我们简单思考一下

**[00:29:37]** 那么超节点这个产品呢

**[00:29:39]** 它嗯想落地啊

**[00:29:40]** 我这是我个人总结的啊

**[00:29:42]** 仅供参考

**[00:29:42]** 因为超级点个人认为呢还是是一个奢侈品

**[00:29:45]** 为什么呢

**[00:29:45]** 动辄大几千万上几个亿

**[00:29:47]** 一般客户他其实是很有能力有限啊

**[00:29:50]** 就是他预算有限

**[00:29:51]** 要想落地呢

**[00:29:52]** 我就个人认为是三个方面

**[00:29:53]** 第一客户要有预算

**[00:29:54]** 真正能够买得起

**[00:29:56]** 第二客户有技术用得好

**[00:29:58]** 第三个的话真正能有应用

**[00:30:00]** 就是价值能发挥啊

**[00:30:01]** 这个的话呢主要聚焦在像一些互联网对吧

**[00:30:04]** 所以互联网公司

**[00:30:05]** 包括一些这个大的这种制造企业啊

**[00:30:08]** 这个这个他们会用到啊

**[00:30:09]** 互联网啊

**[00:30:10]** 包括运营商

**[00:30:11]** 他们他们有真正有能力

**[00:30:12]** 有有有这个技术

**[00:30:14]** 还有一些这个客户群体受众

**[00:30:16]** 他们才能把它真正的价值发挥出来嗯

**[00:30:19]** OK那么今天的内容分享就是这些啊

**[00:30:22]** 那么感谢大家对我的支持

**[00:30:24]** 也别忘了这个是可以顺手啊

**[00:30:26]** 帮我点个赞啊

**[00:30:27]** 感谢大家

## 原文链接

https://www.bilibili.com/video/BV159AjzwEee
