---
格式版本: 2
标题: "华为把8192张显卡，“焊”成了一张"
原文链接: "https://www.bilibili.com/video/BV1qyPrzME8x"
发布日期: "2026-03-08"
发现时间: "2026-03-08T00:00:00+08:00"
入库时间: "2026-05-28T02:39:38+08:00"
来源平台: "历史资料迁移"
搜索渠道: "legacy_migration"
搜索词: "url-index.json 迁移"
匹配关键词:
  - "url-index.json 迁移"
  - "待定数据"
  - "厂家"
  - "华为"
  - "Bilibili"
  - "超节点"
  - "高速互联子系统"
  - "05.md"
相关厂家:
  - "华为"
相关专家:
  []
内容类型: "视频"
抓取工具: "历史采集"
清洗工具: "历史资料原文保留 + LLM 正文裁剪"
关联判断: "待人工确认"
关联置信度: 0
关联理由: "历史资料迁移，未重新调用模型判定"
AI优质: "否"
AI打分: 66
AI分档: "召回候选"
AI质检状态: "不通过"
AI打分理由: "内容聚焦华为Atlas 950超节点架构、UB互联协议与光模块、模块化设计及年末商用计划，主题高度相关且信息较新。但来源为B站自媒体视频，属二手解读，技术细节偏科普概述且部分参数表述存疑，缺乏官方一手规格与明确客户落地信号，综合评为召回候…"
AI质检模型: "qwen3.6-plus"
AI质检时间: "2026-06-03T10:39:27+08:00"
AI主题相关性: 18
AI来源权威性: 6
AI新颖性: 14
AI技术细节: 12
AI商业部署信号: 8
AI完整性: 8
采集批次: "2026年5月28日2点39分33秒"
采集批次ID: "legacy-migration-20260528023933"
去重键: "https://www.bilibili.com/video/BV1qyPrzME8x"
人工更新时间: "2026-06-03T09:31:34+08:00"
---

## 视频简介

*(无简介)*

## 字幕全文

**[00:00:00]** 大家还记得去年华为的cloud matrix384亮相吉特

**[00:00:03]** 英伟达老黄连夜找特朗普打小报告

**[00:00:05]** 逼得美国放松对H100出售管控吗

**[00:00:08]** 最近华为又又又更新超节点产品了

**[00:00:11]** 这里是差评

**[00:00:12]** 前言部

**[00:00:13]** 我们在巴塞罗那MWC的现场

**[00:00:15]** 整个会场到处都弥漫着AI的味道

**[00:00:17]** 华为也带来了他们最新的计算产品

**[00:00:20]** atlas950超节点

**[00:00:21]** 我们都知道

**[00:00:22]** 因为起步晚

**[00:00:23]** 芯片工艺的问题

**[00:00:24]** 现在国内显卡性能无法与英伟达

**[00:00:26]** 最先进的卡相比

**[00:00:27]** 但华为走通了一条大力出奇迹的路

**[00:00:30]** 用拼规模的方式缩小差距

**[00:00:32]** 现场展示的是他们一个机柜的demo

**[00:00:34]** 这一整个机柜大概可以放下64张升腾显卡

**[00:00:37]** 多个机柜串联的话

**[00:00:38]** 大概最多能扩展到8192张显卡互联

**[00:00:41]** 相比去年3月份的AITAS900超节点

**[00:00:44]** 也就是我们熟知的cloud matrix

**[00:00:46]** 384最高384张显卡互联

**[00:00:49]** 可以说足足提升了21倍

**[00:00:51]** 当然大规模也不是谁都能拼的

**[00:00:53]** 背后的门道也不少

**[00:00:54]** 我们看到它把功能相同的产品都集中在了一起

**[00:00:57]** 比如电源CPUGPU

**[00:00:59]** 这有什么好处呢

**[00:01:00]** 只要每个模块的标准化排线

**[00:01:02]** 散热抗干扰啥的都可以做的非常好

**[00:01:05]** 后期运维也会简单很多

**[00:01:06]** 当然这不是超级点的核心

**[00:01:08]** 我觉得最关键的是

**[00:01:09]** 华为打通了不同显卡之间的互联问题

**[00:01:12]** 想要把几千张显卡当做一张显卡用

**[00:01:14]** 就要把显卡间互联的延迟降到最低

**[00:01:17]** 硬件上

**[00:01:17]** 华为做到了稳定传输的光传输模块

**[00:01:20]** 最长可达1000米

**[00:01:21]** 保证机柜之间高速互联

**[00:01:23]** 软件上

**[00:01:23]** 华为用unified bus

**[00:01:25]** 也就是零区协议

**[00:01:26]** 打通了不同组件间数据传输的阻碍

**[00:01:29]** 要知道

**[00:01:29]** 一般一个NPU的数据想要传到另一个NPU

**[00:01:32]** 会经过多个不同的组件

**[00:01:34]** 因为不同组件间的协议不同

**[00:01:35]** 需要至少经过三次打包和解包的过程

**[00:01:38]** 数据才能传过去

**[00:01:39]** 时间全部耽误在这上面了

**[00:01:41]** 但是如果都用的是领取协议的话

**[00:01:43]** NPU和NPU之间就可以直接通信

**[00:01:45]** 不用额外的数据打包

**[00:01:47]** 不用CPU转发

**[00:01:48]** 就像打通了点对点的高速公路一样

**[00:01:50]** 这样所有的NPU内存

**[00:01:52]** 可以看成一块超大的虚拟内存

**[00:01:54]** NPU之间的读写像访问本地一样简单

**[00:01:57]** 数据传输速度一下就提上来了

**[00:01:59]** 根据华为的说法

**[00:02:00]** 这塞特勒950内部互联带宽

**[00:02:02]** 可以达到每秒16.3PBFP

**[00:02:04]** 八算力可以达到800000000flop

**[00:02:06]** 他一秒钟能完成的计算量

**[00:02:08]** 相当于咱家用电脑算上百年时间

**[00:02:11]** 你想8192张NPU统一编制

**[00:02:13]** 无缝并行

**[00:02:14]** 这能力英伟达看了也得羡慕死了

**[00:02:16]** 毕竟英伟达2027年的规划

**[00:02:18]** 撑死也只有576张卡

**[00:02:20]** 就是因为缺少灵渠这个直通车

**[00:02:22]** 不过华为为了打破整个行业的算力生态壁垒

**[00:02:26]** 已经在去年底把领取进行了开源

**[00:02:28]** 如果英伟达在未来适配领取的话

**[00:02:30]** 估计也能很快实现相同规模的服务器

**[00:02:32]** 不得不说这波华为大格局了哈

**[00:02:35]** 去年cloud matrix384刚出来的时候

**[00:02:37]** 我们欣喜地看到国产显卡的突破

**[00:02:39]** 尤其是他和deep sick的完美适配

**[00:02:42]** 给了国人很多对发展国产大模型的信心

**[00:02:45]** 没有英伟达

**[00:02:46]** 我们也有自己的一把刀

**[00:02:47]** 但要说遗憾也是有的

**[00:02:49]** 受限于显卡的性能和规模

**[00:02:51]** 彼时我们还不能支持预训练

**[00:02:53]** 只能支持推理训练

**[00:02:54]** 而现在华为带着艾特勒950迅速突破

**[00:02:57]** 这个产品

**[00:02:58]** 预计今年年末就能商用

**[00:03:00]** 到时候咱国内的万亿参数

**[00:03:01]** 大模型的预训练也能啃下

**[00:03:03]** 而且8192远不是极限

**[00:03:05]** 未来50万张显卡的互联互通也在规划中

**[00:03:08]** 也许艾特勒在生态上离英伟达还有不少距离

**[00:03:11]** 但是他给了我们一个底气

**[00:03:13]** 你尽管继续禁售

**[00:03:14]** 我们自己发展也很快

**[00:03:16]** 尽管难

**[00:03:16]** 但你无法掐住我们的脖子

**[00:03:18]** 限制我们的发展路

## 原文链接

https://www.bilibili.com/video/BV1qyPrzME8x
