---
格式版本: 2
标题: "| NVIDIA On-Demand"
原文链接: "https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/"
发布日期: "2026-09-03"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "rule:local:strict_original_body"
发布时间证据: "Published Time: Thu, 03 Sep 2026 05:53:38 GMT"
发布时间校准原因: "规则确认唯一严格发布时间，来源 local:strict_original_body"
发布时间校准置信度: "high"
发布时间候选数量: 8
发布时间严格候选数量: 2
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-09-03T14:38:19+08:00"
发布时间仲裁状态: "skipped"
发布时间仲裁尝试次数: 0
发布时间仲裁耗时毫秒: 0
发现时间: "2026-09-03T14:37:40+08:00"
入库时间: "2026-09-03T06:38:19.128Z"
来源平台: "固定入口"
搜索渠道: "fixed_url"
搜索词: "https://www.nvidia.cn/gtc/"
匹配关键词:
  - "NVLink"
  - "路线图"
  - "部署"
  - "性能"
  - "带宽"
  - "内存"
  - "GPU"
  - "光"
  - "计算"
  - "AI"
相关厂家:
  - "NVIDIA"
  - "Meta"
相关专家:
  []
内容类型: "网页"
抓取工具: "Jina Reader"
清洗工具: "Jina Reader Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 60
AI分档: "召回候选"
AI质检状态: "不通过"
AI打分理由: "正文主线为CUDA编程模型、执行调度及编译工具链（Green Contexts, CUDA Tile, Dynamo等）的技术演讲，虽涉及NVLink 72机架和超节点系统的软件层调度与内存管理，但缺乏硬件架构、规格参数或量产部署等核心基础设施增量信息。来源为NVIDIA官方GTC会议视频页（On-Demand），权威性高，但页面主体为视频播放器与字幕，正文完整性受限。属于软件/开发者工具层面的技术分享，未命中超节点硬件/标准/部署的高价值准入通道，判定为召回候选。"
AI质检模型: "qwen3.8-flash"
AI质检时间: "2026-09-03T22:27:47+08:00"
AI主题相关性: 12
AI来源权威性: 14
AI新颖性: 10
AI技术细节: 16
AI商业部署信号: 2
AI完整性: 6
AI评分提示词版本: "v17-精简生产版"
AI评分提示词SHA256: "48fb9777f386026761b4873eaff30807694fb11e9b352d7c69bf2dfde750cc7d"
AI评分知识库版本: "knowledge_base_v1-20260819+runtime.79"
AI评分知识库SHA256: "ad5339a9b3f07a474daef7187359bbf1a27ee77a32c91143b7d7a0dd1ca535b4"
AI评分知识库检索词: "[\"NVIDIA\",\"NVIDIA GTC\",\"https://www.nvidia.cn/gtc/\",\"Blackwell\",\"NVLink\",\"GPU\",\"英伟达\",\"Meta\",\"URL\",\"GMT\",\"EN\",\"TAL\"]"
AI评分知识库命中: "[{\"id\":\"runtime-f42510f490b4e8271c10e963\",\"title\":\"NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt\",\"sourceType\":\"ai_excellent_article\",\"time\":\"\",\"matchedTerms\":[\"NVIDIA\",\"NVIDIA GTC\",\"Blackwell\",\"NVLink\",\"GPU\",\"URL\",\"EN\",\"TAL\"],\"rank\":-13.21303650791069},{\"id\":\"july-correct-0095\",\"title\":\"Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"NVIDIA\",\"Blackwell\",\"NVLink\",\"GPU\",\"Meta\",\"URL\",\"EN\",\"TAL\"],\"rank\":-12.140742916510298},{\"id\":\"runtime-e7e2d0be34e4809da81f22ad\",\"title\":\"Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents\",\"sourceType\":\"ai_excellent_article\",\"time\":\"\",\"matchedTerms\":[\"NVIDIA\",\"NVIDIA GTC\",\"Blackwell\",\"NVLink\",\"GPU\",\"URL\",\"EN\",\"TAL\"],\"rank\":-12.131854234177958},{\"id\":\"runtime-52343a012216677e078ffdd2\",\"title\":\"NVIDIA NVLink Fusion Expands With NVHBM Custom High-Bandwidth Memory\",\"sourceType\":\"ai_excellent_article\",\"time\":\"\",\"matchedTerms\":[\"NVIDIA\",\"NVIDIA GTC\",\"NVLink\",\"GPU\",\"URL\",\"EN\",\"TAL\"],\"rank\":-11.649051458123592},{\"id\":\"runtime-8870e60555ebf4805990c527\",\"title\":\"How XPUs Meet a World-Class AI Factory\",\"sourceType\":\"ai_excellent_article\",\"time\":\"\",\"matchedTerms\":[\"NVIDIA\",\"NVIDIA GTC\",\"NVLink\",\"GPU\",\"URL\",\"EN\",\"TAL\"],\"rank\":-11.37858180922832}]"
采集批次: "2026年9月3日14点30分09秒"
采集批次ID: "20260903-143009-038"
去重键: "https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859"
---

Title: | NVIDIA On-Demand

URL Source: https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/

Published Time: Thu, 03 Sep 2026 05:53:38 GMT
Thu, 03 Sep 2026 05:53:38 GMT

Markdown Content:
[](https://www.nvidia.cn/ "NVIDIA 引领人工智能计算")

*   [](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/#) 
*   [](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/#)      
*   [](https://www.nvidia.cn/account/)
*   [登录](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/#)[登出](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/#)

    *   [简中](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/#)
        *   [简中](https://www.nvidia.cn/on-demand/)
        *   [EN](https://www.nvidia.com/en-us/on-demand/)
        *   [日本語](https://www.nvidia.com/ja-jp/on-demand/)
        *   [繁中](https://www.nvidia.com/zh-tw/on-demand/)
        *   [한국어](https://www.nvidia.com/ko-kr/on-demand/)

[NVIDIA On-Demand](https://www.nvidia.cn/on-demand/)

[精选播放列表](https://www.nvidia.cn/on-demand/featured-playlist/)

[我的频道](https://www.nvidia.cn/on-demand/my-profile/)

[常见问题解答](https://www.nvidia.cn/on-demand/faq/)

[高级搜索](https://www.nvidia.cn/on-demand/search/?q=-&sort=date&headerText=All%20Sessions&expandFilter=true)

*   [精选播放列表](https://www.nvidia.cn/on-demand/featured-playlist/)
*   [我的频道](https://www.nvidia.cn/on-demand/my-profile/)
*   [常见问题解答](https://www.nvidia.cn/on-demand/faq/)
*   [高级搜索](https://www.nvidia.cn/on-demand/search/?q=-&sort=date&headerText=All%20Sessions&expandFilter=true)

[](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/# "Menu")

[](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/# "Menu")

*   [精选播放列表](https://www.nvidia.cn/on-demand/featured-playlist/)
*   [我的频道](https://www.nvidia.cn/on-demand/my-profile/)
*   [常见问题解答](https://www.nvidia.cn/on-demand/faq/)
*   [高级搜索](https://www.nvidia.cn/on-demand/search/?q=-&sort=date&headerText=All%20Sessions&expandFilter=true)

[Video 1](blob:https://www.nvidia.cn/b1e646b5-623c-4490-8c3e-99b4d6cda8a0)

Video Player is loading.

Play Video

Play

Mute

Current Time 0:00

/

Duration 44:26

Loaded: 0.08%

00:00

Stream Type LIVE

Seek to live, currently behind live LIVE

Remaining Time-44:26

1x

Playback Rate

Chapters

*   Chapters

Descriptions

*   descriptions off, selected

Subtitles

*   字幕选项, opens subtitles settings dialog
*   关闭字幕
*   Simplified Chinese, selected
*   英语 (自动生成)

Audio Track

*   default, selected

*   Quality
*   360p
*   480p
*   540p
*   720p
*   1080p
*   Auto, selected

Picture-in-Picture Fullscreen

This is a modal window.

Beginning of dialog window. Escape will cancel and close the window.

Text Color Transparency Background Color Transparency Window Color Transparency 

Font Size Text Edge Style Font Family

Reset restore all settings to the default values Done

Close Modal Dialog
End of dialog window.

字幕

X

X

00:10

大家好

00:12

感谢您从马路对面赶来听我介绍 CUDA

00:16

我每年都会谈到这一点 而且总有许多话要说

00:23

我站在这里，代表着数百名同事，他们 做了大量工作，取得了惊人的成就

00:29

所以，我是发言人，而不是所有 这些事情背后的推动者

00:37

通常，在这些演讲中，我首先 介绍一下我对 GPU 计算的格局

00:44

和本质的看法，然后将这些内容 与我们的发展方向联系起来

00:50

我经常谈论并行编程和并行算法

00:55

显然，这就是我所做的

00:57

这实际上是我几年前在一次演讲 中使用过的一张幻灯片，用于介绍

01:03

如何在 GPU 算法、深度学习、科学计算 等领域利用不同形式的并行性

01:11

但我今天不想讨论并行算法

01:15

我其实更想谈谈它们 的运行方式，对吧？

01:20

这些并行算法必须在巨大的系统 上运行，就像这样

01:24

因此，这不仅仅是将程序分解成 多个部分，以便能够将数据进行

01:28

分割并一起处理的问题

01:29

它还涉及如何运行这些数据、如何运行 这些程序、在何处运行这些程序等

01:38

GPU 可以被视为这个 巨型数据中心的缩影

01:42

这里是 Blackwell GPU

01:44

它有 160 个 SM

01:46

它有数十万个线程

01:49

光是这台计算机就可以被 视为一台超级计算机

01:52

我看了看。它与 2004 年全球 最大的超级计算机一样大

01:56

这是一款集强大功能于一身的芯片

01:59

当然，如今这些数据中心拥有 多达 10 万个甚至更多的服务器

02:05

但是，我想谈谈并行执行和并行算法 方面的对称并行与非对称并行

02:12

因为我看到这些系统上的程序运行 方式正在发生巨大变化

02:19

我将对称并行定义为当一个 并行程序填充整个机器时

02:24

该机器的每个核心、每个节点 都在同一时间运行相同的内容

02:29

当然，非对称是相反的情况 即运行多个不同的东西

02:33

因此，从 CUDA 角度来看，CUDA 早就支持对称执行

02:37

在 CUDA 中，我们使用所谓的 网格启动，即在一个程序上运行

02:41

然后在所有 SM 上运行，在 Blackwell Ultra 中，共有 160 个 SM

02:47

因此，您在各个地方运行相同的 内容，这就是非常对称的机制

02:51

因此，如果我运行一系列工作 A 后面是 B，后面是 C，那么我首先

02:56

运行 A，然后运行 B，然后运行 C 它是对称的，因为每个人都在运行相同

03:01

的内容，它也是顺序的，因为我在运行 B 之前先完成了所有 A 处理，对吗？

03:09

几乎从一开始，CUDA 就提供了 一种打破这种限制并利用机会

03:15

完成更多工作的能力

03:17

有时 GPU 的某些部分处于空闲 状态，因此我们开发了 CUDA

03:23

Streams，它允许您选择要运行 的工作，并创建操作序列

03:30

几年前，我们更进一步，定义了一个 任务图，将所有工作封装在一个工作

03:38

流中，并表示这些工作将如何运行

03:43

但是，所有这些东西 并不一定能填满整个机器

03:47

因此，我可以查看此流，然后说 好吧，通过此流进行时间切片

03:51

在特定时间，我的机器上可能 同时运行 A、B 和 C

03:58

但是，GPU 的运行方式的本质是 这些流只是描述了可以完成的工作

04:04

如果 A3 首先跳入，它可能会 填满整个系统，而 B2 和 C1

04:09

则无法与之并行运行，对吗？

04:12

因此，即使并行性是不对称的，它也 不是真正的保证，而是机会主义

04:19

因此，我想谈谈这一举措

04:23

需要更多的保证

04:26

之所以采取这一举措，是因为 如果能够以这种方式描述工作

04:31

那么将有大量性能和优化机会

04:35

这里展示的是一个非常形象化的图像

04:40

推理工作负载

04:41

通常，你会将其视为生产和消费模式

04:45

首先，您需要输入查询，接收 用户请求，然后查看大量数据

04:52

并对其进行处理，以创建上下文 创建解码器将要处理的内容

05:01

解码循环快速迭代，生成 token

05:05

我从 Dynamo 的朋友那里偷来这张图 它很好地描述了对称和非对称并行

05:12

之间的区别，以及当前的发展趋势

05:16

所以，在左侧，您所 看到的是传统服务

05:20

您有预填充操作

05:23

然后，解码操作会在之后生成 token

05:27

现在，您面临的挑战是，如果查看 左侧的图片，预填充非常依赖计算

05:33

需要大量的计算工作

05:35

它会执行许多矩阵运算

05:37

它执行的是矩阵乘以矩阵乘以矩阵

05:39

因此，您需要强大的计算能力

05:42

而右侧的 token 生成（解码 组件）则不需要太多的计算能力

05:49

它需要的是能够快速迭代内存

05:52

它需要大量内存带宽

05:54

因此，您配置或配置这两个 系统的方式截然不同

05:58

因此，如果大家还记得我之前 提到的 ABC，那么右边的想法

06:01

就是，我们不要试图将所有这些 都按顺序放在一个系统中

06:05

让我们故意同时运行这两个程序 并对它们进行一些不同的配置

06:10

而且可以带来巨大的好处。这可以 将速度提升 10 倍甚至更多，因为

06:15

现在您已经调整了这两个部分的规模

06:19

因此，就运行方式而言，我的预 填充工作线程在 GPU 集上运行

06:25

而解码工作线程在另一 GPU 集上运行

06:30

这样我就可以控制配置

06:32

现在，所有这些都需要由大量 的复杂性和系统来监督，以便

06:37

管理运行的位置，因为这些工作 负载非常难以预测，对吗？

06:42

它们会移动、变化，你不知道查询内容 是什么，还有很多不同的事情在发生

06:49

因此，这个编排器，我在这里填入了 Dynamo 系统，这是 NVIDIA 的这种分解

06:55

系统的编排器，它的工作是集中控制

07:00

它的工作是动态管理 运行内容和运行位置

07:04

它将启动这些推理引擎，这些 推理引擎将运行预填充工作线程

07:08

和解码工作线程，所有这些都 将被精妙地编排在一起

07:13

有趣的是，如何协调这些工作 负载将取决于工作负载本身

07:20

如果我的工作负载非常依赖上下文 如果有人说，这是维基百科，请为

07:23

我总结一下，那么这就是大量的数据

07:25

我将重点介绍预填充 部分，即蓝色部分

07:29

但如果我正在进行推理，生成 token 并将其反馈到自身，那么

07:34

我需要优先生成 token，对吗？

07:37

因此，最终的结果是这种非常 谨慎的动态控制，非常针对特定

07:42

问题，甚至在问题内部也是动态的 以控制生产和消费之间的平衡

07:48

目标是让所有组件都得到充分的 资源，让所有组件都全力以赴

07:52

感谢您的宝贵时间

07:55

所以，让我们回到单 GPU，因为 正如我所说，单 GPU 本身就是

07:59

一个由 160 个 SM 组成的庞大系统

08:02

我也可以用同样的方式思考，对吗？

08:08

我可以思考如何利用具有 Teraflops 性能和数百个

08:13

SM 和数十万个线程的 GPU

08:17

您可以轻松地以类似的方式将这些资源 进行分区，将部分资源用于特定任务

08:24

除了在更小的环境中，它还具有 与大系统去隔离相同的好处

08:29

因此，虽然你可能无法在单个 GPU 的 显存中运行整个 AI 模型，但对于许多

08:36

小任务来说，这种分区方式非常有用

08:40

现在，GPU 面临的挑战是，尽管我们 拥有许多多任务机制，而且这些机制

08:45

已经存在了很长时间，但我在前面提到 的 CUDA 的左流几乎从一开始就存在

08:51

在右侧，我有一个我们称之为多 实例 GPU 的设备，它具有硬分区

08:56

但它不具备这些工作 负载所需的动态性

09:00

中间是多进程服务，它在 这方面做了很多工作

09:05

它让我能够分区，但它并 没有给我带来动态性

09:10

这些限制使得我很难获得我想要 的这种有保证的不对称性，这种

09:16

控制水平与分区水平相结合

09:20

因此，我们在过去几年里所 做的就是构建这个名为 Green

09:23

Contexts 的东西

09:25

Green Contexts 是一种位于流 之间的机制，因为它位于单个

09:31

进程中，在单个应用程序中 允许动态响应正在发生的事情

09:38

另一方面，多进程服务为我提供了 分区，这为我提供了所需资源的细分

09:45

它恰好介于两者之间 如果你愿意，可以……

09:50

它将是一个单一应用，一个单一 控制器，就像 Dynamo 控制器

09:54

一样，它可以协调我的程序并 动态分配我需要的资源，而不是

09:59

使用单独的进程，这更多的是将不同的 东西隔离并一起运行。我们使用 GPU

10:05

那么，您如何快速在它们之间 进行选择？但我真的想谈谈绿色

10:10

上下文，因为我认为这开启了一种 新能力，这种能力真正关注我刚刚提到

10:16

的保证不对称性和保证并行性的未来

10:21

因此，创建绿色背景非常简单 即使我这里有许多步骤

10:26

您会发现机器上有多少个 GPU 在本例中为 160 个

10:29

您可以决定如何对它们进行分区 然后为这些不同的分区创建一组

10:34

描述符，以便我使用这些描述符 为它们分配绿色上下文

10:38

我这里有这些描述符，以便您可以 嵌套上下文和其他类似的东西

10:44

在确定了这些描述符并决定了分区 方案后，您就可以创建绿色上下文

10:48

而上下文只是运行某些内容 的一个小边界沙箱

10:53

从中创建 CUDA 流

10:55

如果您是 CUDA 开发者，您会知道 这个流就是我提交和调度工作的单位

11:02

非常重要的是

11:05

您只是正常地在流中 启动核函数，对吧？

11:07

这就是绿色环境中的神奇之处

11:10

我可以将执行（换句话说 布局、映射、分区）与个人

11:17

工作分开管理，对吗？

11:20

这就像我有一个控制系统来管理 正在运行的内容和正在运行的东西

11:24

而这些东西只是在做自己的事情

11:26

我可以创建其中一个流

11:27

我可以启动

11:29

如果运行爆炸操作、傅里叶变换 或其他程序，它会占用一半或

11:35

三分之二的 GPU 资源，完全 无视我给它分配了较少资源的事实

11:42

因此，这使我能够实现我想要的复用

11:48

所有这些都来自 CUDA 的一部分 即开发者工具，这些工具可让您深入

11:54

了解程序在何处运行以及如何运行

11:58

因为坦率地说，如果你要进行 这种并行程序控制，你必须能够

12:03

检查你正在实现的目标，以便 进行调整、优化，并发现问题所在

12:12

这种动态控制在何处运行的能力 无需影响我实际运行的工作

12:19

从而产生许多不同的模式

12:23

这是我在幻灯片上绘制的四个图案

12:25

您可以轻松想象出其他十几种模式

12:28

但关键在于，你可以用它做各种各样 的事情，因为现在我可以说哪些

12:32

东西在什么地方运行，哪些东西 会重叠，这为各种事情打开了

12:37

大门，低延迟预留是一个常见的事情

12:40

这是一种改进的优先级 形式，我保证资源可用

12:46

重叠执行、嵌套上下文，这些都是 我想要谈论的，但实际上我最想谈论

12:52

的是动态分区，因为这指向了我一直 在谈论的这种分解的工作负载，对吗？

12:58

能够控制在何处运行的内容，对吧？

13:01

关于非对称并行的讨论，对吧？

13:03

控制它的能力是关键

13:06

绿色背景对我来说就是关键

13:09

它的工作原理是，我拥有的这些 不同的流，任何放入该流的内容都只

13:18

在创建该流的绿色上下文沙箱中运行

13:24

因此，我的流 A 位于 A 框中 我的流 B 位于 B 框中，我的

13:28

流 C 位于 C 框中。这似乎非常 简单明了，我希望如此，因为

13:32

最好的工程就是这样的隐形工程

13:37

使用 CUDA 还可以做其他一些 事情，我之前提到过图形，您可以

13:40

将流的工作内容捕获到单个图形中

13:43

因此，就像单个图形可以跨越 多个流一样，如果这些流现在针对

13:48

单个绿色上下文，那么我现在有一个 图形可以捕获在不同位置运行的工作

13:53

这是关键。我可以定义一个跨越所有 资源的工作流，并从一个地方启动

14:01

现在，我们真正开始思考这种 编排、这种控制，也就是集中控制

14:06

对图形而言，这实际上并不新鲜

14:09

您一直可以在一个节点中创建跨越 系统中多个 GPU 的图形，因为

14:14

这些 GPU 由 NVLink 或 PCI 连接

14:17

有趣的是，我们已经使用图形很 长时间了，当我提到这一点时

14:21

人们会说，真的，图形可以在 多个 GPU 上运行吗？

14:24

答案是肯定的 它一直都能做到这一点

14:28

因此，如果我有这样的一个图 ABC 我可以让 A、B 和 C 成为不同的

14:31

GPU，以及不同的绿色上下文，对吗？

14:34

规模并不重要

14:35

该图只是描述了工作目标

14:38

当然，如果我稍微向前看一点，那么 这个单节点几乎总是集群的一部分

14:46

它是机架的一部分。它是 系统的一部分，对吧？

14:48

您可以轻松想象，如果我使用 NVLink 连接的 GPU，我可以

14:51

拥有一个跨越的图形，那么我可能希望 一个图形跨越我的 NVLink 72 机架

14:56

为什么不呢？看起来很明显

14:58

想象这可能发生并不是火箭科学

15:00

现在，您无法做到这一点

15:02

我正在展望我们想要做的事情 因为我想告诉大家，如果我们

15:06

想要做到这一点，必须具备哪些条件？

15:10

是的，如果我的一个 NVLink 72 机架 中的所有 72 块 GPU 都可以跨越

15:17

那么我怎么会不愿意跨越多个机架呢？

15:22

或者，我怎么会不愿意 跨越整个数据中心呢？

15:24

例如，在我看来，您需要确定 每个 GPU 上运行的内容

15:29

我想能够定义工作流并分配不同 的 GPU 和资源，回想一下我

15:33

之前关于 Dynamo 的工作原理 的图片，并说这里有一堆预填充，这里

15:38

有一堆解码，以不同的方式管理它们 并拥有一个词汇表，一种表达方式

15:43

CUDA 不会做出 Dynamo 所做的 决策，因为它对系统了解不够

15:47

但它会提供工具，因此 Dynamo 不必自己做很多繁重的工作

15:51

这真的很有趣。但是，要实现 这一看似简单的事情，实际上需要

15:55

在幕后做一些非常复杂的工作，这就是 我们在系统软件层面所考虑的问题

16:02

CUDA 必须能够完成 一些核心多节点任务

16:08

为了实现这一点，我需要一个 相当简单直接的图形，该图形

16:13

包含跨越所有 GPU 的工作

16:15

抱歉

16:17

首先是命名？

16:20

顺便说一句

16:22

这是我在 PowerPoint 中 绘制的最糟糕的图片

16:27

这是一个 36 节点的 RAIDX4 Dragonfly 网络，我让 Nanobanana

16:32

绘制它，结果它画出了一个滑稽可笑 的图，所以我不得不手动绘制这个图

16:38

这里涉及到很多线条、点击和其它 内容，但这些内容很重要，因为

16:43

事实上，当我有了一个大型 系统时，每个人都必须就 B3

16:47

和 F2 的节点达成一致

16:49

而且，如果我说要在 D1 上运行 每个人都必须知道 D1 是什么

16:54

如果我说要将我的内存从这里移到 那里，我们都必须就命名达成一致

16:58

拓扑和命名是基础

17:00

除非你是系统软件层，否则很难以 一致的方式做到这一点，因为 CUDA

17:04

正在这些机器的每一台机器上运行

17:07

CUDA 可以坐在这里说，是的 我们都知道 F2 是谁

17:10

但是，如果 10 个不同的 应用程序都以不同的方式

17:12

列举它，那么这真的很难做到

17:14

因此，这些功能需要在 系统软件层中实现

17:18

现在，我们已经讨论了 多节点执行，对吧？

17:21

显然，我希望能够从一个位置 启动多节点 CUDA 图，但跨越

17:26

系统中的任何 GPU

17:29

但还需要更多，对吧？

17:31

在这种规模的上下文中，CUDA 图形 需要能够提供一些额外的保证，这些

17:37

保证对于我们能够实现我之前提到的有 保证的非对称并行性非常重要，对吗？

17:44

我不仅想知道这些东西在哪里 运行，还想知道它们什么时候运行

17:50

我需要能够说，这些东西会相互 通信，确保它们同时运行

17:54

或者，这个任务必须先于另一个 任务开始，因为这个任务将设置

17:58

一些该任务将要使用的东西

18:00

因此，从某种意义上说，我所 得到的是一个图形，它表示我们

18:05

今天所说的控制依赖关系现在 正在获取一组新的依赖关系

18:09

即约束，这些约束表示确保 A3、B2 和 C1 一起运行，因此我得到的是我之前

18:15

向您展示的图片，而不是机会主义

18:18

因为在我们讨论的这种 规模下，这一点非常重要

18:23

最后一点，也是最难做到的一点 我们仍在思考这个问题

18:28

这些都是 CUDA 尚未具备的功能 但我想与大家分享的是我们正在

18:32

考虑的内存管理方式

18:34

显存管理显然是系统级的事情

18:36

内存管理分配位于 Linux 内核 或 Windows 内核中

18:40

这不是应用程序需要处理的问题 因为它是全局性的，并且与命名

18:44

和所有其他方面都息息相关

18:46

但是您可能也这么做过，所以我们 认为，这将比分配指针要复杂一点

18:51

因为你需要考虑更多，对吧？

18:53

所以，首先你要说 好吧，这是我的花

18:57

我们称之为花，无论您在哪个 节点上，每个人都同意这是花

19:01

如何分解工作完全取决于您

19:03

我不知道如何打破，也许你想要 方块，也许你想要长条，我不知道

19:07

根据你的问题，你将 弄清楚如何分解它

19:10

因此，您必须决定如何 跨越、分配和排列花朵

19:15

然后，您必须决定谁 可以看到哪些内容

19:18

这其实并不明显

19:19

但是，如果我有一台拥有 10 万个 GPU 的机器（这在当今

19:23

非常合理），那么如果我做出 更改并需要告诉人们，如果我

19:27

需要告诉 10 万人，那需要很长时间

19:30

如果我甚至要分配资源，我必须告诉 10 万个关于它的东西，这需要很长时间

19:34

因此，您需要做的就是限制和缩小 谁与谁交谈、谁可以看到什么，这为

19:40

您提供了很多性能调整工作的机会

19:44

最后，所有这些的底线是，一旦 你完成了所有这些工作，你就可以

19:47

指向你的数据，然后读取和写入数据

19:50

与绿色上下文相同，在绿色上下文 内运行的内核不知道也不关心它处于

19:56

绿色上下文，因此我们决定多节点 CUDA 的粒度不是跨越多个 GPU 的一个网格

20:04

整个系统的内核各不相同

20:07

内核本身是本地的

20:11

网格是局部的，而图覆盖整个系统

20:14

这是我们的一个关键决策点，因为这 意味着，如果我看看这些堆栈的图片

20:20

一个分层的多节点系统软件堆栈 在这种情况下，每个 GPU 上的一切都是

20:25

垂直堆栈，由编排器管理一切 看起来很漂亮，但实际上并不漂亮

20:31

实际上，每个人都绕开了 其他人，他们都在横向、

20:34

上下交谈，这真的让人抓狂

20:36

因为现在每个人都在尝试将各种 东西拼凑在一起，所以我们的

20:41

想法是，如果我可以插入一个层 一个多节点 CUDA 驱动程序，它可以

20:46

为您提供命名功能，让您能够管理 内存，我们不会为您管理决策，而是

20:52

为您提供工具，让您做需要做的事情 然后，我们的想法是，您在这里生成

20:58

互操作性，确保每个人都在谈论节点 F2 是同一个节点，最终，这会融合到……

21:05

只有 CUDA。CUDA 成为多节点 CUDA

21:08

这就是我们要关注的领域。这就是 CUDA 及其超越之处，如果你

21:11

喜欢，这就是演讲中超越之处

21:13

但我想让大家知道我们是如何 思考的，并让大家自己思考一下

21:16

这与大家正在做的工作有什么 关系，因为说实话，现在已经没有

21:20

人再在单 GPU 机器上运行任何东西了

21:25

现在，我们已经为多节点和大型 系统在 CUDA 中做了很多工作

21:29

您知道，我已经谈到了 Dynamo 这是 NVIDIA 推出的用于管理

21:35

所有这些内容的产品

21:38

Dynamo 的底层还有其他一些 东西，比如 GPU 直接存储

21:43

cuFile 就是它的 API，它允许 Dynamo 非常具体和详细地控制不同

21:49

KV 缓存位置的存储位置，它还允许

21:53

用于 GPU 和存储之间 低延迟的直接传输

21:57

我们还有一个检查点机制

21:59

这是非常有趣的事情之一

22:01

当你在工程领域构建一些东西 而人们以你意想不到的方式使用

22:05

它时，这总是令人着迷的

22:06

事实证明，检查点是 Modal 的一个很棒的演讲主题，我在

22:09

下面引用了这个演讲

22:11

顺便说一句，我在这些幻灯片 底部的链接中，列出了与我所

22:14

谈论的任何内容相关的演讲

22:18

将它用于弹性而不是弹性 恢复的想法非常有趣

22:21

事实证明，这样做非常有效

22:26

当然，最后是开发者工具

22:29

我们必须能够调查和检查正在 发生的事情，因此 Insight 还

22:32

提供用于管理这类事项的云开发工具

22:35

我们专门为此创建了一个网站 并将在本周晚些时候进行相关讨论

22:41

所以，我将稍微改变一下话题 但它与之前的话题有关，您会

22:43

看到它们之间的联系

22:45

去年，我们宣布推出 CUDA Tile，并在 12 月发布了 CUDA Tile。CUDA Tile

22:52

是 CUDA 编程模型的扩展，可更详细地 描述您在数组和张量方面的工作内容

22:59

你告诉系统更多关于你的工作 的信息，这非常有用

23:04

我将回顾一下 Dynamo 和分片推理 因为推理 It's Benchmark Suite（类似

23:10

于 InferenceX）就是基于 Dynamo 的

23:14

整个层级都包含了这些内容，其中 一个核心部分称为 Flash Infer 库

23:20

这是经过高度调优的内核库 可以完成繁重的工作

23:23

这是预填充 worker 和解码 worker 容器中的内容

23:28

因此，我们对 tile 系统所做 的其中一件事是，我们开始将

23:32

这些基准测试（抱歉，这些基准 测试中使用的内核）移植到 tile

23:39

我们希望将它们转移到 Tile 上，因为 Tile 更便携，开发

23:43

起来更简单，但我们也希望确保 自己的性能能力能够满足要求

23:48

因此，我这里有一个比较，即在使用 CUDA Tile 之前和之后的情况

23:55

而且，在各个方面，您都看到 90%或更高的百分比

23:59

现在，这只是内核的一半左右

24:00

我们仍在努力

24:01

我们一直没有做到这一点

24:03

但我们非常高兴看到一些非常 有趣且出色的性能数据，这些

24:07

数据表明该工具对我们非常有用，因为 我们可以获得高性能和所有其他功能

24:13

我来告诉大家其他所有事情，对吧？

24:14

因此，我们从中挑选了一些内核 并表示，让我们使用这些内核

24:19

因为 TAL 模型的一个关键基石是 您编写的代码可以在所有这些

24:24

不同的 GPU 架构中移植

24:27

我们使用其中几个内核，即多头 注意力内核和批量矩阵乘法内核

24:32

我们无需更改代码，即可在 Ampere、 Hopper、Blackwell、RTX、GeForce

24:38

和 DGX Spark 上运行该模型

24:42

然后，自动调谐器会选择 不同的 tile 大小

24:45

Blackwell 的机器比 Spark（B10）更大

24:49

因此，Blackwell 芯片 比 Spark 芯片更大

24:52

但是如果没有变化，内核只是 从 GPU 移动到 GPU，效率大约

24:56

为 80%、85%或更高

25:00

性能曲线。现在，在底部的右侧 我们仍在研究这个问题

25:03

我们上周才发布了 Ampere，因此我们仍 在调整一些 Ampere 编译方面的问题

25:07

但我的想法是，如果我可以获得 足以满足推理 Max 基准测试

25:12

的内核，那么我只需编写一次 代码，就可以在任何地方运行

25:16

现在，您可以从这里开始调整

25:19

然后调整本地特定架构

25:21

您可以开始在程序和 其他内容中添加提示

25:22

所以，你仍然需要努力工作才能 达到 100%的巅峰状态

25:26

但如果你的起点是 80%或 90% 那么这是一个相当不错的起点

25:31

因此，这足以鼓励我们继续使用 这些工具进行内部开发，并在

25:38

Tile 中构建许多库

25:41

我稍后会向您介绍更多相关 内容，但其中一部分是通过

25:45

这个编译堆栈实现的，其中

25:48

以前，您只有线程级编译器 现在我们添加了 tile 级编译器

25:51

可以做更多的事情，以及 Cutlass 即 Tensor Core 编译器，它让您能够

25:56

完全控制 Tensor Core 的低级操作

25:58

因此，我将向您介绍 编译器堆栈的发展历程

26:02

左侧是编译器堆栈的传统方式 即内核与线程级通信，我们称之为

26:07

SIMT，即单指令多线程

26:10

它是线程级编程模型

26:12

右侧是我们今天所处的位置

26:15

您可以针对不同的方面进行优化 因为如果针对正确的事物进行

26:18

优化，如果使用合适的工具 您就可以获得很多好处，例如我

26:22

之前提到的 Tile 的性能和可移植性

26:24

你可以选择任何你想要的东西 但你应该选择最好的，因为它会

26:27

让你的生活更轻松，或者更具 性能，或者做任何你需要做的事情

26:31

在幕后，CUDA 一直通过 PTX 来管理架构之间的可移植性

26:37

但随着架构特定的 Tensor Core 类功能 的出现，保持可移植性变得更加棘手

26:43

即使对于 GPU 的复杂 Tensor Core 架构，Tile 层也能实现这种可移植性

26:50

这意味着我的库系统在它们之上 看起来略有不同，以前，一切

26:56

都被绑定到程序的单个线程级表示

26:59

现在，我的库可以选择

27:01

Cutlass 在右侧消失了，因为 它已经变成了一个编译器，但

27:05

FlashInfer 这样的工具可以 挑选它要使用的所有东西

27:09

现在，这实际上非常重要，因为 如果我可以选择要谈论的内容

27:13

我们可以使用一些 FlashInfer 基准测试，在这种情况下，这是

27:17

针对 InferenceX 基准测试之一 的预填充的 DeepSeek R1 基准测试

27:23

我们没有将 100%的内核移植 到 tile 中，而是使用右边的

27:29

对角线条，显示在使用 tile 模式和 不使用 tile 模式时，性能是一样的

27:36

事实证明，如果你有足够多的 选择，如果你足够精明，或者

27:39

你愿意投入时间，事实证明 一些内核比其他内核更胜一筹

27:43

因此，您可以通过使用不同的 编译器来混合和匹配这些内核

27:50

换句话说，在这种情况下，通过 将特定内核从一种风格切换到另

27:54

一种风格，基准测试结果可提升 17%

27:58

这为您的调优系统或忍者开发者 提供了巨大的力量

28:05

或者，您也可以让系统自行运行 然后您仍然会得到一个确切的

28:10

盈亏平衡性能故事，只是现在 您将可以随时随地使用

28:16

现在，我们一直在内部进行相关工作 在下一个 CUDA 版本中，我们即将

28:22

推出的一项功能是 C++ CUDA tile

28:25

我们有 Python 中的 cuTile 这是 Python 语言中的 CUDA

28:29

tile，于 12 月发布

28:32

我们将在下一个 CUDA 版本中推出 C++

28:35

C++的故事有意看起来非常相似

28:39

它通过我们的 C++编译器 NVCC 来 实现，但我们确保了 C++惯用语虽然

28:46

看起来像 C++，但 Python 和 C++仍然 具有相同的语言和相同的视觉效果

28:54

无论你想要哪种语言，我都 强烈建议你应该直接映射

29:01

我们做的一件非常有趣的事情是 我们坐下来，不要担心左边的

29:05

文本墙，我想向您展示的是 我们实现了一个看起来不像您在

29:09

平铺模式下所看到的那种算法，对吗？

29:12

这是一个稀疏矩阵向量乘数

29:15

必须解决稀疏问题

29:16

它实现了切片 ELPAC 算法

29:20

我们编写了一个内核

29:24

我们实施了该算法，并在 Cuspars 使用的测试矩阵套件上运行了该算法

29:30

现在，稀疏矩阵都非常复杂 并且有许多不同的类别

29:34

但在这些矩阵类别中，我们的一个 内核击败了最先进的 cuSparse

29:39

库，因为编译器可以带来更多优势

29:43

我们看到这个数字后，不禁感叹 这比我们预期的要多得多

29:47

在黄线以上的所有内容都是我们 一个内核比我们运行的数十个

29:52

内核库表现更好的地方

29:55

我们仔细研究后发现，有什么不同？

30:00

事实证明，如果我使用 tile 编译器并 以这种基于数组的高级模型来表达我的

30:05

问题，那么编译器可以做更多的事情

30:08

因此，我可以将一个内核放在 之前在特定情况下，在软件线程

30:13

级别执行此操作需要 12 个内核

30:17

因此，78 行代码的程序可以与 12 个内核中的 1000 行代码

30:22

的程序执行速度相当

30:25

这就是我之前提到的编译堆栈的强大 之处，当你的问题可以映射到编译器

30:31

上时，编译器可以为你做更多的事情

30:34

每个人都更愿意维护 78 行代码 而不是 1000 行代码

30:38

您需要一个不仅可以映射，而且 可以在不同架构之间移植的算法

30:43

所以，这是我们发现的 一项非常强大的功能

30:46

因此，所有这些事情的一部分，以及 弄清楚发生了什么，当然就是分析

30:51

Tile 位于计算内部，因此您 可以分析 Tile 的运行情况

31:00

从时间轴来看，从运行 Tilecode 的 13.0 到 13.1 的发布，13.2

31:06

上周发布，支持 Ampere，13.3 引入了 C++和 Hopper 支持

31:13

大家都可以浏览这些幻灯片

31:14

我不打算把所有内容都读给大家听

31:17

此外，您还可以与专家联系 与我们讨论路线图上的内容、

31:20

这些内容对您而言意味着什么 以及如何将其应用于您的应用

31:26

不过，无论何时在 CUDA 中构建 任何内容，其中一个核心部分

31:30

就是这个，如果你看过黄仁勋的演讲 他的主题演讲，他谈到了已安装的

31:36

基础，即已经存在的现有堆栈，以及新 事物与旧事物进行交互和协作的能力

31:42

因此，我们构建了一个快速测试 示例，其中我们调用 FFT 库，调用

31:48

我们的并行算法库，在这种情况下调用 CUDA Cooperative，因为它是 Python

31:55

同时确保在两者之间切换不会 产生任何实际开销

32:00

在本 FFT 示例中，最差 情况仅为百分之几

32:04

是的，因此能够与各种事物进行 接口和交互至关重要，否则系统

32:09

将变得更加难以使用

32:13

我们还认识到，在多节点主题中 通信在任何应用中都至关重要

32:20

因此，我们使用多节点 FFT 傅里叶变换，不用担心代码

32:24

它只是分成几个不同的部分 以防您喜欢在幻灯片上阅读代码

32:29

但实际上，我们只是先进行 Y 傅里叶变换，然后进行 Z 傅里叶

32:31

变换，最后进行 X 傅里叶变换 中间进行一些通信

32:34

而通信是关键，因为我们能够将 NVShmem（我们的通信库之一）

32:38

嵌入到 tile 程序中

32:41

用于协调我正在进行的 傅里叶变换之间的通信

32:45

结果再次让我们感到意外

32:49

它比现有的多进程 FFT 快 10%（ 如果是 64 位，则超过 10%）

32:57

其中很大一部分来自在计算层面 上与通信进行交错的能力，就像

33:02

我刚刚展示的那样

33:04

但是这种能力

33:08

一小段代码，就是我刚刚展示 的那一段，虽然不太好读，但它

33:14

能产生这样的结果，这让我们 确信，这是我们内部将要投资的东西

33:21

我们的库将致力于开发接口 以便以这种 tile 格式对自己

33:27

的部分内容进行编程，因为这种 格式具有灵活性和性能

33:32

同样，我们的 Tensor Core 级 编程模型 Cutlass（这是我在

33:37

编译器图片中的第三个方框） 也集成这些通信，即内核内部的在线

33:43

通信，这对于管理低延迟和控制您正在 使用的细粒度非对称并行至关重要

33:50

因此，就我们的通信库整体而言 它们都在朝着通信库的设备 API 方向

33:57

发展，当然，它们也拥有主机 API

34:00

好吧，这是我从我的同事 Matt Nicely 的演讲中偷来的幻灯片

34:04

他有很多非常有趣的东西，作为 他演讲的链接，请点击下方链接

34:10

但就库本身而言，正如我所说，我们 NVIDIA 认为这非常有趣，因此我们将

34:16

开始在 Tile 中实现自己的功能，我们 将开始为各种事物构建 Tile 接口

34:22

设备扩展库，您可以在内核中 调用线性代数，不仅是线性代数

34:27

还有线性代数、傅里叶变换、 压缩等各种内容，就像在内核

34:32

中进行通信一样强大，因此能够 在内核中调用库也是如此

34:37

现在，库变得复杂了

34:39

我们有 CPU 库、GPU 库、设备库

34:43

在向 Python 迁移的过程中，有一点 非常有趣，那就是 Python 编译器

34:48

让我们能够将所有这些东西整合到一个 单元中，我们称之为 NVMath Python

34:54

它为您执行大量调度和繁重的工作

34:58

因此，如果您是 Python 应用 您将与 NVMath Python 交互

35:02

它将调用正确的库

35:03

它不仅能做到这一点

35:05

它能够以我稍后将向您展示的 方式对它们进行 jit 和操作

35:08

NVMath Python 本身是我们整体 Python 堆栈的一部分，即 CUDA Python，我们

35:15

即将发布 1.0 版本，这意味着它

35:19

完整版

35:22

我们去年宣布了这一计划，在今年 我们一直在努力解决许多不同

35:26

的问题，现在我们已经准备好 正式发布 1.0 版本

35:29

这里有一整套各种不同的东西 我强烈推荐我的同事 Jonathan

35:35

Dektiar 的演讲，因为他将更 详细地介绍这些东西

35:40

但我们一直强调的重点是峰值性能 就像在任何类型的 CUDA 中一样

35:44

Python 通常不会与峰值性能 出现在同一句话中，对吗？

35:48

但要实现峰值性能，就需要以较低 的开销访问这些 C++语言特性或

35:55

其他结构，例如 CUDA 图形和 Fusion

36:00

Python 的强大之处之一在于，它在运行 时进行解释，因此我能够进行 Fusion

36:06

调用代码时，对吧？

36:08

因此，我可以将不同的运算符融合在 一起，创建单个内核，事实上，NVMath

36:14

库所做的其中一件事就是查看您正在 执行的这些调用，在左下角，我有一个

36:19

数字 1，就在单个指令旁边，它会查看 您的所有类型，并在运行时组装正确

36:25

的调用，并为您进行即时编译，为您 提供一个运行速度快三倍的内核，因为

36:30

它能够将所有这些调用捆绑在一起

36:35

除此之外，我还要再次强调开发工具 因为没有它们，你什么也做不了

36:41

最后，借助开发者工具，我们终于 可以在 Python 中调试 CUDA 核心

36:45

我们可以调试 CUDA 的单线程 编译器 number CUDA

36:51

在 Python 中，您可以调试它 这绝对是一条好消息

36:54

您还可以将其导入 Insight，以便 开始分析、检查和调试 Python 代码

37:02

这实际上要大得多

37:03

如果您是 Python 程序员，您知道 工具有多重要和有多难

37:07

但是，如果没有检查正在发生的事情 的能力，你就无法编写并行代码

37:14

现在，我将快速介绍一下编译器堆栈的 内部情况，因为我想告诉大家，我刚才

37:19

提到的这些神奇功能是如何实现的

37:22

在这一堆栈之下，如果我们稍微 展开一下，就会发现有许多层

37:26

但我特别想向您强调的是深绿色框 这些框代表了我之前提到的恢复

37:31

可移植性，即使对于非常复杂 的 Tensacore 代码也是如此

37:36

它具有可移植性，因此我可以 在 Ampere、Hopper、Blackwell

37:39

和 Spark 上运行相同的代码

37:41

您看到了那个图形，对吧？

37:42

编译器堆栈中的这些层提供了实现这一 目标的能力，但堆栈本身更为复杂

37:49

我们之所以构建如此复杂的堆栈 是因为我们了解到，我们构建

37:53

的 CUDA 内部内容往往是攻击目标

37:57

其他编译器 而不仅仅是人类编写代码

38:00

所以我们有 MLIR 层 我们有，你知道，一些

38:04

人针对源代码，他们也欢迎

38:06

我们甚至提供了一个转换器，因此如果 您有 Triton 代码，则无需移植代码

38:11

您可以保留 Triton 代码，并将 其与所有组合、所有工具以及

38:16

所有其他可用内容一起插入到后端

38:18

您只需将代码作为堆栈 其余部分的一部分即可

38:23

是的，这些东西是如何构建的 故事，就是研究人们将如何以

38:27

各种方式来处理它

38:29

同时，我们一直基于 LLVM，LLVM 是一种编译器层，用于将一种

38:35

编译器格式转换为另一种编译器格式

38:40

我们一直在努力开展 LLVM 编译器 层的工作，如果你是一名编译器

38:45

人员，你就会知道我在说什么

38:48

将它放在上游，这样我们就能 始终处于 LLVM 树的顶端

38:52

因为一直存在这种差距，而且 到目前为止，CUDA 支持的 LLVM

38:56

与树顶部的 LLVM 之间存在很大差距

39:00

现在，我们正在将我们的 LLVM 工作成果纳入我们称之为 NVVM

39:03

的项目中，这是 NVIDIA 对标准 LLVM 的扩展，我们正在将其

39:05

上游化，因此从 CUDA 13.2 开始 我们将在 LLVM 中使用 NVVM

39:11

我认为是 13.2 Blackwell，Blackwell 编译器正在上游集成到 LLVM 21 中

39:22

最后，在编译器方面，还有其他优化

39:26

编译器十分复杂

39:28

有成千上万个选项和可调参数 人类很难进行调优

39:33

事实上，这项工作非常困难 因此我们构建了一个机器学习

39:36

算法来为您完成调优

39:38

我们称之为 CompileIQ

39:39

这个想法是，您可以使用特定 版本的编译器迭代特定内核，并且

39:45

您可以让系统自动调整编译器设置

39:49

最终得到的文件称为高级控制 文件，您可以将其与编译一起

39:55

打包，以便控制 NVCC 编译器和 PTX 编译器，从而真正微调您的工作

40:03

我喜欢的是，这是免费的性能

40:07

Meta 一直在与我们合作，在他们 的内核中尝试并测试这一技术

40:10

这些是 Meta 在其 TritonBench 基准测试中的数据，左侧是他们

40:14

的 TritonBench 基准测试 右侧是他们一直在做的 Helion 工作

40:18

首先要注意到的是，每一项都是正数

40:22

如果你花时间去做这件事 你就能获得速度提升

40:25

我的意思是，只需转动旋钮并等待 几个小时即可自行调整，速度提升 5%

40:29

或甚至 10%并不是什么大不了的事

40:33

这太棒了，我们正在将它用于 内部内核，但我想向您展示 Meta

40:37

的一些数据，非常感谢他们与 我们分享这些数据

40:42

因为这些都是他们在现实世界 中处理的真实工作负载

40:50

最后，我想说的是 我一直在谈论工具

40:56

每次我谈到一个 功能时，我都会谈到工具

41:00

但是我认为，如果你没有某种 AI 编码助手工具，那么你的

41:06

工具箱就不完整，而这种工具 是当今工具箱中不可或缺的

41:13

我们每个人，至少我本人，以及 我合作的所有人都希望你们都

41:18

能在开发过程中使用这些编码代理

41:21

这是一种令人难以置信的力倍增器

41:23

因此，我们投资了 Ensight Copilot 它可以生成 CUDA 代码

41:29

而且，你知道，它是一个助手 作为 Visual Studio，抱歉

41:33

它作为 Visual Studio 的扩展 插入到 Visual Studio 中

41:36

关于这一点，我们有一 整场演讲，请观看我的

41:39

DevTools 同事的一些演讲

41:42

我们还将 Insight Copilot 集成到 Insight Compute 中

41:45

帮助您进行分析、分析和分析 并找出发生了什么

41:48

由于这些智能体功能强大，因此 您当然希望能够访问它们

41:56

同样，我的一些研究同事一直在 研究如何对这些编码智能体进行

42:02

基准测试和评估，以及智能体有多好

42:07

因此，他们提出了一个非常有趣 的结构，在这个结构中，你可以

42:12

从各种不同的应用程序中提取 250 个不同的基准测试来测试这些

42:17

编码代理，并说如何衡量 AI 的质量？

42:21

这非常非常困难

42:23

就在那里

42:24

我们应该说，这是一套经过深思熟虑、 详细、全面的基准测试套件

42:32

用于测试 AI，看看我是否提高 了智能体的质量，对吧？

42:39

他们举办内核生成竞赛

42:41

这里有一个二维码

42:43

您可以访问他们的 网站并探索基准测试

42:47

同样，所有这些链接，PDF 将 在线提供，您可以直接点击链接

42:52

最后，我很高兴我的同事经常问我 是否可以推荐一本关于 CUDA 的书

43:00

在 AI 智能体时代，两年后这 可能有点多余，但现在，人们

43:06

对 CUDA 书籍非常感兴趣，我的 朋友、同事、我的长期 CUDA 爱好者

43:13

Wen Mei Wu 博士即将推出第五版 《并行编程》，我想它本周即将推出

43:20

当然，每本书在发布后的第二天 就会过时，所以今天这本书是

43:23

最新版本，今天就来获取吧 因为只有今天……不，这样说不太公平

43:29

不仅如此，他还会进行问答环节 虽然我讨厌宣传自己的演讲

43:33

但我实际上正在主持一个由所有 CUDA 老手组成的座谈会，他们会谈论过去

43:39

彼此的糗事，你应该在星期三来参加

43:42

这是底部的链接，因为您有机会 看到 Wen Mei，并向我们提问

43:48

了解过去 20 年的 CUDA，因为 20 年前的 CUDA 刚刚问世

43:54

测试版发布于 2006 年

43:58

所以，在整个演讲中，我都会 给您提供链接列表

44:01

最后总会有一个表格

44:02

这些是我同事的谈话，他们提供 了我一直在告诉你的所有信息

44:06

我给大家两张幻灯片

44:09

他们会花 45 分钟时间 向您介绍这些内容

44:12

如果您是 CUDA 开发者，这些是您 想要观看或稍后流式传输的演讲

44:17

它与专家联系 让大家都能与专家交流

44:20

我也会介绍其中一些

44:22

就到此结束，非常感谢

# CUDA: New Features and Beyond

Stephen Jones (SW),CUDA Architect,NVIDIA

立即评分

The CUDA platform is the foundation of the GPU computing ecosystem. Every application and framework that uses the GPU does so through CUDA's libraries, compilers, runtimes and language—which means CUDA is growing as fast as its ecosystem is evolving. Presented by one of the architects of CUDA, at this engineering-focused talk you will learn about all that's new and what's coming next for both CUDA and GPU computing as a whole.

分享

收藏

添加到列表

PDF 

活动:GTC San Jose

日期:March 2026

行业:所有行业

话题:Developer Tools & Techniques - Programming Languages / Compilers

级别:通用

语言:英语

NVIDIA 技术:CUDA

所在地:

公司信息

*   [关于 NVIDIA](https://www.nvidia.cn/about-nvidia/)
*   [投资者](https://investor.nvidia.com/home/default.aspx)
*   [Venture Capital (NVentures)](https://www.nventures.ai/)
*   [NVIDIA 基金会](https://www.nvidia.cn/foundation/)
*   [NVIDIA 研究](https://www.nvidia.cn/research/)
*   [企业可持续发展](https://www.nvidia.cn/sustainability/home/)
*   [技术](https://www.nvidia.cn/technologies/)
*   [职业生涯](https://www.nvidia.cn/about-nvidia/careers/)

新闻与活动

*   [新闻中心](https://www.nvidia.cn/newsroom/)
*   [公司博客](https://blogs.nvidia.cn/)
*   [技术博客](https://developer.nvidia.cn/zh-cn/blog/)
*   [加入开发者计划](https://developer.nvidia.cn/developer-program)
*   [在线研讨会](https://www.nvidia.cn/about-nvidia/webinar-portal/)
*   [获得最新信息](https://www.nvidia.cn/preferences/email-signup/)
*   [近期活动](https://www.nvidia.cn/events/)
*   [GTC AI 大会](https://www.nvidia.cn/gtc-global/)
*   [NVIDIA On-Demand](https://www.nvidia.cn/on-demand/)

热门链接

*   [开发者](https://developer.nvidia.cn/)
*   [合作伙伴](https://www.nvidia.cn/about-nvidia/partners/)
*   [高管见解](https://www.nvidia.cn/executive-insights/)
*   [NVIDIA 初创加速计划](https://www.nvidia.cn/deep-learning-ai/startups/)
*   [文档](https://docs.nvidia.cn/)
*   [NVIDIA 培训和认证](https://www.nvidia.cn/training/)
*   [面向 IT 专业人员的培训和认证](https://academy.nvidia.com/en/)
*   [面向数据科学人员的专业服务](https://www.nvidia.cn/ai-data-science/professional-services/)

关注 NVIDIA

[](https://space.bilibili.com/1320140761/)[](https://www.douyin.com/user/MS4wLjABAAAA-v_JG_5ioC7lMiXoo4bh1nCeK4TEvA1nJxrRZazrByQ)[](https://weibo.com/u/5943087025)

![Image 1](https://www.nvidia.cn/content/dam/en-zz/zh_cn/Solutions/newsroom/wc_qrcode.jpg?v2)
扫描二维码关注 

NVIDIA 英伟达微信公众号

[](https://www.nvidia.cn/gtc/session-catalog/sessions/gtc26-s81859/)

[CHN - 中国](https://www.nvidia.com/en-us/location-selector/)

*   [隐私声明](https://www.nvidia.cn/about-nvidia/privacy-policy/)
*   [您的隐私选择](https://www.nvidia.cn/about-nvidia/privacy-center/)
*   [服务条款](https://www.nvidia.cn/about-nvidia/terms-of-service/)
*   [无障碍访问](https://www.nvidia.cn/about-nvidia/accessibility/)
*   [公司政策](https://www.nvidia.cn/about-nvidia/company-policies/)
*   [产品安全性](https://www.nvidia.com/en-us/security/)
*   [联系我们](https://www.nvidia.cn/contact/asia/)
*   [英文网站](https://www.nvidia.com/en-us/)

Copyright © 2026 NVIDIA Corporation

NVIDIA 及其第三方合作伙伴利用 Cookie 和其他工具收集并记录您提供的信息，以及您与我们网站的互动信息，以提高性能、进行分析并辅助营销工作。点击“全部接受”，即表示您同意我们使用 Cookie 和其他工具，如我们的 [Cookie 政策](https://www.nvidia.cn/about-nvidia/cookie-policy/)中所述。您可以通过点击“管理设置”来管理您的 Cookie 设置。请参阅我们的[隐私政策](https://www.nvidia.cn/about-nvidia/privacy-policy/)，详细了解我们的隐私实践。

我们检测到全球隐私控制 (GPC) 信号，并记录了您拒绝本网站对此浏览器的所有可选 Cookie。您可以通过点击“管理设置”来管理您的 Cookie 设置。请参阅我们的 [Cookie 政策](https://www.nvidia.cn/about-nvidia/cookie-policy/) 以了解更多信息，同时查看问我们的[隐私政策](https://www.nvidia.cn/about-nvidia/privacy-policy/)，以了解我们的隐私实践详情。

管理设置

拒绝可选 Cookie 全部接受 

![Image 3: 公司徽标](https://www.nvidia.cn/assets/cn/onetrust/consent/1984719c-04aa-48de-8c22-5174bdf5c0ed/01917434-8292-70f9-8fae-1602521d0b2a/logos/10ddf4ca-c072-45d0-b3ac-eead0ed93db0/b73a5c09-1e15-4dc7-8722-f9cb6c578110/9a7ca633-555d-4e05-a249-5cd7dc512da5/logo_nvidia.png)

Cookie 设置

我们与第三方合作伙伴（包括社交媒体、广告和分析合作伙伴）使用 Cookie 和其他追踪技术，在您访问我们的网站时收集、存储、监控并处理您的某些相关信息。收集的信息可能与您、您的偏好或您的设备有关。我们使用这些信息来保障网站运行，并在征得您同意的情况下分析网站的性能和流量，以提供更加个性化的网络体验，并辅助我们的营销工作。点击下方不同类别的标题，获取更多信息，并根据您的偏好更改设置。您无法选择退出必备Cookie，因为其部署旨在确保我们网站的正常运行（例如提示 Cookie 横幅和记住您的设置等)。点击底部的“保存并接受”，即表示您同意按照您的设置使用我们的 [Cookie 政策](https://www.nvidia.cn/about-nvidia/cookie-policy/)中提及的 Cookie 和其他工具。有关我们隐私实践的更多信息，请参阅我们的[隐私政策](https://www.nvidia.cn/about-nvidia/privacy-policy/)。

必备 Cookie

始终有效

这些 Cookie 支持核心功能，如安全性、网络管理和可访问性。它们是网站运行所必需的，不能够关闭。

Cookie 详细信息

性能 Cookie

- [x] 性能 Cookie 

这些 Cookie 用于量化分析我们网站的访问者，例如您访问的次数、页面停留时间、鼠标移动、滚动、点击和按键活动；其他浏览、搜索或产品研究行为；以及您访问我们网站的原因。它们可以存储唯一 ID，以便我们的系统在您再次访问时能记得您。这些 Cookie 收集的信息用于评估网站性能和寻找改进方法。

Cookie 详细信息

个性化 Cookie

- [x] 个性化 Cookie 

这些 Cookie 收集有关您如何与我们的网站互动的数据，以帮助我们改善您的网络体验，例如您访问了哪些页面。它们可以存储唯一 ID，以便我们的系统在您再次访问时能记得您。这些 Cookie 可能由我们自身或其服务已添加到我们网页的第三方提供商设置。有了这些 Cookie，我们能够提供增强的网站功能和个性化，并且可让我们发送给您的营销信息更符合您的兴趣。如果您不允许使用这些 Cookie，则部分或全部服务可能无法正常运行。

Cookie 详细信息

广告 Cookie

- [x] 广告 Cookie 

这些 Cookie 记录您访问我们网站的情况、您访问的页面以及您所浏览的链接，以影响您在其他网站上看到的广告。这些 Cookie 及其收集的信息可能由其他公司（包括我们的广告合作伙伴）管理，并且用于构建您的兴趣画像以及在其他网站上向您展示相关广告。我们与广告合作伙伴将利用这些信息，使我们的网站以及网站上显示的广告更贴合您的兴趣。

Cookie 详细信息

Cookie 列表

Clear

*   - [x] checkbox label label 

Apply Cancel

Consent Leg.Interest

- [x] checkbox label label

- [x] checkbox label label

- [x] checkbox label label

全部拒绝 保存并接受

[![Image 4: Powered by Onetrust](https://www.nvidia.cn/assets/cn/onetrust/consent/1984719c-04aa-48de-8c22-5174bdf5c0ed/01917434-8292-70f9-8fae-1602521d0b2a/logos/static/powered_by_logo.svg)](https://www.onetrust.com/products/cookie-consent/)
