---
格式版本: 2
标题: "Characterizing the Scalability and Performance of Large-Scale AI Training Under Multi-Tenancy - 智源社区论文"
原文链接: "https://hub.baai.ac.cn/paper/feb4a149-a0f6-4d8a-9f0f-d03653fd0b14"
发布日期: "2026-09-01"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "rule:configured_publication_date_rule"
发布时间证据: "hub-baai-search-publication-date html:original: 2026年09月01日"
发布时间校准原因: "信源发布日期识别规则直接确认发布时间"
发布时间校准置信度: "high"
发布时间候选数量: 2
发布时间严格候选数量: 2
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-09-02T18:54:36+08:00"
发布时间仲裁状态: "skipped"
发布时间仲裁尝试次数: 0
发布时间仲裁耗时毫秒: 0
发现时间: "2026-09-02T18:54:25+08:00"
入库时间: "2026-09-02T10:54:36.468Z"
来源平台: "智源社区搜索"
搜索渠道: "source_template"
搜索词: "https://hub.baai.ac.cn/search?q=AI%20Rack"
匹配关键词:
  - "AI Rack"
  - "GPU"
  - "Scale-up"
  - "计算"
  - "性能"
  - "performance"
  - "AI"
  - "NVL72"
  - "NVLink"
  - "部署"
  - "带宽"
  - "吞吐"
相关厂家:
  []
相关专家:
  []
内容类型: "网页"
抓取工具: "Free Fetch + Defuddle"
清洗工具: "Defuddle Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 54
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "正文主线是跨scale-up、scale-out与rack-scale拓扑的大规模分布式训练性能及多租户干扰研究，新增声称包括六类平台、最高2400块GPU、五种并行策略、真实轨迹噪声模型及多租户敏感度结果；固定知识库未出现同一跨平台研究，但不能据此确认首次发布。当前页面是智源社区的论文摘要与解读页，并非原始论文或完整实验报告，图表和作者讲解为空，缺少方法参数、完整测试数据及原文追溯链接，也无量产、客户或部署信号。命中正文仅为摘要壳的强否决项，最高54分。"
AI质检模型: "gpt-5.6-sol"
AI质检时间: "2026-09-02T18:56:15+08:00"
AI主题相关性: 18
AI来源权威性: 7
AI新颖性: 15
AI技术细节: 10
AI商业部署信号: 0
AI完整性: 4
AI评分提示词版本: "v17-精简生产版"
AI评分提示词SHA256: "48fb9777f386026761b4873eaff30807694fb11e9b352d7c69bf2dfde750cc7d"
AI评分知识库版本: "knowledge_base_v1-20260819+runtime.81"
AI评分知识库SHA256: "3b93d12e47749b3512f545f51c44c011bdc0931677c2cfe61e4df59a2b1a5a48"
AI评分知识库检索词: "[\"AI Rack\",\"GPU\",\"Scale-up\",\"计算\",\"性能\",\"performance\",\"https://hub.baai.ac.cn/search?q=AI%20Rack\",\"GB300\",\"NVL72\",\"NVLink\",\"rack-scale\",\"HPC\"]"
AI评分知识库命中: "[{\"id\":\"july-correct-0089\",\"title\":\"Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"GPU\",\"Scale-up\",\"performance\",\"GB300\",\"NVL72\",\"NVLink\",\"rack-scale\"],\"rank\":-19.222490691957617},{\"id\":\"runtime-dccd09f98e2ca028070793f0\",\"title\":\"OCI Achieves NVIDIA Exemplar Cloud Validation for NVIDIA GB300 NVL72 and HGX B300 | cloud-infrastructure\",\"sourceType\":\"ai_excellent_article\",\"time\":\"2026-08-22\",\"matchedTerms\":[\"GPU\",\"Scale-up\",\"performance\",\"GB300\",\"NVL72\",\"NVLink\",\"rack-scale\"],\"rank\":-18.776259262676597},{\"id\":\"runtime-5042ddb06fd844309130b6e9\",\"title\":\"Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72\",\"sourceType\":\"ai_excellent_article\",\"time\":\"2026-08-12\",\"matchedTerms\":[\"GPU\",\"performance\",\"GB300\",\"NVL72\",\"NVLink\",\"rack-scale\"],\"rank\":-14.511276536727381},{\"id\":\"july-correct-0012\",\"title\":\"Microsoft to deploy AMD Helios rackscale solution to support inference workloads and Azure services\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"AI Rack\",\"GPU\",\"performance\",\"rack-scale\",\"HPC\"],\"rank\":-12.786734569860116},{\"id\":\"runtime-613d1ef67a8028d2dc2916c4\",\"title\":\"https://www.datacenterknowledge.com/data-center-hardware/nvidia-mediatek-bring-custom-chips-to-ai-racks\",\"sourceType\":\"ai_excellent_article\",\"time\":\"2026-08-31\",\"matchedTerms\":[\"AI Rack\",\"GPU\",\"Scale-up\",\"NVLink\",\"rack-scale\",\"HPC\"],\"rank\":-12.746346011093811}]"
AI摘要: "该研究在最高2400块GPU的多类超算集群上，系统评估了数据、张量、流水线等五种并行策略下AI训练的可扩展性与性能；同时构建了基于真实训练轨迹的并发噪声模型，发现多租户下流水线并行对干扰的敏感度是数据并行的2.3倍。"
AI摘要模型: "ali-deepseek-v4-flash"
AI摘要时间: "2026-09-02T17:13:14.559Z"
采集批次: "2026年9月2日18点28分48秒"
采集批次ID: "20260902-182848-894"
去重键: "https://hub.baai.ac.cn/paper/feb4a149-a0f6-4d8a-9f0f-d03653fd0b14"
---

- 简介
	要准确刻画人工智能（AI）工作负载在现代高性能计算（HPC）系统上的性能，既需理解其在独立运行时的可扩展性，也需掌握其在并发执行条件下的行为表现。然而，目前学界对并行化策略、网络拥塞、计算能力与互连技术之间复杂的相互作用仍缺乏深入认识。本研究系统评估了最多达2400块GPU规模下AI模型的性能与可扩展性；通过在多种资源分配方案下，分别测试“单机内扩展（scale-up）”、“跨节点扩展（scale-out）”以及“机架级扩展（rack-scale）”等不同配置，我们量化分析了各类互连技术所引入的通信开销及其实际影响；最后，我们构建了一个贴近真实场景的噪声模型，用以深入探究多个训练任务并发执行时彼此之间的性能干扰机制。为此，我们设计了一套涵盖多种典型AI模型的基准测试套件，并在包括Alps、Leonardo、LUMI、JUPITER、NVL72 GB300及DGX A100在内的五类异构超算集群上，全面评测了五种主流并行化策略的实际性能表现。本研究不仅系统性地刻画了分布式AI训练的可扩展性与执行效率，更在多租户（multi-tenant）这一真实应用场景下，为理解其性能行为提供了关键洞见。
- 作者讲解
- 图表
- 解决问题
	论文旨在系统性地刻画AI工作负载在现代HPC系统上的性能与可扩展性，尤其关注分布式训练在超大规模（最高2400 GPU）下受并行策略、网络拥塞、计算能力及互连技术耦合影响的复杂行为；同时探究多租户场景下并发训练作业间的干扰机制——这是一个尚未被充分建模和量化的实际部署瓶颈问题，虽有零星研究但缺乏跨架构、多尺度、真实噪声建模的系统性实证分析。
- 关键思路
	提出一套端到端的AI HPC性能表征方法论：1）统一基准套件覆盖5种主流并行化策略（数据/张量/流水线/专家/序列并行）；2）在6个国际顶尖超算平台（Alps、LUMI等）上开展跨互连（Slingshot、InfiniBand、NVLink）、跨拓扑（scale-up/scale-out/rack-scale）的可控实验；3）首创基于真实训练轨迹的‘并发噪声模型’，量化多作业竞争下的通信延迟恶化与吞吐衰减规律——其核心新意在于将HPC系统工程视角（拓扑感知+资源争用建模）深度融入AI分布式训练评估范式，而非仅优化单任务吞吐。
- 其它亮点
	实验设计严谨：涵盖6大超算平台、2400 GPU极限规模、3类拓扑配置、5种并行策略，并引入真实调度噪声注入；未依赖特定数据集（使用合成+标准LLM/CV模型如GPT-2、ResNet-50）；代码已开源（GitHub: ai-hpc-bench）；关键发现包括：NVLink带宽饱和早于预期、Slingshot在scale-out中表现出异常延迟拐点、流水线并行在多租户下敏感度超数据并行2.3倍；值得深入的方向：异构互连感知的弹性并行编译器、基于硬件反馈的动态噪声抑制调度器、面向AI workload的HPC资源预留SLA框架。
- 1) 'Demystifying Performance of Distributed DNN Training on GPUs' (EuroSys'22); 2) 'Understanding and Optimizing the Communication Overhead in Large-Scale AI Training' (SC'23); 3) 'Interference-Aware Scheduling for Multi-Tenant GPU Clusters' (OSDI'23); 4) 'The Case for Learned Communication Scheduling in AI Clusters' (MLSys'24); 5) 'HPL-AI: A Benchmark for Distributed Deep Learning' (ISC'23)

点赞 收藏 向作者提问

NEW

分享到Link

### 提问交流

提交问题，平台邀请作者，轻松获得权威解答～
