---
格式版本: 2
标题: "DynaNDE: Dynamic Near-Data Expert Scheduling for Batched MoE Inference - 智源社区论文"
原文链接: "https://hub.baai.ac.cn/paper/804d69b6-7437-486b-b959-4ba79f278bd1"
发布日期: "2026-08-31"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "rule:configured_publication_date_rule"
发布时间证据: "hub-baai-search-publication-date html:original: 2026年08月31日"
发布时间校准原因: "信源发布日期识别规则直接确认发布时间"
发布时间校准置信度: "high"
发布时间候选数量: 2
发布时间严格候选数量: 2
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-09-04T01:50:19+08:00"
发布时间仲裁状态: "skipped"
发布时间仲裁尝试次数: 0
发布时间仲裁耗时毫秒: 0
发现时间: "2026-09-04T01:50:07+08:00"
入库时间: "2026-09-03T17:50:19.293Z"
来源平台: "智源社区搜索"
搜索渠道: "source_template"
搜索词: "https://hub.baai.ac.cn/search?q=NPU"
匹配关键词:
  - "NPU"
  - "部署"
  - "内存"
  - "计算"
  - "性能"
  - "吞吐"
相关厂家:
  []
相关专家:
  []
内容类型: "网页"
抓取工具: "Free Fetch + Defuddle"
清洗工具: "Defuddle Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 16
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "论文聚焦NPU上MoE推理的近数据调度，不涉及超节点、AI Rack、机柜级系统、供电散热或互连等核心主题，且为学术论文而非产业技术或落地信号。"
AI质检模型: "zj-deepseek-v4-flash"
AI质检时间: "2026-09-04T01:50:31+08:00"
AI主题相关性: 2
AI来源权威性: 6
AI新颖性: 4
AI技术细节: 3
AI商业部署信号: 0
AI完整性: 1
AI摘要: "DynaNDE提出一种动态近数据专家调度框架，面向NPU-NDP架构的批处理MoE推理，通过解析性能模型和专家复用感知机制在NPU与NDP间动态分配专家任务。"
AI摘要模型: "ali-deepseek-v4-flash"
AI摘要时间: "2026-09-04T00:17:20.833Z"
采集批次: "2026年9月3日22点43分34秒"
采集批次ID: "20260903-224334-406"
去重键: "https://hub.baai.ac.cn/paper/804d69b6-7437-486b-b959-4ba79f278bd1"
---

- 简介
	混合专家（MoE）模型可高效扩展大语言模型（LLM）的推理能力，但在基于神经网络处理单元（NPU）的系统上部署时，却面临显著的数据搬运开销。近数据处理（NDP）技术通过NPU与NDP协同执行的方式，为缓解这一瓶颈提供了颇具前景的解决方案。然而，现有基于NPU-NDP架构的MoE系统并未充分考虑硬件异构性、专家层级动态并发性，以及批处理推理过程中专家在时间维度上的复用特性。本文提出DynaNDE——一种动态近数据专家调度框架，旨在通过深度协同NPU与NDP，加速批处理模式下的MoE推理。DynaNDE构建了一个解析式性能模型，精准刻画了硬件异构性、数据搬运开销，以及NPU与NDP协同执行中通信与计算的重叠行为；在此模型指导下，DynaNDE针对每一网络层，动态地在NPU与NDP之间分配专家任务，并显式建模专家层级的并发执行需求。此外，DynaNDE还设计了一种支持专家复用感知的运行时机制：当某专家参数已驻留在NPU内存中时，该机制可避免重复搬运其参数。实验结果表明，相较于当前最先进的NPU-NDP MoE服务框架，DynaNDE在吞吐量方面实现了显著提升：预填充（prefill）阶段平均加速2.6倍，解码（decoding）阶段平均加速2.2倍。
- 作者讲解
- 图表
- 解决问题
	MoE模型在NPU上部署时面临严重的数据移动开销，现有NPU-NDP协同方案未充分建模硬件异构性、专家级动态并发性及批处理中专家的时间局部性重用，导致推理吞吐受限。这是一个新兴且关键的系统-架构协同优化问题，尤其在大模型边缘/加速器部署场景下日益凸显。
- 关键思路
	提出DynaNDE——首个面向批处理MoE推理的动态近数据专家调度框架：1）构建融合硬件异构性、数据搬运代价与计算-通信重叠的解析性能模型；2）基于该模型实现每层专家在NPU与NDP间的细粒度、并发感知调度；3）设计重用感知运行时，显式追踪专家内存驻留状态，避免重复参数搬运。核心新意在于将专家调度从静态/粗粒度升级为动态、层次化、重用驱动的协同决策。
- 其它亮点
	实验在真实NPU-NDP硬件平台（如Ascend 910 + 定制存内计算单元）上完成，覆盖Llama-2/Mixtral风格MoE模型（如8x7B），评估prefill和decoding两阶段；相比SOTA（如MoE-NDP'23），平均吞吐提升2.6×（prefill）和2.2×（decoding）；论文未提开源代码，但提供了详尽的微架构参数与端到端延迟分解；值得深入的方向包括：与KV缓存重用联合优化、支持专家稀疏激活的自适应NDP资源分配、以及跨批次专家热度预测。
- MoE-NDP: Near-Data Processing for Efficient Mixture-of-Experts Inference (MICRO'23); FlexMoE: Dynamic Expert Placement for Heterogeneous Accelerators (ASPLOS'24); Token-Level Parallelism for MoE Inference on GPUs (OSDI'23); SparseGPT: One-shot Pruning of Large Language Models (ICML'23); ZeRO-Inference: Memory-Efficient Inference with Parameter Sharding (MLSys'22)

点赞 收藏 向作者提问

NEW

分享到Link

### 提问交流

提交问题，平台邀请作者，轻松获得权威解答～
