---
格式版本: 2
标题: "大模型推理性能翻倍秘籍：计算巢PD分离快速部署指南-阿里云开发者社区"
原文链接: "https://developer.aliyun.com/article/1722190"
发布日期: "未标注"
发现时间: "2026-06-23T08:31:30+08:00"
入库时间: "2026-07-07T09:41:19.878Z"
来源平台: "Exa"
搜索渠道: "exa_search"
搜索词: "P/D分离芯片"
匹配关键词:
  - "GPU"
  - "测试"
相关厂家:
  - "阿里"
相关专家:
  []
内容类型: "网页"
抓取工具: "XCrawl Scrape"
清洗工具: "XCrawl Markdown + LLM 正文裁剪"
原始附件:
  []
图片摘要:
  - "✗ ./assets/img-8be15a48.png | decorative | 阿里云品牌Logo图标，装饰性图片，与正文无关"
  - "★ ./assets/img-290fbc74.webp | diagram | 展示PD分离架构下，预填充和解码阶段分别部署在不同实例上，通过高速网络交互，实现性能翻倍。"
  - "★ ./assets/img-e84599e3.webp | chart | 显示PD分离部署后的推理时间对比数据，包括首Token延迟和总吞吐量等关键性能指标提升。"
  - "★ ./assets/img-b9b810d6.webp | diagram | 展示PD分离方案中服务调用流程，包括Prefilling实例、Decoding实例和Router的交互步骤。"
  - "✓ ./assets/img-8179438b.webp | screenshot | 显示计算巢PD分离快速部署的配置参数界面，包括实例规格、模型名称、镜像等关键选项。"
  - "✓ ./assets/img-460c8641.webp | screenshot | 展示PD分离部署验证流程，包括服务注册、查询状态、路由配置等步骤的界面截图。"
  - "✓ ./assets/img-83f2b327.webp | screenshot | 展示PD分离部署测试命令及输出结果，包括API接口调用和返回的推理响应数据。"
  - "✓ ./assets/img-0169b6ea.webp | screenshot | 展示使用ArgoWorkflows自动化部署PD分离方案的DAG工作流编排界面。"
  - "✓ ./assets/img-5c364dfa.webp | other | "
  - "✓ ./assets/img-8b4b793b.webp | other | "
  - "✓ ./assets/img-1719a39a.webp | other | "
  - "✓ ./assets/img-ec9cdaaf.webp | other | "
  - "✓ ./assets/img-3ce89955.webp | other | "
  - "✓ ./assets/img-157ee351.webp | other | "
  - "✓ ./assets/img-e7f8d23c.webp | other | "
  - "✓ ./assets/img-d04a3ca9.webp | other | "
  - "✓ ./assets/img-ce6609b6.webp | other | "
  - "✓ ./assets/img-80ca1316.webp | other | "
  - "✓ ./assets/img-770634ed.webp | other | "
  - "✓ ./assets/img-21d8c99d.webp | other | "
  - "✓ ./assets/img-54919813.webp | other | "
AI优质: "否"
AI打分: 30
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "正文为阿里云PD分离推理部署指南，仅涉及软件层面的推理优化，未讨论超节点/AI Rack/机柜级AI基础设施硬件架构、供电、散热、互连等核心主题，与项目关注范围无关。"
AI质检模型: "deepseek-v4-flash"
AI质检时间: "2026-07-30T01:39:21+08:00"
AI主题相关性: 2
AI来源权威性: 10
AI新颖性: 3
AI技术细节: 5
AI商业部署信号: 0
AI完整性: 10
采集批次: "2026年7月7日16点36分44秒"
采集批次ID: "20260707-163644-932"
去重键: "https://developer.aliyun.com/article/1722190"
---

## 方案概述

[计算巢模型市场](https://computenest.console.aliyun.com/ai-lab/model/cn-hangzhou) 为大语言模型（LLM）提供了开箱即用的 PD 分离部署方案，无需手动配置复杂的基础设施即可实现生产级别的高性能推理服务。本方案基于阿里云容器计算服务 ACS集群，采用 PD 分离（Prefill-Decode 分离）架构和专家并行（Expert Parallelism）优化，为 MoE（Mixture of Experts）架构的大模型提供极致性能体验。

当前支持Qwen、Deepseek、智谱等系列模型的快速部署。

## 核心优势

- **极简部署体验** ：通过计算巢控制台可视化界面，3 分钟即可完成 LLM 模型 PD 分离部署。全程无需手动配置 ACS 集群、OSS 存储、Kubernetes 组件、网络拓扑等复杂基础设施，真正实现"零门槛"上手，让您专注于业务创新而非底层运维。
- **SOTA 级性能调优** ：基于阿里云内部大规模生产实践和性能基准测试（SOTA）结果，预置最优性能参数配置。无需深入理解 PD 分离原理、专家并行机制、显存管理策略等复杂技术细节，即可获得业界领先的推理吞吐量和延迟表现。在生产环境中，同等算力下吞吐量可达到单机部署的1.5到2倍。详情可参考性能测试。
- **企业级生产能力** ：开箱即用的企业级特性，包括多维度监控大盘（模型级、Pod 级、GPU 级）、支持弹性伸缩等，保障生产环境稳定。

## 单机部署 vs PD 分离

### 基本原理

LLM的推理过程可分为两个阶段：

● **Prefill (提示词处理) 阶段** ：此阶段一次性处理用户输入的全部提示词（Prompt），并行计算所有输入Token的注意力，并生成初始的KV缓存。这个过程是 **计算密集型（Compute-Bound）** 的，需要强大的并行计算能力，但只在请求开始时执行一次。

● **Decode (解码生成) 阶段** ：此阶段是自回归过程，模型根据已有的KV缓存，逐个生成新的Token。每一步的计算量很小，但需要反复、快速地从显存中加载巨大的模型权重和KV缓存，因此是内 **存带宽密集型（Memory-Bound）** 的。

Prefill阶段常采用首Token延迟(Time to first token，TTFT)作为SLO，即从用户输入prompt到返回首Token的时延。用户对于TTFT时延容忍度较高，生产环境一般约束mean TTFT<3s即可。

Decode阶段采用输出Token延迟（Time per output token, TPOT）作为SLO，即LLM模型生成后续Token的时延。用户对于TPOT时延容忍度较低，生产环境一般约束mean TPOT<50ms。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_a1204a0419934a3c9bf717ad1f51dd25.png "image.png")

### 单机部署

为了提升GPU利用率，推理引擎在处理多个用户请求时往往会采用凑批处理（Continuous Batching）的方式，将不同请求的Prefill阶段和Decode阶段放在一个批次里调度。Prefill阶段需要处理全部提示词因此计算时间长，Decode只需要计算一个Token因此计算时间短。若在同一批次中调度，Decode阶段会因等待Prefill导致时延增加，进而增加系统整体延迟并降低吞吐量。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_49b2f47ab84b40d4ac465bafd4887d6d.png "image.png")

### PD 分离架构

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_6129074b27c140c1807f8edcfddc2416.png "image.png")

PD分离架构的解决方案就是将这两个阶段解耦，将Prefill和Decode阶段分开部署在不同GPU上。通过分离部署，可以针对不同阶段的计算特性独立配置硬件资源、并行策略和优化参数，实现资源利用率和性能的双重提升。

## 生产环境性能测试

### 📊 2台H200 1P1D 性能测试对比表

注：H200性能约为H20的2.5倍，设H20的吞吐数为1

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_6ac73637f1cf4d429106590d4675315e.png "image.png")

### 关键结果分析

🔍 为什么短上下文出现“正向优化”？

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_ab9b4c1a28e145f8bbfcec3e0b0b2e85.png "image.png")

📉 为什么长上下文出现“负优化”？

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_868052ee03654ff280ecfa541a198eb3.png "image.png")

🛠️ 长上下文负优化解决方案

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_f24ccdc4655246fc8640aef9c98e05c1.png "image.png")

## 部署流程

1. 在 [计算巢模型市场](https://computenest.console.aliyun.com/ai-lab/model/cn-hangzhou) 页面选择要部署的模型，以Deepseek-R1为例，单击开始部署。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_34512ee303ef4d05aeb4bb4473385b55.png "image.png")

点击开始部署后会进入到模型部署页面，选择ACS集群部署。

2. 选择SGLang->ACS集群PD分离方式进行部署。部分模型支持PD分离配置预估工具，可以根据您的需求，自动生成适配的部署参数。如部分模型未支持此工具，可以采用默认部署参数或自行调整。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_5bde97fd99144c309c7a811feee9e860.png "image.png")

3. 基础资源配置可选择ACS集群与可用区等参数配置。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_0da8fb7df604474e95f3a7bf8c71f178.png "image.png")

4. 模型权重配置，可以选择新建Bucket或已有Bucket。具体配置含义参见模型权重同步机制。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_5be727855d1346db8a5084ca521fc1f6.png "image.png")

5. 注意事项，如您在部署过程中存在疑问，可进入钉钉群寻求技术支持。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_969487fb44bc4f6abe2146488cf6bbb0.png "image.png")

6. 确认订单后可看到费用预估和依赖权限检查，单击 **立即创建** 进入到服务实例创建流程。权限问题详见权限检查。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_9031d85ade914c8eaa7d309d1a4416c8.png "image.png")

## 技术支持

如果您在部署模型服务或使用服务过程中遇到任何问题，可加入下面的钉钉群寻求技术支持。

![image.png](https://ucc.alicdn.com/pic/developer-ecology/nq5th7voitcge_c26f2ea7152f4b0b8d0da201e72b4854.png "image.png")

## 相关文档

- [计算巢模型市场容器集群部署最佳实践](https://help.aliyun.com/zh/compute-nest/use-cases/computing-nest-model-market-container-cluster-deployment-best-practices?spm=a2c4g.11186623.help-menu-268599.d_5_0_0_5.59887f25ysTyVQ#15092b6f35yon)

介绍来计算巢部署LLM模型服务的原理与常见问题。

- [部署SGLang PD分离推理服务](https://help.aliyun.com/zh/ack/cloud-native-ai-suite/user-guide/deploy-sglang-pd-separated-inference-service)

展示如何在ACK上手动部署PD分离的模型服务。
