---
格式版本: 2
标题: "GitHub - ModelEngine-Group/flexai · GitHub"
原文链接: "https://github.com/ModelEngine-Group/flexai"
发布日期: "未标注"
发现时间: "2026-06-01T09:50:19+08:00"
入库时间: "2026-06-01T05:59:51.818Z"
来源平台: "博查 AI Search"
搜索渠道: "bocha_ai_search"
搜索词: "XPU"
匹配关键词:
  - "XPU"
  - "GPU"
  - "华为"
相关厂家:
  - "华为"
相关专家:
  []
内容类型: "网页"
抓取工具: "XCrawl Scrape"
清洗工具: "XCrawl Markdown + LLM 正文裁剪"
原始附件:
  []
AI优质: "否"
AI打分: 47
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "聚焦XPU/GPU虚拟化与容器调度软件，属AI算力软件层工具，未涉及超节点/AI Rack硬件架构、供电散热、高速互连或机柜级部署等核心关注点，缺乏硬件技术细节与商业落地信号。"
AI质检模型: "qwen3.6-plus"
AI质检时间: "2026-06-02T23:51:51+08:00"
AI主题相关性: 8
AI来源权威性: 10
AI新颖性: 10
AI技术细节: 8
AI商业部署信号: 5
AI完整性: 6
采集批次: "2026年6月1日9点50分10秒"
采集批次ID: "20260601-095010-781"
去重键: "https://github.com/ModelEngine-Group/flexai"
---

# ModelEngine-Group/flexai

# Flex:ai 介绍及使用说明

## 概述
Flex:ai是一个面向AI容器场景的开源项目，由上海交通大学、西安交通大学、厦门大学、华为等联合发起。其核心能力包含两大部分，分别是XPU虚拟化和多级智能调度。其中XPU虚拟化分为本地XPU虚拟化和跨节点拉远虚拟化，本地XPU虚拟化支持将1台服务器上的XPU算力卡虚拟化分割出多个虚拟算力单元，实现单张算力卡在多个容器的共享。跨节点拉远虚拟化支持通过RDMA或TCP网络访问远端节点上的算力卡。多级智能调度支持对切分出的虚拟卡进行Binpack等资源级调度，以及对AI训推任务进行分时调度等能力。

## 动机
用户的AI业务集群通常是大小模型混部的场景，集群除了运行AI大模型如Deepseek、Qwen系列，还有大量的小参数量模型，如CV模型、Embedding模型等，这些小参数量模型无法充分使用整张算力卡的资源，从而导致昂贵的GPU/NPU资源存在浪费。此外算力集群中运行的AI工作负载千差万别，如何基于有限的算力资源对大并发的AI工作负载进行高效调度是一个难题。基于上述的背景，我们构筑了Flex:ai开源项目，提供将XPU算力卡进行虚拟化切分，以及面向AI训推任务和集群资源做智能调度的能力。

# Ascend NPU虚拟化
请查看[Ascend-Virtual-Service](https://github.com/ModelEngine-Group/flexai/blob/main/Ascend-Virtual-Service)

# GPU虚拟化
请查看[GPU-Virtual-Service](https://github.com/ModelEngine-Group/flexai/blob/main/GPU-Virtual-Service)

# License
Flex:ai is licensed under the MIT with additional conditions. Please read the LICENSE file for details.
