---
格式版本: 2
标题: "“榨”出硅的极限：怎么让GPU不“闲着”？-36氪"
原文链接: "https://36kr.com/p/3920675282163337"
发布日期: "2026-08-10"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "llm:scrape:provider_published_at"
发布时间证据: "provider publishedAt: 2026-08-10"
发布时间校准原因: "根据优先级规则，provider publishedAt（c1）为最高优先级候选，且未被排除。"
发布时间校准置信度: "1"
发布时间候选数量: 5
发布时间严格候选数量: 2
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-08-10T12:55:17+08:00"
发布时间仲裁状态: "confirmed"
发布时间仲裁尝试次数: 1
发布时间仲裁耗时毫秒: 8397
发现时间: "2026-08-10T12:01:10+08:00"
入库时间: "2026-08-10T04:55:25.426Z"
来源平台: "36氪搜索"
搜索渠道: "source_template"
搜索词: "https://36kr.com/search/articles/Microsoft"
匹配关键词:
  - "GPU"
  - "光"
  - "HBM"
  - "NVL72"
  - "NVLink"
  - "内存"
  - "计算"
  - "交付"
  - "部署"
  - "性能"
  - "带宽"
  - "吞吐"
相关厂家:
  - "Microsoft"
  - "NVIDIA"
  - "AMD"
  - "阿里"
  - "字节"
  - "Meta"
  - "Google"
  - "博通"
  - "OpenAI"
相关专家:
  - "黄仁勋"
内容类型: "网页"
抓取工具: "Jina Reader"
清洗工具: "Jina Reader Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 50
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "本文主要讨论AI推理软件层优化（SGLang、vLLM），虽提及NVL72但仅作为背景，缺乏超节点/AI Rack硬件架构、供电、散热、互连等核心内容，主题相关性低。"
AI质检模型: "deepseek-v4-flash"
AI质检时间: "2026-08-10T12:55:34+08:00"
AI主题相关性: 5
AI来源权威性: 10
AI新颖性: 15
AI技术细节: 5
AI商业部署信号: 5
AI完整性: 10
采集批次: "2026年8月10日12点00分08秒"
采集批次ID: "20260810-120008-232"
去重键: "https://36kr.com/p/3920675282163337"
---

Title: “榨”出硅的极限：怎么让GPU不“闲着”？-36氪

URL Source: https://36kr.com/p/3920675282163337

Published Time: 2026-08-10T12:55:01+08:00

Markdown Content:
![Image 1: 36氪](https://36kr.com/p/3920675282163337)

[](https://36kr.com/usercenter/basicinfo)[账号设置](https://36kr.com/usercenter/account-password "账号设置")[我的关注](https://36kr.com/usercenter/follow "我的关注")[我的收藏](https://36kr.com/usercenter/favorite "我的收藏")[申请的项目](https://36kr.com/seek-report-new?tabKey=2 "申请的项目")[退出登录](https://36kr.com/p/3920675282163337 "退出登录")

登录

搜索

*   [36氪Auto](https://img.36krcdn.com/hsossms/20230605/v2_384be8e4c1e942a28cf13a2e427fe211@18900718_oswg78404oswg320oswg320_img_png) [数字时氪](https://img.36krcdn.com/hsossms/20230605/v2_636063907bdc44389b46e7db9c761a38@18900718_oswg62424oswg320oswg320_img_png) [未来消费](https://img.36krcdn.com/hsossms/20230210/v2_38d1cdabc8404b00806de58cbedb3b7b_oswg27031oswg320oswg320_img_png) [智能涌现](https://img.36krcdn.com/hsossms/20230605/v2_da74c43ba887426f8fbccaede691b844@18900718_oswg76573oswg320oswg320_img_png) [未来城市](https://img.36krcdn.com/hsossms/20230209/v2_8c2233c88a854c6496ff4f7842a9f9dd_oswg17629oswg320oswg320_img_png) [启动Power on](https://img.36krcdn.com/hsossms/20230605/v2_632f36f1c5904a539a1e57efe4497e3a@18900718_oswg63630oswg320oswg320_img_png) [36氪出海](http://letschuhai.com/) [36氪研究院](https://img.36krcdn.com/hsossms/20230605/v2_89fa42090fae495ca5e45ba921ee42ff@18900718_oswg65306oswg320oswg320_img_png) [潮生TIDE](https://img.36krcdn.com/hsossms/20231204/v2_3b8447ffdda24a38a30fd839fd934baa@000000_oswg40121oswg430oswg430_img_jpeg) [36氪企服点评](https://img.36krcdn.com/hsossms/20230605/v2_c4720503500642d294b5be04064ef870@18900718_oswg58529oswg320oswg320_img_png) [36氪财经](https://img.36krcdn.com/hsossms/20230209/v2_d6d3f8b57fa04507915c48adf0f9620d_oswg16586oswg320oswg320_img_png) [职场bonus](https://img.36krcdn.com/hsossms/20230605/v2_efc94b0cce7043dbac883c1dfe00c810@18900718_oswg57046oswg320oswg320_img_png) [36碳](https://img.36krcdn.com/hsossms/20230209/v2_9eb02027be264174b61b9d49c391ca75_oswg15571oswg320oswg320_img_png) [后浪研究所](https://img.36krcdn.com/hsossms/20230605/v2_86f220b69e164751946d583b5472c857@18900718_oswg97988oswg320oswg320_img_png) [暗涌Waves](https://img.36krcdn.com/hsossms/20230209/v2_0c6a697748b54beea356d6e1f1fcec5f_oswg17066oswg320oswg320_img_png) [硬氪](https://img.36krcdn.com/hsossms/20230209/v2_2f845ed16244458d8887a5526c63c6d6_oswg17346oswg320oswg320_img_png) [氪睿研究院](https://img.36krcdn.com/hsossms/20251118/v2_d5e97c1ebb974011b0117c1338a9c747@000000_oswg146520oswg1280oswg1280_img_jpg)  媒体品牌 
*   [企业号](https://q.36kr.com/) [企服点评](https://www.36dianping.com/) [36Kr研究院](https://36kr.com/academe) [36Kr创新咨询](https://innovation.36kr.com/)  企业服务 
*   [核心服务](https://www.36kr.com/p/2492318105786505) [城市之窗](https://36kr.com/policy)  政府服务 
*   [创投发布](https://topics.36kr.com/topic/1645523444931974) [LP源计划](https://36kr.com/LPlan) [VClub](https://36kr.com/VClub) [VClub投资机构库](https://36kr.com/organization/) [投资机构职位推介](https://36kr.com/topics/1620276089894403) [投资人认证](https://pitchhub.36kr.com/audit-investor)  投资人服务 
*   [项目推荐](https://36kr.com/seek-report-new) [36氪Pro](https://img.36krcdn.com/hsossms/20230209/v2_95565530d4d94dc4ad904f3131c7b690_oswg23055oswg320oswg320_img_png) [创投氪堂](https://topics.36kr.com/topic/1961250130199045) [企业入驻](https://36kr.com/project-form/settled)  创业者服务 
*    创投平台 
*    [AI测评网](https://ai.36kr.com/)

[](https://36kr.com/topics/799051634713857)[](http://www.bjjubao.org.cn/node_1606.html)[](ttps://36kr.com/topics/799051634713857)

[](https://36kr.com/)

*   [首页](https://36kr.com/) 
*   [快讯](https://36kr.com/newsflashes/) 
*   [资讯](https://36kr.com/information/web_news/) 

    *   [推荐](https://36kr.com/information/web_recommend/)
    *   [财经](https://36kr.com/information/ccs/)
    *   [AI](https://36kr.com/information/AI/)
    *   [项目推荐](https://36kr.com/information/aireport/)
    *   [安徽](https://36kr.com/local/anhui)

    *   [最新](https://36kr.com/information/web_news/latest/)
    *   [创投](https://36kr.com/information/contact/)
    *   [汽车](https://36kr.com/information/travel/)
    *   [科技](https://36kr.com/information/technology/)
    *   [专精特新](https://36kr.com/information/shuzihua/)

*   [直播](https://36kr.com/live/channel) 
*   [视频](https://36kr.com/video/) 
*   [专题](https://36kr.com/topics/) 
*   [活动](https://36kr.com/activity) 

*   [广东](https://36kr.com/local/guangdong)
*   [浙江](https://36kr.com/local/zhejiang)
*   [四川](https://36kr.com/local/sichuan)
*   [安徽](https://36kr.com/local/anhui)

搜索

[项目推荐](https://36kr.com/seek-report-new?t=1786337701786)

我要入驻

[城市合作](https://36kr.com/station-business)

# “榨”出硅的极限：怎么让GPU不“闲着”？

[硅谷101](https://36kr.com/user/132427329)_·_ 2026年08月02日 02:32

AI Infra的效率革命

AI行业突然开始了一场“造芯大战”。

7月20日，The Information报道称，谷歌正在研发一款内部代号“Frozen v2”的服务器芯片，计划把Gemini模型的部分架构直接固化进硅片。

而在一个月前的6月24日，OpenAI亮出了和博通联合研发的首款推理芯片Jalapeño，从设计到流片只用了九个月。

![Image 2](https://img.36krcdn.com/hsossms/20260801/v2_7a0b6d508e444538957a8fbaa14c334d@132427329_oswg612067oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

此外，Anthropic、智谱、_DeepSeek_ 也都相继传出正在进行相关布局。

但并不是每家公司都有资金、有能力去重造一块芯片。因此有一个市场正在引发资本和巨头的关注：AI infra。背后的逻辑是：已经部署好的数据中心和GPU，本身还存在优化的空间。

AI推理平台Baseten一年收入增长了20倍，估值从21亿美元暴涨至130亿。同赛道的fireworks，七个月内估值翻了四倍达到 175 亿美元，年化营收突破10亿美元。

而最近，这个赛道还迎来了一股强劲势力。开源推理引擎“双子星”vLLM和SGLang前后脚宣布商业化，种子轮融资都超过1亿美元，背后几乎聚齐了AI产业里所有巨头和顶级风投的名字，拉开了强强对决的大幕。

所以，“GPU的利用率”成为了硅谷的最新关键词，也带出了一个新的千亿级市场。

这篇文章，我们邀请到了由SGLang孵化的RadixArk的联合创始人和核心成员，以及数据中心专家，一起聊聊AI Infra的四层架构、行业如何把“硅”的潜力榨到极限，以及背后的关键技术。

![Image 3](https://img.36krcdn.com/hsossms/20260801/v2_9c5648a4e07c47f388242baffb3893f2@132427329_oswg15654oswg1080oswg401_img_000?x-oss-process=image/format,jpg/interlace,1)

大模型的重心从训练走向推理，这对算力会提出完全不同的要求。

训练成本极高，但训练完之后，任务就告一段落。但推理不同，无论是Chatbot还是Agent，AI应用越多，GPU需要处理的请求就越多，而且这些请求完全不间断，推理需求也随之爆发性增长。

![Image 4](https://img.36krcdn.com/hsossms/20260801/v2_e0452992616442918415853ba7c7a38a@132427329_oswg540085oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

> **朱邦华**
> 
> 
> **RadixArk联合创始人**
> 
> 
> **随着新的应用逐渐增多，推理的总量会比原来大很多。随着大家不断拓展应用、不断拓展模型的智能边界，推理的需求会越来越大。现在已经大到，市面上的卡基本都很难找到，每一家都缺卡。**

现在的情况就是，市面上每一家都缺卡，而对于有钱的巨头们来说，最直接的方法当然还是继续建数据中心、采购更多GPU。

Meta、Google、Microsoft等科技巨头持续提高资本开支，今年合计预计超过1万亿美元。而黄仁勋预测，到2030年，全球AI基础设施年投资规模将达到4万亿美元。

![Image 5](https://img.36krcdn.com/hsossms/20260801/v2_fa917411ce784c02b46a37f7760416d5@132427329_oswg464482oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

但华尔街，是担心的。

> **Ethan Xu**
> 
> 
> **前微软能源战略经理、突破能源科研总监**
> 
> 
> **华尔街的担心不无道理，过去我们是有前车之鉴的。像互联网时代泡沫的破灭，当时大量资金投入到光纤建设、互联网公司，虽然长期来看实现了它们的价值，但短期出现了很大的问题。**

![Image 6](https://img.36krcdn.com/hsossms/20260801/v2_ca2610fb75ad4542bb2eba0cfcd84a1d@132427329_oswg552770oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

所以，如果不能在短时期内大规模增加算力，还有什么办法能够满足AI快速发展的需求？答案是：**提高GPU的利用率。**这背后的这一层产业，叫做AI Infra（人工智能基础设施层）。

首先，我们从AI Infra的整体架构角度，来科普GPU的一个误区：**你以为GPU很忙，其实大多数时候，GPU是很“闲”的。**

GPU只是整个AI系统中的一环。从一条用户请求进入系统开始，它需要经过网络传输、资源调度、模型加载、内存管理，再到最终完成推理、返回结果。整个过程中，只要任何一个环节出现瓶颈，GPU就只能停下来等待。

卡内基梅隆大学（CMU）今年4月发布的一项研究，对一个大型学术AI集群里的756块GPU做了31天的细粒度遥测，覆盖A6000、L40S、A100、H100到最新B200等六种型号。结果发现，很多时候GPU都处于一种叫做“execution-idle”（执行时空转）的状态。

这种“看似繁忙实则空转”到底有多严重？在他们观测的集群中，**整体上有近20%的执行时间和约11%的能耗被浪费在了等待上。**更值得关注的是推理场景，Azure Code负载有高达65%的能耗消耗在这种空转上，OpenAI的Chat类请求也达到52%。

![Image 7](https://img.36krcdn.com/hsossms/20260801/v2_1066023f4cf4458e9c48155e2dc84c16@132427329_oswg507785oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

那么，为什么GPU会被跑不满呢？我们首先要了解一下AI Infra的四层架构，每一层其实都会影响GPU的利用率。

**第一层：能源基础设施（Power Infrastructure）**，也就是电。这一层决定的是，GPU能不能持续稳定地运行。

**第二层：计算硬件（Hardware Infrastructure）**，也就是卡。除了GPU，现在还包括高带宽存储（HBM）、高速互联（NVLink、InfiniBand）和CPU等。这一层决定的是理论上能够提供的计算上限。

**第三层：系统软件（System Software）**，包括CUDA、编译器（Compiler）、通信库、内存管理和底层算子（Kernel）库等，决定的是每一次计算能不能被执行到硬件的物理极限。

**第四层：服务编排（Service Orchestration）**，这一层要负责协调GPU资源，决定哪些任务优先运行，以及不同业务间的动态调度。推理引擎、训练框架、请求调度和资源管理等都属于这一层，代表性项目有vLLM、SGLang等，也是近年来创新最密集的地方。

搞清楚了AI Infra的架构之后，回到我们的问题：为什么这么多GPU跑不满，主要卡在什么环节？

理论上来说，四个层级中的任何一层出现问题，都会影响GPU利用率：电力和散热不足，GPU会被迫降频运行；硬件互联跟不上，会让GPU花大量时间在等数据而不是算数据；系统软件优化不够，会让每一次计算都无法触及硬件的物理极限；而请求调度不当，会让本来可以合并的计算被拆散、可以复用的结果被重算，造成浪费。

但这四层的问题，性质并不相同。能源基础设计层和计算硬件层是“硬”问题，电力、散热、芯片的改造周期以年为单位，而且优化空间正在快速见顶。系统软件层和服务编排层是“软”问题，本质上是工程问题和算法问题，优化之后能带来数倍的性能提升。

![Image 8](https://img.36krcdn.com/hsossms/20260801/v2_807be6668c174dffb1c21696083e7906@132427329_oswg469161oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

在这样的背景下，行业的注意力也在快速往这两层“软”问题上移。

> **陈震林（Richard）**
> 
> 
> **RadixArk Member of Technical Staff**
> 
> 
> **尽管成本主要发生在物理层，但大部分工作都要放在软件层和服务编排。因为你把人力投入到这一块当中，能够带来最大的优化可能性。**

![Image 9](https://img.36krcdn.com/hsossms/20260801/v2_1fc617b3c6054c98838e3e5b3a9bb06e@132427329_oswg538800oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

举一个具体的例子。一台NVIDIA GB200 NVL72机柜，采购成本大约在400万美元。但如果软件栈没有做好调度和优化，GPU的实际利用率可能只有50%，相当于只用到了200万，剩下的200万美元就以电费、折旧和机会成本的形式被白白烧掉了。反过来，如果能把利用率从50%推到90%以上，效果就相当于凭空多出了一台机柜。

> **陈震林（Richard）**
> 
> 
> **RadixArk Member of Technical Staff**
> 
> 
> **软件层能做得最好，就会带来更好的服务和更好的token消耗。通过这一层的重写和优化，去帮助推理引擎和训练框架做更好的交互，也包括像reinforcement learning（强化学习）这种现在特别火的post-training（后训练）过程的调度，把GPU的利用率给提上来。**

这就是为什么，当硬件成本高到这个量级时，软件层的每一次优化，都变成了直接的商业问题。

不久之前，有网友扒出Anthropic的员工中现在占比最大的就是AI Infra相关的工程师，背后也与这个逻辑息息相关。

![Image 10](https://img.36krcdn.com/hsossms/20260801/v2_fbef6bf8066e459ba9bd3b2289d27219@132427329_oswg226702oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

> **陈震林（Richard）**
> 
> 
> **RadixArk Member of Technical Staff**
> 
> 
> **Anthropic现在推理的队伍大概已经有200多个人，在这三年期间，他们也是从infra极度不稳定，到现在极度趋于稳定，以及把成本和优化做得更强，这也直接影响了他们的营收能够在二季度就实现盈利。**

OpenAI、Anthropic和谷歌会把这样的AI Infra团队放在公司内部做，因为这成为了各大前沿实验室的竞争壁垒之一。但对于没有资金量做优化的稍小一些的模型团队或初创公司来说，两个开源框架成为了他们的支柱，分别是SGLang与vLLM。

> **陈震林（Richard）**
> 
> 
> **RadixArk Member of Technical Staff**
> 
> 
> **这就是为什么两年前会有像SGLang这样的开源社区出现。你需要有这样新的框架，去重新定义这一波新的硬件系统组合，才能跟它做更好的适配。**

理解了四层架构以及需要被优化的两层“软”问题，那具体应该怎么做呢？

![Image 11](https://img.36krcdn.com/hsossms/20260801/v2_a30ed75d45de4c5bbb21d2d3cb2cd452@132427329_oswg16981oswg1080oswg401_img_000?x-oss-process=image/format,jpg/interlace,1)

目前所有的优化工作，都可以归结为对四个问题的回答：**哪些计算不用重新做？哪些等待可以消除？哪些算力没有吃满？哪些资源没有协同？**

刚才我们提到的SGLang与vLLM都是在围绕着这几个问题展开，只是设计思路略有不同。vLLM因提出PagedAttention而受到广泛关注，更强调常规、通用的推理部署场景。SGLang则从推理执行流程出发，更强调计算复用和系统级优化。

![Image 12](https://img.36krcdn.com/hsossms/20260801/v2_dd41a03afb76475e9be452e507027b19@132427329_oswg415148oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

我们来看看，SGLang孵化出来的RadixArk团队，现在是如何思考AI Infra优化的这四个核心问题的。首先，我们先来解决一下计算的问题。

**▍K/V Cache的极致复用**

大模型推理里有一个“很傻”的事实：当同一段文字被反复喂给模型时，它每次都要从头计算一遍。

这在实际业务里简直就是硬伤，尤其是在agent（智能体）工作流里，同样的工具描述可能被调用几十次，每次都从零开始。业界现在把它称为“推理税”，这意思大概跟智商税也差不太多，反正都是白花的钱。

那这税能不能省呢？当然能。

Anthropic之前就做过一版优化，直接把成本砍了90%，同样的东西本来要花十块，优化完只花一块。而这背后最核心的思路，叫做KV Cache复用，简单来说就是把算过一遍的东西存下来、下次直接拿来用，不用从头算。

![Image 13](https://img.36krcdn.com/hsossms/20260801/v2_4d0c4525b55941adbc5c35d03738ce47@132427329_oswg807531oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

Transformer在解码时，每一层self-attention（自注意力机制）都会把历史token映射成Key / Value张量，简称KV，Cache就是缓存。有了KV Cache之后，在第一次请求的prefill（预填充，指用户输入完prompt到生成首个token的过程）阶段，系统能把prompt中每个token、每一层的K/V存下来。之后解码每个新token时，只计算新token的KV并追加到缓存里，历史token的K/V则直接复用。

但KV Cache有一个弊端。它虽然可以降低解码的计算量、降低首token延迟（TTFT），但代价是占GPU显存。当上下文很长、同时又有很多用户请求时，KV Cache会占用大量显存。显存一旦不够，模型就很难继续提高并发和速度，所以它常常会变成推理服务的主要瓶颈。

而SGLang在这件事上的解决方案，是一项叫做**RadixAttention的核心技术。**

它的核心思路是用一种叫做“基数树”（Radix Tree）的数据结构，来组织海量请求的KV Cache。你可以把它想象成一棵共享前缀的家族树，共享同样开头的请求会共用同一段枝干，只有当内容开始分叉时，才各自长出新的树枝。

![Image 14](https://img.36krcdn.com/hsossms/20260801/v2_8af5b60837a4481fb70ce0fdc1709ff5@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

> **朱邦华**
> 
> 
> **RadixArk联合创始人**
> 
> 
> **现在的智能体世界里，很多时候会有很多共享的系统提示词，在共享的系统提示词之后会有不同的用户提示词，而在同一个用户提示词下面，大家会接着问问题，所以树状结构就会不断向下延伸。这也是SGLang论文比较有远见的地方，它在2023年的时候就已经大概预见到了这样的模式。随着智能体编程的用户越来越多，Radix Tree，也包括SGLang本身的prefix cache（前缀缓存）这套系统，带来的增益就越来越大。**

简单来说，**SGLang完成的核心优化之一，就是跨请求、跨机器地共享和复用KV Cache。**普通KV Cache只服务于一个请求，但SGLang把KV Cache变成了全局可复用的资源。

不过，这件事听起来简单，工程上却很复杂。比如说，缓存存在哪里、怎么快速匹配、多个请求怎么共享、显存不够时该淘汰谁，每一步都要精细设计。仅仅有一个好的缓存结构还不够，还需要“调度器”主动把可以共享前缀的请求安排在一起处理。否则缓存明明存着，调度器却把请求分到不同时间、不同GPU上，缓存就等于白存。对此，SGLang也做了非常多的优化策略。

比如说Cache-aware scheduling（缓存感知调度），就是把相似请求排在一起处理。你可以把大模型运作想成餐厅后厨，如果后厨现在连续处理的三单都是麻辣香锅，那很多调料和准备工作可以复用，效率很高，就算有区别，也只是小辣、中辣、大辣的区别。

但如果顺序变成麻辣香锅、寿司、牛排、麻辣香锅、寿司、披萨、麻辣香锅，中间切来切去，大厨还得洗锅，那复用机会就少了。所以SGLang会用Cache-aware scheduling让前缀相似的请求靠近处理，把顺序重新排成3份麻辣香锅、2份寿司、牛排、披萨，这样缓存更容易命中，效率也就进一步提高。

![Image 15](https://img.36krcdn.com/hsossms/20260801/v2_728a0479b4f044eab5b3ec698118bd2a@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

还有一个叫Eviction（淘汰机制），就是显存不够时，扔掉最不可能再用的缓存，跟你管理手机内存是一样的道理，10年前的照片和文档，可能就没有最近几个月的数据那么有价值。所以常用的系统提示词、高频RAG文档，还有最近刚被用过的对话前缀更会被保留，而显存不够时，就淘汰很久没用过的、复用价值低的、不太可能再被访问的KV Cache。

![Image 16](https://img.36krcdn.com/hsossms/20260801/v2_bd86eb44b7af44ceb4b727b222e71e66@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

还有一个让AI Infra显得非常有智商的技术，叫做分布式cache-aware load balancer（缓存感知负载均衡）。大规模服务通常有很多GPU，如果某段长prompt的KV Cache在GPU 1上，但下一个相同前缀的请求被发到了GPU 3，那GPU 3没有这份缓存，还是得重新算。所以SGLang还会尽量把请求发到“已经有笔记”的那个GPU上，这样一来，可以少算很多重复内容。

![Image 17](https://img.36krcdn.com/hsossms/20260801/v2_906621add67c4ca18ab27ebfde3f482e@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

还有其他的小技术细节我们就暂时不展开了。总体而言，虽然SGLang把架构都搭好了，但具体每个团队怎么部署infra，还是蛮有工程上的考量的。我们接下来看看优化工作的第二个大难题：等待。

**▍等待：让GPU别闲着**

现在这行情，内存价格一个季度能涨90%，高端显存缺货缺到2027 年，GPU有钱都不一定抢得到。但最后，这些花了大价钱抢到的卡，一半时间却都在“干等”。

**第一是请求之间的等待。**最早的推理引擎是“排队制”，请求一个个来，一个算完再算下一个。后来演进到“批处理”，凑够一批一起算，但凑批也要等，这不解决浪费的问题，而且一批里如果有的请求短、有的请求长，短的算完了要等长的算完才能一起下车，短请求的用户体验极差。

现在主流的做法叫Continuous Batching（连续批处理），不再等一批人全部到齐再发车，而是像一辆随时可以上下客的公交车，新请求随时能上车，算完的请求随时能下车，GPU始终保持满载。这一改造，能让GPU的实际吞吐量提升2到4倍。

![Image 18](https://img.36krcdn.com/hsossms/20260801/v2_cfeb265d3438410b941ff52b7668b9d1@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

除了请求等待之外，**计算阶段也有等待。**大模型的推理其实包含“读入”和“生成”两个阶段。读入阶段（Prefill）要快速处理一大段文字，对算力要求高。生成阶段（Decode）则是一个字一个字往外蹦，计算量不大，但每写一个字都要翻一遍完整记忆，对显存带宽极其敏感。过去这两个部分都被塞进同一张GPU里混合执行，结果就是Prefill在算的时候Decode在等，Decode在算的时候Prefill在等，互相拖累。

现在的做法叫Prefill/Decode分离，把这两个阶段拆到不同的GPU上，各自用最适合的硬件配置，通过高速网络传递中间结果。比如 _DeepSeek_ 就采用了这个方案，Prefill“读题”时，32张GPU组成一个最小计算单元，等真正开始“逐字作答”，任务就交给另一批GPU接手，两拨卡各干各的，互不打扰。

![Image 19](https://img.36krcdn.com/hsossms/20260801/v2_0dec1a77af0a4f3ab78e9383edcc6353@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

如今，PD分离已经成为推理引擎最重要的架构演进之一。在英伟达推出的分布式推理框架Dynamo中，PD分离被放在了整个架构设计的核心位置，而SGLang也是业界最早支持大规模PD分离部署的推理引擎之一。

接下来我们说说第三个大问题：算力跑满的问题。

**▍算力：“多释放一倍”**

当年英伟达的H100发布后，Tensor Core算力相比A100提升了数倍，整个行业都期待着AI推理能同步增长、性能飞跃，但现实却并不是这样。背后的主要原因是，GPU大量时间花在了数据搬运上，又受限于串行解码，计算能力无法得到充分释放。

解决思路有两个主要方向。

**一个是低精度计算。**大模型在运行时，GPU显存里主要装了三样东西：模型权重、中间激活值、以及KV Cache，这三部分的精度可以独立设置。用更小的数据格式来存储或运算其中的任何一部分，都能减少显存占用，也能利用GPU上更快的低精度算力。在合适的场景下，甚至能多释放出一倍的算力空间。

**另一个是投机采样（Speculative Decoding）**，意思是先用一个小模型（draft model，也叫草稿模型）“猜”接下来几个字，再让大模型进行一次性验证，猜对了就等于一次计算生成多个字。

做个类比，大模型是个很厉害但很忙的老师，小模型是个速度很快的助教。之前，学生每写一个字都要问老师这个字行不行，老师确认后再写下一个字。但投机采样是助教先帮学生写一小段草稿，老师一次性看这一小段，如果前面都对就全部通过，如果中间错了，就从错的地方重新来。

![Image 20](https://img.36krcdn.com/hsossms/20260801/v2_0a50a1a2a3c24f9f871a79a4e693b4b0@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

这样的方式，最佳情况下能把生成速度提升2到3倍。而推理引擎在这里扮演着一个至关重要的角色，就是把这些新能力第一时间集成到系统里，把软件和硬件打通，优化协同起来。

> **朱邦华**
> 
> 
> **RadixArk联合创始人**
> 
> 
> **SGLang本身是一个整体的解决方案，它是一个inference engine（推理引擎）。它需要保证，比如我们会做kernel（计算内核）优化，会做scheduler （调度器）优化，会做比如说CUDA Graph（CUDA图执行优化）、continuous batching（连续批处理），甚至再往上走，你会有routing（请求路由），也包括 prefix cache(前缀缓存）怎么去被路由到对应的推理引擎实例。所以SGLang其实有非常非常多的技术组合在一起，把整个推理方案做到极致、做到最好。**

我们的嘉宾还提到，像SGLang这样的推理引擎，现在跟芯片厂商之间已经是一种深度绑定的联合优化了。芯片厂在设计新硬件的时候，就已经在和SGLang团队一起做联合调优，等到硬件正式发布，SGLang也几乎在同一时刻完成了day-0支持，双方一起把硅的性能压缩到极致。

![Image 21](https://img.36krcdn.com/hsossms/20260801/v2_2f8e64e6e52341f9ab1db96d5bea0d48@132427329_oswg389253oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

> **朱邦华**
> 
> 
> **RadixArk联合创始人**
> 
> 
> **不管是哪一个硬件厂，做出来新的GPU、新的硬件，都要证明这个硬件是非常高性能的。基本上现在默认，很多人的选择都是通过跑SGLang，甚至现在SGLang已经变成一个硬件评测的工具。比如你可以看到AMD最新的硬件、英伟达最新的硬件，现在都是SGLang的首发合作伙伴，甚至就在发布硬件的当天，他们就会说在SGLang上的性能表现达到了多少。我们现在会和所有这种硬件厂商合作，SGLang本身和我们团队能够把他们硬件的性能压缩到极致，使得最后能交付更好的推理性能、训练性能等等。**

这其实也解释了RadixArk从SGLang孵化出来进行融资的时候，机构投资人方面，英伟达、AMD、联发科、Databricks等AI硬件与系统层的主要玩家几乎全部到齐，个人投资者的名单更是一个比一个重磅，包括英特尔CEO陈立武、博通CEO陈福阳、OpenAI联合创始人John Schulman、PyTorch之父Soumith Chintala等等，可以说是非常豪华的阵容了。

![Image 22](https://img.36krcdn.com/hsossms/20260801/v2_4629e1beb0ef4cedb3c1635134c8b54f@132427329_oswg601677oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

因为对他们来说，投资RadixArk这样的推理引擎是一种战略下注。他们需要一个连接算力与应用的基础设施入口，把更多模型、企业应用和Agent都汇聚到自己的算力生态中。

最后，我们再来说说SGLang在强化学习上的一个重要优化：Miles。

**▍资源协同：适配RL后训练的Miles**

强化学习成为了新一代模型的核心训练方式，这包括OpenAI o1和 _DeepSeek_ R1等等，这也让AI训练的形态发生了巨大变化。

传统的模型训练是一件“体质单一”的事：喂数据、更新参数、再喂数据、再更新参数，整个过程中GPU干的都是同一类活儿。这种情况下，硬件配置和调度策略只要针对“训练”这一件事优化到位就行了。但强化学习要把推理、评估、参数更新三种完全不同的计算揉在一起循环跑，三件事对硬件的需求天差地别。

> **朱邦华**
> 
> 
> **RadixArk联合创始人**
> 
> 
> **准确来说，强化学习必须要做在线推理。它的负载是，我先让模型生成很多要回答的内容，然后根据这些内容打分，再把模型更新一下，再去回答一些新的问题，然后再给它打分。所以本身它就是一个交替做训练和推理的过程。**

如果用传统的训练框架来跑强化学习，它们会在同一批GPU里争抢资源，生成的时候训练在等，训练的时候生成在等，大量算力被浪费在阶段切换和相互等待上。

所以资源协同，成了效率提升的命门。这也是为什么RadixArk在SGLang之外，还推出了训练框架Miles。

![Image 23](https://img.36krcdn.com/hsossms/20260801/v2_4230f21be8e04adb93aa499a330e7789@132427329_oswg193933oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

> **陈震林（Richard）**
> 
> 
> **RadixArk Member of Technical Staff**
> 
> 
> **如果单纯无视训练、只做推理，反而可能没有办法押注未来。因为最终可能还是会有很多人希望自己训练自己的模型，然后再去推理。所以如果我们想做整体的AI软件基础设施，我们认为两边都需要关注。**

Miles是一个面向大模型后训练的开源训练框架。所谓后训练，是指模型有了基础能力之后，再通过SFT（监督微调）、强化学习等方式继续打磨，让它更会听指令，也更会思考。

![Image 24](https://img.36krcdn.com/hsossms/20260801/v2_cedef879c1fa43729f1fe14f510d8f47@132427329_img_000?x-oss-process=image/format,jpg/interlace,1)

**和传统训练框架相比，Miles最大的不同是：它把“训练”和“推理”放进了同一个系统里一起考虑。**这点在强化学习里非常重要，就像我们前文提到的，在强化学习中推理和训练是一个交替进行的过程，如果配合不好，很多算力就会被浪费掉。

Miles和SGLang配合在一起之后，SGLang在推理端不断产出新样本，Miles在训练端不断更新模型权重，更新后的模型又可以继续用于下一轮生成。这样的优化，能让推理和训练衔接得更顺，减少等待和切换的时间浪费，从而形成一个更高效的后训练闭环。

> **陈震林（Richard）**
> 
> 
> **RadixArk Member of Technical Staff**
> 
> 
> **不匹配的情况在现在的工程领域当中还很容易经常发生，它会导致在推理和训练模型当中，你什么时候能够共用一些共享的模型权重、kernel，你才能保持对齐。很多人会用SGLang，那这时候再用Miles，本身会带来更强的训练能力，然后对推理任务、长程任务，还有智能体的任务，提高更多的稳定性。MoE（混合专家模型）现在是大家都在使用的架构，但MoE本身会有一些routing（路由），这个过程当中会导致训练和推理当中并行的一些策略、还有最后的准确率都会不一样。所以这时候你就需要有更强的工程能力，能把这个事情给做成。所以Miles本身就带来了这一块的优化，以及把训练和推理去做更好的结合。**

目前，Miles在新硬件支持、MoE训练以及训练与推理一致性（Training-Inference Alignment）等方面都进行了大量工程优化，使整个后训练流程能够更稳定、更高效地运行。自2025年11月项目启动以来，Miles已经被不少前沿实验室采用。

我们说了这么多技术上的理论，是因为这一层对于AI大模型的发展真的非常重要。它希望把“硅”的极限榨出来，让整个AI系统的算力效率被系统性地释放出来。

![Image 25](https://img.36krcdn.com/hsossms/20260801/v2_b8f0484e4d364f21901f6953910b4f67@132427329_oswg332573oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

而就如我们之前提到的，SGLang和vLLM都是开源架构，背后主要依靠一群研究者和工程师在业余时间共同维护、为爱发电。但当全世界都面临算力紧缺、需要去“榨”硅的极限从而释放更多算力的时候，仅靠开源社区的协作已经难以满足庞大的需求了。于是，SGLang和vLLM的主创团队都前后选择了正式出来创业，更快速、更投入地把技术往前推。

![Image 26](https://img.36krcdn.com/hsossms/20260801/v2_c800cf27b9c9458c9fde1487465b9984@132427329_oswg21068oswg1080oswg401_img_000?x-oss-process=image/format,jpg/interlace,1)

从SGLang正式孵化出来之后，RadixArk有着更大的野心。他们认为，就像云计算改变了服务器一样，未来AI Infra也可能演变成整个AI行业能够共享的基础设施。

最近，黄仁勋牵头成立开源AI联盟，联盟里既有模型公司，也有芯片公司，还有像SGLang这样的AI Infra项目。

![Image 27](https://img.36krcdn.com/hsossms/20260801/v2_a37b01e4f41f458289d3526985feedae@132427329_oswg307124oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

今天开源模型迭代的速度越来越快，从 _DeepSeek_ V4、智谱GLM-5.2到7月17日刚刚发布的 _Kimi_ K3，每隔几周就会出现新的SOTA模型。但开源模型开放的只是权重，权重并不会自动变成Token。任何人下载了这些模型之后，仍然要解决部署、显存、吞吐和调度等一系列工程问题，而SGLang现在都能做到day-0支持。

![Image 28](https://img.36krcdn.com/hsossms/20260801/v2_76c6fd6bb02549e9af1f5650d58f8465@132427329_oswg215887oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)

这意味着，模型一发布，任何开发者都能借助SGLang这样的引擎立即部署，同一套推理框架也能够跑在英伟达、AMD以及更多新兴AI芯片之上。**推理框架正越来越像AI时代的“操作系统”，成为连接模型与芯片的关键一层。**

> **朱邦华**
> 
> 
> **RadixArk联合创始人**
> 
> 
> **我们做RadixArk一个更大的目的，其实是希望以后就不要有frontier lab（前沿实验室）这个词，因为人人都可以做前沿实验室。我觉得前沿本身也是一个非常动态的事情，两年前大家都会觉得Anthropic并不是前沿公司，甚至在这之前，大家可能觉得谷歌离OpenAI太远了，不可能追上。所以在这方面，我觉得现在AI变化太快了。**

> **我们相信会有越来越多的挑战者，越来越多有自己想法的人，他们会做出更好的AI模型和AI产品。我们做RadixArk，就是希望能够赋能这些更有想法的人，让他们更好地去做自己的事情，我们给他们提供的是infra上最强的支持。他们在想做的这一刻开始，就会有和现在的前沿实验室一战之力。那最终，可能这个世界上所有人其实都能自己训练出前沿级别的模型，然后能做最好的推理，所以我们其实更希望是这样一个支持者的角色。**

所以，**当AI Infra能力从少数前沿模型巨头的独家资源，变成任何一家创业公司都能直接调用的公共品，从事AI工作的门槛会被显著降低。**而这，或许才是“榨出硅的极限”这件事最重要的意义。

我们也希望看到，在infra红利被全面释放之后，会有越来越多带着新想法、新架构、新应用场景的团队不再因为infra而被拖慢脚步，这也能让AGI距离我们更近一步。

该文观点仅代表作者本人，36氪平台仅提供信息存储空间服务。

品牌专题

[](https://adx.36kr.com/api/ad/click?sign=62ebabf15264af05dd236256c80ef528&param.redirectUrl=aHR0cHM6Ly90b3BpY3MuMzZrci5jb20vdG9waWMvMzkwNjQwODg1ODg0OTUzOQ&param.adsdk=yuW3gTS8SWSO9GtH0oktllGU8gkwyQHCxVVNW-vpe7HfuuIyL6iqBWNbQQaGy7o0IBWg8R6xs5zZXIpbUhy05Q)

+1

62

好文章，需要你的鼓励

[](https://36kr.com/user/132427329)[硅谷101](https://36kr.com/user/132427329)特邀作者

**24**_收 藏_+1**0**_评 论_

![Image 29: 36氪](https://gateway.36kr.com/api/mis/sns/share/qrCodeUrl?partner_id=web&param.siteId=1&param.platformId=2&param.url=https://36kr.com/p/3920675282163337)_打开微信“扫一扫”，打开网页后点击屏幕右上角分享按钮_[_微 博_](https://service.weibo.com/share/share.php?appkey=595885820&url=https://36kr.com/p/3920675282163337&title=%E2%80%9C%E6%A6%A8%E2%80%9D%E5%87%BA%E7%A1%85%E7%9A%84%E6%9E%81%E9%99%90%EF%BC%9A%E6%80%8E%E4%B9%88%E8%AE%A9GPU%E4%B8%8D%E2%80%9C%E9%97%B2%E7%9D%80%E2%80%9D%EF%BC%9F)

_沉浸阅读_ _返回顶部_

举报

参与评论

评论千万条，友善第一条

[登录](https://36kr.com/p/3920675282163337)后参与讨论

提交评论 0/1000

你可能也喜欢这些文章

[](https://36kr.com/p/3930236944596099)[视频生成模型正在争夺什么？](https://36kr.com/p/3930236944596099)

[](https://36kr.com/p/3930314422533512)[1200亿美元之上，中国服务器厂商重新排位](https://36kr.com/p/3930314422533512)

[](https://36kr.com/p/3933141502868617)[硅谷模型厂正在比谁的 Agent 更能闯祸，背后全是营销剧本](https://36kr.com/p/3933141502868617)

[](https://36kr.com/p/3933115490368647)[OpenAI全新GPT Image突袭，碾压Image 2，塑料感终于消失](https://36kr.com/p/3933115490368647)

[](https://36kr.com/p/3933114464255112)[刚刚，Anthropic最新Fable泄露了](https://36kr.com/p/3933114464255112)

[](https://36kr.com/p/3933070123089287)[字节 Seedance 爆火背后，藏着一只 50 亿美元的独角兽](https://36kr.com/p/3933070123089287)

[](https://36kr.com/p/3933001917496707)[谁有资格定义AI汽车？](https://36kr.com/p/3933001917496707)

[](https://36kr.com/p/3932991443877001)[「假外卖」产品火了，但这款会吐槽用户乱点外卖的AI理财App，年入超1亿美元](https://36kr.com/p/3932991443877001)

[](https://36kr.com/p/3932271102196866)[AI盛世下的暗雷，藏着下一个“次级债”危机](https://36kr.com/p/3932271102196866)

![Image 30](https://staticx.36krcdn.com/36kr-web/static/new_qr_img.72d61993.png)

[](https://36kr.com/user/132427329)

[硅谷101](https://36kr.com/user/132427329)

特邀作者

《硅谷101》是一档分享当下最新鲜的技术与思想的科技播客

发表文章 224 篇

### 最近内容

[挑战GPU、绕过HBM，深挖史上最大芯片背后的Cerebras](https://36kr.com/p/3932085570197382)

5小时前

[对话盛颖：xAI，Infra的浪漫，SGLang，开源，平权与“甄嬛传”](https://36kr.com/p/3926152549029761)

2026-08-05

[“榨”出硅的极限：怎么让GPU不“闲着”？](https://36kr.com/p/3920675282163337)

2026-08-02

[阅读更多内容，狠戳这里](https://36kr.com/user/132427329)

品牌专题

[](https://36kr.com/p/3920675282163337)

## 提及的AI

[查看AI测评](https://ai.36kr.com/)

[DeepSeek](https://ai.36kr.com/product-detail/14638)

[Kimi](https://ai.36kr.com/product-detail/14559)

## 36氪AI测评

选靠谱AI，看真实评测

查看

36氪AI测评官方交流社区

加入

## 36氪项目推荐

咨询项目审核和入驻

联系

36氪项目推荐订阅号

关注

### 下一篇

[25岁，爆仓，婚礼前亏1000亿](https://36kr.com/p/3920705787178377)

比电影还跌宕。

2026-08-02

关于36氪

*   [城市合作](https://36kr.com/station-business)
*   [项目推荐](https://36kr.com/seek-report-new)
*   [我要入驻](https://36kr.com/p/3920675282163337)
*   [投资者关系](http://ir.36kr.com/)

*   [商务合作](https://36kr.com/p/3920675282163337)
*   [关于我们](https://36kr.com/pages/about)
*   [联系我们](https://36kr.com/p/3920675282163337)
*   [加入我们](https://zhaopin.36kr.com/)
*   [36氪欧洲站](https://eu.36kr.com/)[36氪欧洲站](https://eu.36kr.com/zh)[36氪欧洲站](https://eu.36kr.com/de)[Ai产品日报](https://www.aicpb.com/)

[网络谣言信息举报入口](https://36kr.com/refute-rumor-notice)

热门推荐

*   [热门资讯](https://36kr.com/hot-list/catalog)
*   [热门产品](https://36kr.com/project)
*   [文章标签](https://36kr.com/tags)
*   [快讯标签](https://36kr.com/nftags)

合作伙伴

*   [![Image 31: 阿里云](https://staticx.36krcdn.com/36kr-web/static/aly.e9118f2f.png)](https://www.aliyun.com/)
*   [![Image 32: 火山引擎](https://staticx.36krcdn.com/36kr-web/static/bytey.7484dc04.png)](https://www.volcengine.cn/)
*   [![Image 33: 高德](https://staticx.36krcdn.com/36kr-web/static/gaodi.9e9d6741.png)](https://36kr.com/p/3920675282163337)
*   [![Image 34: 个推](https://staticx.36krcdn.com/36kr-web/static/getui.d2af25d2.png)](https://www.getui.com/cn/index.html)
*   [![Image 35: 星球日报](https://staticx.36krcdn.com/36kr-web/static/dailyPlanet.783b0e10.png)](https://www.odaily.com/)
*   [![Image 36: 鲸准](https://staticx.36krcdn.com/36kr-web/static/logo_jz@2x.525a51f1.png)](https://www.jingdata.com/)
*   [![Image 37: 氪空间](https://staticx.36krcdn.com/36kr-web/static/logo_kkj@2x.47737e8d.png)](https://www.krspace.cn/)
*   [![Image 38: 富途牛牛](https://staticx.36krcdn.com/36kr-web/static/ftnn.4f5db2d2.png)](https://www.futunn.com/)
*   [![Image 39: 企服点评](https://staticx.36krcdn.com/36kr-web/static/logo_qifudianping@2x.c5635d6a.png)](https://www.36dianping.com/pk/)
*   [![Image 40: 人人都是产品经理](https://staticx.36krcdn.com/36kr-web/static/renren@2x.f6ecd8fa.png)](http://www.woshipm.com/)
*   [![Image 41: 领氪](https://staticx.36krcdn.com/36kr-web/static/lingke.34f56307.PNG)](https://www.36linkr.com/)

36氪APP下载

![Image 42](https://staticx.36krcdn.com/36kr-web/static/code_production.72d61993.png)

iOS & Android

[![Image 43: 36氪](https://staticx.36krcdn.com/36kr-web/static/logoWhite.2a5eceda.png)](https://36kr.com/)

本站由[阿里云](https://www.aliyun.com/)提供计算与安全服务 违法和不良信息、未成年人保护举报电话：010-89650707 举报邮箱：jubao@36kr.com[网上有害信息举报](https://www.12377.cn/)

© 2011~2026 北京多氪信息科技有限公司 |[京ICP备12031756号-6](https://beian.miit.gov.cn/#/Integrated/index)|[京ICP证150143号](https://dxzhgl.miit.gov.cn/dxxzsp/xkz/xkzgl/resource/qiyesearch.jsp?num=%25E5%258C%2597%25E4%25BA%25AC%25E5%25A4%259A%25E6%25B0%25AA%25E4%25BF%25A1%25E6%2581%25AF%25E7%25A7%2591%25E6%258A%2580%25E6%259C%2589%25E9%2599%2590%25E5%2585%25AC%25E5%258F%25B8&type=xuke)|[京公网安备11010502057322号](http://www.beian.gov.cn/portal/registerSystemInfo?recordcode=11010502057322)

[](https://weibo.com/wow36kr)[](https://36kr.com/rss-center)

[意见反馈](https://36kr.com/mform/1755983296602372)

![Image 44](https://staticx.36krcdn.com/36kr-web/static/code_production.72d61993.png)

36氪APP 让一部分人先看到未来

36氪

鲸准

氪空间

![Image 45](https://staticx.36krcdn.com/36kr-web/static/kr.ad0c1158.jpg)
推送和解读前沿、有料的科技创投资讯

![Image 46](https://staticx.36krcdn.com/36kr-web/static/jingzhun.9a251862.jpg)
一级市场金融信息和系统服务提供商

![Image 47](https://staticx.36krcdn.com/36kr-web/static/krSpace.7efbe7d3.jpg)
聚焦全球优秀创业者，项目融资率接近97%，领跑行业
