GPU利用率仅35%?揭秘AI Infra如何通过软件优化榨干硬件极限

0 阅读

当全球科技巨头每年投入数万亿美元构建AI数据中心时,一个常被忽视的真相正浮出水面:我们引以为傲的GPU集群,大部分时间其实都在“摸鱼”。

这并非危言耸听。卡内基梅隆大学近期的一项细粒度遥测研究揭示了一个令人震惊的数据:在包含A100、H100乃至最新B200等高端芯片的大型集群中,整体有约20%的执行时间和11%的能耗被浪费在“执行时空转”状态。而在更复杂的推理场景中,如Azure Code负载,这一浪费比例高达65%;OpenAI的Chat类请求也有52%的时间处于无效等待。

这意味着,如果你拥有一台价值400万美元的NVIDIA GB200机柜,由于软件栈调度的缺失,实际可能只发挥了200万美元的价值。剩下的预算并非消失,而是以电费、折旧和机会成本的形式白白烧掉。在芯片产能受限、高端显存缺货至2027年的背景下,这种低效不仅是工程痛点,更是巨大的商业损耗。

AI行业的重心正从“造芯”转向“用芯”。随着Google研发固化Gemini架构的芯片、OpenAI推出联合研发的Jalapeño推理芯片,以及Anthropic、智谱等公司纷纷布局,算力竞赛进入深水区。但对于大多数缺乏重资产投入能力的团队而言,真正的战场不在硅片制造厂,而在软件层。如何通过系统优化,将GPU的利用率从50%推升至90%以上,成为AI Infra(人工智能基础设施)领域的核心命题。

AI Infra四层架构与软性瓶颈

要理解为何GPU会“闲置”,首先需厘清AI系统的完整架构。一个完整的AI推理服务,横跨四个层级,每一层的短板都会导致上层资源的浪费。

**第一层:能源基础设施。**这是物理基石,决定GPU能否持续稳定运行。电力波动或散热不足会导致GPU降频,直接折损性能。

**第二层:计算硬件基础设施。**包括GPU、高带宽内存(HBM)、高速互联网络(如NVLink、InfiniBand)及CPU。这一层定义了理论上的计算上限,但其优化周期以年计,且物理极限正在逼近。

**第三层:系统软件。**涵盖CUDA、编译器、通信库、内存管理及底层算子(Kernel)。它决定单次计算能否触及硬件物理极限。这是目前优化空间最大的“深水区”。

**第四层:服务编排。**负责资源调度、任务优先级管理及模型加载。代表性项目如vLLM和SGLang。这一层直接决定请求如何被分发、合并及处理,是近年来创新最密集、也是解决“GPU空闲”问题的关键所在。

能源与硬件是“硬”问题,投入大、周期长;而系统软件与服务编排是“软”问题,本质是算法与工程能力的体现。后者能带来数倍的性能提升,且边际成本更低。因此,行业焦点正快速向这两层转移。Anthropic内部AI Infra工程师占比跃升,其推理团队通过底层优化使成本降低90%,直接助力其在二季度实现盈利,便是这一趋势的最佳注脚。

破解“推理税”:KV Cache的极致复用

在大模型推理中,存在一个看似低效的现象:相同的文本被反复输入时,模型每次都从头计算。在智能体(Agent)工作流中,系统提示词(System Prompt)可能被调用数十次,这种重复计算被称为“推理税”,是对算力的极大浪费。

传统的解决方案依赖于KV Cache(键值缓存)。Transformer架构中,Self-Attention机制会将历史Token映射为Key和Value张量。首次请求预填充(Prefill)后,系统缓存这些KV数据,解码新Token时直接复用,从而降低计算量和首Token延迟(TTFT)。

然而,传统KV Cache存在显著缺陷:它随上下文长度线性增长,占用大量显存。当并发请求增多或上下文变长时,显存成为瓶颈,导致服务崩溃或速度骤降。

SGLang团队孵化的RadixArk通过RadixAttention技术解决了这一难题。其核心在于引入“基数树”(Radix Tree)数据结构来组织KV Cache。

想象一棵共享前缀的家族树:所有共享相同开头(如系统提示词)的请求共用同一“枝干”(缓存块),仅当内容分叉时,才衍生出新分支。这种设计实现了跨请求、跨机器的KV Cache全局复用。

工程实现的复杂性在于调度策略:

  1. 缓存感知调度(Cache-aware Scheduling):将前缀相似的请求集中处理。如同餐厅后厨,连续制作三道麻辣香锅比交替制作香锅、寿司、牛排更高效,因为调料准备可复用。
  2. 淘汰机制(Eviction):当显存不足时,智能剔除复用价值低的缓存。高频使用的系统提示词、最近访问的对话历史被优先保留,低频数据被清理。
  3. 分布式负载均衡:将具有相同前缀缓存的请求路由至同一GPU,避免缓存未命中导致的重复计算。

通过这些优化,RadixArk不仅节省了显存,更大幅提升了吞吐量。随着智能体应用的爆发,这种基于共享上下文的缓存复用技术,其价值将呈指数级增长。

消除等待:连续批处理与PD分离

GPU的空闲,很大一部分源于“等待”。

在早期的“排队制”推理中,请求串行处理,资源利用率极低。随后的“批处理”虽提升了吞吐,但需等待所有请求就绪,且短请求需等待长请求完成才能“下车”,造成严重的长尾延迟。

**连续批处理(Continuous Batching)**是当前的主流方案。它摒弃了固定的批次边界,允许新请求随时加入,完成请求随时退出。GPU始终处于满载状态,吞吐量可提升2至4倍。

除了请求间的等待,计算阶段也存在内部矛盾:

  • Prefill阶段:处理长文本,算力密集,依赖高FLOPS。
  • Decode阶段:逐字生成,算力需求低,但需反复读取全部KV Cache,极度依赖显存带宽。

将两者混合同一GPU执行,会导致Prefill计算时Decode空闲,Decode读取时Prefill等待。解决方案是Prefill/Decode分离(PD分离)

将两阶段卸载至不同GPU集群:Prefill集群专注于高算力处理输入,Decode集群专注于高带宽生成输出。两者通过高速互联传输中间状态。DeepSeek等模型已采用此架构,NVIDIA的Dynamo框架亦将其为核心设计。SGLang作为早期支持者,已实现大规模PD分离部署,有效解耦了算力与带宽瓶颈。

压榨极限:低精度计算与投机采样

在解决等待问题后,如何让GPU在计算时“跑满”?

低精度计算是首要手段。大模型权重、激活值和KV Cache的精度可独立配置。采用FP8或INT8等低精度格式,不仅减少显存占用,更能利用GPU上专用的低精度Tensor Core,潜在释放双倍算力空间。

**投机采样(Speculative Decoding)**则是算法层面的突破。其原理类似于“助教猜题,老师批改”。

  1. 一个小参数模型(草稿模型)快速预测接下来N个Token。
  2. 大模型一次性验证这N个Token的正确性。
  3. 若全部正确,则一次性接受;若中途出错,则回退至错误点重新生成。

这种并行验证机制,最佳情况下可将生成速度提升2至3倍。这要求推理引擎必须具备极高的系统集成能力,将草稿模型验证与大模型推理无缝衔接。

目前,硬件厂商与推理引擎的关系已从单纯的兼容转向深度绑定。NVIDIA、AMD等在新芯片发布首日,即可在SGLang上获得性能基准测试数据。SGLang已成为事实上的硬件评测标准,双方联合调优,共同挖掘硅片性能极限。

资源协同:适应强化学习的新范式

随着OpenAI o1和DeepSeek R1等模型引入强化学习(RL),训练范式发生了根本性变化。

传统训练是单向的“数据喂入-参数更新”,而强化学习是循环的“推理生成-评分评估-参数更新”。这一过程要求在线推理与训练同步进行,对资源协同提出极高要求。

传统框架无法高效处理这种混合负载,导致推理与训练在GPU资源上相互争夺,产生大量切换延迟。为此,RadixArk推出了Miles训练框架。

Miles的核心创新在于训练-推理一致性(Training-Inference Alignment)。它将训练与推理纳入统一系统考量:

  • SGLang负责高效生成样本。
  • Miles负责利用这些样本更新模型。
  • 更新后的模型权重立即反馈给推理端,形成闭环。

Miles针对MoE(混合专家)模型的路由策略、新硬件支持及算子优化进行了深度定制,确保训练与推理在并行策略和准确率上保持一致。这不仅提升了后训练(Post-training)的效率,更为智能体等复杂任务的稳定性提供了保障。

AI Infra:通往AGI的公共基础设施

SGLang与vLLM的开源崛起,标志着AI Infra从实验室走向工业化。

过去,先进的Infra优化是OpenAI、Anthropic等前沿实验室的独家壁垒。现在,随着RadixArk等商业实体的成立,这些技术正转化为公共产品。开源AI联盟的成立,汇聚了模型厂商、芯片巨头与Infra团队,进一步加速了这一进程。

模型权重的开放仅是第一步。任何人下载权重后,仍面临部署、显存、吞吐等技术障碍。SGLang等推理引擎实现了“Day-0支持”,即新模型发布当日即可高效部署,且跨芯片兼容。

这引发了行业格局的深远变化:

  1. 门槛降低:初创公司无需组建庞大的Infra团队,即可享受前沿级的推理效率。
  2. 生态互联:推理引擎成为连接模型与芯片的“操作系统”,屏蔽底层硬件差异。
  3. 创新加速:开发者可专注于应用逻辑与模型创新,而非基础设施搭建。

正如RadixArk联合创始人朱邦华所言,Infra的终极目标是消除“前沿实验室”的概念。当算力优化成为普惠的基础设施,任何拥有好想法的团队,都能具备与巨头一战的能力。

从KV Cache的树状复用,到PD分离的解耦架构,再到强化学习的协同闭环,AI Infra正在系统性地“榨出”硅的极限。这不仅是对现有算力的救赎,更是推动AGI从实验室走向广泛应用的关键引擎。在算力短缺的寒冬,软件定义的效率革命,或许正是点燃下一波AI创新浪潮的火种。