AI SSD崛起:大模型推理中存储如何重塑Token生成效率

1 阅读

在大模型技术演进的浪潮中,行业焦点正经历一场深刻的范式转移。过去两年,基础设施的竞争几乎完全围绕GPU数量、芯片峰值算力、HBM带宽以及高速互联网络展开。然而,当应用场景从简单的问答转向长上下文理解、复杂逻辑推理以及多智能体协作时,决定系统有效产出能力的瓶颈发生了微妙而关键的位移。GPU作为算力底座的重要性毋庸置疑,但其实际利用率不再仅仅取决于计算速度,而是越来越依赖于模型权重、键值缓存(KV Cache)以及混合专家(MoE)模型中的专家权重能否在精确的时间点抵达正确的计算节点。

这种变化揭示了当前AI基础设施面临的核心矛盾:如果KV Cache无法被及时复用,系统将被迫重新执行昂贵的预填充(Prefill)阶段;若MoE专家权重未在路由决策前加载至内存,GPU将陷入空转等待;而当大量推理状态长期占用高成本的HBM时,并发请求的处理能力和批处理效率将受到严重挤压。因此,AI基础设施正在从单纯的“计算资源堆叠”阶段,迈入“计算、网络、内存与存储数据路径深度协同”的新纪元。月之暗面推出的Mooncake架构与NVIDIA发布的CMX平台,正是这一趋势的两个标志性信号,它们共同指向一个结论:推理状态已成为一级基础设施资源,存储设备正式进入Token生成的实时主链路。

Mooncake架构的产业意义远超出一套新的推理服务系统,它从根本上重构了大模型基础设施对数据的组织逻辑。在传统推理节点中,GPU、CPU、DRAM和本地SSD被视为服务器内部的固定绑定资源,KV Cache通常跟随请求和GPU实例存在。一旦缓存被驱逐或请求发生迁移,此前完成的Prefill计算成果便可能失效,导致重复计算和资源浪费。随着上下文长度的增加,这种浪费呈指数级增长。Moonshot AI与清华大学联合提出的Mooncake方案,采用以KV Cache为中心的分离式架构,将Prefill与Decode部署在不同的资源池中,并将集群中未被充分利用的CPU、DRAM、SSD和网络接口卡(NIC)整合成分布式的KV Cache池。

在该架构中,中央调度器Conductor不再仅依据GPU负载分发请求,而是综合考量KV Cache分布、缓存命中率、节点负载以及首字延迟(TTFT)、每Token生成时间(TBT等服务目标,动态决定缓存复用、Prefill执行和Decode调度。可复用的Prefix KV Cache被优先送至合适的Prefill实例,新生成的KV Cache随模型计算持续产生,并通过异步流传输至目标Decode节点。只有当缓存准备就绪,请求才进入连续批处理阶段。这种“用更多存储换取更少计算”的策略,在真实业务场景下显著提升了有效请求承载能力,证明了端到端架构协同的巨大潜力。更值得关注的是,Mooncake已将SSD明确纳入多级缓存体系,允许内存淘汰对象后台写入SSD,并在需要时回读,这使得SSD不再是冷数据仓库,而是影响推理性能的关键活跃层。

与此同时,NVIDIA在Agent时代背景下推出的CMX平台,进一步确立了Flash存储在GPU内存层级中的地位。在智能体应用中,一次复杂请求往往涉及模型调用、工具执行、记忆检索等多轮交互,KV Cache需要从GPU内部的临时状态转变为跨节点共享的基础设施数据。NVIDIA构建了从G1到G4的分层存储体系,其中G1为GPU HBM,G2为系统内存,G3为本地SSD,G4为持久化存储。针对G3容量有限而G4延迟过高的问题,CMX引入了“G3.5”层——一种基于Flash介质、通过以太网连接、面向KV Cache优化的Pod级上下文内存。

CMX并非简单的外挂大容量SSD,而是通过BlueField-4 DPU、Dynamo KV块管理器及Spectrum-X以太网等技术,实现了KV块的跨层编排、预取和共享。当Decode阶段即将使用某组KV块时,系统可提前将其从CMX预置到系统内存或HBM,从而消除GPU等待时间。尽管厂商数据需结合实际场景验证,但CMX释放的信号极为明确:Flash存储已被正式定义为AI推理内存体系中的正式一层,承担着短暂、派生且延迟敏感的推理上下文存储任务。

然而,将SSD纳入推理主链路,对存储设备本身提出了前所未有的挑战。传统SSD设计围绕顺序带宽、随机IOPS和可靠性优化,而LLM推理需要的是带有严格时序约束的数据供应。KV Cache在Prefill阶段集中生成,随后在对话中被反复读取;MoE模型则需要在每一层激活部分专家,同时保存远超显存容量的专家权重。如果数据读取未能赶上模型的计算窗口,即便最终能读出,GPU也已进入等待状态。此外,NAND Flash的物理特性(页读取、块擦除)与FTL层的垃圾回收机制,可能在持续写入KV Cache时引发写放大和不可预测的尾延迟。传统的逻辑块地址(LBA)排布也无法感知模型层、KV块及执行次序之间的关联,导致逻辑上相关的数据在物理介质中分散,难以实现高效并行读取。

因此,真正的AI SSD不能仅以峰值带宽定义,而必须解决低延迟、高耐久性以及参与数据分层管理的问题。目前市场上的解决方案逐渐分化为两类:一类是AI负载强化型企业级SSD,如英韧科技的洞庭-N3X和华为OceanDisk LC 560,它们通过优化介质和固件,提供更高的耐久性和顺序读取能力,主要解决底层I/O供给问题;另一类则是“推理参与型AI SSD”,试图让SSD从被动响应命令转向主动参与运行时管理。

在推理参与型路线中,群联电子、江波龙以及寅谱-联芸代表了三种不同的技术切入方向。群联的aiDAPTIV方案通过专用缓存SSD和中间件,将SSD组织为GPU显存之外的高容量缓存层。当模型权重超过VRAM容量时,系统根据执行进度在SSD与VRAM之间流式搬运数据,使活跃数据留在GPU附近,非活跃数据下沉至Flash。这种方案边界清晰,适合工作站和小型集群,通过高耐久性SSD(最高达100 DWPD)和中间件配合,实现了类似云侧“以存储扩展内存”的效果。

江波龙则强调存储侧的智能化,其架构以SPU为硬件执行层,iSA为软件决策层。iSA感知推理负载并制定数据分层与预取策略,SPU负责具体的数据搬运、压缩和缓存管理。通过引入存内无损压缩和混合NAND调度,江波龙方案让SSD控制器承担了更多原本由主机CPU执行的调度任务,重点面向AI PC和端侧智能设备,体现了“存储即计算”的边缘延伸。

寅谱与联芸的合作则代表了从AI Infra反向定义SSD数据路径的思路。寅谱作为AI Native企业,从模型执行和数据流出发,与联芸的主控技术结合,推行software-defined chip和近存计算。该方案贯通计算侧缓存体系、中间件、固件和NAND介质管理,围绕MoE专家、KV Cache和数值精度进行数据切分与冷热分层。它不将SSD视为孤立设备,而是云边端推理数据路径中的可调度层级,虽然研发成本高,但能更精准地匹配模型执行过程,减少对主流框架的侵入。

这三条路线并非简单的替代关系,而是分别适用于不同场景。群联侧重显存扩展的易用性,江波龙侧重存储侧的智能调度,寅谱-联芸侧重全栈协同的深度优化。从长远来看,AI SSD的竞争将是完整数据路径能力的竞争。门槛不仅在于主控规格或峰值性能,更在于企业能否建立从NAND介质、FTL、固件到推理框架的完整协作体系。模型兼容性、缓存命中率、尾延迟控制等指标,需要通过长期的工程实践积累。

Mooncake和CMX已在集群层面证明推理状态值得单独调度,而AI SSD则将这一变革带入节点内部。它不会取代HBM或DRAM,而是推动形成更细致的存储层级:最热数据留存在计算芯片附近,温数据进入高性能Flash,冷数据下沉至低成本层级,并由软硬件共同决定迁移时机。当AI产业从模型能力竞赛转向大规模应用落地,基础设施的核心指标将从FLOPS转向每瓦电力生成的有效Token数。在这一进程中,算力、网络、内存与存储的边界日益模糊,AI SSD正从外围设备跃升为AI基础设施核心数据路径的关键组成部分,重塑着大模型推理的经济性与效率边界。