硬件与推理研究 🇨🇳 07.08.2026 07:02

AI SSD:大语言模型推理中的存储范式转变

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
AI基础设施正超越原始计算力的范畴,推理状态正成为一种头等资源。诸如Moonshot AI的Mooncake和NVIDIA的CMX平台等系统,正将存储集成到令牌生成的实时数据路径中。这一转变正推动专为低延迟、高耐用性和智能数据管理而设计的AI专用SSD的出现。
AI基础设施的竞争正在从单纯的GPU数量和计算能力转向更全面的方法,即计算、网络、内存和存储每token协同工作。这一转变由长上下文模型、复杂推理和多代理系统驱动,需要高效管理KV缓存和MoE专家权重。两个代表性信号是Moonshot AI的Mooncake和NVIDIA的CMX。Mooncake是一种以KV缓存为中心的分解式架构,将空闲的CPU、DRAM、SSD和NIC资源组织成分布式缓存池,在测试中有效请求容量提高了59%至498%。NVIDIA的CMX上下文内存存储平台在HBM和共享存储之间增加了“G3.5”层,在GPU pod内提供PB级的共享上下文内存,持续token吞吐量和功耗效率可能提升高达5倍。这些系统凸显了推理状态正成为一种关键资源,存储必须参与放置、迁移和重用。因此,AI SSD应运而生,分为两类:AI增强的企业级SSD(例如,英韧科技的洞庭-N3X、华为的OceanDisk LC 560)和参与推理的AI SSD。后者有三大值得关注的路线:群联的aiDAPTIV(使用专用缓存SSD和中间件)、江波龙电子(Longsys)的SPU+iSA(利用存储端智能),以及英菲普拉-迈极(Infplane-Maxio)的跨层协调。AI SSD的竞争最终将围绕完整的数据路径展开,需要NAND介质、FTL、固件、驱动程序、中间件和推理框架之间的协作。AI SSD不会取代HBM、VRAM或DRAM,而是会形成更精细的存储层级,根据访问热度放置数据,并由软件和硬件管理迁移。
来源: QbitAI 量子位 — 原文
我们之前关于此话题的帖子 ↓
最新新闻