SSDs de IA: Uma Mudança de Paradigma no Armazenamento para Inferência de LLMs
Moonshot AI
NVIDIA
Huawei
Maxio Tech
A infraestrutura de IA está indo além do poder computacional bruto, com os estados de inferência se tornando um recurso de primeira classe. Sistemas como o Mooncake da Moonshot AI e a plataforma CMX da NVIDIA estão integrando o armazenamento no caminho de dados em tempo real para a geração de tokens. Essa mudança está impulsionando o surgimento de SSDs específicos para IA, projetados para baixa latência, alta durabilidade e gerenciamento inteligente de dados.
A competição por infraestrutura de IA está se deslocando da contagem bruta de GPUs e poder computacional para uma abordagem mais holística, onde computação, rede, memória e armazenamento trabalham juntos por token. Isso é impulsionado por modelos de contexto longo, raciocínio complexo e sistemas multiagentes, exigindo gerenciamento eficiente de KV Cache e pesos de especialistas MoE. Dois sinais representativos são o Mooncake da Moonshot AI e o CMX da NVIDIA. O Mooncake é uma arquitetura desagregada centrada em KV Cache que organiza recursos ociosos de CPU, DRAM, SSD e NIC em um pool de cache distribuído, melhorando a capacidade efetiva de requisições em 59% a 498% em testes. O CMX da NVIDIA, plataforma de armazenamento de memória de contexto, adiciona uma camada 'G3.5' entre HBM e armazenamento compartilhado, fornecendo memória de contexto compartilhada em escala de petabytes dentro de um pod de GPUs, potencialmente oferecendo até 5x de melhoria na taxa de transferência sustentada de tokens e eficiência energética. Esses sistemas destacam que o estado de inferência está se tornando um recurso-chave, e o armazenamento deve participar do posicionamento, migração e reutilização. Consequentemente, os SSDs de IA estão surgindo, com duas categorias: SSDs empresariais aprimorados para IA (por exemplo, InnoGrit Dongting-N3X, Huawei OceanDisk LC 560) e SSDs de IA que participam da inferência. Três rotas notáveis para estes últimos são o aiDAPTIV da Phison (usando SSDs de cache dedicados e middleware), o SPU+iSA da Longsys (aproveitando a inteligência do lado do armazenamento) e a coordenação entre camadas da Infplane-Maxio. A competição em SSDs de IA, em última análise, será sobre o caminho completo de dados, exigindo colaboração entre mídia NAND, FTL, firmware, drivers, middleware e estruturas de inferência. Os SSDs de IA não substituirão HBM, VRAM ou DRAM, mas formarão uma hierarquia de armazenamento mais refinada, com dados posicionados com base na temperatura de acesso e migração gerenciada por software e hardware.
Fonte: QbitAI 量子位 —
original
