HBM Não Basta, SSD de IA Pronto para Crescimento Explosivo
Moonshot AI
NVIDIA
Huawei
Maxio Tech
À medida que a inferência de grandes modelos de linguagem atinge limites de capacidade e de I/O, os SSDs estão migrando do armazenamento estático para o caminho de dados em tempo real da inferência, tornando-se um nível formal de armazenamento após HBM, VRAM e DRAM. A indústria está vendo duas rotas principais: SSDs empresariais aprimorados com IA e SSDs que participam da inferência, agendando dados diretamente, com empresas como Phison, Longsys e a aliança Maxio-Infplane liderando o avanço.
A inferência de modelos de linguagem de grande porte está esbarrando em dois limites: capacidade e I/O. Os parâmetros dos modelos continuam crescendo, enquanto contextos longos, diálogos multi-turno e tarefas de agente inflam o KV Cache; modelos MoE reduzem os parâmetros ativos por computação, mas exigem armazenar pesos de especialistas que excedem em muito a capacidade de VRAM ou DRAM. Em data centers em nuvem, a cara HBM é ocupada por pesos e KV Cache, limitando a utilização da GPU; em edge e dispositivos, a DRAM ou memória unificada limitada restringe o tamanho do modelo. Como a memória sozinha não consegue mais lidar com a carga de inferência, os SSDs estão entrando no caminho de dados da inferência em tempo real, tornando-se uma camada de armazenamento formal após HBM, VRAM e DRAM. Essa mudança é visível na infraestrutura de inferência: o Mooncake da Moonshot AI usa uma arquitetura desagregada centrada em KV Cache, agrupando CPU, DRAM e SSD como cache distribuído, com o Mooncake Store suportando cache em múltiplos níveis com DRAM e SSD/NVMe; em 2026, a NVIDIA introduziu a plataforma de armazenamento de contexto CMX na infraestrutura Vera Rubin, adicionando uma camada flash conectada via Ethernet para o KV Cache, com o BlueField-4 gerenciando SSDs NVMe. No entanto, SSDs tradicionais não são adequados para tarefas de inferência persistentes: eles são projetados para armazenamento de arquivos e blocos, focando em largura de banda sequencial, IOPS aleatório e confiabilidade, enquanto a inferência de LLM exige fornecimento de dados com restrições de tempo rigorosas. O KV Cache é escrito na prefill e lido repetidamente; MoE precisa de pesos de especialistas específicos antes de cada cálculo de camada; uma única leitura perdida pode travar a GPU, NPU ou CPU. Picos de IOPS em altas profundidades de fila não equivalem a latência estável para acesso de baixa profundidade de fila e granulação fina. A leitura da NAND Flash é por página e o apagamento por bloco, com o FTL causando amplificação de escrita e latência de cauda; escritas contínuas de KV Cache pressionam a resistência do flash. O layout LBA tradicional ignora relações semânticas entre camadas, especialistas e blocos KV, dispersando dados relacionados e impossibilitando leituras paralelas previsíveis. Sistemas de arquivos, dispositivos de bloco e pilhas de software NVMe adicionam latência. Sem layout de endereço, particionamento de cache, agendamento de prioridade, pré-busca assíncrona e gerenciamento de vida útil orientados à ordem de execução do modelo, os SSDs não podem participar de forma estável da geração de tokens como DRAM ou VRAM. O mercado apresenta dois tipos de 'SSD de IA': primeiro, SSDs empresariais com desempenho aprimorado para cargas de IA, como a série Dongting N3X da InnoGrit, usando XL-Flash e NAND SLC para baixa latência e alta resistência, direcionados para descarga de KV Cache e dados temporários de alta concorrência, alegando um terço da latência, tripla taxa de transferência de escrita e 17-33x DWPD vs SSDs TLC; a série OceanDisk da Huawei inclui o EX 560 para alto desempenho de escrita aleatória, o SP 560 para desempenho equilibrado e o LC 560 com até 245 TB de capacidade para dados de treinamento e bancos de dados vetoriais, com o software de driver DiskBooster permitindo hierarquização com HBM e DDR. Segundo, SSDs de IA que participam da inferência visam mudar a lógica de operação do SSD, criando uma hierarquia virtualizada de NAND e DRAM/VRAM através de controlador, firmware e middleware. O aiDAPTIV da Phison usa um SSD de cache e middleware para transmitir pesos do modelo entre VRAM e SSD, estendendo o tamanho do modelo sem adicionar GPUs, preservando o KV Cache para reutilização, com resistência de até 100 DWPD. O WM8500 SPU da Longsys integra compressão, cache e agendamento de dados, com o software iSA tomando decisões de hierarquização e pré-busca, usando processo de 5 nm, compressão sem perdas, HLC e agendamento híbrido de NAND. A aliança Maxio-Infplane (Maxio Tech e Infplane) combina as tecnologias de chip de inferência da Infplane, como cache em múltiplos níveis e pré-busca, com a experiência em NAND e controlador de SSD da Maxio, visando especialistas MoE, KV Cache e precisão numérica, buscando compatibilidade sem modificar arquivos de modelo ou frameworks, expandindo a verificação em PCs de IA, estações de trabalho e dispositivos de edge. Essas rotas diferem em escopo técnico, com algumas melhorando I/O e outras participando do agendamento em tempo de execução. A competição na indústria está apenas começando, com produtos validados e tentativas de comercialização, e o futuro pode não substituir HBM, VRAM ou DRAM, mas re-hierarquizar capacidade, desempenho e custo, tornando o SSD uma variável-chave na economia de tokens.
Fonte: InfoQ 中国 —
original
