SSD de IA: un cambio de paradigma en el almacenamiento para la inferencia de LLM
Moonshot AI
NVIDIA
Huawei
Maxio Tech
La infraestructura de IA está yendo más allá del cómputo puro, con los estados de inferencia convirtiéndose en un recurso de primera clase. Sistemas como Mooncake de Moonshot AI y la plataforma CMX de NVIDIA están integrando el almacenamiento en la ruta de datos en tiempo real para la generación de tokens. Este cambio está impulsando la aparición de SSD específicos para IA, diseñados para baja latencia, alta durabilidad y gestión inteligente de datos.
La competencia en la infraestructura de IA está pasando de centrarse en el número bruto de GPU y la potencia de cómputo a un enfoque más holístico donde el cómputo, la red, la memoria y el almacenamiento trabajan juntos por token. Esto viene impulsado por los modelos de contexto largo, el razonamiento complejo y los sistemas multiagente, que requieren una gestión eficiente de la caché KV (clave-valor) y los pesos de los expertos de MoE. Dos señales representativas son Mooncake de Moonshot AI y CMX de NVIDIA. Mooncake es una arquitectura desagregada centrada en la caché KV que organiza los recursos inactivos de CPU, DRAM, SSD y NIC en un grupo de caché distribuido, mejorando la capacidad efectiva de solicitudes entre un 59% y un 498% en las pruebas. La plataforma CMX Context Memory Storage Platform de NVIDIA añade una capa 'G3.5' entre la HBM y el almacenamiento compartido, proporcionando memoria de contexto compartida a escala de petabytes dentro de un pod de GPU, con el potencial de ofrecer hasta una mejora de 5 veces en el rendimiento sostenido de tokens y en la eficiencia energética. Estos sistemas destacan que el estado de la inferencia se está convirtiendo en un recurso clave, y el almacenamiento debe participar en la colocación, migración y reutilización. En consecuencia, están surgiendo los SSD de IA, con dos categorías: los SSD empresariales mejorados con IA (por ejemplo, InnoGrit Dongting-N3X, Huawei OceanDisk LC 560) y los SSD de IA que participan en la inferencia. Tres rutas notables para estos últimos son aiDAPTIV de Phison (que utiliza SSD de caché dedicados y middleware), SPU+iSA de Longsys (aprovechando la inteligencia del lado del almacenamiento) y la coordinación entre capas de Infplane-Maxio. La competencia en los SSD de IA dependerá en última instancia de la ruta completa de datos, que requiere la colaboración entre el medio NAND, el FTL, el firmware, los controladores, el middleware y los marcos de inferencia. Los SSD de IA no reemplazarán a la HBM, la VRAM o la DRAM, sino que formarán una jerarquía de almacenamiento más fina, con datos colocados según la temperatura de acceso y migración gestionada por software y hardware.
Fuente: QbitAI 量子位 —
original
