Hardware e InferenciaNegocios y Mercado 🇨🇳 07.08.2026 06:02

HBM no basta, los SSD de IA se preparan para un crecimiento explosivo

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
A medida que la inferencia de modelos de lenguaje de gran tamaño alcanza sus límites de capacidad y cuellos de botella de entrada/salida, los SSD están pasando del almacenamiento estático a la ruta de datos en tiempo real de la inferencia, convirtiéndose en un nivel de almacenamiento formal después de HBM, VRAM y DRAM. La industria está viendo dos rutas principales: SSD empresariales mejorados con carga de IA y SSD que participan en la inferencia y programan datos directamente, con empresas como Phison, Longsys y la alianza Maxio-Infplane liderando el camino.
La inferencia con modelos de lenguaje de gran tamaño se topa con dos limitaciones: capacidad y E/S. Los parámetros de los modelos no dejan de crecer, mientras que los contextos largos, los diálogos multiturno y las tareas de agentes inflan la caché KV; los modelos MoE reducen los parámetros activos por cómputo, pero requieren almacenar pesos de expertos que superan con creces la capacidad de la VRAM o la DRAM. En los centros de datos en la nube, la costosa HBM está ocupada por pesos y caché KV, lo que limita la utilización de la GPU; en el borde y en los dispositivos, la DRAM o la memoria unificada limitada restringe el tamaño del modelo. A medida que la memoria por sí sola no puede con la carga de la inferencia, los SSD entran en la ruta de datos de inferencia en tiempo real, convirtiéndose en un nivel de almacenamiento formal después de HBM, VRAM y DRAM. Este cambio es visible en la infraestructura de inferencia: Moonshot AI's Mooncake utiliza una arquitectura desagregada centrada en la caché KV, agrupando CPU, DRAM y SSD como caché distribuida, y Mooncake Store soporta caché multinivel con DRAM y SSD/NVMe; en 2026, NVIDIA presentó la plataforma de almacenamiento de contexto CMX en la infraestructura Vera Rubin, añadiendo un nivel flash conectado por Ethernet para la caché KV, con BlueField-4 gestionando los SSD NVMe. Sin embargo, los SSD tradicionales no son adecuados para tareas de inferencia persistente: están diseñados para almacenamiento de archivos y bloques, centrándose en ancho de banda secuencial, IOPS aleatorias y fiabilidad, mientras que la inferencia de LLM requiere suministro de datos con restricciones de tiempo estrictas. La caché KV se escribe en prefill y se lee repetidamente; MoE necesita pesos específicos de expertos antes de cada cómputo de capa; una sola lectura fallida puede detener la GPU, la NPU o la CPU. Los picos de IOPS a profundidades de cola altas no equivalen a una latencia estable para accesos de grano fino con baja profundidad de cola. La NAND Flash lee por páginas y borra por bloques, con el FTL causando amplificación de escritura y latencia de cola; las escrituras continuas de caché KV afectan la resistencia del flash. El diseño tradicional de LBA ignora las relaciones semánticas entre capas, expertos y bloques KV, dispersando datos relacionados e impidiendo lecturas paralelas predecibles. Los sistemas de archivos, los dispositivos de bloque y las pilas de software NVMe añaden latencia. Sin una disposición de direcciones, particionado de caché, programación de prioridades, prefetch asíncrono y gestión de vida útil orientada al orden de ejecución del modelo, los SSD no pueden participar de manera estable en la generación de tokens como la DRAM o la VRAM. El mercado presenta dos tipos de 'SSD de IA': primero, SSD empresariales mejorados para cargas de IA, como la serie Dongting N3X de InnoGrit, que utilizan XL-Flash y SLC NAND para baja latencia y alta resistencia, dirigidos a la descarga de caché KV y datos temporales de alta concurrencia, afirmando un tercio de la latencia, el triple de rendimiento de escritura y 17-33 veces DWPD en comparación con los SSD TLC; la serie OceanDisk de Huawei incluye el EX 560 para alto rendimiento de escritura aleatoria, el SP 560 para rendimiento equilibrado y el LC 560 con hasta 245 TB de capacidad para datos de entrenamiento y bases de datos vectoriales, con el software de controlador DiskBooster que permite la jerarquización con HBM y DDR. Segundo, los SSD de IA que participan en la inferencia tienen como objetivo cambiar la lógica de operación del SSD, creando una jerarquía virtualizada de NAND y DRAM/VRAM a través del controlador, el firmware y el middleware. El aiDAPTIV de Phison utiliza un SSD de caché y middleware para transmitir pesos del modelo entre VRAM y SSD, ampliando el tamaño del modelo sin añadir GPUs, preservando la caché KV para reutilización, con resistencia de hasta 100 DWPD. El WM8500 SPU de Longsys integra compresión, caché y programación de datos, con el software iSA tomando decisiones de jerarquización y prefetch, utilizando proceso de 5nm, compresión sin pérdida, HLC y programación de NAND híbrida. La alianza Maxio-Infplane (Maxio Tech e Infplane) combina las tecnologías de chip de inferencia de Infplane como la caché multinivel y el prefetch con la experiencia en NAND y controladores SSD de Maxio, dirigida a expertos MoE, caché KV y precisión numérica, con el objetivo de ser compatible sin modificar archivos de modelo o frameworks, ampliando la verificación en PC de IA, estaciones de trabajo y dispositivos de borde. Estas rutas difieren en el alcance técnico, algunas mejoran la E/S y otras participan en la programación en tiempo de ejecución. La competencia en la industria está comenzando, con productos validados e intentos de comercialización, y el futuro puede no reemplazar la HBM, la VRAM o la DRAM, sino re-jerarquizar capacidad, rendimiento y coste, convirtiendo al SSD en una variable clave en la economía de tokens.
Fuente: InfoQ 中国 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas