Matériel et InférenceRecherche 🇨🇳 07.08.2026 07:02

SSD IA : un changement de paradigme de stockage dans l'inférence LLM

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
L'infrastructure IA dépasse les simples calculs bruts, les états d'inférence devenant une ressource de première classe. Des systèmes comme Mooncake de Moonshot AI et la plateforme CMX de NVIDIA intègrent le stockage dans le chemin de données en temps réel pour la génération de jetons. Cette évolution favorise l'émergence de SSD spécifiques à l'IA, conçus pour une faible latence, une durabilité élevée et une gestion intelligente des données.
La compétition dans l'infrastructure de l'IA passe d'une focalisation sur le nombre brut de GPU et la puissance de calcul à une approche plus holistique où le calcul, le réseau, la mémoire et le stockage travaillent de concert par jeton. Cette évolution est motivée par les modèles à contexte long, le raisonnement complexe et les systèmes multi-agents, qui exigent une gestion efficace du cache KV et des poids des experts MoE. Deux signaux représentatifs sont Mooncake de Moonshot AI et CMX de NVIDIA. Mooncake est une architecture désagrégée centrée sur le cache KV qui organise les ressources CPU, DRAM, SSD et NIC inactives en un pool de cache distribué, améliorant la capacité de requêtes effectives de 59 % à 498 % lors des tests. La plateforme CMX Context Memory Storage de NVIDIA ajoute une couche "G3.5" entre la HBM et le stockage partagé, offrant une mémoire contextuelle partagée à l'échelle du pétaoctet dans un pod GPU, avec potentiellement jusqu'à 5 fois d'amélioration du débit soutenu de jetons et de l'efficacité énergétique. Ces systèmes mettent en évidence que l'état d'inférence devient une ressource clé, et que le stockage doit participer au placement, à la migration et à la réutilisation. Par conséquent, des SSD IA émergent, avec deux catégories : les SSD d'entreprise améliorés pour l'IA (par exemple, InnoGrit Dongting-N3X, Huawei OceanDisk LC 560) et les SSD IA participant à l'inférence. Trois voies notables pour ces derniers sont aiDAPTIV de Phison (utilisant des SSD de cache dédiés et un middleware), SPU+iSA de Longsys (tirant parti de l'intelligence côté stockage) et la coordination inter-couches d'Infplane-Maxio. La compétition dans les SSD IA portera finalement sur le chemin de données complet, nécessitant une collaboration entre les supports NAND, le FTL, les firmwares, les pilotes, les middlewares et les frameworks d'inférence. Les SSD IA ne remplaceront pas la HBM, la VRAM ou la DRAM, mais formeront une hiérarchie de stockage plus fine, avec des données placées en fonction de la température d'accès et une migration gérée par le logiciel et le matériel.
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches