Hardware & InferenzGeschäft & Markt 🇨🇳 07.08.2026 06:02

HBM reicht nicht aus: KI-SSDs stehen vor explosivem Wachstum

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
Da die Inferenz großer Sprachmodelle an Kapazitäts- und I/O-Grenzen stößt, wandern SSDs von statischem Speicher in den Echtzeit-Datenpfad der Inferenz und werden nach HBM, VRAM und DRAM zu einer formellen Speicherebene. Die Branche sieht zwei Hauptwege: KI-Last-optimierte Enterprise-SSDs und inferenzteilnehmende SSDs, die Daten direkt planen, wobei Unternehmen wie Phison, Longsys und die Maxio-Infplane-Allianz führend sind.
Die Inferenz großer Sprachmodelle stößt an zwei Grenzen: Kapazität und I/O. Die Modellparameter wachsen stetig, während lange Kontexte, Mehrrunden-Dialoge und Agentenaufgaben den KV-Cache aufblähen; MoE-Modelle reduzieren zwar die aktiven Parameter pro Berechnung, erfordern aber die Speicherung von Expertengewichten, die die VRAM- oder DRAM-Kapazität bei weitem übersteigen. In Cloud-Rechenzentren wird teurer HBM durch Gewichte und KV-Cache belegt, was die GPU-Auslastung begrenzt; am Edge und auf Geräten begrenzt der begrenzte DRAM oder Unified Memory die Modellgröße. Da der Speicher allein die Inferenzlast kaum bewältigen kann, gelangen SSDs in den Datenpfad der Echtzeit-Inferenz und werden zu einer formalen Speicherebene nach HBM, VRAM und DRAM. Dieser Wandel zeigt sich in der Inferenzinfrastruktur: Moonshot AIs Mooncake nutzt eine disaggregierte Architektur mit KV-Cache im Zentrum, die CPU, DRAM und SSD als verteilten Cache vereint, wobei Mooncake Store mehrstufiges Caching mit DRAM und SSD/NVMe unterstützt; 2026 führte NVIDIA im Vera-Rubin-Infrastruktur die CMX-Kontextspeicherplattform ein, die eine über Ethernet angebundene Flash-Ebene für den KV-Cache hinzufügt, wobei BlueField-4 die NVMe-SSDs verwaltet. Allerdings sind herkömmliche SSDs nicht für persistente Inferenzaufgaben geeignet: Sie sind für Datei- und Blockspeicher ausgelegt, mit Fokus auf sequenzielle Bandbreite, zufällige IOPS und Zuverlässigkeit, während die LLM-Inferenz eine Datenversorgung mit strengen Zeitvorgaben erfordert. Der KV-Cache wird beim Prefill geschrieben und wiederholt gelesen; MoE benötigt vor jeder Schichtberechnung die spezifischen Expertengewichte; ein einzelner verpasster Lesezugriff kann die GPU, NPU oder CPU zum Stillstand bringen. Spitzen-IOPS bei hohen Queue-Tiefen entsprechen nicht stabiler Latenz bei geringer Queue-Tiefe und feinkörnigem Zugriff. NAND-Flash liest seitenweise und löscht blockweise, wobei die FTL Schreibverstärkung und Tail-Latenz verursacht; kontinuierliche KV-Cache-Schreibvorgänge belasten die Flash-Haltbarkeit. Das herkömmliche LBA-Layout ignoriert semantische Beziehungen zwischen Schichten, Experten und KV-Blöcken, verstreut zusammengehörige Daten und verhindert vorhersehbare parallele Lesevorgänge. Dateisysteme, Blockgeräte und NVMe-Software-Stacks fügen Latenz hinzu. Ohne Adresslayout, Cache-Partitionierung, Prioritätsplanung, asynchrones Prefetching und Lebensdauermanagement, die auf die Ausführungsreihenfolge des Modells ausgerichtet sind, können SSDs nicht stabil an der Tokenerzeugung teilnehmen wie DRAM oder VRAM. Der Markt bietet zwei Typen von KI-SSDs: Erstens KI-last-verbesserte Enterprise-SSDs, wie die Dongting-N3X-Serie von InnoGrit, die XL-Flash und SLC-NAND für geringe Latenz und hohe Haltbarkeit nutzen, auf KV-Cache-Auslagerung und hochparallele temporäre Daten abzielen und ein Drittel der Latenz, dreifachen Schreibdurchsatz und 17-33-fache DWPD gegenüber TLC-SSDs beanspruchen; Huaweis OceanDisk-Serie umfasst die EX 560 für hohe zufällige Schreibleistung, die SP 560 für ausgewogene Leistung und die LC 560 mit bis zu 245 TB Kapazität für Trainingsdaten und Vektordatenbanken, wobei die DiskBooster-Treibersoftware ein Tiering mit HBM und DDR ermöglicht. Zweitens zielen inferenzteilnehmende KI-SSDs darauf ab, die SSD-Betriebslogik zu ändern und durch Controller, Firmware und Middleware eine virtualisierte NAND- und DRAM/VRAM-Hierarchie zu schaffen. Phisons aiDAPTIV nutzt eine Cache-SSD und Middleware, um Modellgewichte zwischen VRAM und SSD zu streamen, wodurch die Modellgröße ohne zusätzliche GPUs erweitert wird und der KV-Cache für die Wiederverwendung erhalten bleibt, mit einer Haltbarkeit von bis zu 100 DWPD. Longsys' WM8500-SPU integriert Komprimierung, Caching und Datenplanung, wobei die iSA-Software Tiering- und Prefetch-Entscheidungen trifft, mit 5-nm-Prozess, verlustfreier Komprimierung, HLC und hybridem NAND-Scheduling. Die Allianz Maxio-Infplane (Maxio Tech und Infplane) kombiniert Infplanes Inferenzchip-Technologien wie mehrstufiges Caching und Prefetch mit Maxios Fachwissen für NAND und SSD-Controller und zielt auf MoE-Experten, KV-Cache und numerische Präzision ab, mit dem Ziel der Kompatibilität ohne Modifikation von Modelldateien oder Frameworks, wobei die Verifizierung auf KI-PCs, Workstations und Edge-Geräte ausgeweitet wird. Diese Wege unterscheiden sich im technischen Umfang: Einige verbessern die I/O, andere beteiligen sich an der Laufzeitplanung. Der Branchenwettbewerb beginnt gerade erst, mit validierten Produkten und Kommerzialisierungsversuchen, und die Zukunft könnte HBM, VRAM oder DRAM nicht ersetzen, sondern Kapazität, Leistung und Kosten neu staffeln und SSD zu einer Schlüsselvariable in der Token-Ökonomie machen.
Quelle: InfoQ 中国 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten