Hardware & InferentieBedrijf & Markt 🇨🇳 07.08.2026 06:02

HBM niet genoeg, AI-SSD klaar voor explosieve groei

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
Nu de inference van grote taalmodellen tegen capaciteits- en I/O-limieten aanloopt, verschuiven SSD's van statische opslag naar het real-time datapad van inference, en worden ze een formele opslaglaag naast HBM, VRAM en DRAM. De industrie ziet twee hoofdroutes: AI-belasting verbeterde enterprise-SSD's en inference-deelnemende SSD's die direct data plannen, met bedrijven zoals Phison, Longsys en de Maxio-Infplane-alliantie die de leiding nemen.
Inferentie van grote taalmodellen stuit op twee muren: capaciteit en I/O. De modelparameters blijven groeien, terwijl lange contexten, dialogen met meerdere beurten en agenttaken de KV-cache opblazen; MoE-modellen verminderen het aantal actieve parameters per berekening, maar vereisen de opslag van expertgewichten die de capaciteit van VRAM of DRAM ver overtreffen. In cloud-datacenters wordt dure HBM ingenomen door gewichten en KV-cache, wat het GPU-gebruik beperkt; op de edge en op apparaten beperkt beperkt DRAM of unified memory de modelgrootte. Nu het geheugen moeite heeft om inferentielasten alleen te verwerken, komen SSD's in het real-time inferentie datapad terecht en worden ze een formele opslaglaag na HBM, VRAM en DRAM. Deze verschuiving is zichtbaar in de inferentie-infrastructuur: Moonshot AI's Mooncake gebruikt een KV-cache-gerichte ontkoppelde architectuur, waarbij CPU, DRAM en SSD worden gebundeld als gedistribueerde cache, en Mooncake Store ondersteunt meerdere cachelagen met DRAM en SSD/NVMe; in 2026 introduceerde NVIDIA het CMX context memory storage platform in Vera Rubin-infrastructuur, met een via Ethernet aangesloten flashlaag voor KV-cache, waarbij BlueField-4 NVMe SSD's beheert. Traditionele SSD's zijn echter niet geschikt voor aanhoudende inferentietaken: ze zijn ontworpen voor bestands- en blokopslag, gericht op sequentiële bandbreedte, willekeurige IOPS en betrouwbaarheid, terwijl LLM-inferentie gegevenslevering vereist met strikte timingbeperkingen. KV-cache wordt geschreven tijdens prefill en herhaaldelijk gelezen; MoE heeft specifieke expertgewichten nodig vóór elke laagberekening; een enkele gemiste leesbewerking kan de GPU, NPU of CPU doen stagneren. Piek-IOPS bij hoge wachtrijdiepten zijn niet gelijk aan stabiele latentie voor fijnmazige toegang met lage wachtrijdiepte. NAND-flash wordt per pagina gelezen en per blok gewist, waarbij FTL zorgt voor schrijfamplificatie en staartlatentie; continue KV-cache-schrijfbewerkingen belasten de levensduur van flash. Traditionele LBA-layout negeert semantische relaties tussen lagen, experts en KV-blokken, waardoor gerelateerde gegevens verspreid raken en voorspelbare parallelle leesbewerkingen worden verhinderd. Bestandssystemen, blokapparaten en NVMe-softwarestapels voegen latentie toe. Zonder adreslay-out, cachepartitionering, prioriteitsscheduling, asynchrone prefetch en levensduurbeheer gericht op de uitvoeringsvolgorde van het model, kunnen SSD's niet stabiel deelnemen aan tokengeneratie zoals DRAM of VRAM. De markt kent twee typen 'AI SSD's': ten eerste, AI-belasting-verbeterde enterprise SSD's, zoals InnoGrit's Dongting N3X-serie, met XL-Flash en SLC NAND voor lage latentie en hoge levensduur, gericht op KV-cache-offload en tijdelijke gegevens met hoge gelijktijdigheid, met een claim van een derde van de latentie, drie keer de schrijfdoorvoer en 17-33x DWPD versus TLC SSD's; Huawei's OceanDisk-serie omvat EX 560 voor hoge willekeurige schrijfprestaties, SP 560 voor gebalanceerde prestaties en LC 560 met tot 245TB capaciteit voor trainingsgegevens en vectordata, met DiskBooster-stuurprogrammasoftware die tiering met HBM en DDR mogelijk maakt. Ten tweede, inferentie-deelnemende AI SSD's die de operationele logica van SSD's willen veranderen, waardoor een gevirtualiseerde NAND- en DRAM/VRAM-hiërarchie ontstaat via controller, firmware en middleware. Phison's aiDAPTIV gebruikt een cache-SSD en middleware om modelgewichten tussen VRAM en SSD te streamen, waardoor de modelgrootte wordt uitgebreid zonder GPU's toe te voegen, KV-cache behouden voor hergebruik, met levensduur tot 100 DWPD. Longsys's WM8500 SPU integreert compressie, caching en gegevensplanning, met iSA-software die tiering- en prefetch-beslissingen neemt, met 5nm-proces, verliesvrije compressie, HLC en hybride NAND-planning. De Maxio-Infplane-alliantie (Maxio Tech en Infplane) combineert Infplane's inferentiechip-technologieën zoals meerlaagse caching en prefetch met Maxio's expertise op het gebied van NAND- en SSD-controllers, gericht op MoE-experts, KV-cache en numerieke precisie, met als doel compatibiliteit zonder modellen of frameworks te wijzigen, en de validatie uit te breiden naar AI-pc's, werkstations en edge-apparaten. Deze routes verschillen in technische reikwijdte, sommige verbeteren I/O en andere nemen deel aan runtime-planning. De concurrentie in de industrie staat nog in de kinderschoenen, met gevalideerde producten en commercialiseringspogingen, en de toekomst zal HBM, VRAM of DRAM mogelijk niet vervangen, maar de capaciteit, prestaties en kosten herschikken, waardoor SSD een sleutelvariabele wordt in tokeneconomie.
Bron: InfoQ 中国 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws