Donanım ve Çıkarımİş ve Pazar 🇨🇳 07.08.2026 06:02

HBM Yeterli Değil, Yapay Zeka SSD'leri Patlayıcı Büyümeye Hazır

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
Büyük dil modeli çıkarımı kapasite ve G/Ç duvarlarına ulaşırken, SSD'ler statik depolamadan çıkarımın gerçek zamanlı veri yoluna taşınıyor ve HBM, VRAM ve DRAM'den sonra resmi bir depolama katmanı haline geliyor. Sektörde iki ana yol görülüyor: yapay zeka yükü artırılmış kurumsal SSD'ler ve verileri doğrudan zamanlayan çıkarıma katılan SSD'ler; Phison, Longsys ve Maxio-Infplane ittifakı gibi şirketler bu alanda öncülük ediyor.
Büyük dil modeli çıkarımı iki duvarla karşı karşıya: kapasite ve G/Ç. Model parametreleri büyümeye devam ederken, uzun bağlamlar, çok turlu diyaloglar ve ajan görevleri KV Önbelleği şişiriyor; MoE modelleri hesaplama başına aktif parametreleri azaltıyor ancak VRAM veya DRAM kapasitesini çok aşan uzman ağırlıklarının saklanmasını gerektiriyor. Bulut veri merkezlerinde, pahalı HBM bellek ağırlıklar ve KV Önbelleği tarafından işgal edilerek GPU kullanımını sınırlıyor; uçta ve cihazda, sınırlı DRAM veya birleşik bellek model boyutunu kısıtlıyor. Bellek çıkarım yükünü tek başına karşılamakta zorlanırken, SSD'ler gerçek zamanlı çıkarım veri yoluna girerek HBM, VRAM ve DRAM'den sonra resmi bir depolama katmanı haline geliyor. Bu değişim çıkarım altyapısında görülüyor: Moonshot AI'nin Mooncake'i, KV Önbellek merkezli ayrıştırılmış bir mimari kullanarak CPU, DRAM ve SSD'yi dağıtık önbellek olarak havuzluyor ve Mooncake Store, DRAM ve SSD/NVMe ile çok düzeyli önbelleği destekliyor; 2026'da NVIDIA, Vera Rubin altyapısında CMX bağlam bellek depolama platformunu tanıtarak KV Önbelleği için Ethernet bağlantılı bir flash katmanı ekledi ve BlueField-4 NVMe SSD'leri yönetiyor. Ancak geleneksel SSD'ler kalıcı çıkarım görevleri için uygun değil: dosya ve blok depolama için tasarlandılar, sıralı bant genişliğine, rastgele G/Ç işlemlerine ve güvenilirliğe odaklanıyorlar, oysa LLM çıkarımı katı zamanlama kısıtlamalarıyla veri tedariki gerektiriyor. KV Önbelleği ön dolguda yazılır ve tekrar tekrar okunur; MoE, her katman hesaplamasından önce belirli uzman ağırlıklarını gerektirir; tek bir kaçırılan okuma GPU, NPU veya CPU'yu durdurabilir. Yüksek kuyruk derinliklerinde tepe G/Ç işlemleri, düşük kuyruk derinlikli, ince taneli erişim için kararlı gecikme anlamına gelmez. NAND Flash sayfa bazında okur ve blok bazında siler; FTL, yazma büyütmesine ve kuyruk gecikmesine neden olur; sürekli KV Önbelleği yazımları flash dayanıklılığını zorlar. Geleneksel LBA düzeni katmanlar, uzmanlar ve KV blokları arasındaki anlamsal ilişkileri yok sayar, ilgili verileri dağıtır ve öngörülebilir paralel okumaları engeller. Dosya sistemleri, blok aygıtları ve NVMe yazılım yığınları gecikme ekler. Model yürütme sırasına yönelik adres düzeni, önbellek bölümleme, öncelik zamanlaması, eşzamansız önceden getirme ve ömür yönetimi olmadan SSD'ler DRAM veya VRAM gibi belirteç üretimine istikrarlı bir şekilde katılamaz. Piyasada iki tür 'AI SSD' bulunur: birincisi, AI yüküyle geliştirilmiş kurumsal SSD'ler, örneğin InnoGrit'in Dongting N3X serisi, düşük gecikme ve yüksek dayanıklılık için XL-Flash ve SLC NAND kullanarak KV Önbelleği boşaltma ve yüksek eşzamanlı geçici verileri hedefler; TLC SSD'lere kıyasla üçte bir gecikme, üç kat yazma verimi ve 17-33 kat DWPD iddia eder; Huawei'nin OceanDisk serisi, yüksek rastgele yazma performansı için EX 560, dengeli performans için SP 560 ve eğitim verileri ve vektör veritabanları için 245TB'a kadar kapasiteye sahip LC 560 içerir ve DiskBooster sürücü yazılımı HBM ve DDR ile katmanlamayı etkinleştirir. İkincisi, çıkarıma katılan AI SSD'ler SSD çalışma mantığını değiştirmeyi amaçlar, denetleyici, üretici yazılımı ve ara katman yazılımı aracılığıyla sanallaştırılmış bir NAND ve DRAM/VRAM hiyerarşisi oluşturur. Phison'un aiDAPTIV'i bir önbellek SSD ve ara katman yazılımı kullanarak model ağırlıklarını VRAM ve SSD arasında akıştırır, GPU eklemeden model boyutunu genişletir, yeniden kullanım için KV Önbelleğini korur ve 100 DWPD'ye kadar dayanıklılık sağlar. Longsys WM8500 SPU, sıkıştırma, önbelleğe alma ve veri zamanlamasını entegre eder; iSA yazılımı katmanlama ve önceden getirme kararları verir, 5nm işlem, kayıpsız sıkıştırma, HLC ve hibrit NAND zamanlaması kullanır. Maxio-Infplane ittifakı (Maxio Tech ve Infplane), Infplane'ın çok düzeyli önbelleğe alma ve önceden getirme gibi çıkarım çipi teknolojilerini Maxio'nun NAND ve SSD denetleyici uzmanlığıyla birleştirir, MoE uzmanlarını, KV Önbelleğini ve sayısal hassasiyeti hedefler ve model dosyalarını veya çerçevelerini değiştirmeden uyumluluğu amaçlayarak doğrulamayı AI PC'ler, iş istasyonları ve uç cihazlara genişletir. Bu yollar teknik kapsam açısından farklılık gösterir; bazıları G/Ç'yi geliştirirken diğerleri çalışma zamanı zamanlamasına katılır. Sektör rekabeti yeni başlıyor, doğrulanmış ürünler ve ticarileştirme girişimleri var ve gelecek HBM, VRAM veya DRAM'ın yerini almayabilir, ancak kapasite, performans ve maliyeti yeniden katmanlayarak SSD'yi belirteç ekonomisinde önemli bir değişken haline getirebilir.
Kaynak: InfoQ 中国 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler