AI SSD:LLM推論におけるストレージのパラダイムシフト
Moonshot AI
NVIDIA
Huawei
Maxio Tech
AIインフラストラクチャは生の計算能力を超えて進化しており、推論状態が第一級のリソースになりつつあります。Moonshot AIのMooncakeやエヌビディアのCMXプラットフォームなどのシステムは、トークン生成のためのリアルタイムデータパスにストレージを統合しています。このシフトは、低レイテンシ、高耐久性、インテリジェントなデータ管理を目的としたAI専用SSDの登場を促進しています。
AIインフラの競争は、単純なGPU数や計算能力から、トークンごとに計算、ネットワーク、メモリ、ストレージが連携するという、より総合的なアプローチへと移行しつつある。これは、長いコンテキストを持つモデル、複雑な推論、マルチエージェントシステムによって牽引されており、KVキャッシュとMoEエキスパート重みの効率的な管理が求められている。代表的な2つのシグナルが、Moonshot AIのMooncakeとNVIDIAのCMXである。Mooncakeは、KVキャッシュ中心の分離型アーキテクチャであり、アイドル状態のCPU、DRAM、SSD、NICリソースを分散キャッシュプールに編成し、テストでは有効なリクエスト容量を59%から498%向上させる。NVIDIAのCMXコンテキストメモリストレージプラットフォームは、HBMと共有ストレージの間に「G3.5」レイヤーを追加し、GPUポッド内にペタバイト規模の共有コンテキストメモリを提供する。これにより、持続的なトークンスループットと電力効率が最大5倍向上する可能性がある。これらのシステムは、推論状態が重要なリソースになりつつあり、ストレージが配置、移行、再利用に参加する必要があることを浮き彫りにしている。その結果、AI SSDが登場しており、AI拡張エンタープライズSSD(例:InnoGrit Dongting-N3X、Huawei OceanDisk LC 560)と推論参加型AI SSDの2つのカテゴリがある。後者には、PhisonのaiDAPTIV(専用キャッシュSSDとミドルウェアを使用)、LongsysのSPU+iSA(ストレージ側のインテリジェンスを活用)、Infplane-Maxioのクロスレイヤー連携という3つの注目すべきアプローチがある。AI SSDの競争は、最終的には完全なデータパスに関するものとなり、NANDメディア、FTL、ファームウェア、ドライバ、ミドルウェア、推論フレームワークにわたる連携が必要となる。AI SSDはHBM、VRAM、DRAMを置き換えるものではなく、アクセス頻度に基づいてデータを配置し、ソフトウェアとハードウェアによって移行を管理する、より細かいストレージ階層を形成するだろう。
出典: QbitAI 量子位 —
原文
