AI推論には根本的に異なるデータインフラが必要、Silkが提言
NVIDIA
Silk
AIエージェントがチャットボットから自律的なマルチステップワークフローへと移行する中、推論ワークロードが従来のクラウドストレージ(AWS EBS)を極度の同時実行性、読み取りスパイク、テールレイテンシで圧倒しています。Silkは、パフォーマンスと容量を切り離すソフトウェア定義ストレージを提唱し、脆弱な読み取りレプリカや過剰プロビジョニングに頼ることなくこれらの要求に対処できるようにします。
NvidiaのCEOであるJensen Huang氏は「AIファクトリー」の時代を宣言したが、Silkはチャットボットから自律型AIエージェントへの移行が大規模なデータ問題を引き起こすと警告する。推論は前例のない同時実行性、読み取りスパイク、予測不可能なアクセスパターンを伴うOLTP++のように振る舞い、AWS EBSのバーストクレジットを急速に消費し、レイテンシを1ミリ秒から100ミリ秒以上に跳ね上げる。ストレージのボトルネックが、計算処理ではなく、重大な障害ポイントとなる。Silkは「FinRetail」の事例研究を提示し、RAGベースのショッピングアシスタントが「成功の災厄」を引き起こし、ストレージ層を圧迫してサイト全体をダウンさせたと述べる。Silkによると、解決策はソフトウェア定義のストレージ抽象化であり、アプリケーションのパフォーマンスをネイティブのAWSストレージ制限から切り離し、混合負荷下でも一貫したサブミリ秒のp99レイテンシを提供する。Silkの対称型アクティブ-アクティブアーキテクチャと分散キャッシングは、20 GiB/sのI/Oスループットを実現し、脆弱な読み取りレプリカやEC2コンピュートの過剰プロビジョニングを不要にする。
出典: The Register AI/ML —
原文
