AI推論には根本的に異なるデータ基盤が必要、Silkが主張
NVIDIA
Silk
AIエージェントがチャットボットから自律的なマルチステップワークフローへと移行するにつれ、推論ワークロードは従来のクラウドストレージ(AWS EBS)を極端な並行性、読み取りスパイク、テールレイテンシで圧倒しています。Silkは、こうした要求に対応するために、パフォーマンスと容量を分離するソフトウェア定義ストレージを提唱しており、脆弱な読み取りレプリカや過剰プロビジョニングに頼る必要がないとしています。
NvidiaのCEOであるJensen Huang氏は「AIファクトリー」の時代を宣言したが、Silkはチャットボットから自律型AIエージェントへの移行が大規模なデータ問題を引き起こすと警告する。推論は前例のない同時実行性、読み取りスパイク、予測不可能なアクセスパターンを伴うOLTP++のように振る舞い、AWS EBSのバーストクレジットを急速に消費し、レイテンシを1ミリ秒から100ミリ秒以上に跳ね上げる。ストレージのボトルネックが、計算処理ではなく、重大な障害ポイントとなる。Silkは「FinRetail」の事例研究を提示し、RAGベースのショッピングアシスタントが「成功の災厄」を引き起こし、ストレージ層を圧迫してサイト全体をダウンさせたと述べる。Silkによると、解決策はソフトウェア定義のストレージ抽象化であり、アプリケーションのパフォーマンスをネイティブのAWSストレージ制限から切り離し、混合負荷下でも一貫したサブミリ秒のp99レイテンシを提供する。Silkの対称型アクティブ-アクティブアーキテクチャと分散キャッシングは、20 GiB/sのI/Oスループットを実現し、脆弱な読み取りレプリカやEC2コンピュートの過剰プロビジョニングを不要にする。
出典: The Register AI/ML —
原文
