AIインフラの隠れた落とし穴:立ち上げから6ヶ月後に顧客が学ぶこと(そして当社のハードウェア・ソフトウェア複合体でどう対処したか)
NVIDIA
Rubytechグループの一員であるScala^rチームのアーキテクトが、顧客が自社AIインフラを構築する際に直面する典型的な問題(統合問題、GPU選定、ネットワークボトルネック、電力と冷却、認証など)について説明します。この記事では、特製のハードウェア・ソフトウェア複合体(PAK)Scala^r MIIが、テスト済みスタック、最適化されたネットワーク、スケジューラの拡張を提供することで、これらの問題をどのように回避しているかを解説します。
この記事は、Rubytechグループの一部であるScala^rのアーキテクトであるAlexey氏が、顧客が独自のAIインフラストラクチャを構築する際に直面する課題について論じています。主な落とし穴には、個々には機能するが負荷がかかると連携して機能しないコンポーネント、不適切なGPUの選択(多くの場合、必要ないのにH100を選択する)、パフォーマンスを低下させるネットワーク設定の誤り(例えば、RDMAトラフィックとバックアップトラフィックの混在)、Kubernetesクラスタにおけるフォールトトレランスの欠如、電力と冷却の要件の過小評価、そして規制産業向けの長い認証プロセスが含まれます。これらの問題に対処するため、Scala^rは「Scala^r MII」ハードウェア・ソフトウェア複合体を提供しています。これは、ハードウェア、OS、Kubernetes、GPUスタック、ネットワークスタックの事前テスト済みの組み合わせを提供し、展開時間を1〜2週間に短縮し、自己組み立てと比較してパフォーマンスを200〜300%向上させます。この複合体は、複数のGPUプラットフォーム(NVIDIAや中国の代替品)をサポートし、物理的なトラフィック分離、MLAGネットワーキング、GPUトポロジ認識を備えたカスタムスケジューラ、冗長電源、FSTEC(連邦技術・輸出管理庁)証明書などの機能を含みます。記事はまた、トレーニング、ファインチューニング、推論の3つのシナリオを強調しており、PAK(ハードウェア・ソフトウェア複合体)が大幅なパフォーマンス向上をもたらします。
出典: Habr — хаб ИИ —
原文
