Hugging Face ストレージで任意のクラウド上にAIワークロードを実行:SkyPilotによるゼロエグレス
Hugging Face
Hugging Face と SkyPilot は提携し、AI ワークロードを任意のクラウドで実行しつつ、モデルとデータセットをゼロエグレス料金で Hugging Face Hub に保存できるようにしました。ユーザーは、単一の hf:// URL を使用して Hugging Face Bucket または Hub リポジトリを SkyPilot ジョブにマウントし、20以上のクラウド、Kubernetes、Slurm、またはオンプレミス環境の任意の GPU クラスターで起動できます。新しい store: hf バックエンドは、遅延読み込みのための FUSE マウント、チェックポイントのための Xet ベースの重複排除、データ読み取り時のエグレス料金なしを提供します。
Hugging FaceとSkyPilotは、新しい統合を共同で発表しました。これにより、AIワークロードを任意のクラウドで実行しながら、データをHugging Face Storageに保持し、エグレスコストをゼロにできます。ユーザーは、単一のhf://URLと既存のHF_TOKENを使用して、Hugging Face Bucket(読み取り/書き込み可能)または任意のモデル/データセット/スペースリポジトリ(読み取り専用)をSkyPilotタスクにマウントできます。その後、ジョブは20以上のクラウド、Kubernetes、Slurm、またはオンプレミスインフラ上の任意のGPUクラスターで起動できます。Hugging Faceはデータ読み取りに対してエグレス料金やコンテンツ配信ネットワーク(CDN)料金を請求しないため、GPUがどこで実行されていても、同じバケットからモデルやデータセットを読み取るのは無料です。マウントにはHugging Faceのhf-mount FUSEバックエンドを使用してレイジーリードを実現し、コードが実際に触れたバイトのみがネットワーク経由で転送され、オンディスクキャッシュにより繰り返しの読み取りはローカルで行われます。チェックポイントの書き込みはバケットに直接行われ、最大約〜170 MB/sの速度です。Xetベースのストレージはコンテンツ定義の重複排除を提供し、インクリメンタルチェックポイント、アダプター重み、モデルバリアントは変更されたチャンクのみを保存および転送するため、アップロード時間とストレージコストを削減します。認証はすべてのクラウドで同一のHF_TOKENを使用し、クラウドごとのバケットキーを不要にします。AWS、GCP、LambdaでQwen/Qwen3.5-4Bをファインチューニングするベンチマークでは、モデルが約30秒でトレーニング準備が整い、エグレスコストはゼロでした。この統合はオープンソースであり、pip install skypilot[huggingface]で利用可能です。
出典: Hugging Face blog —
原文
