Jalankan Beban Kerja AI di Cloud Mana Pun dengan Hugging Face Storage: Tanpa Biaya Egress via SkyPilot
Hugging Face
Hugging Face dan SkyPilot bermitra untuk memungkinkan beban kerja AI berjalan di cloud mana pun sambil menyimpan model dan dataset di Hugging Face Hub tanpa biaya egress. Pengguna dapat memasang Bucket atau repositori Hub Hugging Face ke dalam pekerjaan SkyPilot melalui satu URL hf:// dan menjalankannya di kluster GPU mana pun di lebih dari 20 cloud, Kubernetes, Slurm, atau on-prem. Backend store: hf yang baru menggunakan pemasangan FUSE untuk pembacaan malas, deduplikasi berbasis Xet untuk checkpoint, dan tanpa biaya egress untuk pembacaan data.
Hugging Face dan SkyPilot bersama-sama mengumumkan integrasi baru yang memungkinkan beban kerja AI dijalankan di cloud mana pun sambil menyimpan data di Hugging Face Storage tanpa biaya egress. Pengguna dapat memasang Hugging Face Bucket (baca-tulis) atau repositori model/dataset/ruang apa pun (hanya baca) ke dalam tugas SkyPilot menggunakan satu URL hf:// dan HF_TOKEN yang sudah dimiliki. Tugas kemudian dapat diluncurkan di klaster GPU mana pun yang tersebar di lebih dari 20 cloud, Kubernetes, Slurm, atau infrastruktur lokal. Hugging Face tidak mengenakan biaya egress atau Content Delivery Network (CDN) untuk membaca data, sehingga membaca model dan dataset dari bucket yang sama gratis di mana pun GPU berjalan. Pemasangan menggunakan backend FUSE hf-mount dari Hugging Face untuk pembacaan lambat, artinya hanya byte yang benar-benar disentuh oleh kode yang melintasi jaringan, dan cache pada disk menjaga pembacaan berulang tetap lokal. Penulisan checkpoint langsung menuju bucket dengan kecepatan hingga sekitar 170 MB/s. Penyimpanan berbasis Xet menyediakan deduplikasi yang ditentukan konten, sehingga checkpoint inkremental, bobot adapter, dan varian model hanya menyimpan dan mentransfer potongan yang berubah, mengurangi waktu unggah dan biaya penyimpanan. Autentikasi menggunakan HF_TOKEN yang sama di semua cloud, menghilangkan kunci bucket per cloud. Tolok ukur fine-tuning Qwen/Qwen3.5-4B di AWS, GCP, dan Lambda menunjukkan model dimuat dan siap dilatih dalam waktu sekitar 30 detik dengan biaya egress nol. Integrasi ini bersumber terbuka dan tersedia melalui pemasangan pip install skypilot[huggingface].
Sumber: Hugging Face blog —
asli
