AI-workloads op elke cloud met Hugging Face-opslag: zero-egress via SkyPilot
Hugging Face
Hugging Face en SkyPilot hebben een partnerschap gesloten om AI-workloads op elke cloud te laten draaien, terwijl modellen en datasets op Hugging Face Hub worden opgeslagen zonder egresskosten. Gebruikers kunnen een Hugging Face Bucket of Hub-repo via een enkele hf:// URL in een SkyPilot-job mounten en deze starten op elke GPU-cluster op meer dan 20 clouds, Kubernetes, Slurm of on-premises. De nieuwe store: hf-backend maakt gebruik van FUSE-mounts voor luie reads, Xet-backed deduplicatie voor checkpoints en geen egresskosten voor datalezen.
Hugging Face en SkyPilot hebben gezamenlijk een nieuwe integratie aangekondigd waarmee AI-workloads op elke cloud kunnen worden uitgevoerd, terwijl de gegevens op Hugging Face Storage blijven met nul egress-kosten. Gebruikers kunnen een Hugging Face Bucket (lees-schrijf) of een model/dataset/Space-repo (alleen-lezen) koppelen aan een SkyPilot-taak met behulp van een enkele hf:// URL en hun bestaande HF_TOKEN. De taak kan vervolgens worden gestart op elke GPU-cluster in meer dan 20 clouds, Kubernetes, Slurm of on-prem infrastructuur. Hugging Face rekent geen egress- of CDN-kosten voor het lezen van gegevens, dus het lezen van modellen en datasets uit dezelfde bucket is gratis, ongeacht waar de GPU's draaien. De koppeling gebruikt Hugging Face's hf-mount FUSE-backend voor luie reads, wat betekent dat alleen de bytes die daadwerkelijk door de code worden aangeraakt, over het netwerk gaan, en een on-disk cache houdt herhaalde reads lokaal. Checkpoint-schrijfbewerkingen gaan rechtstreeks naar de bucket met snelheden tot ~170 MB/s. Xet-backed storage biedt content-defined deduplicatie, zodat incrementele checkpoints, adaptergewichten en modelvarianten alleen gewijzigde brokken opslaan en overdragen, wat uploadtijd en opslagkosten vermindert. Authenticatie gebruikt dezelfde HF_TOKEN in alle clouds, waardoor per-cloud bucket-sleutels overbodig zijn. Een benchmark waarbij Qwen/Qwen3.5-4B werd gefinetuned op AWS, GCP en Lambda toonde aan dat het model in ongeveer 30 seconden klaar was om te trainen met nul egress-kosten. De integratie is open source en beschikbaar via pip install skypilot[huggingface].
Bron: Hugging Face blog —
origineel
