Execute Cargas de IA em Qualquer Nuvem com Armazenamento Hugging Face: Zero Egresso via SkyPilot
Hugging Face
Hugging Face e SkyPilot se uniram para permitir que cargas de trabalho de IA sejam executadas em qualquer nuvem enquanto armazenam modelos e conjuntos de dados no Hugging Face Hub com zero taxas de egresso. Os usuários podem montar um Hugging Face Bucket ou repositório Hub em um job do SkyPilot usando uma única URL hf:// e iniciá-lo em qualquer cluster de GPU em mais de 20 nuvens, Kubernetes, Slurm ou on-premise. O novo backend store: hf utiliza montagens FUSE para leitura lazy, deduplicação baseada em Xet para checkpoints e sem cobranças de egresso para leituras de dados.
Hugging Face e SkyPilot anunciaram conjuntamente uma nova integração que permite executar cargas de trabalho de IA em qualquer nuvem, mantendo os dados no armazenamento do Hugging Face com custos zero de egress. Os usuários podem montar um Bucket Hugging Face (leitura e gravação) ou qualquer repositório de modelo, conjunto de dados ou Space (somente leitura) em uma tarefa do SkyPilot usando uma única URL hf:// e seu HF_TOKEN existente. O trabalho pode então ser iniciado em qualquer cluster de GPU em mais de 20 nuvens, Kubernetes, Slurm ou infraestrutura local. O Hugging Face não cobra taxas de egress ou CDN para leitura de dados, portanto, ler modelos e conjuntos de dados do mesmo bucket é gratuito, independentemente de onde as GPUs estejam sendo executadas. A montagem usa o backend FUSE hf-mount do Hugging Face para leituras lentas (lazy reads), o que significa que apenas os bytes realmente tocados pelo código atravessam a rede, e um cache em disco mantém as leituras repetidas localmente. As gravações de checkpoints vão diretamente para o bucket a velocidades de até aproximadamente 170 MB/s. O armazenamento baseado em Xet fornece deduplicação definida por conteúdo, de modo que checkpoints incrementais, pesos de adaptadores e variantes de modelo armazenam e transferem apenas os blocos alterados, reduzindo o tempo de upload e os custos de armazenamento. A autenticação usa o mesmo HF_TOKEN em todas as nuvens, eliminando chaves de bucket específicas por nuvem. Um benchmark de ajuste fino do Qwen/Qwen3.5-4B na AWS, GCP e Lambda mostrou que o modelo foi carregado pronto para treinar em cerca de 30 segundos com custo zero de egress. A integração é de código aberto e está disponível via pip install skypilot[huggingface].
Fonte: Hugging Face blog —
original
