通过 Hugging Face Storage 在任何云上运行 AI 工作负载:SkyPilot 实现零出站费用
Hugging Face
Hugging Face 与 SkyPilot 合作,允许用户在任何云上运行 AI 工作负载,同时将模型和数据集存储在 Hugging Face Hub 上,并免除出站费用。用户可以通过单个 hf:// URL 将 Hugging Face Bucket 或 Hub 存储库挂载到 SkyPilot 作业中,并在 20 多个云平台、Kubernetes、Slurm 或本地 GPU 集群上启动。新的 store:hf 后端使用 FUSE 挂载实现延迟读取,基于 Xet 的去重技术用于检查点,并且数据读取无出站费用。
Hugging Face 和 SkyPilot 联合宣布了一项新的集成,允许在任意云上运行 AI 工作负载,同时将数据保留在 Hugging Face Storage 中,且无需支付出口费用。用户可以使用单个 hf:// URL 和现有的 HF_TOKEN,将 Hugging Face Bucket(可读写)或任何模型/数据集/Space 仓库(只读)挂载到 SkyPilot 任务中。然后,该任务可以在 20 多个云、Kubernetes、Slurm 或本地基础设施上的任何 GPU 集群上启动。Hugging Face 对读取数据不收取出口或 CDN(内容分发网络)费用,因此无论 GPU 在何处运行,从同一个 bucket 读取模型和数据集都是免费的。挂载使用 Hugging Face 的 hf-mount FUSE(用户空间文件系统)后端进行惰性读取,这意味着只有代码实际触及的字节才会通过网络传输,而磁盘上的缓存则使重复读取在本地进行。检查点写入直接进入 bucket,速度可达约 170 MB/s。Xet 支持的后端存储提供内容定义的去重,因此增量检查点、适配器权重和模型变体仅存储和传输发生变化的块,从而减少上传时间和存储成本。身份验证在所有云上使用相同的 HF_TOKEN,省去了每个云的 bucket 密钥。在 AWS、GCP 和 Lambda 上对 Qwen/Qwen3.5-4B 进行微调的基准测试显示,模型加载并准备好训练大约需要 30 秒,且无出口费用。该集成是开源的,可通过 pip install skypilot[huggingface] 安装。
来源: Hugging Face blog —
原文
