硬件与推理框架 🇷🇺 01.08.2026 01:02

Kubernetes 1.36:应对 GPU 设备故障,避免无限等待

NVIDIANVIDIA MetaMeta
在 Kubernetes 中,GPU 设备故障不会自动导致 Pod 重新调度;相反,kubelet 会在同一故障设备上重启容器,从而引发崩溃循环。文章在测试平台上演示了这一场景,并展示了 Kubernetes 1.36 中的新机制(如设备健康状态和污点)如何打破这一循环。
文章强调,Kubernetes 默认情况下仅通过重启容器来处理设备故障,这对于GPU加速的工作负载而言并不足够。文章引用Meta在训练Llama 3 405B时的一项研究,指出拥有数千个GPU的集群会频繁遭遇中断,这通常是由GPU和内存故障引起的。作者解释了经典设备插件方法的局限性,该方法仅能减少可分配的设备数量,并与较新的DRA(动态资源分配)模型进行了对比,后者提供了基于对象的设备管理。在测试集群上,作者通过从PCIe总线上热拔除一个设备来模拟GPU故障,导致出现Xid 79错误。随后,Pod进入崩溃循环,在已故障的设备上不断重启,而调度器不会将其重新调度,因为它仍绑定在该节点上。Kubernetes 1.36引入了多项beta功能来解决这一问题:Pod状态中的设备健康状态、设备污点与容忍度,以及可分区设备。利用这些功能,集群能够识别故障并将Pod调度到健康的GPU上,避免无休止的重启。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻