Отказы GPU в Kubernetes: обработка сбоев устройств без бесконечного ожидания
В 2024 году кластер Meta из 16 384 ускорителей H100, обучавший модель Llama 3 405B, испытал 419 прерываний, 58,7% из которых были вызваны GPU. Kubernetes часто справляется с такими сбоями простым перезапуском контейнеров на том же неисправном устройстве, что приводит к бесконечному состоянию Pending. В этой статье объясняется, как новые функции динамического выделения ресурсов (DRA) в Kubernetes 1.36 наконец предлагают решение, на примере живого демо на управляемом кластере VK Cloud.
В статье рассказывается об опыте Meta при обучении модели Llama 3 405B: в кластере из 16 384 GPU (Graphics Processing Unit, графических процессоров) H100 произошло 419 сбоев, 58,7% которых были связаны именно с GPU. Отмечается, что Kubernetes традиционно обрабатывает отказы устройств так же, как отказы stateless-сервисов, — пытается перезапустить под на том же неисправном GPU, что приводит к
Показать ещё ↓
Источник: Habr — хаб ML —
оригинал
