Kubernetes 1.36: обработка сбоев GPU-устройств без бесконечного ожидания

NVIDIA Meta
В Kubernetes сбой GPU-устройства не приводит автоматически к перепланированию подов; вместо этого kubelet перезапускает контейнер на том же неисправном устройстве, вызывая цикл сбоев. В статье демонстрируется этот сценарий на тестовом стенде и показывается, как новые механизмы в Kubernetes 1.36, такие как статус работоспособности устройств и taints, могут разорвать этот цикл.
Статья подчеркивает, что Kubernetes по умолчанию обрабатывает отказы устройств простым перезапуском контейнера, что недостаточно для рабочих нагрузок, использующих ускорители GPU. Ссылаясь на исследование Meta по обучению Llama 3 405B, автор отмечает, что кластеры с тысячами GPU испытывают частые сбои, часто из-за отказов GPU и памяти. Автор объясняет ограничения классического подхода с плагинами
Показать ещё ↓
Источник: Habr — хаб ML — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости