AplikasiPerangkat Keras & Inferensi 🇷🇺 31.07.2026 11:01

Kegagalan GPU di Kubernetes: Menangani Kegagalan Perangkat Tanpa Pending yang Tak Berujung

MetaMeta NVIDIANVIDIA
Pada tahun 2024, klaster Meta yang terdiri dari 16.384 H100 yang melatih Llama 3 405B mengalami 419 gangguan, dengan 58,7% disebabkan oleh GPU. Kubernetes sering menangani kegagalan semacam itu hanya dengan me-restart container pada perangkat mati yang sama, yang menyebabkan status Pending yang tak berujung. Artikel ini menjelaskan bagaimana fitur Dynamic Resource Allocation (DRA) yang baru di Kubernetes 1.36 akhirnya menawarkan jalan keluar, menggunakan demo langsung pada klaster terkelola VK Cloud.
Artikel ini menyoroti pengalaman Meta dalam melatih Llama 3 405B, di mana kluster yang terdiri dari 16.384 GPU H100 mengalami 419 gangguan, 58,7% di antaranya terkait GPU. Poin yang ditekankan adalah bahwa Kubernetes secara tradisional memperlakukan kegagalan perangkat seperti kegagalan layanan stateless, yaitu mencoba memulai ulang pada GPU yang sama yang rusak, sehingga menyebabkan loop crash. Untuk mengatasi hal ini, Kubernetes 1.36 memperkenalkan beberapa mekanisme: DRA (Dynamic Resource Allocation) sudah stabil sejak 1.34, menyediakan model berbasis objek bukan sekadar penghitung sederhana; daftar prioritas (firstAvailable) untuk perangkat cadangan; status kesehatan perangkat di dalam status pod; taint dan tolerasi perangkat; serta kondisi pengikatan perangkat, antara lain. Penulis membangun pengujian pada VK Cloud Managed Kubernetes 1.36 dengan node GPU dan mensimulasikan kegagalan GPU dengan melepas perangkat PCIe secara langsung. Mereka menunjukkan bahwa node melaporkan perangkat sebagai tidak sehat dan jumlah yang dapat dialokasikan menurun, tetapi pod terus dimulai ulang pada GPU yang mati tanpa adanya penjadwalan ulang. Artikel ini diakhiri dengan menjelaskan mengapa Kubernetes tidak memiliki fitur descheduling bawaan untuk pod dengan status CrashLoopBackOff dan menyebutkan pola DIY seperti pengontrol kesehatan node yang mematikan seluruh node, yang merupakan solusi kasar.
Sumber: Habr — хаб ML — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru