Falhas de GPU no Kubernetes: Lidando com Falhas de Dispositivos sem Pendência Infinita
Em 2024, o cluster de 16.384 H100s da Meta, que treinava o Llama 3 405B, sofreu 419 interrupções, com 58,7% atribuídas às GPUs. O Kubernetes frequentemente lida com essas falhas simplesmente reiniciando contêineres no mesmo dispositivo defeituoso, levando a estados de Pendência infinitos. Este artigo explica como os novos recursos de Alocação Dinâmica de Recursos em inglês: Dynamic Resource Allocation, doravante denominada DRA, no Kubernetes 1.36 finalmente oferecem uma saída, usando uma demonstração ao vivo em um cluster gerenciado pela VK Cloud.
Meta
NVIDIA


