Aplicações RSS

Aplicações 🇷🇺

Falhas de GPU no Kubernetes: Lidando com Falhas de Dispositivos sem Pendência Infinita

Em 2024, o cluster de 16.384 H100s da Meta, que treinava o Llama 3 405B, sofreu 419 interrupções, com 58,7% atribuídas às GPUs. O Kubernetes frequentemente lida com essas falhas simplesmente reiniciando contêineres no mesmo dispositivo defeituoso, levando a estados de Pendência infinitos. Este artigo explica como os novos recursos de Alocação Dinâmica de Recursos em inglês: Dynamic Resource Allocation, doravante denominada DRA, no Kubernetes 1.36 finalmente oferecem uma saída, usando uma demonstração ao vivo em um cluster gerenciado pela VK Cloud.

MetaMeta NVIDIANVIDIA
Habr — хаб ML31.07 · 11:01
Aplicações 🇺🇸

Meta-monitoramento de inferência para endpoints do Amazon SageMaker AI com Amazon Quick

Este artigo do blog de ML da AWS apresenta um sistema de meta-monitoramento de inferência para endpoints do Amazon SageMaker AI. Ele fornece uma camada de governança para rastrear continuamente as métricas de qualidade de previsão e dados, usando serviços gerenciados da AWS e ferramentas de código aberto como Evidently AI. O sistema inclui detecção de deriva, integração de ground truth atrasado e painéis de desempenho automatizados.

Amazon Web ServicesAmazon Web Services Evidently AIEvidently AI
AWS ML blog31.07 · 10:03
Notícias frescas