Errores ocultos en la infraestructura de IA: lo que el cliente aprende seis meses después del lanzamiento (y cómo lo abordamos en nuestro complejo de hardware y software)
NVIDIA
Un arquitecto del equipo Scala^r (parte del grupo Rubytech) describe los problemas típicos que enfrentan los clientes al construir su propia infraestructura de IA, como problemas de integración, selección de GPU, cuellos de botella de red, energía y refrigeración, y certificación. El artículo explica cómo su complejo de hardware y software prefabricado (PAK) Scala^r MII evita estos problemas al proporcionar una pila probada, red optimizada y mejoras en el programador.
El artículo, escrito por Alexey, arquitecto en Scala^r (parte del Grupo Rubytech), analiza los desafíos que enfrentan los clientes al construir su propia infraestructura de IA. Los principales escollos incluyen: componentes que funcionan individualmente pero fallan en conjunto bajo carga; elegir la GPU incorrecta (a menudo H100 cuando no se necesita); configuraciones de red incorrectas que degradan el rendimiento (por ejemplo, mezclar tráfico RDMA con tráfico de respaldo); falta de tolerancia a fallos en los clústeres de Kubernetes; subestimar los requisitos de energía y refrigeración; y el largo proceso de certificación para industrias reguladas. Para abordar estos problemas, Scala^r ofrece el complejo de hardware y software 'Scala^r MII', que proporciona una combinación previamente probada de hardware, sistema operativo, Kubernetes, pila de GPU y pila de red, reduciendo el tiempo de implementación a 1–2 semanas y aumentando el rendimiento en un 200–300% en comparación con el autoensamblaje. El complejo admite múltiples plataformas de GPU (NVIDIA y alternativas chinas) e incluye características como separación física del tráfico, redes MLAG, un programador personalizado con conocimiento de la topología de GPU, alimentación redundante y certificados FSTEC. El artículo también destaca tres escenarios: entrenamiento, ajuste fino e inferencia, donde el PAK proporciona ganancias de rendimiento significativas.
Fuente: Habr — хаб ИИ —
original
