La infraestructura de IA enfrenta nuevos desafíos: los modelos crecen, la computación heterogénea y la complejidad de los agentes reconfiguran el campo
Huawei
4Paradigm (Fourth Paradigm)
DeepSeek
Alibaba/Qwen
Cosmos (NVIDIA)
Google/DeepMind
Meta
Anthropic
A medida que las arquitecturas de modelos de IA se vuelven cada vez más complejas y diversas, la infraestructura de IA debe adaptarse a la computación heterogénea, los pipelines multimodelo y el aumento de cargas de trabajo impulsadas por agentes. Expertos de Huawei, Inferact vLLM y 4Paradigm discuten desafíos clave: gestionar diversos aceleradores de IA (NVIDIA, Ascend, Cambricon, etcétera), optimizar la inferencia multimodal y cómo la IA podría eventualmente automatizar gran parte de la gestión de infraestructura, trasladando a los ingenieros de la implementación a la planificación y definición de SLA.
En una reciente discusión en vivo de InfoQ, Huang Zhipeng, director de ecología de código abierto de Huawei AI, moderó a Mo Zifeng, committer de Inferact vLLM, y a Yang Shouren, experto en I+D de sistemas de 4Paradigm (Cuarto Paradigma), para examinar la evolución de la infraestructura de IA. Mo señaló que las arquitecturas de modelos están creciendo mucho más rápido que las cadenas de herramientas, con ejemplos como el complejo MoE de DeepSeek V4 y los modelos multimodales que evolucionan desde LLaVA hasta Cosmos V, un modelo completo. Yang destacó el desafío central de la gestión de cómputo heterogéneo a medida que proliferan los aceleradores de IA nacionales (NVIDIA, Ascend, Cambricon, Kunlun, Tianshu, Muxi), lo que causa problemas de consistencia donde una salida de tensor puede fallar en ciertas formas en una GPU específica. Yang presentó HAMi, un proyecto de código abierto para virtualización y compartición de GPUs entre dispositivos, y discutió las limitaciones de la Asignación Dinámica de Recursos (DRA por sus siglas en inglés) de Kubernetes para la gestión avanzada de dispositivos. El grupo también exploró el impacto de los agentes de IA en las comunidades de código abierto: ahora los agentes ayudan con tareas rutinarias de solicitudes de extracción (PR), pero también inundan los repositorios con envíos de baja calidad que los committers deben clasificar manualmente. Mo describió la adopción de una estrategia de filtrado 'solo humanos' mediante verificación de correo electrónico laboral o educativo. De cara al futuro, Yang predijo que la IA asumirá gradualmente las operaciones de infraestructura, liberando a los ingenieros para que se centren en el diseño de SLA/SLO/costo de nivel superior, pero señaló que los proyectos de código abierto deben mantener la confianza en la calidad mediante pruebas exhaustivas. Mo añadió que el software tipo plataforma seguirá siendo esencial porque incluso los agentes potentes se benefician de las optimizaciones colectivas del ecosistema, y el 'efecto Mateo' concentrará el uso en proyectos bien mantenidos como vLLM. La conversación concluyó con consejos prácticos sobre cómo manejar operadores de hardware no soportados: soporte del proveedor, descarga a CPU o perfilado iterativo mediante agentes, aunque los errores en casos extremos siguen siendo difíciles de detectar.
Fuente: InfoQ 中国 —
original
