L'infrastructure IA face à de nouveaux défis : croissance des modèles, calcul hétérogène et complexité des agents redessinent le paysage
Huawei
4Paradigm (Fourth Paradigm)
DeepSeek
Alibaba/Qwen
Cosmos (NVIDIA)
Google/DeepMind
Meta
Anthropic
Alors que les architectures des modèles d'IA deviennent de plus en plus complexes et diversifiées, l'infrastructure IA doit s'adapter au calcul hétérogène, aux pipelines multi-modèles et à l'essor des charges de travail pilotées par les agents. Des experts de Huawei, Inferact vLLM et 4Paradigm discutent des principaux défis : gestion de divers accélérateurs IA (NVIDIA, Ascend, Cambricon, etc.), optimisation de l'inférence multi-modale, et comment l'IA pourrait un jour automatiser une grande partie de la gestion de l'infrastructure, faisant passer les ingénieurs de la mise en œuvre à la planification et à la définition des SLA.
Lors d'une récente discussion live sur InfoQ, Huang Zhipeng, directeur de l'écosystème open source de l'IA chez Huawei, a animé un échange avec Mo Zifeng, contributeur Inferact vLLM, et Yang Shouren, expert en R&D systèmes chez 4Paradigm (Fourth Paradigm), pour examiner l'évolution de l'infrastructure IA. Mo a noté que les architectures de modèles progressent bien plus rapidement que les chaînes d'outils, citant par exemple le MoE complexe de DeepSeek V4 et les modèles multimodaux évoluant de LLaVA à Cosmos V. Yang a souligné le défi central de la gestion hétérogène du calcul alors que les accélérateurs IA domestiques prolifèrent (NVIDIA, Ascend, Cambricon, Kunlun, Tianshu, Muxi), entraînant des problèmes de cohérence où un tenseur en sortie peut échouer sur certaines formes sur un GPU spécifique. Yang a présenté HAMi, un projet open source de virtualisation et de partage de GPU entre appareils, et a discuté des limites du Kubernetes DRA (Dynamic Resource Allocation) pour la gestion avancée des dispositifs. Le groupe a également exploré l'impact des agents IA sur les communautés open source : les agents aident désormais à traiter les tâches routinières de pull request, mais ils inondent aussi les dépôts de soumissions de faible qualité que les mainteneurs doivent trier manuellement. Mo a décrit l'adoption d'une stratégie de filtrage 'humain uniquement' via la vérification par email professionnel ou académique. Pour l'avenir, Yang a prédit que l'IA prendra progressivement en charge les opérations d'infrastructure, libérant les ingénieurs pour se concentrer sur la conception de plus haut niveau (SLA/SLO/coût), mais a noté que les projets open source doivent maintenir la confiance en leur qualité grâce à des tests exhaustifs. Mo a ajouté que les logiciels de plateforme resteront essentiels car même des agents puissants bénéficient des optimisations collectives de l'écosystème, et que 'l'effet Matthieu' concentrera l'utilisation autour de projets bien maintenus comme vLLM. La conversation s'est conclue par des conseils pratiques pour gérer les opérateurs matériels non supportés : support du fournisseur, déchargement CPU, ou profilage itératif avec des agents, bien que les bugs de cas particuliers restent difficiles à détecter.
Source: InfoQ 中国 —
original
