AI-infrastructuur krijgt nieuwe uitdagingen: modellen groeien, heterogene computing en agentcomplexiteit hervormen het veld
Huawei
4Paradigm (Fourth Paradigm)
DeepSeek
Alibaba/Qwen
Cosmos (NVIDIA)
Google/DeepMind
Meta
Anthropic
Nu AI-modelarchitecturen steeds complexer en diverser worden, moet AI-infrastructuur zich aanpassen aan heterogene computing, multi-modelpijplijnen en toenemende agent-gedreven workloads. Experts van Huawei, Inferact vLLM en 4Paradigm bespreken de belangrijkste uitdagingen: het beheren van diverse AI-versnellers (NVIDIA, Ascend, Cambricon, enzovoort), het optimaliseren van multi-modale inferentie, en hoe AI uiteindelijk veel van het infrastructuurbeheer kan automatiseren, waardoor ingenieurs verschuiven van implementatie naar planning en SLA-definitie.
In een recente live-discussie van InfoQ organiseerde Huang Zhipeng, directeur open-source-ecologie bij Huawei AI, een gesprek met Mo Zifeng, committer van Inferact vLLM, en Yang Shouren, expert systeemonderzoek en -ontwikkeling bij 4Paradigm (Fourth Paradigm), over de evolutie van AI-infrastructuur. Mo merkte op dat modelarchitecturen veel sneller groeien dan toolchains, met voorbeelden zoals de complexe MoE van DeepSeek V4 en multimodale modellen die evolueren van LLaVA naar het volledig modale Cosmos V. Yang benadrukte de kernuitdaging van heterogeen rekenbeheer nu binnenlandse AI-versnellers zich vermenigvuldigen (NVIDIA, Ascend, Cambricon, Kunlun, Tianshu, Muxi), wat consistentieproblemen veroorzaakt waarbij een tensoruitvoer op bepaalde vormen op een specifieke GPU kan falen. Yang introduceerde HAMi, een open-sourceproject voor GPU-virtualisatie en -deling tussen apparaten, en besprak de beperkingen van Kubernetes Dynamic Resource Allocation (DRA) voor geavanceerd apparaatbeheer. De groep verkende ook de impact van AI-agents op opensourcegemeenschappen: agents helpen nu bij routinematige PR-taken maar overspoelen repositories ook met kwalitatief slechte inzendingen die committers handmatig moeten sorteren. Mo beschreef het aannemen van een 'alleen-menselijk' filterstrategie via verificatie van werk-/school-e-mail. Vooruitkijkend voorspelde Yang dat AI geleidelijk de infrastructuurbewerkingen overneemt, waardoor ingenieurs zich kunnen concentreren op hoger niveau SLA/SLO/kostenontwerp, maar merkte op dat opensourceprojecten kwaliteitsvertrouwen moeten behouden door uitgebreid testen. Mo voegde toe dat platformsoftware essentieel zal blijven omdat zelfs krachtige agents profiteren van de collectieve optimalisaties van het ecosysteem, en het 'Mattheüseffect' zal het gebruik concentreren rond goed onderhouden projecten zoals vLLM. Het gesprek eindigde met praktisch advies over het omgaan met niet-ondersteunde hardwareoperatoren: vendorondersteuning, CPU-offload, of iteratieve profilering met agents, hoewel randgevallenbugs moeilijk te vangen blijven.
Bron: InfoQ 中国 —
origineel
