Tekoälyn infrastruktuuri kohtaa uusia haasteita: Mallit kasvavat, heterogeeninen laskenta ja agenttien monimutkaisuus muokkaavat alaa
Huawei
4Paradigm (Fourth Paradigm)
DeepSeek
Alibaba/Qwen
Cosmos (NVIDIA)
Google/DeepMind
Meta
Anthropic
Kun tekoälymallien arkkitehtuurit muuttuvat yhä monimutkaisemmiksi ja monimuotoisemmiksi, tekoälyn infrastruktuurin on sopeuduttava heterogeeniseen laskentaan, monimalliputkiin ja kasvaviin agenttivetoihin työkuormiin. Huawein, Inferact vLLM:n ja 4Paradigmin asiantuntijat keskustelevat keskeisistä haasteista: erilaisten tekoälykiihdyttimien (NVIDIA, Ascend, Cambricon jne.) hallinta, monimuotoisen inferenssin optimointi ja se, miten tekoäly saattaa lopulta automatisoida suuren osan infrastruktuurin hallinnasta siirtäen insinöörit toteutuksesta suunnitteluun ja palvelutasosopimusten määrittelyyn.
Tuoreessa InfoQ:n livetilaisuudessa Huawein tekoälyavointa lähdekoodia edistävän osaston johtaja Huang Zhipeng isännöi Inferact vLLM:n committeriä Mo Zifengia ja 4Paradigman (Fourth Paradigm) järjestelmien tutkimus- ja kehitysasiantuntija Yang Shourenia keskustelemaan tekoälyinfrastruktuurin kehityksestä. Mo huomautti, että mallien arkkitehtuurit kehittyvät paljon nopeammin kuin työkaluketjut, esimerkkeinä DeepSeek V4:n monimutkainen MoE ja multimodaaliset mallit, jotka kehittyvät LLaVA:sta täysin multimodaaliseksi Cosmos V:ksi. Yang korosti heterogeenisen laskennan hallinnan ydinkysymystä kotimaisten tekoälykiihdyttimien yleistyessä (NVIDIA, Ascend, Cambricon, Kunlun, Tianshu, Muxi), mikä aiheuttaa yhdenmukaisuusongelmia, joissa tulosuure saattaa epäonnistua tietyillä muodoilla tietyssä grafiikkasuorittimessa. Yang esitteli HAMi:n, avoimen lähdekoodin projektin, joka mahdollistaa GPU:n virtualisoinnin ja jakamisen eri laitteiden välillä, ja keskusteli Kubernetes DRA:n (Dynamic Resource Allocation, eli dynaaminen resurssien allokointi) rajoituksista edistyneessä laitteiden hallinnassa. Ryhmä tarkasteli myös tekoälyagenttien vaikutusta avoimen lähdekoodin yhteisöihin: agentit auttavat nyt rutiininomaisissa pull request -tehtävissä, mutta myös tulvivat arkistoja heikkolaatuisilla lähetyksillä, jotka kehittäjien on lajiteltava manuaalisesti. Mo kuvaili 'vain ihmiset' -suodatusstrategian käyttöönottoa työ- tai koulusähköpostin vahvistuksen avulla. Tulevaisuutta ajatellen Yang ennusti tekoälyn ottavan vähitellen haltuunsa infrastruktuurin ylläpidon, jolloin insinöörit voivat keskittyä korkeamman tason SLA/SLO/kustannussuunnitteluun, mutta huomautti, että avoimen lähdekoodin projektien on ylläpidettävä laatuluottamusta kattavien testien avulla. Mo lisäsi, että alustatyyppinen ohjelmisto pysyy edelleen välttämättömänä, koska edistyneetkään agentit eivät hyödy ilman ekosysteemin yhteisiä optimointeja, ja 'Matteus-efekti' keskittää käyttöä hyvin ylläpidettyihin projekteihin, kuten vLLM:ään. Keskustelu päättyi käytännön neuvoihin tuettomien laitteisto-operaattoreiden käsittelystä: toimittajan tuki, suorittimen purku tai iteratiivinen profilointi agenttien avulla, joskin rajalliset virheet ovat edelleen vaikeasti havaittavissa.
Lähde: InfoQ 中国 —
Alkuperäinen
