Silk: tekoälyn päätelmätyö vaatii täysin erilaista data-infrastruktuuria
NVIDIA
Silk
Kun tekoälyagentit siirtyvät chattiboteista autonomisiin monivaiheisiin työnkulkuihin, päätelmätyömäärät ylikuormittavat perinteistä pilvitallennusta (Amazon Web Servicesin Elastic Block Store) äärimmäisellä rinnakkaisuudella, lukuisten piikkejä aiheuttavilla pyynnöillä ja häntäviiveellä. Silk kannattaa ohjelmistopohjaista tallennusta, joka erottaa suorituskyvyn kapasiteetista, jotta nämä vaatimukset voidaan hoitaa ilman hauraita luku-replikoita tai ylimitoitettua kapasiteettia.
Nvidian toimitusjohtaja Jensen Huang julisti 'tekoälytehtaiden' aikakauden, mutta Silk varoittaa, että siirtyminen keskusteluboteista autonomisiin tekoälyagentteihin luo massiivisen dataongelman. Päätelmä käyttäytyy kuin OLTP++ (online transaction processing plus plus) ennennäkemättömällä samanaikaisuudella, lukupeikeillä ja arvaamattomilla käyttökuvioilla, mikä tyhjentää nopeasti AWS EBS -burst-luotot ja aiheuttaa viivepiikkejä yhdestä millisekunnista yli sataan millisekuntiin. Tallennuspullonkaulat, eivät laskentateho, muodostuvat kriittiseksi vikapisteeksi. Silk esittelee 'FinRetail'-tapausselosteen, jossa RAG-pohjainen ostosavustaja aiheutti 'menestyskatastrofin' ylikuormittamalla tallennuskerroksen ja kaatamalla koko sivuston. Silkin mukaan ratkaisu on ohjelmistopohjainen tallennusabstraktio, joka irrottaa sovelluksen suorituskyvyn natiiveista AWS-tallennusrajoituksista ja tarjoaa tasaisen alle millisekunnin p99-viiveen jopa sekakuormituksella. Silkin symmetrinen aktiivi-aktiivi-arkkitehtuuri ja hajautettu välimuisti voivat tuottaa 20 GiB/s I/O-suorituskykyä, mikä poistaa tarpeen hauraille luku-replikoille tai EC2-laskennan ylivarautumiselle.
Lähde: The Register AI/ML —
Alkuperäinen
