Silk: AI-päätely vaatii täysin erilaista tietoinfrastruktuuria
NVIDIA
Silk
Kun tekoälyagentit siirtyvät chatboteista autonomisiin monivaiheisiin työnkulkuihin, päätelytyökuormat ylikuormittavat perinteistä pilvitallennusta (AWS EBS) äärimmäisellä samanaikaisuudella, lukuprosessien piikeillä ja viiveen hännällä. Silk kannattaa ohjelmistopohjaista tallennusta, joka erottaa suorituskyvyn kapasiteetista vastatakseen näihin vaatimuksiin ilman hauraita lukumonistuksia tai ylivarautumista.
Nvidian toimitusjohtaja Jensen Huang julisti 'tekoälytehtaiden' aikakauden, mutta Silk varoittaa, että siirtyminen keskusteluboteista autonomisiin tekoälyagentteihin luo massiivisen dataongelman. Päätelmä käyttäytyy kuin OLTP++ (online transaction processing plus plus) ennennäkemättömällä samanaikaisuudella, lukupeikeillä ja arvaamattomilla käyttökuvioilla, mikä tyhjentää nopeasti AWS EBS -burst-luotot ja aiheuttaa viivepiikkejä yhdestä millisekunnista yli sataan millisekuntiin. Tallennuspullonkaulat, eivät laskentateho, muodostuvat kriittiseksi vikapisteeksi. Silk esittelee 'FinRetail'-tapausselosteen, jossa RAG-pohjainen ostosavustaja aiheutti 'menestyskatastrofin' ylikuormittamalla tallennuskerroksen ja kaatamalla koko sivuston. Silkin mukaan ratkaisu on ohjelmistopohjainen tallennusabstraktio, joka irrottaa sovelluksen suorituskyvyn natiiveista AWS-tallennusrajoituksista ja tarjoaa tasaisen alle millisekunnin p99-viiveen jopa sekakuormituksella. Silkin symmetrinen aktiivi-aktiivi-arkkitehtuuri ja hajautettu välimuisti voivat tuottaa 20 GiB/s I/O-suorituskykyä, mikä poistaa tarpeen hauraille luku-replikoille tai EC2-laskennan ylivarautumiselle.
Lähde: The Register AI/ML —
Alkuperäinen
