L'inférence IA exige une infrastructure de données fondamentalement différente, selon Silk
NVIDIA
Silk
Alors que les agents d'IA passent des chatbots aux workflows autonomes multi-étapes, les charges de travail d'inférence submergent le stockage cloud traditionnel (AWS EBS) avec une concurrence extrême, des pics de lecture et une latence de queue. Silk préconise un stockage défini par logiciel qui dissocie les performances de la capacité pour répondre à ces demandes sans dépendre de réplicas de lecture fragiles ou de surprovisionnement.
Le PDG de Nvidia, Jensen Huang, a déclaré l'ère des 'usines d'IA', mais Silk prévient que le passage des chatbots aux agents d'IA autonomes crée un problème massif de données. L'inférence se comporte comme OLTP++ avec un niveau de concurrence sans précédent, des pics de lecture et des schémas d'accès imprévisibles, épuisant rapidement les crédits de burst d'AWS EBS et provoquant des pics de latence de 1 ms à plus de 100 ms. Les goulots d'étranglement du stockage, et non du calcul, deviennent le point de défaillance critique. Silk présente une étude de cas de 'FinRetail' où un assistant shopping basé sur RAG a provoqué un 'succès désastreux' en submergeant la couche de stockage, ce qui a entraîné la panne complète du site. La solution, selon Silk, est une abstraction de stockage définie par logiciel qui découple les performances des applications des limites natives du stockage AWS, offrant une latence p99 constante inférieure à la milliseconde même sous charges mixtes. L'architecture active-active symétrique et la mise en cache distribuée de Silk peuvent fournir un débit d'E/S de 20 Go/s, éliminant le besoin de réplicas en lecture fragiles ou de surprovisionnement de calcul EC2.
Source: The Register AI/ML —
original
