Las demandas de inferencia de IA requieren una infraestructura de datos fundamentalmente diferente, según Silk
NVIDIA
Silk
A medida que los agentes de IA pasan de chatbots a flujos de trabajo autónomos de múltiples pasos, las cargas de inferencia están abrumando el almacenamiento en la nube tradicional (AWS EBS) con concurrencia extrema, picos de lectura y latencia de cola. Silk aboga por un almacenamiento definido por software que desvincule el rendimiento de la capacidad para manejar estas demandas sin depender de réplicas de lectura frágiles o sobreaprovisionamiento.
El CEO de Nvidia, Jensen Huang, declaró la era de las 'fábricas de IA', pero Silk advierte que el cambio de chatbots a agentes autónomos de IA crea un problema masivo de datos. La inferencia se comporta como OLTP++ (procesamiento de transacciones en línea) con una concurrencia sin precedentes, picos de lectura y patrones de acceso impredecibles, agotando rápidamente los créditos de ráfaga de EBS de AWS y provocando picos de latencia de 1 ms a más de 100 ms. Los cuellos de botella de almacenamiento, no los de cómputo, se convierten en el punto crítico de fallo. Silk presenta un caso de estudio de 'FinRetail' donde un asistente de compras basado en RAG (generación aumentada por recuperación) causó un 'desastre de éxito' al saturar la capa de almacenamiento, afectando todo el sitio. La solución, según Silk, es una abstracción de almacenamiento definida por software que desacopla el rendimiento de las aplicaciones de los límites nativos de almacenamiento de AWS, proporcionando una latencia p99 consistente de menos de un milisegundo incluso bajo cargas mixtas. La arquitectura simétrica activa-activa de Silk y su caché distribuida pueden ofrecer un rendimiento de E/S de 20 GiB/s, eliminando la necesidad de réplicas de solo lectura frágiles o de aprovisionar en exceso recursos de cómputo EC2.
Fuente: The Register AI/ML —
original
