Demandas de inferência de IA exigem infraestrutura de dados fundamentalmente diferente, diz Silk
NVIDIA
Silk
À medida que os agentes de IA passam de chatbots para fluxos de trabalho autônomos de múltiplas etapas, as cargas de trabalho de inferência estão sobrecarregando o armazenamento em nuvem tradicional (AWS EBS) com concorrência extrema, picos de leitura e latência de cauda. A Silk defende o armazenamento definido por software que desacopla desempenho da capacidade para lidar com essas demandas sem depender de réplicas de leitura frágeis ou provisionamento excessivo.
O CEO da Nvidia, Jensen Huang, declarou a era das 'fábricas de IA', mas a Silk alerta que a transição de chatbots para agentes autônomos de IA cria um enorme problema de dados. A inferência se comporta como OLTP++ com concorrência sem precedentes, picos de leitura e padrões de acesso imprevisíveis, esgotando rapidamente os créditos de rajada (burst credits) do AWS EBS e causando picos de latência de 1 ms para mais de 100 ms. Gargalos de armazenamento, e não de computação, tornam-se o ponto crítico de falha. A Silk apresenta um estudo de caso da 'FinRetail', onde um assistente de compras baseado em RAG causou um 'desastre de sucesso' ao sobrecarregar a camada de armazenamento, derrubando todo o site. Segundo a Silk, a solução é uma abstração de armazenamento definida por software que desacopla o desempenho das aplicações dos limites nativos do armazenamento da AWS, fornecendo latência p99 consistente de submilissegundo mesmo sob cargas mistas. A arquitetura ativa-ativa simétrica e o cache distribuído da Silk podem oferecer 20 GiB/s de taxa de transferência de E/S, eliminando a necessidade de réplicas de leitura frágeis ou de superprovisionamento de computação EC2.
Fonte: The Register AI/ML —
original
