Crise de Computação em Aplicativo com Bilhões de DAUs: Custos de Inferência Invertidos, Arquitetura Multi-nuvem Reduz Cluster de GPUs em 75%
NVIDIA
Akamai
Um aplicativo transfronteiriço de moda e compras com IA, com mais de 100 milhões de usuários ativos diários, estava perdendo US$ 1 por usuário devido aos altos custos de inferência e baixo ARPU. A mudança para a nuvem da Akamai com GPUs NVIDIA RTX PRO 6000 e quantização FP4 reduziu drasticamente os custos, diminuindo o tamanho do cluster de GPUs em 75%.
Um aplicativo de recomendação de moda e compras com tecnologia de IA, com mais de 100 milhões de usuários ativos diários, enfrentou uma grave crise de custos. O aplicativo gerava imagens realistas de cenas na tela de bloqueio dos usuários com base em selfies, mas a receita por usuário (ARPU) era de apenas US$ 2, enquanto os custos de computação em nuvem e transferência de dados eram de US$ 3 por usuário, resultando em um prejuízo líquido de US$ 1 por usuário. Anteriormente, a empresa usava GPUs NVIDIA L4 de um provedor de nuvem líder, onde gerar uma imagem levava 12 segundos, e as altas taxas de egresso e a latência inflavam ainda mais os custos. A empresa então migrou sua camada de inferência de IA para a nuvem da Akamai, mudando para GPUs NVIDIA RTX PRO 6000. Com geração mais rápida (3-5 segundos por imagem) e suporte a quantização FP4, o tamanho total do cluster de GPUs foi reduzido em 75%, e o custo por imagem tornou-se menor do que com L4. A Akamai também ofereceu taxas de egresso de US$ 0,005/GB, menos de 1/20 dos valores de nuvens tradicionais, e implantou 19 data centers de GPU e mais de 4.400 nós de borda globalmente, reduzindo a latência para menos de 10ms para 95% dos usuários da internet. O aplicativo adotou uma abordagem híbrida multi-nuvem, mantendo seu banco de dados e programa principal na nuvem antiga e migrando apenas a camada de inferência para a Akamai, usando o agendador de código aberto MultiKueue para balanceamento de carga. A Akamai também forneceu subsídios de migração de até US$ 5.000 e suporte 24/7. Além disso, a empresa coreana de jogos DevSisters também adotou RTX PRO 6000 para geração de diálogos de NPC em tempo real, usando RTX 4000 Ada para criação de ativos offline.
Fonte: QbitAI 量子位 —
original
