Hardware e InferenciaNegocios y Mercado 🇨🇳 04.08.2026 07:02

Crisis de cómputo en una app de mil millones de usuarios diarios: costos de inferencia invertidos, la arquitectura multinube reduce el clúster de GPU en un 75%

NVIDIANVIDIA AkamaiAkamai
Una app transfronteriza de moda y compras con IA, con más de 100 millones de usuarios activos diarios, perdía 1 dólar por usuario debido a los altos costos de inferencia y al bajo ARPU. Al cambiar a la nube de Akamai con GPUs NVIDIA RTX PRO 6000 y cuantización FP4, los costos se redujeron drásticamente, recortando el tamaño del clúster de GPU en un 75%.
Una aplicación de recomendación de moda y compras basada en inteligencia artificial, con más de 100 millones de usuarios activos diarios, enfrentó una grave crisis de costos. La aplicación generaba imágenes de escenas realistas en las pantallas de bloqueo de los usuarios basándose en selfies, pero el ingreso promedio por usuario (ARPU, por sus siglas en inglés) era de solo $2, mientras que los costos de cómputo en la nube y transferencia de datos eran de $3 por usuario, lo que resultaba en una pérdida neta de $1 por usuario. Anteriormente, la empresa utilizaba GPU NVIDIA L4 de un proveedor de nube líder, donde generar una imagen tomaba 12 segundos, y las altas tarifas de salida de datos y la latencia aumentaban aún más los costos. La empresa luego migró su capa de inferencia de IA a la nube de Akamai, cambiando a GPU NVIDIA RTX PRO 6000. Con una generación más rápida (3-5 segundos por imagen) y soporte de cuantización FP4, el tamaño total del clúster de GPU se redujo en un 75%, y el costo por imagen se volvió más bajo que con L4. Akamai también ofreció tarifas de salida de datos de $0.005/GB, que es menos de 1/20 de las nubes tradicionales, y desplegó 19 centros de datos de GPU y más de 4,400 nodos periféricos a nivel mundial, reduciendo la latencia a menos de 10ms para el 95% de los usuarios de internet. La aplicación adoptó un enfoque híbrido de múltiples nubes, manteniendo su base de datos y programa principal en la nube anterior y migrando solo la capa de inferencia a Akamai, utilizando el programador de código abierto MultiKueue para el equilibrio de carga. Akamai también proporcionó subsidios de migración de hasta $5,000 y soporte 24/7. Además, la empresa coreana de juegos DevSisters también adoptó RTX PRO 6000 para la generación de diálogos de NPC en tiempo real, y utilizó RTX 4000 Ada para la creación de activos fuera de línea.
Fuente: QbitAI 量子位 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas