Matériel et InférenceAffaires et Marché 🇨🇳 04.08.2026 07:02

Crise de calcul pour une application à milliard d'utilisateurs quotidiens : coûts d'inférence inversés, l'architecture multi-cloud réduit le cluster GPU de 75 %

NVIDIANVIDIA AkamaiAkamai
Une application transfrontalière de mode et de shopping IA avec plus de 100 millions d'utilisateurs actifs quotidiens perdait 1 dollar par utilisateur en raison de coûts d'inférence élevés et d'un faible ARPU. Le passage au cloud d'Akamaï avec les GPU NVIDIA RTX PRO 6000 et la quantification FP4 a considérablement réduit les coûts, diminuant la taille du cluster GPU de 75 %.
Une application de recommandation de mode et de shopping alimentée par l'IA, comptant plus de 100 millions d'utilisateurs actifs quotidiens, a été confrontée à une grave crise de coûts. L'application générait des images de scènes réalistes sur les écrans de verrouillage des utilisateurs à partir de selfies, mais le revenu par utilisateur (RPU) n'était que de 2 $, tandis que les coûts de calcul cloud et de transfert de données s'élevaient à 3 $ par utilisateur, entraînant une perte nette de 1 $ par utilisateur. Auparavant, l'entreprise utilisait des GPU NVIDIA L4 d'un grand fournisseur de cloud, où la génération d'une image prenait 12 secondes, et des frais de sortie élevés ainsi que la latence gonflaient encore les coûts. L'entreprise a ensuite migré sa couche d'inférence IA vers le cloud d'Akamai, en passant aux GPU NVIDIA RTX PRO 6000. Avec une génération plus rapide (3 à 5 secondes par image) et le support de la quantification FP4, la taille totale du cluster GPU a été réduite de 75 %, et le coût par image est devenu inférieur à celui du L4. Akamai a également proposé des frais de sortie de 0,005 $/Go, soit moins de 1/20e des clouds traditionnels, et a déployé 19 centres de données GPU et plus de 4 400 nœuds de périphérie dans le monde, réduisant la latence à moins de 10 ms pour 95 % des internautes. L'application a adopté une approche hybride multi-cloud, conservant sa base de données et son programme principal sur l'ancien cloud et migrant uniquement la couche d'inférence vers Akamai, en utilisant le planificateur open-source MultiKueue pour l'équilibrage de charge. Akamai a également fourni des subventions de migration allant jusqu'à 5 000 $ et un support 24/7. De plus, la société de jeux coréenne DevSisters a également adopté RTX PRO 6000 pour la génération de dialogues en temps réel pour les PNJ, et RTX 4000 Ada pour la création d'actifs hors ligne.
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches