Rekeningscrisis bij app met miljard dagelijkse gebruikers: inferentiekosten omgekeerd, cross-cloud-architectuur verkleint GPU-cluster met 75%
NVIDIA
Akamai
Een grensoverschrijdende AI-mode- en shopping-app met meer dan 100 miljoen dagelijkse actieve gebruikers verloor $1 per gebruiker door hoge inferentiekosten en lage ARPU. Door over te stappen naar Akamai's cloud met NVIDIA RTX PRO 6000 GPU's en FP4-kwantificatie werden de kosten drastisch verlaagd, waardoor het GPU-cluster met 75% werd verkleind.
Een AI-gestuurde mode- en shoppingaanbevelingsapp, met meer dan 100 miljoen dagelijkse actieve gebruikers, werd geconfronteerd met een ernstige kostencrisis. De app genereerde realistische scèneafbeeldingen op de vergrendelingsschermen van gebruikers op basis van selfies, maar de omzet per gebruiker (ARPU) was slechts $2, terwijl de kosten voor cloud computing en datatransfer $3 per gebruiker bedroegen, wat resulteerde in een nettoverlies van $1 per gebruiker. Voorheen gebruikte het bedrijf NVIDIA L4 GPU's van een toonaangevende cloudprovider, waarbij het genereren van één afbeelding 12 seconden duurde, en hoge egresskosten en latentie verhoogden de kosten verder. Het bedrijf migreerde vervolgens zijn AI-inferentielaag naar de cloud van Akamai, waarbij het overschakelde op NVIDIA RTX PRO 6000 GPU's. Met snellere generatie (3-5 seconden per afbeelding) en ondersteuning voor FP4-kwantificering werd de totale GPU-clustergrootte met 75% verminderd, en de kosten per afbeelding werden lager dan met L4. Akamai bood ook egresskosten van $0,005/GB, wat minder is dan 1/20e van traditionele clouds, en implementeerde wereldwijd 19 GPU-datacenters en meer dan 4.400 edge-nodes, waardoor de latentie voor 95% van de internetgebruikers onder de 10ms daalde. De app koos voor een hybride multi-cloudbenadering, waarbij de database en het hoofdprogramma op de oude cloud bleven en alleen de inferentielaag naar Akamai werd gemigreerd, met behulp van de open-source MultiKueue-scheduler voor taakverdeling. Akamai bood ook migratiesubsidies tot $5.000 en 24/7-ondersteuning. Daarnaast adopteerde het Koreaanse gamebedrijf DevSisters ook RTX PRO 6000 voor realtime dialooggeneratie door NPC's, met behulp van RTX 4000 Ada voor offline assetcreatie.
Bron: QbitAI 量子位 —
origineel
