10億DAUアプリの計算危機:推論コストが逆転し、クロスクラウドアーキテクチャがGPUクラスタを75%削減

NVIDIANVIDIA AkamaiAkamai
1日あたりのアクティブユーザー数が1億人を超える越境AIファッション・ショッピングアプリは、推論コストが高くARPUが低いため、ユーザー1人あたり1ドルの損失を出していた。AkamaiのクラウドにNVIDIA RTX PRO 6000 GPUとFP4量子化を採用したことでコストが劇的に削減され、GPUクラスタの規模を75%縮小できた。
AIを活用したファッション・ショッピング推薦アプリで、1日のアクティブユーザー数が1億人を超える企業が深刻なコスト危機に直面しました。このアプリは、ユーザーの自撮り写真に基づいてロック画面にリアルなシーン画像を生成していましたが、ユーザー1人当たりの収益(ARPU)は2ドルである一方、クラウドの計算処理とデータ転送にかかるコストはユーザー1人当たり3ドルで、ユーザー1人当たり1ドルの純損失となっていました。以前は、大手クラウドプロバイダーのNVIDIA L4 GPUを使用しており、1枚の画像生成に12秒かかり、高いエグレス(データ送信)料金とレイテンシ(遅延)がさらにコストを押し上げていました。その後、同社はAI推論層をAkamaiのクラウドに移行し、NVIDIA RTX PRO 6000 GPUに切り替えました。生成時間の短縮(1枚あたり3〜5秒)とFP4量子化のサポートにより、GPUクラスターの総規模を75%削減し、1枚あたりのコストはL4よりも低くなりました。また、Akamaiはエグレス料金を1GBあたり0.005ドル(従来のクラウドの20分の1未満)で提供し、世界19箇所のGPUデータセンターと4,400以上のエッジノードを展開し、インターネットユーザーの95%に対してレイテンシを10ミリ秒未満に短縮しました。このアプリはハイブリッドマルチクラウド方式を採用し、データベースとメインプログラムは従来のクラウドに維持しつつ、推論層のみをAkamaiに移行し、オープンソースのMultiKueueスケジューラを使用して負荷分散を行いました。Akamaiはまた、最大5,000ドルの移行補助金と24時間365日のサポートを提供しました。さらに、韓国のゲーム会社DevSistersも、リアルタイムのNPC対話生成にRTX PRO 6000を採用し、オフラインのアセット作成にはRTX 4000 Adaを使用しています。
出典: QbitAI 量子位 — 原文
関連記事 ↓
新着ニュース