أزمة الحوسبة في تطبيق بمليار مستخدم يوميًا: تكاليف الاستدلال انقلبت، والهندسة المعمارية عبر السحابة تخفض مجموعة وحدات المعالجة الرسومية بنسبة 75٪
NVIDIA
Akamai
تطبيق تسوق وأزياء ذكاء اصطناعي عابر للحدود يضم أكثر من 100 مليون مستخدم نشط يوميًا كان يخسر دولارًا واحدًا لكل مستخدم بسبب ارتفاع تكاليف الاستدلال وانخفاض متوسط العائد لكل مستخدم. أدى الانتقال إلى سحابة أكاماي مع وحدات معالجة رسومية NVIDIA RTX PRO 6000 وقياس الكم FP4 إلى خفض التكاليف بشكل كبير، مما قلص حجم مجموعة وحدات المعالجة الرسومية بنسبة 75٪.
واجه تطبيق للتوصيات في الأزياء والتسوق يعمل بالذكاء الاصطناعي، ويضم أكثر من 100 مليون مستخدم نشط يوميًا، أزمة تكاليف حادة. كان التطبيق يولّد صورًا واقعية للمشاهد على شاشات قفل المستخدمين بالاستناد إلى صور السيلفي، لكن متوسط الإيراد لكل مستخدم (ARPU - Average Revenue Per User) لم يكن يتجاوز 2 دولارين، في حين بلغت تكاليف الحوسبة السحابية ونقل البيانات 3 دولارات لكل مستخدم، مما أدى إلى خسارة صافية بمقدار دولار واحد لكل مستخدم. كانت الشركة تستخدم سابقًا وحدات معالجة رسومية من نوع NVIDIA L4 عبر أحد كبار مزوّدي الخدمات السحابية، حيث كان توليد صورة واحدة يستغرق 12 ثانية، وكانت رسوم إخراج البيانات المرتفعة والتأخير الزمني يزيدان من التكاليف.
بعد ذلك، نقلت الشركة طبقة الاستدلال بالذكاء الاصطناعي إلى السحابة الخاصة بـ Akamai، وانتقلت إلى استخدام وحدات معالجة رسومية من نوع NVIDIA RTX PRO 6000. ومع سرعة توليد أعلى (3 إلى 5 ثوانٍ لكل صورة) ودعم تقنية التكميم FP4، تراجع إجمالي حجم مجموعة وحدات المعالجة الرسومية بنسبة 75%، وأصبحت تكلفة توليد الصورة أقل مما كانت عليه مع L4. كما قدّمت Akamai رسوم إخراج بيانات بلغت 0.005 دولار لكل غيغابايت (GB)، وهو أقل من عُشرين ما تفرضه السحب التقليدية، ونشرت 19 مركز بيانات مزوّدًا بوحدات معالجة رسومية وأكثر من 4400 عقدة حوسبة طرفية حول العالم، مما خفّض زمن الاستجابة إلى أقل من 10 ملّي ثانية لـ95% من مستخدمي الإنترنت.
اعتمد التطبيق نهجًا هجينًا متعدد السحب، فأبقى قاعدة البيانات والبرنامج الرئيسي على السحابة القديمة، ونقل فقط طبقة الاستدلال إلى Akamai، مستخدمًا مجدول المهام مفتوح المصدر MultiKueue لتوزيع الأحمال. وقدّمت Akamai أيضًا دعمًا ماليًا للترحيل يصل إلى 5000 دولار، إلى جانب دعم فني متاح على مدار الساعة طوال أيام الأسبوع.
بالإضافة إلى ذلك، تبنّت شركة الألعاب الكورية DevSisters وحدات معالجة رسومية من نوع RTX PRO 6000 لتوليد حوارات الشخصيات غير القابلة للّعب (NPC - Non-Player Character) في الوقت الفعلي، مع استخدام RTX 4000 Ada لإنشاء الأصول البصرية بشكل غير مباشر (offline).
المصدر: QbitAI 量子位 —
الأصلي
