十亿日活应用的算力危机:推理成本倒挂,跨云架构缩减GPU集群75%
NVIDIA
Akamai
一款日活跃用户超1亿的跨境电商AI时尚购物应用,因高推理成本和低每用户平均收入而每位用户亏损1美元。切换至配备NVIDIA RTX PRO 6000 GPU和FP4量化技术的Akamai云后,成本大幅降低,GPU集群规模缩减了75%。
一款拥有超过1亿日活跃用户的AI驱动的时尚与购物推荐应用,曾面临严重的成本危机。该应用根据自拍照在用户锁屏上生成逼真的场景图像,但每用户收入仅为2美元,而云计算和数据传输成本为每用户3美元,导致每用户净亏损1美元。此前,该公司使用了顶级云服务商提供的NVIDIA L4 GPU,生成一张图像需要12秒,高昂的出口流量费用和延迟进一步推高了成本。随后,该公司将其AI推理层迁移至Akamai的云平台,改用NVIDIA RTX PRO 6000 GPU。凭借更快的生成速度(每张图像3至5秒)以及对FP4量化的支持,GPU集群总规模缩减了75%,单张图像的成本也低于使用L4时的水平。Akamai还提供了每GB 0.005美元的出口流量费用,较传统云服务商降低了超过95%,并在全球部署了19个GPU数据中心和超过4400个边缘节点,使95%的互联网用户延迟低于10毫秒。该应用采用了混合多云策略,将数据库和主程序保留在原有云平台上,仅将推理层迁移至Akamai,并使用开源的MultiKueue调度器进行负载均衡。Akamai还提供了高达5000美元的迁移补贴以及全天候技术支持。此外,韩国游戏公司DevSisters也采用了RTX PRO 6000来实时生成NPC对话,并使用RTX 4000 Ada进行离线资源制作。
来源: QbitAI 量子位 —
原文
