Ứng dụng tỷ DAU khủng hoảng chi phí tính toán: Chi phí suy luận đảo ngược, kiến trúc đa đám mây cắt giảm cụm GPU 75%
NVIDIA
Akamai
Một ứng dụng mua sắm và thời trang AI xuyên biên giới với hơn 100 triệu người dùng hoạt động hàng ngày đang lỗ 1 đô la mỗi người dùng do chi phí suy luận cao và ARPU thấp. Việc chuyển sang đám mây của Akamai với GPU NVIDIA RTX PRO 6000 và lượng tử hóa FP4 đã giảm chi phí đáng kể, cắt giảm quy mô cụm GPU tới 75%.
Một ứng dụng mua sắm và đề xuất thời trang được hỗ trợ bởi AI, với hơn 100 triệu người dùng hoạt động hàng ngày, đã phải đối mặt với một cuộc khủng hoảng chi phí nghiêm trọng. Ứng dụng này tạo ra hình ảnh bối cảnh chân thực trên màn hình khóa của người dùng dựa trên ảnh tự chụp, nhưng doanh thu trên mỗi người dùng (ARPU) chỉ là 2 đô la, trong khi chi phí điện toán đám mây và truyền dữ liệu là 3 đô la cho mỗi người dùng, dẫn đến lỗ ròng 1 đô la trên mỗi người dùng. Trước đây, công ty sử dụng GPU NVIDIA L4 từ một nhà cung cấp đám mây hàng đầu, nơi việc tạo ra một hình ảnh mất 12 giây, và phí truyền dữ liệu cao cùng độ trễ càng làm tăng chi phí. Sau đó, công ty đã chuyển lớp suy luận AI của mình sang đám mây của Akamai, chuyển sang sử dụng GPU NVIDIA RTX PRO 6000. Với tốc độ tạo ảnh nhanh hơn (3-5 giây mỗi hình) và hỗ trợ lượng tử hóa FP4, tổng kích thước cụm GPU đã giảm 75%, và chi phí cho mỗi hình ảnh trở nên thấp hơn so với khi dùng L4. Akamai cũng cung cấp phí truyền dữ liệu với giá 0,005 đô la mỗi GB, thấp hơn 1/20 so với các đám mây truyền thống, và triển khai 19 trung tâm dữ liệu GPU cùng hơn 4.400 nút biên trên toàn cầu, giảm độ trễ xuống dưới 10 mili giây cho 95% người dùng internet. Ứng dụng đã áp dụng phương pháp đa đám mây kết hợp, giữ cơ sở dữ liệu và chương trình chính trên đám mây cũ và chỉ chuyển lớp suy luận sang Akamai, sử dụng bộ lập lịch MultiKueue mã nguồn mở để cân bằng tải. Akamai cũng cung cấp trợ cấp di chuyển lên đến 5.000 đô la và hỗ trợ 24/7. Ngoài ra, công ty trò chơi Hàn Quốc DevSisters cũng đã áp dụng RTX PRO 6000 để tạo hội thoại NPC theo thời gian thực, sử dụng RTX 4000 Ada để tạo nội dung ngoại tuyến.
Nguồn: QbitAI 量子位 —
bản gốc
