Một chiếc RTX 5090, giá từ 1 rúp đến 20.726 rúp cho mỗi triệu token, và vì sao API vẫn rẻ hơn
NVIDIA
Một CTO về học máy phân tích chi phí thực tế khi tự vận hành RTX 5090 cho suy luận AI, cho thấy giá mỗi triệu token dao động từ 1 rúp đến hơn 20.000 rúp tùy thuộc vào kích thước mô hình, độ lượng tử hóa và tải đồng thời. Bài viết lập luận rằng mặc dù có những con số này, các dịch vụ API thường vẫn rẻ hơn cho hầu hết các đội ngũ do điểm hòa vốn cao.
Tác giả, một CTO về ML, đề cập đến cuộc tranh luận tái diễn về việc mua GPU để tự lưu trữ suy luận so với việc trả tiền cho các API đám mây. Họ tính toán chi phí chạy một RTX 5090 (32GB) tại Nga, bao gồm khấu hao, điện năng và chi phí hệ thống, đưa ra con số khoảng 17 rúp mỗi giờ hoặc 12.435 rúp mỗi tháng cho hoạt động 24/7. Bài viết cho thấy giá mỗi triệu token trên cùng một card dao động rất lớn, từ 1 rúp đến 20.726 rúp tùy thuộc vào mô hình và khối lượng công việc. Họ so sánh các GPU khác nhau theo giá mỗi gigabyte VRAM, lưu ý rằng RTX 3090 rẻ hơn nhiều mỗi GB, và thảo luận về các cấu hình đa GPU, thường không hiệu quả do tắc nghẽn PCIe. Các phép đo hiệu suất chính trong llama.cpp cho thấy tốc độ tạo token dao động từ 61 đến 234 token mỗi giây cho các mô hình khác nhau, trong khi vLLM với xử lý theo lô liên tục trên một 5090 có thể đạt khoảng 4.570 token mỗi giây tổng hợp trên hàng trăm yêu cầu đồng thời. Mặc dù vậy, điểm hòa vốn so với bảy dịch vụ API là cao, thường vượt quá mức sử dụng token hàng tháng thực tế, dẫn đến kết luận của tác giả rằng API thường tiết kiệm chi phí hơn cho hầu hết các nhóm.
Nguồn: Habr — хаб ИИ —
bản gốc
