एक RTX 5090 से मिलियन टोकन की कीमत 1 ₽ से 20,726 ₽ तक, और API अभी भी सस्ता क्यों है
NVIDIA
एक ML CTO RTX 5090 के साथ एआई इंफेरेंस के लिए असली लागत का विश्लेषण करते हैं, जिसमें दिखाया गया है कि प्रति मिलियन टोकन की कीमत मॉडल के आकार, क्वांटाइजेशन और समवर्ती लोड के आधार पर 1 रूबल से 20,000 रूबल से अधिक तक भिन्न हो सकती है। लेख का तर्क है कि इन आंकड़ों के बावजूद, अधिकांश टीमों के लिए API सेवाएं अक्सर सस्ती रहती हैं क्योंकि ब्रेकईवन पॉइंट अधिक होता है।
लेखक, जो एक ML CTO हैं, सेल्फ-होस्टेड इन्फ्रेंस के लिए GPU खरीदने बनाम क्लाउड API के लिए भुगतान करने की बहस पर चर्चा करते हैं। वे रूस में RTX 5090 (32GB) चलाने की लागत की गणना करते हैं, जिसमें परिशोधन, बिजली और सिस्टम लागत शामिल है, और 24/7 ऑपरेशन के लिए प्रति घंटे लगभग 17 रूबल या प्रति माह 12,435 रूबल पर पहुँचते हैं। लेख दिखाता है कि उसी कार्ड पर प्रति मिलियन टोकन की कीमत मॉडल और वर्कलोड के आधार पर 1 रूबल से 20,726 रूबल तक भिन्न होती है। वे विभिन्न GPU की प्रति VRAM गीगाबाइट कीमत की तुलना करते हैं, यह देखते हुए कि RTX 3090 प्रति जीबी कहीं सस्ता है, और मल्टी-GPU सेटअप पर चर्चा करते हैं, जो अक्सर PCIe बाधाओं के कारण अक्षम होते हैं। llama.cpp में प्रमुख प्रदर्शन माप विभिन्न मॉडलों के लिए टोकन जनरेशन गति 61 से 234 टोकन प्रति सेकंड दिखाते हैं, जबकि एक 5090 पर निरंतर बैचिंग के साथ vLLM सैकड़ों समवर्ती अनुरोधों में लगभग 4,570 टोकन प्रति सेकंड समग्र प्राप्त कर सकता है। इसके बावजूद, सात API सेवाओं के विरुद्ध ब्रेकईवन बिंदु उच्च है, अक्सर यथार्थवादी मासिक टोकन उपयोग से अधिक, जिससे लेखक ने निष्कर्ष निकाला है कि अधिकांश टीमों के लिए API आमतौर पर अधिक लागत प्रभावी होते हैं।
स्रोत: Habr — хаб ИИ —
मूल
