Eine RTX 5090, Preise von 1₽ bis 20.726₽ pro Million Tokens und warum die API immer noch günstiger ist
NVIDIA
Ein ML-CTO analysiert die tatsächlichen Kosten für den Betrieb einer eigenen RTX 5090 für KI-Inferenz und zeigt, dass der Preis pro Million Tokens je nach Modellgröße, Quantisierung und gleichzeitiger Last zwischen 1 und über 20.000 Rubel variiert. Der Artikel argumentiert, dass trotz dieser Zahlen API-Dienste für die meisten Teams oft günstiger bleiben, da der Break-even-Punkt hoch liegt.
Der Autor, ein ML-CTO, befasst sich mit der wiederkehrenden Debatte darüber, ob man eine GPU für Self-Hosted-Inferenz kaufen oder für Cloud-APIs bezahlen sollte. Er berechnet die Kosten für den Betrieb einer RTX 5090 (32 GB) in Russland, einschließlich Amortisation, Strom und Systemkosten, und kommt auf etwa 17 Rubel pro Stunde bzw. 12.435 Rubel pro Monat für einen 24/7-Betrieb. Der Artikel zeigt, dass der Preis pro Million Tokens auf derselben Karte je nach Modell und Arbeitslast stark variiert – von 1 Rubel bis 20.726 Rubel. Er vergleicht verschiedene GPUs anhand des Preises pro VRAM-Gigabyte und stellt fest, dass die RTX 3090 pro GB deutlich günstiger ist, und diskutiert Multi-GPU-Setups, die aufgrund von PCIe-Engpässen oft ineffizient sind. Wichtige Leistungsmessungen in llama.cpp zeigen Token-Erzeugungsgeschwindigkeiten von 61 bis 234 Tokens pro Sekunde für verschiedene Modelle, während vLLM mit kontinuierlichem Batching auf einer 5090 eine aggregierte Geschwindigkeit von etwa 4.570 Tokens pro Sekunde über Hunderte gleichzeitiger Anfragen erreichen kann. Trotzdem ist der Break-even-Punkt gegenüber sieben API-Diensten hoch und übersteigt oft den realistischen monatlichen Token-Verbrauch, was den Autor zu dem Schluss führt, dass APIs für die meisten Teams in der Regel kosteneffizienter sind.
Quelle: Habr — хаб ИИ —
Original
