Hardware & InferentieBedrijf & Markt 🇷🇺 04.08.2026 13:01

Eén RTX 5090, prijzen van 1₽ tot 20.726₽ per miljoen tokens, en waarom API nog steeds goedkoper is

NVIDIANVIDIA
Een ML-CTO ontleedt de werkelijke kosten van het draaien van een eigen RTX 5090 voor AI-inferentie en laat zien dat de prijs per miljoen tokens varieert van 1 roebel tot meer dan 20.000 roebel, afhankelijk van modelgrootte, kwantisering en gelijktijdige belasting. Het artikel stelt dat ondanks deze cijfers API-diensten voor de meeste teams vaak goedkoper blijven, omdat het omslagpunt hoog ligt.
De auteur, een ML CTO, gaat in op het terugkerende debat over het kopen van een GPU voor zelf-hosted inferentie versus het betalen voor cloud-API's. Ze berekenen de kosten van het draaien van een RTX 5090 (32GB) in Rusland, inclusief afschrijving, elektriciteit en systeemkosten, en komen uit op ongeveer 17 roebel per uur of 12.435 roebel per maand voor een 24/7 operatie. Het artikel laat zien dat de prijs per miljoen tokens op dezelfde kaart enorm varieert van 1 roebel tot 20.726 roebel, afhankelijk van het model en de workload. Ze vergelijken verschillende GPU's op prijs per VRAM-gigabyte, en merken op dat de RTX 3090 veel goedkoper is per GB, en bespreken multi-GPU-opstellingen, die vaak inefficiënt zijn vanwege PCIe-flessenhalzen. Belangrijke prestatiemetingen in llama.cpp tonen tokens generatiesnelheden variërend van 61 tot 234 tokens per seconde voor verschillende modellen, terwijl vLLM met continuous batching op één 5090 ongeveer 4.570 tokens per seconde geaggregeerd kan bereiken over honderden gelijktijdige verzoeken. Desondanks ligt het break-evenpunt ten opzichte van zeven API-diensten hoog, vaak boven het realistische maandelijkse tokenverbruik, waardoor de auteur concludeert dat API's meestal kosteneffectiever zijn voor de meeste teams.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws