Matériel et InférenceAffaires et Marché 🇷🇺 04.08.2026 13:01

Un RTX 5090, des prix de 1 à 20 726 roubles le million de jetons, et pourquoi l'API reste plus économique

NVIDIANVIDIA
Un directeur technique en apprentissage automatique décompose le coût réel de l'exploitation de votre propre RTX 5090 pour l'inférence en IA, montrant que le prix par million de jetons varie de 1 rouble à plus de 20 000 roubles selon la taille du modèle, la quantification et la charge concurrente. L'article soutient que, malgré ces chiffres, les services API restent souvent plus rentables pour la plupart des équipes, car le seuil de rentabilité est élevé.
L'auteur, un CTO spécialisé en ML, aborde le débat récurrent entre l'achat d'un GPU pour l'inférence auto-hébergée et le paiement d'API cloud. Il calcule le coût d'exploitation d'une RTX 5090 (32 Go) en Russie, en incluant l'amortissement, l'électricité et les coûts système, pour arriver à environ 17 roubles par heure, soit 12 435 roubles par mois pour un fonctionnement 24h/24 et 7j/7. L'article montre que le prix par million de jetons sur la même carte varie énormément, de 1 rouble à 20 726 roubles, selon le modèle et la charge de travail. Il compare différents GPU par le prix par gigaoctet de mémoire vidéo, notant que la RTX 3090 est bien moins chère par gigaoctet, et discute des configurations multi-GPU, souvent inefficaces en raison des goulots d'étranglement PCIe. Les mesures de performance clés dans llama.cpp montrent des vitesses de génération de jetons allant de 61 à 234 jetons par seconde pour différents modèles, tandis que vLLM avec le traitement par lots continu sur une seule 5090 peut atteindre environ 4 570 jetons par seconde en agrégat sur des centaines de requêtes concurrentes. Malgré cela, le seuil de rentabilité par rapport à sept services API est élevé, dépassant souvent l'utilisation mensuelle réaliste de jetons, ce qui amène l'auteur à conclure que les API sont généralement plus rentables pour la plupart des équipes.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches