Una RTX 5090, precios desde 1 rublo hasta 20.726 rublos por millón de tokens, y por qué la API sigue siendo más barata
NVIDIA
Un director de tecnología de aprendizaje automático analiza el costo real de operar tu propia RTX 5090 para inferencia de IA, mostrando que el precio por millón de tokens varía desde 1 rublo hasta más de 20.000 rublos dependiendo del tamaño del modelo, la cuantización y la carga concurrente. El artículo argumenta que, a pesar de estas cifras, los servicios de API suelen seguir siendo más baratos para la mayoría de los equipos debido a que el punto de equilibrio es alto.
El autor, un CTO de ML, aborda el recurrente debate sobre comprar una GPU para inferencia autoalojada frente a pagar por APIs en la nube. Calculan el coste de ejecutar una RTX 5090 (32GB) en Rusia, incluyendo amortización, electricidad y costes del sistema, llegando a unos 17 rublos por hora o 12.435 rublos al mes por operación 24/7. El artículo muestra que el precio por millón de tokens en la misma tarjeta varía enormemente desde 1 rublo hasta 20.726 rublos dependiendo del modelo y la carga de trabajo. Comparan varias GPUs por precio por gigabyte de VRAM, señalando que la RTX 3090 es mucho más barata por GB, y discuten configuraciones multi-GPU, que a menudo son ineficientes debido a los cuellos de botella de PCIe. Mediciones clave de rendimiento en llama.cpp muestran velocidades de generación de tokens que van desde 61 a 234 tokens por segundo para diferentes modelos, mientras que vLLM con procesamiento por lotes continuo en una sola 5090 puede alcanzar alrededor de 4.570 tokens por segundo agregados entre cientos de solicitudes concurrentes. A pesar de esto, el punto de equilibrio frente a siete servicios de API es alto, a menudo superando el uso mensual realista de tokens, lo que lleva al autor a concluir que las APIs suelen ser más rentables para la mayoría de los equipos.
Fuente: Habr — хаб ИИ —
original
