Uma RTX 5090, Preços de 1₽ a 20.726₽ por Milhão de Tokens, e Por que a API Ainda é Mais Barata
NVIDIA
Um CTO de ML detalha o custo real de operar sua própria RTX 5090 para inferência de IA, mostrando que o preço por milhão de tokens varia de 1 rublo a mais de 20.000 rublos, dependendo do tamanho do modelo, quantização e carga concorrente. O artigo argumenta que, apesar desses números, os serviços de API muitas vezes permanecem mais baratos para a maioria das equipes, pois o ponto de equilíbrio é elevado.
O autor, um CTO de ML, aborda o recorrente debate sobre comprar uma GPU para inferência auto-hospedada versus pagar por APIs em nuvem. Eles calculam o custo de executar uma RTX 5090 (32GB) na Rússia, incluindo amortização, eletricidade e custos de sistema, chegando a cerca de 17 rublos por hora ou 12.435 rublos por mês para operação 24/7. O artigo mostra que o preço por milhão de tokens na mesma placa varia enormemente, de 1 rublo a 20.726 rublos, dependendo do modelo e da carga de trabalho. Eles comparam várias GPUs pelo preço por gigabyte de VRAM, observando que a RTX 3090 é muito mais barata por GB, e discutem configurações multi-GPU, que muitas vezes são ineficientes devido a gargalos de PCIe. Medições de desempenho-chave em llama.cpp mostram velocidades de geração de tokens variando de 61 a 234 tokens por segundo para diferentes modelos, enquanto o vLLM com batching contínuo em uma única 5090 pode atingir cerca de 4.570 tokens por segundo agregados em centenas de solicitações concorrentes. Apesar disso, o ponto de equilíbrio contra sete serviços de API é alto, muitas vezes excedendo o uso mensal realista de tokens, levando o autor a concluir que APIs são geralmente mais econômicas para a maioria das equipes.
Fonte: Habr — хаб ИИ —
original
