Auto-hospedagem versus API: como calcular o custo real de uma tarefa resolvida na era dos modelos abertos
Moonshot AI
DeepSeek
Anthropic
O artigo argumenta que comparar auto-hospedagem e API com base em preços por token é enganoso. Propõe usar preços de API combinados e custo total de propriedade para auto-hospedagem, com um ponto de equilíbrio de volume dependente da utilização. Para tarefas resolvidas, introduz uma métrica de custo por tarefa que incorpora taxas de resolução do modelo e orçamentos de token, destacando que APIs baratas muitas vezes vencem a auto-hospedagem para o mesmo modelo devido à escala do provedor.
O autor critica a prática comum de comparar os custos de self-hosting e API apenas com base no preço por token, destacando que o self-hosting é um custo fixo, enquanto a API é variável, e que a métrica relevante é o custo por tarefa resolvida, não por token. Os modelos abertos alcançaram a qualidade dos fechados em benchmarks como o SWE-bench Verified, tornando a escolha uma questão econômica. A Parte 1 deriva uma análise de ponto de equilíbrio: mesclando os preços dos tokens de entrada/saída para API (por exemplo, Claude Opus 4.8 a US$ 15,00/M tokens para geração longa, Kimi K3 a US$ 9,00, DeepSeek V3.2 a US$ 0,286) e estimando os custos de self-hosting para um nó 8×H200 (amortizado em ~US$ 7,7-10,3 mil/mês, mais eletricidade ~US$ 580-880/mês). O ponto de equilíbrio ocorre quando o volume mensal V excede cost_per_million_self / (blended_price_api - marginal_cost_self), mas também requer capacidade de throughput suficiente; baixa utilização torna a API mais barata. A Parte 2 introduz o custo por tarefa resolvida = (token_budget_per_attempt * cost_per_token) / solve_rate, usando pontuações do SWE-bench Verified e um orçamento fixo de 1,5M tokens. O DeepSeek V3.2 via API custa US$ 0,49 por tarefa, enquanto o self-hosted na utilização dada custa US$ 4,37, mostrando que a API barata supera o self-hosting para o mesmo modelo. O self-hosting só vence contra APIs fechadas caras, como Claude Opus 4.8 (US$ 11,54) ou Kimi K3 (US$ 6,57), em alta utilização. A Parte 3 observa fatores não relacionados a custos: residência de dados (força o self-hosting), dependência de fornecedor e volatilidade de preços (por exemplo, a Moonshot AI suspendeu novas assinaturas do Kimi K3 após 48 horas devido à demanda), assimetria de atualizações (a API recebe upgrades gratuitos, o self-hosting exige esforço) e depreciação de hardware atrelada aos ciclos de lançamento da NVIDIA, não a cronogramas contábeis. A conclusão é que a decisão entre API e self-hosting depende da utilização da infraestrutura, dos requisitos de dados e das restrições operacionais, não apenas do preço do token.
Fonte: Habr — хаб ИИ —
original
