Autohospedaje frente a API: cómo calcular el costo real de una tarea resuelta en la era de los modelos abiertos
Moonshot AI
DeepSeek
Anthropic
El artículo argumenta que comparar el autohospedaje y la API basándose en precios por token es engañoso. Propone utilizar precios de API combinados y el costo total de propiedad para el autohospedaje, con un punto de equilibrio de volumen que depende de la utilización. Para tareas resueltas, introduce una métrica de costo por tarea que incorpora las tasas de resolución del modelo y los presupuestos de token, destacando que la API barata a menudo supera al autohospedaje para el mismo modelo debido a la escala del proveedor.
El autor critica la práctica habitual de comparar los costes de autogestión y API basándose únicamente en el precio por token, señalando que la autogestión tiene un coste fijo mientras que la API es variable, y que la métrica relevante es el coste por tarea resuelta, no por token. Los modelos abiertos han alcanzado la calidad de los cerrados en benchmarks como SWE-bench Verified, lo que convierte la elección en un asunto económico. La parte 1 deriva un análisis de punto de equilibrio: combinando los precios de token de entrada y salida de la API (por ejemplo, Claude Opus 4.8 a 15,00 dólares por millón de tokens para generación larga, Kimi K3 a 9,00 dólares, DeepSeek V3.2 a 0,286 dólares) y estimando los costes de autogestión para un nodo 8×H200 (amortizado en aproximadamente 7700–10 300 dólares al mes más electricidad de unos 580–880 dólares al mes). El punto de equilibrio se alcanza cuando el volumen mensual V supera coste_por_millón_propio / (precio_combinado_api - coste_marginal_propio), pero también requiere suficiente capacidad de rendimiento; una baja utilización hace que la API sea más barata. La parte 2 introduce el coste por tarea resuelta = (presupuesto_de_tokens_por_intento * coste_por_token) / tasa_de_resolución, utilizando puntuaciones de SWE-bench Verified y un presupuesto fijo de 1,5 millones de tokens. DeepSeek V3.2 a través de API cuesta 0,49 dólares por tarea, mientras que la autogestión con la utilización dada cuesta 4,37 dólares, lo que demuestra que la API barata supera a la autogestión para el mismo modelo. La autogestión solo gana frente a APIs cerradas caras como Claude Opus 4.8 (11,54 dólares) o Kimi K3 (6,57 dólares) con alta utilización. La parte 3 señala factores no relacionados con costes: residencia de datos (obliga a la autogestión), dependencia del proveedor y volatilidad de precios (por ejemplo, Moonshot AI pausó las suscripciones a Kimi K3 después de 48 horas por la demanda), asimetría de las actualizaciones (la API recibe mejoras gratuitas, la autogestión supone un esfuerzo costoso), y depreciación del hardware ligada a los ciclos de lanzamiento de NVIDIA y no a los planes contables. La conclusión es que la decisión entre API y autogestión depende de la utilización de la infraestructura, los requisitos de datos y las limitaciones operativas, no solo del precio del token.
Fuente: Habr — хаб ИИ —
original
