Affaires et MarchéModèles 🇷🇺 26.07.2026 23:02

Auto-hébergement vs API : comment calculer le coût réel d'une tâche résolue à l'ère des modèles ouverts

Moonshot AIMoonshot AI DeepSeekDeepSeek AnthropicAnthropic
L'article soutient que comparer l'auto-hébergement et les API sur la base des prix par jeton est trompeur. Il propose d'utiliser des prix API pondérés et le coût total de possession pour l'auto-hébergement, avec un seuil de rentabilité dépendant de l'utilisation. Pour les tâches résolues, il introduit une métrique de coût par tâche intégrant les taux de résolution des modèles et les budgets de jetons, soulignant que les API bon marché surpassent souvent l'auto-hébergement pour le même modèle grâce à l'échelle du fournisseur.
L'auteur critique la pratique courante consistant à comparer les coûts de l'auto-hébergement et des API uniquement sur une base par jeton, soulignant que l'auto-hébergement est un coût fixe tandis que l'API est variable, et que la métrique pertinente est le coût par tâche résolue, non par jeton. Les modèles ouverts ont rattrapé leur retard en matière de qualité sur des benchmarks comme SWE-bench Verified, ce qui fait du choix une question économique. La première partie propose une analyse du seuil de rentabilité : en mélangeant les prix des jetons d'entrée et de sortie pour les API (par exemple, Claude Opus 4.8 à 15,00 $ par million de jetons pour une génération longue, Kimi K3 à 9,00 $, DeepSeek V3.2 à 0,286 $) et en estimant les coûts d'auto-hébergement pour un nœud 8×H200 (amorti à environ 7 700-10 300 $ par mois plus électricité d'environ 580-880 $ par mois). Le seuil de rentabilité est atteint lorsque le volume mensuel V dépasse coût_par_million_auto / (prix_moyen_api - coût_marginal_auto), mais nécessite également une capacité de débit suffisante ; une faible utilisation rend l'API moins chère. La deuxième partie introduit le coût par tâche résolue = (budget_de_jetons_par_tentative * coût_par_jeton) / taux_de_résolution, en utilisant les scores SWE-bench Verified et un budget fixe de 1,5 million de jetons. DeepSeek V3.2 via API coûte 0,49 $ par tâche, tandis qu'auto-hébergé à une utilisation donnée coûte 4,37 $, montrant qu'une API bon marché bat l'auto-hébergement pour le même modèle. L'auto-hébergement ne l'emporte que face aux API fermées coûteuses comme Claude Opus 4.8 (11,54 $) ou Kimi K3 (6,57 $) à forte utilisation. La troisième partie aborde les facteurs non liés aux coûts : la résidence des données (impose l'auto-hébergement), la dépendance au fournisseur et la volatilité des prix (par exemple, Moonshot AI a suspendu les inscriptions à Kimi K3 après 48 heures en raison de la demande), l'asymétrie des mises à jour (l'API bénéficie de mises à jour gratuites, l'auto-hébergement nécessite des efforts), et la dépréciation du matériel liée aux cycles de sortie de NVIDIA plutôt qu'aux calendriers comptables. La conclusion est que la décision entre API et auto-hébergement dépend de l'utilisation de l'infrastructure, des exigences en matière de données et des contraintes opérationnelles, et non du seul prix par jeton.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches