Un agent pour un dollar : l'économie de la combinaison Hermes Agent + DeepSeek V4 Flash
DeepSeek
Une capture d'écran virale prétendait que des centaines de millions de jetons étaient traités pour un peu plus d'un dollar grâce à l'agent open-source Hermes sur DeepSeek V4 Flash. Cette actualité explique les mécanismes derrière ces coûts aussi faibles, en se concentrant sur la mise en cache automatique des préfixes, et décrit ce qui casse le cache et les affirmations du fournisseur.
Début août, une capture d'écran circulait sur X montrant un tableau de bord avec des centaines de millions de jetons traités et une facture d'un peu plus d'un dollar, provenant prétendument de l'utilisation de l'agent Hermes ouvert sur le modèle DeepSeek V4 Flash. L'agent Hermes, développé par Nous Research sous licence MIT, fonctionne avec tout endpoint compatible OpenAI et dispose d'une boucle d'apprentissage fermée, enregistrant les compétences acquises dans des fichiers Markdown. DeepSeek V4 Flash, en version bêta publique depuis le 31 juillet, utilise la même architecture que l'aperçu d'avril, mais avec des capacités agentiques améliorées après un ajustement fin. L'économie principale ne vient pas du faible tarif de base, mais de la mise en cache automatique des préfixes : les préfixes de prompt répétés sont facturés à un tarif des dizaines de fois inférieur. La boucle agentique s'intègre presque parfaitement à ce mécanisme, car chaque appel renvoie le même prompt système et le même historique, avec seulement quelques nouvelles lignes ajoutées. Cependant, les économies sont perdues si des éléments dans l'en-tête du prompt changent, tels que les horodatages, les identifiants de session ou les listes d'outils réordonnées dynamiquement. Le fournisseur affirme que le modèle plus petit surpasse le modèle d'aperçu plus grand sur les benchmarks agentiques, mais recommande d'utiliser le V4-Pro pour les raisonnements complexes. Des suppléments pour les heures de pointe sont annoncés mais pas encore actifs, et le routage hybride avec escalade vers Pro réinitialise le cache. L'article fournit les tarifs, énumère les éléments courants qui cassent le cache, et donne des conseils sur la planification et les considérations opérationnelles telles que les limites de débit et le périmètre de sécurité.
Source: Habr — хаб ИИ —
original
