Économies sur les LLM : un modèle chinois se met soudainement à écrire en caractères chinois
Tencent
DeepSeek
Un bot agrégateur d’actualités IA est passé à un modèle chinois moins cher (ling-2.6-flash) coûtant huit fois moins, mais a découvert que le modèle génère souvent des caractères chinois dans les textes en russe. Le développeur a ajouté une détection des caractères CJK et un basculement vers un modèle plus coûteux pour le nettoyage, ce qui a permis une économie nette d’environ 42 %.
Un développeur qui gère un bot de fil d'actualités bilingue effectuant environ 936 appels LLM par jour a cherché des modèles moins chers sur OpenRouter. Sur 17 modèles gratuits, seuls 3 étaient utilisables, mais ils présentaient des problèmes comme la lenteur ou l'absence de support JSON. Le développeur a ensuite trouvé le modèle chinois payant inclusionai/ling-2.6-flash à 0,010 $ par million de tokens d'entrée, soit 8 fois moins cher et 4 fois plus rapide que le deepseek-v4-flash ($0,098) utilisé précédemment. Cependant, après le déploiement, le bot a commencé à produire des caractères chinois dans les titres d'actualités russes. Les tests ont montré que 17 % des résumés courts et 57 % des analyses longues contenaient du texte chinois. La solution a été d'ajouter un détecteur d'expressions régulières CJK : si des caractères chinois étaient trouvés, la même requête était renvoyée au modèle propre deepseek-v4-flash. Après la correction, la contamination est tombée à 0 % (0 sur 8). Le développeur a également appris trois leçons inattendues : les coûts sont déterminés par les sources d'actualités, pas par le nombre d'utilisateurs ; les modèles gratuits cessent de fonctionner lorsque le solde du compte devient négatif, même pour les modèles à 0 $ ; et l'absence du paramètre max_tokens entraîne d'énormes réservations de tokens. Le pipeline final utilise ling-2.6-flash comme modèle principal, deepseek-v4-flash comme secours pour le nettoyage CJK, et gemma:free en dernier recours. Les coûts mensuels sont passés de 14,8 $ à environ 8,6 $, soit une économie de 42 % au lieu des 8 fois espérées, en raison du double paiement pour les analyses longues.
Source: Habr — хаб ML —
original
