Économiser sur un LLM : un modèle chinois se met soudainement à écrire en caractères chinois
Tencent
DeepSeek
Le développeur d'un bot d'actualités bilingue a décidé de passer à un modèle d'IA moins cher : Ling 2.6 Flash d'Inclusion AI coûte 8 fois moins cher que DeepSeek V4 Flash et fonctionne 4 fois plus vite. Cependant, après une heure d'utilisation, des caractères chinois sont apparus dans le flux : le modèle revenait périodiquement à sa langue maternelle, le chinois, en particulier lors de générations plus longues. Le problème a été résolu en ajoutant un détecteur de caractères chinois avec une nouvelle requête au modèle propre.
L'auteur de l'article gère un fil d'actualité bilingue où chaque dépêche passe par un LLM (environ 936 appels par jour) pour catégorisation, traduction, ton et analyse. Afin d'économiser, il a passé en revue les modèles gratuits d'OpenRouter, mais la plupart étaient indisponibles en raison des politiques de données, et ceux qui fonctionnaient étaient trop lents. Il a ensuite testé un modèle payant bon marché, inclusionai/ling-2.6-flash (0,010 $ par million de tokens d'entrée contre 0,098 $ pour deepseek-v4-flash). Sur des prompts réels, il a montré une qualité équivalente (4/4 pour les catégories, 6/6 pour l'analyse), une vitesse de 2,4 secondes (contre 10 secondes) et était 8 fois moins cher. Cependant, une heure plus tard, un titre avec des caractères chinois et des signes de ponctuation est apparu dans le fil. Il s'est avéré que le modèle est chinois : sur les sorties courtes, les caractères apparaissaient dans 17 % des cas, sur les analyses longues, dans 57 % des cas, tandis que DeepSeek V4 Flash ne produisait pas d'erreurs. L'auteur a ajouté un détecteur de caractères (expression régulière pour les symboles CJK) et un renvoi au modèle « propre » DeepSeek V4 Flash, ce qui a réduit les fuites à zéro. Désormais, la chaîne est la suivante : Ling 2.6 Flash en principal, DeepSeek V4 Flash pour nettoyer les caractères chinois, et Gemma:free en secours en cas de défaillance du fournisseur. L'économie finale est d'environ 8,6 $ par mois, contre 14,8 $ pour du DeepSeek pur, mais elle s'est avérée inférieure aux attentes en raison du double paiement pour 57 % des analyses longues. La principale conclusion : un modèle bon marché peut être excellent selon les métriques mesurées, mais échouer là où l'auteur n'a pas pensé à vérifier – dans ce cas, sur la langue de réponse.
Source: Habr — хаб ML —
original
