Modèles 🇷🇺 27.07.2026 09:03

RAG : Les benchmarks comptent plus que le code. L'histoire d'un bot où des améliorations « correctes » ont dégradé le résultat

Un développeur a construit un bot RAG pour modérer des discussions crypto, mais a constaté que les améliorations standard — BM25 et un re-ranker — ne faisaient que dégrader les métriques. Le seul changement efficace a été le calibrage du seuil de coupure. L'article souligne l'importance d'un benchmarking approfondi sur ses propres données.
Un développeur a entrepris de construire un robot RAG pour l'assistance ciblée des utilisateurs de chat de cryptomonnaies : le robot devait trouver des requêtes similaires et afficher des réponses d'administration préexistantes. En utilisant un corpus de 3,9 millions de messages et un ensemble d'évaluation de 51 questions, il a mesuré un hit@3 de base pour la recherche vectorielle pure à 74 %. En essayant d'améliorer le système, il a ajouté la recherche hybride avec BM25 et un réordonnanceur à encodeur croisé. Les deux changements ont réduit la métrique : hybride a donné 55 %, réordonnanceur 64 %, et hybride+réordonnanceur 57 %. L'analyse a montré que BM25 était inefficace en raison de l'absence de tokens exacts dans le corpus d'échantillons de questions, tandis que le réordonnanceur a gâché un classement déjà bon. Le seul changement bénéfique a été d'ajuster le seuil de coupure pour correspondre au rôle du robot (comme solution de repli, pas comme répondeur final) : cela a amélioré la sortie utile sans nécessiter de code supplémentaire. La leçon principale est que dans le RAG, ce qui compte n'est pas les valeurs par défaut de l'industrie, mais des mesures honnêtes et le nettoyage des données.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches