RAG: Measurements Matter More Than Code. The Story of a Bot Where 'Correct' Improvements Worsened Results
A developer built a RAG bot for moderating crypto chats but found that standard improvements—BM25 and a reranker—only degraded metrics. The only change that worked was calibrating the cutoff threshold. The article emphasizes the importance of careful measurements on one's own data.
Разработчик решил создать RAG-бота для адресной поддержки пользователей крипточатов: бот должен находить похожие обращения и показывать готовые ответы админов. На корпусе из 3,9 млн сообщений и eval-наборе из 51 вопроса он измерил базовый hit@3 чистого векторного поиска — 74%. При попытке улучшить систему он добавил гибридный поиск с BM25 и cross-encoder реранкер. Оба изменения уронили метрику: гибрид дал 55%, реранкер — 64%, гибрид+реранкер — 57%. Анализ показал, что BM25 не эффективен из-за отсутствия точных токенов в корпусе вопросов-образцов, а реранкер портит и без того хорошее ранжирование. Единственным полезным изменением стала настройка порога отсечения под роль бота (подстраховка, а не финальный ответчик): это подняло полезную выдачу, не требуя дополнительного кода. Главный вывод — в RAG важны не индустриальные дефолты, а честные замеры и чистка данных.
Nguồn: Habr — хаб ИИ —
bản gốc
