RAG: Benchmarks zijn belangrijker dan code. Het verhaal van een bot waarbij 'juiste' verbeteringen het resultaat verslechterden
Een ontwikkelaar bouwde een RAG-bot voor het modereren van crypto-chats, maar ontdekte dat standaardverbeteringen — BM25 en een reranker — de metrics alleen maar verslechterden. De enige effectieve wijziging was het kalibreren van de afkapdrempel. Het artikel benadrukt het belang van grondig benchmarken op je eigen data.
Een ontwikkelaar bouwde een RAG-bot voor gerichte ondersteuning van cryptochatgebruikers: de bot moest vergelijkbare vragen vinden en bestaande antwoorden van beheerders tonen. Met een corpus van 3,9 miljoen berichten en een evaluatieset van 51 vragen mat hij een basishit@3 voor pure vector search van 74%. In een poging het systeem te verbeteren, voegde hij hybride search met BM25 en een cross-encoder reranker toe. Beide wijzigingen verlaagden de metriek: hybride gaf 55%, reranker 64%, en hybride+reranker 57%. Analyse wees uit dat BM25 niet effectief was door de afwezigheid van exacte tokens in het voorbeeldvragencorpus, terwijl de reranker een al goede rangschikking verpestte. De enige nuttige wijziging was het aanpassen van de afkapdrempel aan de rol van de bot (als vangnet, niet als finale antwoordgever): dit verbeterde nuttige output zonder extra code. De belangrijkste les is dat bij RAG niet de industrienormen tellen, maar eerlijke metingen en datareiniging.
Bron: Habr — хаб ИИ —
origineel
