Onderzoek 🇷🇺 15.08.2026 04:02

Een eerlijke RAG-evaluatieset opbouwen: hoe je de eerste 100-300 gevallen verzamelt zonder jezelf te misleiden

MicrosoftMicrosoft
Het artikel bespreekt het belang van het creëren van een handmatige evaluatieset voor RAG-systemen, apart van rooktesten en trainingsdata. Het stelt voor om 100-300 zorgvuldig geselecteerde gevallen te verzamelen in verschillende scenario's, retriever en antwoordgeneratie apart te labelen, en metrics zoals Recall@k, MRR@k en nDCG@k te gebruiken. Synthetische data en publieke benchmarks zijn onvoldoende voor domeinspecifieke retriever-evaluatie.
De auteur betoogt dat publieke benchmarks zoals MTEB en BEIR geen goede retriever garanderen voor domeinspecifieke taken, en dat synthetische data kan leiden tot te nette formuleringen. In plaats daarvan raden ze aan om een handmatige evaluatieset te bouwen van 100-300 gevallen, met een praktische start van 120 gevallen afkomstig uit logs, documentatie, interviews met experts en synthetische kandidaten na beoordeling. Elk geval moet velden bevatten zoals query, scenario, verwachte document-ID's, gouden bewijs fragmenten, verwachte feiten, beantwoordbaarheid en waarom het ertoe doet. De set moet worden verdeeld in 6-8 segmenten die exacte entiteiten, parafrasering, lange secties, tabellen, versies, gevallen zonder antwoord, slechte formuleringen en gevoelige scenario's bestrijken. Retrieval en het genereren van antwoorden moeten afzonderlijk worden geëvalueerd, met retrieval-metriken zoals Recall@k, MRR@k en nDCG@k, en antwoordmetriken zoals onderbouwing, volledigheid, relevantie van het antwoord en correct onthouden. De auteur benadrukt dat voor segmenten zonder antwoord standaard recall betekenisloos is en stelt een aparte release-drempel voor. Ze waarschuwen ook tegen het gebruik van trainingsdata in de evaluatieset en suggereren om LLM-as-a-judge te valideren op een handmatige subset.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws