ToepassingenOnderzoek 🇷🇺 27.07.2026 09:05

Testchecklist voor zoek- en RAG-systemen: zes niveaus van controles

Er wordt een checklist gepresenteerd voor het testen van zoek- en RAG-systemen (Retrieval-Augmented Generation), die zes niveaus van controles beslaat — van basisfunctionaliteit tot het omgaan met onvolledige gegevens. Er worden statistieken, hulpmiddelen en een woordenlijst met meer dan 50 termen beschreven. Het belang van de volgorde van niveaus wordt benadrukt: het heeft geen zin om RAG te evalueren als niveau nul niet is doorstaan.
Op Habr is een gedetailleerde checklist gepubliceerd voor het testen van zoekmachines en RAG-architecturen. De auteurs identificeren zes niveaus van controles: Niveau 0 — functioneel (de engine haalt op via gespecificeerde velden, corrigeert typefouten, verwerkt lege query's en speciale tekens); Niveau 1 — klassieke Information Retrieval met metrieken Precision@k, Recall@k, NDCG, MRR, MAP op een gelabelde gouden queryset; Niveau 2 — kwaliteit van opgehaalde context voor RAG (Contextual Precision en Recall); Niveau 3 — kwaliteit van RAG-generatie (Faithfulness, Hallucination Rate, Answer Relevance, Completeness, citatienauwkeurigheid); Niveau 4 — agency en navigatie door kennisgrafieken (multi-hop, toolcorrectheid, taakvoltooiing, planuitvoering); Niveau 5 — omgaan met onvolledige en losjes gerelateerde gegevens (abstentie, over-extrapolatie, conflict tussen verouderde en actuele gegevens). Voor elk niveau worden aanbevolen tools gegeven: pytest, Hypothesis, Postman, k6 voor Niveau 0; ranx, trec_eval voor Niveau 1; deepeval, RAGAS, TruLens voor Niveaus 2–4; op maat gemaakte G-Eval voor Niveau 5. Er wordt speciale nadruk gelegd op de noodzaak van sequentieel testen — het heeft geen zin om RAG-metrieken te evalueren als de zoekmachine basistests faalt, zoals het niet vinden van een document vanwege een typefout.
Bron: Habr — хаб NLP — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws