Testausluettelo haku- ja RAG-järjestelmille: kuusi tarkistustasoa
Esitellään testausluettelo haku- ja RAG (Retrieval-Augmented Generation) -järjestelmille, joka kattaa kuusi tarkistustasoa – perustoiminnallisuudesta puutteellisen datan käsittelyyn. Kuvataan mittarit, työkalut ja yli 50 termin sanasto. Korostetaan tasojen järjestyksen tärkeyttä: RAG:n arvioinnissa ei ole järkeä, jos nollataso ei ole läpäisty.
Häbrissä on julkaistu yksityiskohtainen tarkistuslista hakukoneiden ja RAG-arkkitehtuurien testaamiseen. Kirjoittajat tunnistavat kuusi tarkistustasoa: Taso 0 — toiminnallisuus (hakukone hakee määritetyistä kentistä, korjaa kirjoitusvirheet, käsittelee tyhjät kyselyt ja erikoismerkit); Taso 1 — klassinen tiedonhaku, jossa käytetään mittareita Precision@k, Recall@k, NDCG, MRR ja MAP merkityssä kultaisessa kyselyjoukossa; Taso 2 — haetun kontekstin laatu RAG:lle (kontekstuaalinen tarkkuus ja palautus); Taso 3 — RAG-generoinnin laatu (uskollisuus, hallusinaatioaste, vastauksen relevanssi, täydellisyys ja tarkkuus lähdeviittauksissa); Taso 4 — agenttimaisuus ja navigointi tietograafeissa (monivaiheisuus, työkalujen oikeellisuus, tehtävän suorittaminen, suunnitelman noudattaminen); Taso 5 — epätäydellisten ja heikosti liittyvien tietojen käsittely (pidättäytyminen, yli-ekstrapolointi, ristiriita vanhentuneiden ja ajankohtaisten tietojen välillä). Jokaiselle tasolle on annettu suositeltuja työkaluja: pytest, Hypothesis, Postman ja k6 tasolle 0; ranx, trec_eval tasolle 1; deepeval, RAGAS ja TruLens tasoille 2–4; räätälöity G-Eval tasolle 5. Erityistä painoa on asetettu peräkkäisen testauksen tarpeelle — RAG-mittareiden arvioinnissa ei ole järkeä, jos hakukone epäonnistuu perustesteissä, kuten ei löydä dokumenttia kirjoitusvirheen vuoksi.
Lähde: Habr — хаб NLP —
Alkuperäinen
