Tutkimus 🇷🇺 15.08.2026 04:02

Rehellisen RAG-arviointijoukon rakentaminen: Kuinka kerätä ensimmäiset 100–300 tapausta itseään huijaamatta

MicrosoftMicrosoft
Artikkelissa käsitellään manuaalisen arviointijoukon luomisen tärkeyttä RAG-järjestelmille, erillään savutestistä ja harjoitusdatasta. Ehdotetaan 100–300 huolellisesti valitun tapauksen keräämistä useista skenaarioista, hakemisen ja vastauksen tuottamisen erillistä merkitsemistä sekä mittareita kuten Recall@k, MRR@k ja nDCG@k. Synteettinen data ja julkiset vertailuaineistot eivät riitä domain-kohtaiseen hakemisen arviointiin.
Kirjoittaja väittää, että julkiset vertailuaineistot, kuten MTEB ja BEIR, eivät takaa hyvää hakua toimialakohtaisissa tehtävissä, ja että synteettinen data voi johtaa liian siisteihin muotoiluihin. Sen sijaan he suosittelevat manuaalisen arviointijoukon rakentamista 100–300 tapauksesta, käytännöllisenä alkuna 120 tapausta, jotka on kerätty lokeista, dokumentaatiosta, asiantuntijahaastatteluista ja tarkistetuista synteettisistä ehdokkaista. Jokaisen tapauksen tulisi sisältää kentät, kuten kysely, skenaario, odotetut dokumenttitunnukset, kultaiset todisteet, odotetut faktat, vastattavuus ja miksi se on tärkeää. Joukko tulisi jakaa 6–8 osaan, jotka kattavat tarkat entiteetit, parafraasit, pitkät osiot, taulukot, versiot, tapaukset ilman vastausta, huonon muotoilun ja arkaluonteiset skenaariot. Haku ja vastausten tuottaminen tulisi arvioida erikseen, hakumittareina Recall@k, MRR@k ja nDCG@k, ja vastausmittareina perusteltavuus, täydellisyys, vastauksen relevanssi ja oikea pidättäytyminen. Kirjoittaja korostaa, että tapauksissa ilman vastausta tavallinen recall on merkityksetön, ja ehdottaa erillistä julkaisukynnystä. He myös varoittavat käyttämästä koulutusdataa arviointijoukossa ja suosittelevat LLM-tuomarin validointia manuaalisella osajoukolla.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset