LLM-wiki vs. RAG: Vastausgenerointimenetelmien vertailu yritysdokumenteille
OpenAI
Google DeepMind
Anthropic
Kirjoittaja vertasi LLM-wikiä (wiki-agenttiin perustuva) yksinkertaiseen RAG-järjestelmään käyttäen synteettistä dokumenttia nimeltä "Directive 401." Tulokset osoittivat, että LLM-wiki suoriutui jatkuvasti RAG:ia paremmin vastausten täydellisyydessä (saanti), kun taas tarkkuuden ero oli vähäinen. Wikin rakentamisen kustannukset olivat alle 3,7 dollaria.
Kirjoittaja teki kokeen, jossa verrattiin kahta lähestymistapaa dokumenttipohjaisten vastausten tuottamiseen: LLM-wiki (Andrej Karpathyn ideasta inspiroitunut menetelmä) ja yksinkertainen RAG-järjestelmä vektoripohjaisella hakukomponentilla. Lähdetekstinä käytettiin synteettistä, noin 100 000 merkin pituista yritysdokumenttia nimeltä "Directive 401", jonka laati gemma4:31b-malli. Kysymykset (20 faktapohjaista ja 20 tapauspohjaista) synteesoi gpt-5.1-malli. Wikin rakentamista varten lähdedokumentti jaettiin 25 osaan (24 artiklaa sekä otsikkosivu), minkä jälkeen Obsidianiin lisättiin tiedosto AGENTS.md, ja Claude Code (Sonnet 5) -työkalulla generoitiin 32 wiki-sivua 20 minuutissa alle 3,7 dollarin kustannuksella. Wiki-agentti koostui neljästä komponentista: Navigator (gpt-4.1-mini), Linker (gpt-4.1-mini), Context Collector sekä Synthesizer (gpt-4.1). RAG-järjestelmä käytti LangChainia, ChromaDB:tä, FastAPI:ta ja paikallisia upotuksia (embeddings); pilkkeet (chunks) muodostettiin artikkelinumeroinnin toisen tason perusteella, ja niitä syntyi yhteensä 144. Arvioinnissa käytettiin Precision- ja Recall-mittareita: vastauksista poimittuja faktoja verrattiin referenssiin eli sellaisen kielimallin vastaukseen, joka oli nähnyt koko tekstin. Kolmen wiki-agenttikonfiguraation tulokset (ei pääsyä lähteeseen, pääsy lähteeseen, pääsy lähteeseen ja linkitin käytössä) osoittivat, että LLM-wikin mediaani-recall oli noin 0,72 verrattuna RAG:n 0,54–0,57:ään, ja p-arvot vaihtelivat välillä 10⁻⁸–10⁻¹¹ Wilcoxonin testissä. Precisionin osalta ero oli tilastollisesti merkitsevä vain kahdessa konfiguraatiossa (p < 0,05) ja katosi kokonaan, kun linkitin lisättiin (p = 0,348). Linkitin ei tuonut tilastollisesti merkitsevää parannusta. Pääsy lähteeseen auttoi kohtalaisesti faktakysymyksissä, mutta vaikutus jäi marginaaliseksi. Kirjoittaja huomauttaa, että johtopäätökset rajoittuvat tähän aineistoon.
Lähde: Habr — хаб NLP —
Alkuperäinen
