LLM-wiki versus RAG: Vergelijking van antwoordgeneratiemethoden voor bedrijfsdocumenten
OpenAI
Google DeepMind
Anthropic
De auteur vergeleek LLM-wiki (gebaseerd op een wiki-agent) met een eenvoudig RAG-systeem met behulp van een synthetisch document genaamd 'Directive 401'. Resultaten toonden aan dat LLM-wiki consequent beter presteerde dan RAG in antwoordvolledigheid (recall), terwijl het verschil in precisie verwaarloosbaar was. De kosten om de wiki te bouwen waren minder dan 3,7 Amerikaanse dollar.
De auteur voerde een experiment uit waarbij twee benaderingen voor het genereren van antwoorden op basis van documenten werden vergeleken: LLM-wiki (geïnspireerd door het idee van Andrej Karpathy) en een eenvoudig RAG-systeem met een vectorretriever. De brontekst was een synthetisch bedrijfsdocument met de titel 'Directive 401' van ongeveer 100.000 tekens, opgesteld door het model gemma4:31b. Vragen (20 feitelijke en 20 casusgebaseerde) werden gegenereerd door het model gpt-5.1. Voor de opbouw van de wiki werd het brondocument opgesplitst in 25 delen (24 artikelen plus een titelpagina), waarna het bestand AGENTS.md werd toegevoegd in Obsidian. Met behulp van Claude Code (Sonnet 5) werden in 20 minuten 32 wiki-pagina's gegenereerd tegen een kostprijs van minder dan $ 3,70. De wiki-agent bestond uit vier componenten: Navigator (gpt-4.1-mini), Linker (gpt-4.1-mini), Context Collector en Synthesizer (gpt-4.1). Het RAG-systeem gebruikte LangChain, ChromaDB, FastAPI en lokale embeddings; chunks werden gemaakt op basis van het tweede niveau van artikelnummering (144 chunks in totaal). De evaluatie maakte gebruik van de metrieken Precisie en Recall: feiten uit de antwoorden werden vergeleken met een referentie – het antwoord van een LLM dat de volledige tekst had gezien. Resultaten van drie wiki-agentconfiguraties (geen toegang tot de bron, met toegang, met toegang en linker) toonden aan dat de mediane recall voor LLM-wiki ongeveer 0,72 bedroeg, vergeleken met 0,54–0,57 voor RAG, met p-waarden van 10⁻⁸ tot 10⁻¹¹ met behulp van de Wilcoxon-toets. Wat betreft precisie was het verschil alleen statistisch significant in twee configuraties (p < 0,05) en verdween het volledig wanneer de linker werd toegevoegd (p = 0,348). De linker leverde geen statistisch significante verbetering op. Toegang tot de bron hielp matig bij feitelijke vragen, maar het effect was marginaal. De auteur merkt op dat de conclusies beperkt zijn tot deze dataset.
Bron: Habr — хаб NLP —
origineel
