LLM-wiki contre RAG : comparaison des méthodes de génération de réponses pour les documents d'entreprise
OpenAI
Google DeepMind
Anthropic
L'auteur a comparé LLM-wiki (basé sur un agent wiki) à un système RAG simple en utilisant un document synthétique appelé « Directive 401 ». Les résultats ont montré que LLM-wiki surpassait constamment le RAG en termes d'exhaustivité des réponses (rappel), tandis que la différence de précision était négligeable. Le coût de construction du wiki était inférieur à 3,7 $.
L'auteur a mené une expérience comparant deux approches pour générer des réponses basées sur des documents : LLM-wiki (inspiré par l'idée d'Andrej Karpathy) et un système RAG simple avec un récupérateur vectoriel. Le texte source était un document d'entreprise synthétique intitulé « Directive 401 » d'environ 100 000 caractères, préparé par le modèle gemma4:31b. Les questions (20 factuelles et 20 basées sur des cas) ont été synthétisées par le modèle gpt-5.1. Pour construire le wiki, le document source a été divisé en 25 parties (24 articles plus une page de titre), puis le fichier AGENTS.md a été ajouté dans Obsidian, et en utilisant Claude Code (Sonnet 5), 32 pages wiki ont été générées en 20 minutes pour un coût inférieur à 3,7 dollars. L'agent wiki était composé de quatre composants : Navigateur (gpt-4.1-mini), Lieur (gpt-4.1-mini), Collecteur de Contexte et Synthétiseur (gpt-4.1). Le système RAG utilisait LangChain, ChromaDB, FastAPI et des embeddings locaux ; les segments ont été créés en fonction du deuxième niveau de numérotation des articles (144 segments au total). L'évaluation a utilisé les métriques de Précision et de Rappel : les faits issus des réponses ont été comparés à une référence — la réponse d'un LLM ayant vu l'intégralité du texte. Les résultats de trois configurations de l'agent wiki (sans accès à la source, avec accès, avec accès et lieur) ont montré que le rappel médian pour LLM-wiki était d'environ 0,72 contre 0,54–0,57 pour RAG, avec des valeurs p allant de 10⁻⁸ à 10⁻¹¹ en utilisant le test de Wilcoxon. Pour la précision, la différence n'était statistiquement significative que dans deux configurations (p < 0,05) et a complètement disparu lors de l'ajout du lieur (p = 0,348). Le lieur n'a pas apporté d'amélioration statistiquement significative. L'accès à la source a modérément aidé sur les questions factuelles, mais l'effet était marginal. L'auteur note que les conclusions sont limitées à cet ensemble de données.
Source: Habr — хаб NLP —
original
