ForschungModelle 🇷🇺 27.07.2026 02:04

LLM-wiki vs. RAG: Vergleich von Antwortgenerierungsmethoden für Unternehmensdokumente

OpenAIOpenAI Google DeepMindGoogle DeepMind AnthropicAnthropic
Der Autor verglich LLM-wiki (basiert auf einem Wiki-Agenten) mit einem einfachen RAG-System unter Verwendung eines synthetischen Dokuments namens „Richtlinie 401“. Die Ergebnisse zeigten, dass LLM-wiki durchgängig besser abschnitt als RAG in Bezug auf die Vollständigkeit der Antworten (Recall), während der Unterschied in der Präzision vernachlässigbar war. Die Kosten für den Aufbau des Wikis betrugen weniger als 3,7 Dollar.
Der Autor führte ein Experiment durch, bei dem zwei Ansätze zur Generierung dokumentenbasierter Antworten verglichen wurden: LLM-Wiki (inspiriert von Andrej Karpathys Idee) und ein einfaches RAG-System mit einem Vektor-Retriever. Der Quelltext war ein synthetisches Unternehmensdokument mit dem Titel „Directive 401“ mit etwa 100.000 Zeichen, das vom Modell gemma4:31b erstellt wurde. Die Fragen (20 faktische und 20 fallbasierte) wurden vom Modell gpt-5.1 synthetisiert. Für den Aufbau des Wikis wurde das Quelldokument in 25 Teile aufgeteilt (24 Artikel plus eine Titelseite). Anschließend wurde die Datei AGENTS.md in Obsidian hinzugefügt, und mit Claude Code (Sonnet 5) wurden in 20 Minuten 32 Wiki-Seiten zu Kosten von weniger als 3,7 US-Dollar generiert. Der Wiki-Agent bestand aus vier Komponenten: Navigator (gpt-4.1-mini), Linker (gpt-4.1-mini), Context Collector und Synthesizer (gpt-4.1). Das RAG-System verwendete LangChain, ChromaDB, FastAPI und lokale Embeddings; die Chunks wurden basierend auf der zweiten Gliederungsebene der Artikelnummerierung erstellt (insgesamt 144 Chunks). Die Evaluation nutzte die Metriken Precision und Recall: Die Fakten aus den Antworten wurden mit einer Referenz verglichen – der Antwort eines LLM, das den gesamten Text gesehen hatte. Die Ergebnisse von drei Wiki-Agent-Konfigurationen (kein Zugriff auf die Quelle, mit Zugriff, mit Zugriff und Linker) zeigten, dass der mediane Recall für LLM-Wiki bei etwa 0,72 lag, verglichen mit 0,54–0,57 für RAG, mit p-Werten von 10⁻⁸ bis 10⁻¹¹ im Wilcoxon-Test. Bei der Precision war der Unterschied nur in zwei Konfigurationen statistisch signifikant (p < 0,05) und verschwand vollständig, wenn der Linker hinzugefügt wurde (p = 0,348). Der Linker brachte keine statistisch signifikante Verbesserung. Der Zugriff auf die Quelle half bei Faktenfragen moderat, aber der Effekt war marginal. Der Autor merkt an, dass die Schlussfolgerungen auf diesen Datensatz beschränkt sind.
Quelle: Habr — хаб NLP — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten