Domain-Routed Agents vs. Naïves RAG: Ein Vergleich bei einer Expertensystem-Aufgabe für ein Tabletop-Rollenspiel
Langfuse
Der Artikel beschreibt die Entwicklung eines Expertensystems für das Tabletop-Rollenspiel Vampire: The Masquerade und vergleicht einen domänengerouteten Multi-Agenten-Ansatz mit naïvem Vektor-RAG. Die Autoren erstellten eine Wissensbasis von 176 Dateien (~750.000 Token) aus einem offiziellen Wiki, kategorisiert in 7 Domänen. Sie bauten einen LangGraph-basierten Agenten mit einem Router, parallelen Domänen-Experten und einem Synthesizer und testeten ihn an 40 Fragen unterschiedlicher Komplexität. Der Agent übertraf naïves RAG beim Abrufen domänenübergreifender Fakten und bei der Behandlung von Fragen außerhalb des Themenbereichs.
Der Autor, ein Erzähler-Neuling für Vampire: The Masquerade, stand vor der Herausforderung, hunderte Seiten voller Regeln auswendig zu lernen. Zur Unterstützung baute er ein Expertensystem auf, das ein offizielles Community-Wiki als Wissensbasis nutzt. Das Wiki wurde mittels Playwright analysiert, bereinigt und in sieben Bereiche unterteilt: Mechanik, Disziplinen, Überlieferung, Clans, Sekten, Fertigkeiten und Eigenschaften. Dies ergab 176 Markdown-Dateien (ca. 750.000 Token). Statt naivem RAG (Retrieval-Augmented Generation), das bei bereichsübergreifenden Abfragen aufgrund von Aufteilung und semantischer Distanz versagt, implementierte der Autor eine Multi-Agenten-Architektur mit LangGraph. Das System besteht aus einer Blackboard (gemeinsamer Zustand), einem Router, der relevante Bereiche identifiziert, parallelen Experten-Agenten, die mithilfe eines read_document-Tools nur die notwendigen Dokumente lesen, und einem Synthesizer, der die endgültige Antwort erstellt. Zur Evaluierung wurden 40 Fragen erstellt: 10 faktische, 10 synthetische, 10 bereichsübergreifende, 5 Halluzinationstests (alte Überlieferung) und 5 bereichsfremde. Für jede Frage wurde eine Checkliste mit erforderlichen Fakten erstellt. Das System wurde mit einer naiven Vektor-RAG-Baseline verglichen, wobei Langfuse für Protokollierung und Bewertung verwendet wurde.
Quelle: Habr — хаб NLP —
Original
