LLM-wiki frente a RAG: Comparación de métodos de generación de respuestas para documentos corporativos
OpenAI
Google DeepMind
Anthropic
El autor comparó LLM-wiki (basado en un agente wiki) con un sistema RAG simple utilizando un documento sintético llamado "Directiva 401". Los resultados mostraron que LLM-wiki superó consistentemente a RAG en completitud de respuestas (recuperación), mientras que la diferencia en precisión fue insignificante. El costo de construir el wiki fue inferior a 3,7 dólares.
El autor realizó un experimento comparando dos enfoques para generar respuestas basadas en documentos: LLM-wiki (inspirado en la idea de Andrej Karpathy) y un sistema RAG simple con un recuperador vectorial. El texto fuente era un documento corporativo sintético titulado "Directive 401" de aproximadamente 100,000 caracteres, preparado por el modelo gemma4:31b. Las preguntas (20 factuales y 20 basadas en casos) fueron sintetizadas por el modelo gpt-5.1. Para construir la wiki, el documento fuente se dividió en 25 partes (24 artículos más una portada), luego se añadió el archivo AGENTS.md en Obsidian y, usando Claude Code (Sonnet 5), se generaron 32 páginas wiki en 20 minutos a un costo de menos de $3.7. El agente wiki constaba de cuatro componentes: Navigator (gpt-4.1-mini), Linker (gpt-4.1-mini), Context Collector y Synthesizer (gpt-4.1). El sistema RAG usó LangChain, ChromaDB, FastAPI y embeddings locales; los fragmentos se crearon basándose en el segundo nivel de numeración de artículos (144 fragmentos en total). La evaluación utilizó las métricas de Precisión y Recuperación: los hechos de las respuestas se compararon con una referencia: la respuesta de un LLM que había visto el texto completo. Los resultados de tres configuraciones del agente wiki (sin acceso a la fuente, con acceso, con acceso y linker) mostraron que la mediana de recuperación para LLM-wiki fue de aproximadamente 0.72 en comparación con 0.54–0.57 para RAG, con valores p desde 10⁻⁸ hasta 10⁻¹¹ usando la prueba de Wilcoxon. En cuanto a precisión, la diferencia fue estadísticamente significativa solo en dos configuraciones (p < 0.05) y desapareció por completo cuando se añadió el linker (p = 0.348). El linker no proporcionó una mejora estadísticamente significativa. El acceso a la fuente ayudó moderadamente en las preguntas factuales, pero el efecto fue marginal. El autor señala que las conclusiones se limitan a este conjunto de datos.
Fuente: Habr — хаб NLP —
original
