PesquisaModelos 🇷🇺 27.07.2026 02:04

LLM-wiki vs. RAG: Comparação de Métodos de Geração de Respostas para Documentos Corporativos

OpenAIOpenAI Google DeepMindGoogle DeepMind AnthropicAnthropic
O autor comparou o LLM-wiki (baseado em um agente wiki) com um sistema RAG simples, utilizando um documento sintético chamado "Diretiva 401." Os resultados mostraram que o LLM-wiki teve desempenho consistentemente superior ao RAG em completude das respostas (recall), enquanto a diferença em precisão foi insignificante. O custo para construir o wiki foi inferior a US$ 3,70.
O autor conduziu um experimento comparando duas abordagens para geração de respostas baseadas em documentos: LLM-wiki (inspirada na ideia de Andrej Karpathy) e um sistema RAG simples com recuperador vetorial. O texto-fonte foi um documento corporativo sintético intitulado "Diretiva 401", com cerca de 100 mil caracteres, preparado pelo modelo gemma4:31b. As perguntas (20 factuais e 20 baseadas em casos) foram sintetizadas pelo modelo gpt-5.1. Para construir a wiki, o documento-fonte foi dividido em 25 partes (24 artigos mais uma página de título); em seguida, o arquivo AGENTS.md foi adicionado no Obsidian e, usando Claude Code (Sonnet 5), 32 páginas wiki foram geradas em 20 minutos, a um custo inferior a US$ 3,7. O agente wiki consistia em quatro componentes: Navigator (gpt-4.1-mini), Linker (gpt-4.1-mini), Coletor de Contexto e Synthesizer (gpt-4.1). O sistema RAG usou LangChain, ChromaDB, FastAPI e embeddings locais; os chunks foram criados com base no segundo nível da numeração dos artigos (144 chunks no total). A avaliação utilizou as métricas Precisão e Recall: os fatos das respostas foram comparados com uma referência — a resposta de um LLM que havia visto o texto completo. Resultados de três configurações do agente wiki (sem acesso à fonte, com acesso, com acesso e linker) mostraram que o recall mediano para LLM-wiki foi de aproximadamente 0,72, contra 0,54–0,57 para RAG, com valores de p de 10⁻⁸ a 10⁻¹¹ usando o teste de Wilcoxon. Para precisão, a diferença foi estatisticamente significativa apenas em duas configurações (p < 0,05) e desapareceu completamente quando o linker foi adicionado (p = 0,348). O linker não proporcionou melhora estatisticamente significativa. O acesso à fonte ajudou moderadamente nas perguntas factuais, mas o efeito foi marginal. O autor observa que as conclusões são limitadas a esse conjunto de dados.
Fonte: Habr — хаб NLP — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas