RAG Agêntico, Benchmark TRuST e o que Nafanya tem a ver com isso
DeepSeek
Nafanya é um assistente RAG agêntico para documentação de construção e precificação. O autor adaptou o benchmark TRuST para testá-lo, alcançando melhoria nas métricas por meio de mudanças arquiteturais.
Nafanya é um assistente RAG agêntico para documentação normativa e técnica em construção e precificação, desenvolvido por Nikolai. Ele utiliza uma arquitetura multiagente com planejador, recuperador, avaliador, gerador e crítico. Para testar suas capacidades de busca, o autor adaptou o benchmark TRuST, que contém 324 perguntas complexas em russo que exigem busca em múltiplas etapas. Inicialmente, o sistema obteve pontuação baixa, mas ao introduzir um CoverageCritic e otimizar a arquitetura, o Recall All melhorou de 0,25 para 0,45 e a precisão das respostas subiu de 34% para 56%. Posteriormente, foi adicionado um Final Critic, e o sistema utiliza APIs externas como Qwen e DeepSeek. O autor observa que o TRuST é baseado na metodologia BrowseComp-Plus e inclui índice fixo e vários tipos de complexidade de busca.
Fonte: Habr — хаб ИИ —
original
