RAG agentique, benchmark TRuST et le lien avec Nafanya
DeepSeek
Nafanya est un assistant RAG agentique pour la documentation de construction et de tarification. L'auteur a adapté le benchmark TRuST pour le tester, obtenant une amélioration des métriques grâce à des changements architecturaux.
Nafanya est un assistant RAG agentique pour la documentation normative et technique dans le secteur de la construction et de la tarification, développé par Nikolai. Il utilise une architecture multi-agents comprenant un planificateur, un récupérateur, un évaluateur, un générateur et un critique. Pour tester ses capacités de recherche, l'auteur a adapté le benchmark TRuST, qui contient 324 questions complexes en langue russe nécessitant une recherche en plusieurs étapes. Au départ, le système obtenait des scores faibles, mais en introduisant un CoverageCritic et en optimisant l'architecture, le rappel global est passé de 0,25 à 0,45 et l'exactitude des réponses de 34 % à 56 %. Par la suite, un critique final a été ajouté, et le système utilise des API externes telles que Qwen et DeepSeek. L'auteur note que TRuST repose sur la méthodologie BrowseComp-Plus et comprend un index fixe et différents types de complexité de recherche.
Source: Habr — хаб ИИ —
original
