Agentic RAG, TRuST Benchmark en wat Nafanya ermee te maken heeft
DeepSeek
Nafanya is een agentische RAG-assistent voor bouw- en prijsdocumentatie. De auteur heeft de TRuST-benchmark aangepast om deze te testen en behaalde verbetering in meetwaarden door architecturale wijzigingen.
Nafanya is een agentische RAG-assistent voor normatieve en technische documentatie in de bouw en prijsstelling, ontwikkeld door Nikolai. Het maakt gebruik van een multi-agentarchitectuur met een planner, retriever, evaluator, generator en criticus. Om de zoekmogelijkheden te testen, heeft de auteur de TRuST-benchmark aangepast, die 324 complexe vragen in het Russisch bevat die een zoektocht in meerdere stappen vereisen. Aanvankelijk scoorde het systeem laag, maar door de introductie van een CoverageCritic en het optimaliseren van de architectuur verbeterde Recall All van 0,25 naar 0,45 en de juistheid van antwoorden van 34% naar 56%. Later werd een Final Critic toegevoegd, en het systeem maakt gebruik van externe API's zoals Qwen en DeepSeek. De auteur merkt op dat TRuST is gebaseerd op de BrowseComp-Plus-methodologie en een vaste index en verschillende typen zoekcomplexiteit omvat.
Bron: Habr — хаб ИИ —
origineel
