ForschungHardware & Inferenz 🇷🇺 05.08.2026 18:01

Agentic RAG, TRuST-Benchmark und was Nafanya damit zu tun hat

DeepSeekDeepSeek
Nafanya ist ein agentischer RAG-Assistent für Bau- und Preisbildungsdokumentation. Der Autor hat den TRuST-Benchmark angepasst, um ihn zu testen, und durch architektonische Änderungen eine Verbesserung der Metriken erzielt.
Nafanya ist ein agentischer RAG-Assistent für normative und technische Dokumentation im Bau- und Preiswesen, entwickelt von Nikolai. Er verwendet eine Multi-Agenten-Architektur mit Planner, Retriever, Evaluator, Generator und Kritiker. Um die Suchfähigkeiten zu testen, hat der Autor den TRuST-Benchmark adaptiert, der 324 komplexe russischsprachige Fragen enthält, die mehrstufige Suchen erfordern. Anfangs erzielte das System niedrige Werte, aber durch die Einführung eines CoverageCritic und die Optimierung der Architektur verbesserte sich Recall All von 0,25 auf 0,45 und die Antwortkorrektheit von 34 % auf 56 %. Später wurde ein Final Critic hinzugefügt, und das System nutzt externe APIs wie Qwen und DeepSeek. Der Autor merkt an, dass TRuST auf der BrowseComp-Plus-Methodik basiert und einen festen Index sowie verschiedene Suchkomplexitätstypen umfasst.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten