エージェンティックRAG、TRuSTベンチマーク、そしてNafanyaがそれとどう関係するか
DeepSeek
Nafanyaは、建設および価格文書向けのエージェンティックRAGアシスタントです。著者は、それをテストするためにTRuSTベンチマークを適応させ、アーキテクチャの変更を通じてメトリクスの改善を達成しました。
Nafanyaは、建設および価格設定における規範文書と技術文書向けのエージェント型RAGアシスタントであり、Nikolaiによって開発されました。プランナー、レトリーバー、評価者、ジェネレーター、クリティックからなるマルチエージェントアーキテクチャを使用しています。その検索能力をテストするために、著者はTRuSTベンチマークを適応させました。このベンチマークには、多段階の検索を必要とする324の複雑なロシア語の質問が含まれています。当初、システムのスコアは低かったものの、CoverageCriticを導入しアーキテクチャを最適化することで、Recall Allは0.25から0.45に改善され、回答の正確性は34%から56%に向上しました。その後、Final Criticが追加され、システムはQwenやDeepSeekなどの外部APIを使用しています。著者は、TRuSTがBrowseComp-Plusの方法論に基づいており、固定インデックスとさまざまな検索複雑性タイプを含むと述べています。
出典: Habr — хаб ИИ —
原文
