연구하드웨어 및 추론 🇷🇺 05.08.2026 18:01

Agentic RAG, TRuST 벤치마크, 그리고 Nafanya와의 연관성

DeepSeekDeepSeek
Nafanya는 건설 및 견적 문서를 위한 에이전틱 RAG 어시스턴트입니다. 저자는 이를 테스트하기 위해 TRuST 벤치마크를 적용했으며, 아키텍처 변경을 통해 지표가 개선되었습니다.
Nafanya는 Nikolai가 개발한 건설 및 가격 책정 분야의 규범적·기술적 문서를 위한 에이전틱 RAG 어시스턴트입니다. 이 시스템은 플래너, 검색기, 평가기, 생성기, 비평가로 구성된 다중 에이전트 아키텍처를 사용합니다. 검색 기능을 테스트하기 위해 저자는 324개의 복잡한 러시아어 질문을 포함하는 TRuST 벤치마크를 적용했으며, 이 질문들은 다단계 검색을 요구합니다. 초기에 시스템의 점수는 낮았지만, CoverageCritic을 도입하고 아키텍처를 최적화한 결과, Recall All이 0.25에서 0.45로 개선되고 답변 정확도가 34%에서 56%로 향상되었습니다. 이후 Final Critic을 추가했으며, 시스템은 Qwen 및 DeepSeek과 같은 외부 API를 사용합니다. 저자는 TRuST가 BrowseComp-Plus 방법론을 기반으로 하며 고정 인덱스와 다양한 검색 복잡성 유형을 포함한다고 언급합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스