研究硬件与推理 🇷🇺 05.08.2026 18:01

Agentic RAG、TRuST 基准测试及其与Nafanya的关系

DeepSeekDeepSeek
Nafanya是一个用于建筑和定价文档的agentic RAG助手。作者调整了TRuST基准测试来对其进行测试,并通过架构更改实现了指标的改进。
Nafanya 是一款面向建筑和定价领域规范性与技术文档的智能体 RAG 助手,由 Nikolai 开发。它采用多智能体架构,包含规划器、检索器、评估器、生成器和评论器。为了测试其搜索能力,作者改编了 TRuST 基准,其中包含 324 个需要多步搜索的复杂俄语问题。最初,系统得分较低,但通过引入 CoverageCritic 并优化架构,召回率(Recall All)从 0.25 提升至 0.45,答案正确率从 34% 提升至 56%。后来,系统又加入了最终评论器(Final Critic),并使用了诸如 Qwen 和 DeepSeek 等外部 API。作者指出,TRuST 基于 BrowseComp-Plus 方法论,并包含固定索引和多种搜索复杂度类型。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻