Agentic RAG, Benchmark TRuST, dan Apa Hubungannya dengan Nafanya
DeepSeek
Nafanya adalah asisten agentic RAG untuk dokumentasi konstruksi dan penetapan harga. Penulis mengadaptasi benchmark TRuST untuk mengujinya, mencapai peningkatan metrik melalui perubahan arsitektur.
Nafanya adalah asisten RAG agen untuk dokumentasi normatif dan teknis dalam konstruksi dan penetapan harga, yang dikembangkan oleh Nikolai. Asisten ini menggunakan arsitektur multi-agen dengan perencana, pengambil, penilai, generator, dan kritikus. Untuk menguji kemampuan pencariannya, penulis mengadaptasi tolok ukur TRuST, yang berisi 324 pertanyaan kompleks berbahasa Rusia yang memerlukan pencarian multi-langkah. Awalnya, sistem ini mendapat skor rendah, tetapi dengan memperkenalkan CoverageCritic dan mengoptimalkan arsitektur, Recall All meningkat dari 0,25 menjadi 0,45 dan kebenaran jawaban dari 34% menjadi 56%. Belakangan, Final Critic ditambahkan, dan sistem ini menggunakan API eksternal seperti Qwen dan DeepSeek. Penulis mencatat bahwa TRuST didasarkan pada metodologi BrowseComp-Plus dan mencakup indeks tetap serta berbagai jenis kompleksitas pencarian.
Sumber: Habr — хаб ИИ —
asli
