Membangun Basis Pengetahuan Agen AI dan Mengujinya pada Tes Medis Saya Sendiri
Seorang pengembang backend di Iskra menguji basis pengetahuan agen AI perusahaannya dengan mengunggah hasil tes medisnya sendiri, karena ia dapat segera menemukan kesalahan dalam jawaban tentang data laboratoriumnya sendiri. Sistem ini menggunakan pendekatan seperti sistem file dengan mirror dokumen, grep, dan tautan grafik alih-alih RAG klasik, yang berfungsi dengan baik tetapi memiliki kelemahan seperti agen yang lupa mengakses basis pengetahuan.
Penulis, seorang pengembang backend di Iskra, membangun basis pengetahuan untuk agen AI dan mengujinya dengan hasil pemeriksaan medisnya sendiri, yang dia hafal, sehingga kesalahan menjadi jelas. Sistem ini bekerja seperti sistem file yang disiapkan, bukan indeks pencarian: setiap file mendapatkan file .md yang dicerminkan dengan header YAML, dan agen menavigasi melalui ls, grep, read, dan mengikuti tautan. Pendekatan ini mengungguli RAG klasik untuk jawaban multi-dokumen dan kutipan sumber, karena agen membaca seluruh dokumen, bukan potongan-potongan. Namun, agen terkadang lupa mengakses basis pengetahuan, seperti yang terlihat ketika ia mengaku tidak melihat file terlampir, lalu pada percobaan ulang membaca ketujuh file dan memberikan ringkasan yang benar. Masalah tambahan termasuk penggantian nama file yang aneh (beberapa judul dalam bahasa Latin), ketidakakuratan parafrase dalam kutipan, dan biaya token yang lebih tinggi—sekitar 10–15 panggilan alat per kueri kompleks. Penulis juga mencatat bahwa sistem ini tidak sepenuhnya sempurna: model dapat mengutip sumber tetapi masih berhalusinasi, sehingga daftar sumber di sisi server sangat penting.
Sumber: Habr — хаб NLP —
asli
