Model 🇷🇺 27.07.2026 09:03

RAG: Tolok Ukur Lebih Penting daripada Kode. Kisah Bot di Mana Perbaikan 'Layak' Justru Memperburuk Hasil

Seorang pengembang membuat bot RAG untuk memoderasi obrolan kripto tetapi menemukan bahwa perbaikan standar—BM25 dan reranker—hanya menurunkan metrik. Satu-satunya perubahan yang efektif adalah mengkalibrasi ambang batas (threshold) cutoff. Artikel ini menekankan pentingnya pembuatan tolok ukur menyeluruh pada data Anda sendiri.
Seorang pengembang berniat membangun bot RAG untuk dukungan terarah bagi pengguna chat kripto: bot tersebut dimaksudkan untuk menemukan pertanyaan serupa dan menampilkan jawaban admin yang sudah ada. Menggunakan korpus sebanyak 3,9 juta pesan dan set evaluasi sebanyak 51 pertanyaan, ia mengukur baseline hit@3 untuk pencarian vektor murni sebesar 74%. Dalam upaya meningkatkan sistem, ia menambahkan pencarian hibrida dengan BM25 dan perangking-ulang silang-encoder (cross-encoder reranker). Kedua perubahan tersebut menurunkan metrik: hibrida menghasilkan 55%, perangking-ulang 64%, dan hibrida+perangking-ulang 57%. Analisis menunjukkan bahwa BM25 tidak efektif karena tidak adanya token yang tepat dalam korpus pertanyaan sampel, sementara perangking-ulang merusak peringkat yang sudah baik. Satu-satunya perubahan yang bermanfaat adalah menyesuaikan ambang batas pemotongan (cutoff threshold) agar sesuai dengan peran bot (sebagai cadangan, bukan pemberi jawaban akhir): hal ini meningkatkan keluaran yang berguna tanpa memerlukan kode tambahan. Kesimpulan utamanya adalah bahwa dalam RAG, yang penting bukanlah standar industri, melainkan pengukuran yang jujur dan pembersihan data.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru