Model 🇷🇺 27.07.2026 09:03

RAG: Measurements Matter More Than Code. The Story of a Bot Where 'Correct' Improvements Worsened Results

A developer built a RAG bot for moderating crypto chats but found that standard improvements—BM25 and a reranker—only degraded metrics. The only change that worked was calibrating the cutoff threshold. The article emphasizes the importance of careful measurements on one's own data.
Seorang pengembang memutuskan untuk membuat bot RAG guna memberikan dukungan yang ditargetkan kepada pengguna chat crypto: bot harus menemukan permintaan serupa dan menampilkan jawaban siap pakai dari admin. Pada korpus berisi 3,9 juta pesan dan set eval yang terdiri dari 51 pertanyaan, ia mengukur hit@3 dasar dari pencarian vektor murni sebesar 74%. Saat mencoba meningkatkan sistem, ia menambahkan pencarian hybrid dengan BM25 dan re-ranker cross-encoder. Kedua perubahan tersebut justru menurunkan metrik: hybrid menghasilkan 55%, re-ranker 64%, dan hybrid+re-ranker 57%. Analisis menunjukkan bahwa BM25 tidak efektif karena tidak adanya token yang tepat dalam korpus contoh pertanyaan, sementara re-ranker merusak perangkingan yang sudah baik. Satu-satunya perubahan yang berguna adalah penyesuaian ambang batas pemotongan berdasarkan peran bot (sebagai cadangan, bukan penjawab akhir): ini meningkatkan hasil yang berguna tanpa memerlukan kode tambahan. Kesimpulan utamanya adalah bahwa dalam RAG, yang penting bukanlah pengaturan default industri, melainkan pengukuran yang jujur dan pembersihan data.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru