Agen 🇷🇺 30.07.2026 17:01

Mengapa Agen AI Sebenarnya Lebih Murah daripada RAG

Meskipun asisten RAG klasik tampak lebih murah per kueri, biaya tersembunyi seperti tindak lanjut pengguna dan eskalasi operator membuatnya lebih mahal secara keseluruhan. Agen yang menggunakan loop ReAct secara otonom mencari di berbagai dokumen hingga menemukan jawaban lengkap, mengubah proses 3 percobaan selama 27 menit menjadi satu jawaban dalam 4 menit. Data pilot nyata dari proyek dukungan mengonfirmasi bahwa agen menutup pertanyaan dengan biaya sepertiga dari biaya asisten RAG.
Artikel tersebut berpendapat bahwa perbandingan biaya naif antara asisten RAG dan agen adalah menyesatkan. Asisten RAG klasik melakukan satu panggilan LLM dan mengandalkan pengguna untuk memperbaiki kueri jika jawabannya salah. Dalam praktiknya, pengguna sering menyerah setelah 2–3 kali percobaan, lalu melibatkan operator manusia yang menghabiskan 10–15 menit untuk menyelesaikan kasus. Hal ini menghasilkan biaya yang jauh lebih besar daripada satu panggilan LLM saja. Agen yang didasarkan pada loop ReAct secara otonom melakukan iterasi pada alat pencarian, membuat hipotesis, mengambil potongan informasi, dan mensintesis jawaban akhir tanpa campur tangan pengguna. Agen ISTOK milik penulis menggunakan lima alat: VectorSearch (hibrida dense+BM25 melalui Milvus), Search (PostgreSQL full-text), OpenChunk untuk membaca potongan dokumen lengkap, GetDocumentChunks untuk daftar isi, dan CallOperator sebagai langkah terakhir setelah 2–3 kali percobaan sendiri. Untuk mengelola batas jendela konteks, agen awalnya mencoba peringkasan LLM tetapi ternyata mahal dan tidak dapat diandalkan; sekarang menggunakan jendela geser (menyimpan 6 pesan terakhir, menghapus pesan alat tertua) dengan peringkasan sebagai fallback (maksimal 2 per sesi). Panggilan LLM juga dibedakan: embeddings dan reranking murah, generasi ringan untuk langkah sederhana, medium untuk penalaran biasa, dan berat hanya untuk sintesis akhir atau peringkasan. Dalam uji coba nyata dengan ~1.200 dokumen dan 1.800 permintaan bulanan, asisten rata-rata melakukan 1 panggilan LLM, 2,3 tindak lanjut pengguna, 34% tingkat eskalasi, 27 menit untuk menutup kasus, dan ~18.000 token per pertanyaan tertutup. Agen rata-rata melakukan 6,4 panggilan LLM, 0,3 tindak lanjut, 11% eskalasi, 4 menit untuk menutup kasus, dan ~15.500 token. Dalam biaya langsung, biaya pertanyaan tertutup asisten sekitar 52 RUB (termasuk biaya operator), sedangkan biaya agen sekitar 17 RUB, pengurangan tiga kali lipat. Keunggulan agen menghilang untuk pertanyaan faktual sederhana atau ketika basis pengetahuan kosong, karena agen membuang iterasi. Agen mencatat penggunaan token dan riwayat alat setiap panggilan, dengan pelacakan melalui Arize Phoenix untuk rincian iterasi yang mendetail.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru