RisetModel 🇷🇺 27.07.2026 02:04

LLM-wiki vs. RAG: Perbandingan Metode Pembangkitan Jawaban untuk Dokumen Perusahaan

OpenAIOpenAI Google DeepMindGoogle DeepMind AnthropicAnthropic
Penulis membandingkan LLM-wiki (berdasarkan agen wiki) dengan sistem RAG sederhana menggunakan dokumen sintetis bernama "Directive 401." Hasil menunjukkan bahwa LLM-wiki secara konsisten mengungguli RAG dalam kelengkapan jawaban (recall), sementara perbedaan dalam presisi tidak signifikan. Biaya untuk membangun wiki tersebut kurang dari $3.7.
Penulis melakukan eksperimen yang membandingkan dua pendekatan untuk menghasilkan jawaban berbasis dokumen: LLM-wiki (terinspirasi dari ide Andrej Karpathy) dan sistem RAG sederhana dengan pengambil vektor. Teks sumber adalah dokumen perusahaan sintetis berjudul "Directive 401" sepanjang sekitar 100.000 karakter, yang disiapkan oleh model gemma4:31b. Pertanyaan (20 faktual dan 20 berbasis studi kasus) disintesis oleh model gpt-5.1. Untuk membangun wiki, dokumen sumber dibagi menjadi 25 bagian (24 artikel ditambah halaman judul), kemudian file AGENTS.md ditambahkan di Obsidian, dan menggunakan Claude Code (Sonnet 5), 32 halaman wiki dihasilkan dalam 20 menit dengan biaya kurang dari $3,7. Agen wiki terdiri dari empat komponen: Navigator (gpt-4.1-mini), Penghubung atau Linker (gpt-4.1-mini), Pengumpul Konteks atau Context Collector, dan Sintesis atau Synthesizer (gpt-4.1). Sistem RAG menggunakan LangChain, ChromaDB, FastAPI, dan embeddings lokal; potongan dibuat berdasarkan level kedua penomoran artikel (total 144 potongan). Evaluasi menggunakan metrik Precision dan Recall: fakta dari jawaban dibandingkan dengan referensi—jawaban dari LLM yang telah melihat seluruh teks. Hasil dari tiga konfigurasi agen wiki (tanpa akses ke sumber, dengan akses, dengan akses dan penghubung) menunjukkan bahwa median recall untuk LLM-wiki sekitar 0,72 dibandingkan 0,54–0,57 untuk RAG, dengan nilai-p dari 10⁻⁸ hingga 10⁻¹¹ menggunakan uji Wilcoxon. Untuk precision, perbedaan signifikan secara statistik hanya pada dua konfigurasi (p < 0,05) dan hilang sama sekali ketika penghubung ditambahkan (p = 0,348). Penghubung tidak memberikan peningkatan yang signifikan secara statistik. Akses ke sumber membantu secara moderat pada pertanyaan faktual, tetapi efeknya marjinal. Penulis mencatat bahwa kesimpulan terbatas pada kumpulan data ini.
Sumber: Habr — хаб NLP — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru