LLM-wiki ve RAG: Kurumsal Belgeler İçin Cevap Üretme Yöntemlerinin Karşılaştırması
OpenAI
Google DeepMind
Anthropic
Yazar, "Directive 401" adlı sentetik bir belge kullanarak LLM-wiki'yi (bir wiki aracısına dayalı) basit bir RAG sistemiyle karşılaştırdı. Sonuçlar, LLM-wiki'nin cevap tamlığında (hatırlama) sürekli olarak RAG'den daha iyi performans gösterdiğini, kesinlikteki farkın ise ihmal edilebilir olduğunu ortaya koydu. Wiki'yi oluşturmanın maliyeti 3,7 dolardan azdı.
Yazar, belge tabanlı yanıtlar üretmek için iki yaklaşımı karşılaştıran bir deney gerçekleştirdi: LLM-wiki (Andrej Karpathy'nin fikrinden esinlenilmiştir) ve vektör tarayıcılı basit bir RAG sistemi. Kaynak metin, gemma4:31b modeli tarafından hazırlanan, 'Direktif 401' başlıklı, yaklaşık 100.000 karakter uzunluğunda sentetik bir kurumsal belgeydi. Sorular (20 olgusal ve 20 durum bazlı) gpt-5.1 modeli tarafından sentezlendi. Wiki'yi oluşturmak için kaynak belge 25 parçaya (24 madde artı bir başlık sayfası) bölündü, ardından AGENTS.md dosyası Obsidian'a eklendi ve Claude Code (Sonnet 5) kullanılarak 20 dakikada, 3,7 dolardan daha düşük bir maliyetle 32 wiki sayfası oluşturuldu. Wiki ajanı dört bileşenden oluşuyordu: Yönlendirici (Navigator, gpt-4.1-mini), Bağlayıcı (Linker, gpt-4.1-mini), Bağlam Toplayıcı (Context Collector) ve Sentezleyici (Synthesizer, gpt-4.1). RAG sistemi LangChain, ChromaDB, FastAPI ve yerel yerleştirmeler (embeddings) kullandı; parçalar (chunks), makale numaralandırmasının ikinci seviyesine göre oluşturuldu (toplam 144 parça). Değerlendirmede Kesinlik (Precision) ve Duyarlılık (Recall) ölçütleri kullanıldı: yanıtlardaki gerçekler, tüm metni görmüş bir Büyük Dil Modeli'nden (LLM) alınan yanıt olan bir referansla karşılaştırıldı. Üç wiki ajanı konfigürasyonundan (kaynağa erişim yok, erişim var, erişim ve bağlayıcı var) elde edilen sonuçlar, LLM-wiki için medyan Duyarlılık değerinin yaklaşık 0,72 iken RAG için 0,54-0,57 arasında olduğunu ve Wilcoxon testiyle p-değerlerinin 10⁻⁸ ile 10⁻¹¹ arasında değiştiğini gösterdi. Kesinlik için ise fark yalnızca iki konfigürasyonda istatistiksel olarak anlamlıydı (p < 0,05) ve bağlayıcı eklendiğinde tamamen ortadan kalktı (p = 0,348). Bağlayıcı istatistiksel olarak anlamlı bir iyileşme sağlamadı. Kaynağa erişim, olgusal sorularda orta düzeyde yardımcı oldu, ancak etki marjinaldi. Yazar, sonuçların bu veri kümesiyle sınırlı olduğunu belirtmektedir.
Kaynak: Habr — хаб NLP —
orijinal
