Membangun RAG Lokal untuk Teks Semantik Kompleks: Saat AI Cloud Gagal dan MiniLM Rusak pada Filsafat
Sentence-Transformers (UKPLab)
LM Studio
Seorang pengembang menceritakan pengalamannya membangun pipeline RAG lokal untuk teks-teks filosofis karya Jane Roberts, menggunakan embedding multilingual-e5-large dan Qwen2.5 melalui LM Studio. Proyek ini mencakup persiapan data, penandaan, pemotongan, dan pengambilan. Penulis mencari masukan komunitas tentang arsitektur indeks Chroma, manajemen status dialog, dan penggunaan reranker.
Seorang pengembang membangun sistem RAG (Retrieval-Augmented Generation) lokal untuk teks-teks filosofis karya Jane Roberts setelah model AI berbasis cloud berhalusinasi dan gagal. Pindaian mentah dibersihkan, ditandai dengan XML berisi tag pembicara, dan dibagi menjadi paragraf-paragraf. Untuk embedding, multilingual-e5-large mengungguli all-MiniLM-L6-v2 yang menunjukkan penyimpangan semantik tinggi pada terminologi abstrak. Pipeline menggunakan ChromaDB untuk penyimpanan vektor dan Qwen2.5-14B-coder melalui LM Studio untuk generasi. Keputusan teknis kunci mencakup pengayaan ganda (prefiks 'passage:' untuk E5, prompt 'Quotes from my book' untuk LLM), penyaringan tipe penyampaian seperti arahan panggung, dan dukungan multi-bahasa. Penulis menyoroti tiga pertanyaan terbuka: apakah perlu memisahkan indeks Chroma menjadi beberapa koleksi seiring pertumbuhan data, bagaimana menerapkan memori dialog tanpa meledakkan anggaran token, dan apakah pengurutan ulang dengan cross-encoder akan meningkatkan akurasi pencarian pada 911 potongan saat ini. Proyek ini dipublikasikan sebagai log penelitian di GitHub.
Sumber: Habr — хаб ИИ —
asli
