Aufbau eines lokalen RAG für komplexe semantische Texte: Wenn Cloud-KI versagt und MiniLM an Philosophie scheitert
Sentence-Transformers (UKPLab)
LM Studio
Ein Entwickler berichtet vom Aufbau einer lokalen RAG-Pipeline für philosophische Texte von Jane Roberts, unter Verwendung von multilingual-e5-large-Embeddings und Qwen2.5 über LM Studio. Das Projekt umfasst Datenvorbereitung, Markup, Chunking und Abruf. Der Autor sucht Community-Feedback zur Chroma-Index-Architektur, Dialogzustandsverwaltung und Nutzung von Rerankern.
Ein Entwickler hat ein lokales RAG-System für philosophische Texte von Jane Roberts gebaut, nachdem Cloud-KI-Modelle halluziniert und versagt hatten. Rohe Scans wurden bereinigt, mit Sprecher-Tags in XML ausgezeichnet und in Absätze aufgeteilt. Für die Einbettungen übertraf multilingual-e5-large das all-MiniLM-L6-v2, das bei abstrakten Begriffen eine hohe semantische Drift zeigte. Die Pipeline nutzt ChromaDB für die Vektorspeicherung und Qwen2.5-14B-coder über LM Studio für die Generierung. Zu den wichtigsten technischen Entscheidungen gehören die doppelte Anreicherung (Präfix für E5, Aufforderung mit Zitaten aus meinem Buch für das Sprachmodell), das Herausfiltern von Regieanweisungsartigen Lieferungen und die Mehrsprachigkeitsunterstützung. Der Autor hebt drei offene Fragen hervor: ob der Chroma-Index bei wachsenden Datenmengen in mehrere Sammlungen aufgeteilt werden sollte, wie der Dialogspeicher implementiert werden kann, ohne das Token-Budget zu sprengen, und ob ein Cross-Encoder-Reranker die Abfragegenauigkeit bei den derzeit 911 Chunks verbessern würde. Das Projekt ist als Forschungstagebuch auf GitHub veröffentlicht.
Quelle: Habr — хаб ИИ —
Original
