Recherche 🇷🇺 30.07.2026 15:01

Construire un RAG local pour des textes sémantiques complexes : quand l'IA cloud échoue et que MiniLM échoue sur la philosophie

Sentence-Transformers (UKPLab)Sentence-Transformers (UKPLab) LM StudioLM Studio
Un développeur raconte la construction d'un pipeline RAG local pour des textes philosophiques de Jane Roberts, utilisant les embeddings multilingual-e5-large et Qwen2.5 via LM Studio. Le projet comprend la préparation des données, le balisage, le découpage en chunks et la récupération. L'auteur sollicite les retours de la communauté sur l'architecture de l'index Chroma, la gestion de l'état du dialogue et l'utilisation du reranker.
Un développeur a construit un système RAG local pour les textes philosophiques de Jane Roberts après que les modèles d'IA cloud ont halluciné et échoué. Les scans bruts ont été nettoyés, annotés en XML avec des balises de locuteur, et découpés en paragraphes. Pour les embeddings, multilingual-e5-large a surpassé all-MiniLM-L6-v2, qui présentait une dérive sémantique élevée sur la terminologie abstraite. Le pipeline utilise ChromaDB pour le stockage vectoriel et Qwen2.5-14B-coder via LM Studio pour la génération. Les décisions d'ingénierie clés incluent un double enrichissement (préfixe passage : pour E5, invite Citations de mon livre pour le LLM), le filtrage des indications de mise en scène, et la prise en charge multilingue. L'auteur soulève trois questions ouvertes : faut-il diviser l'index Chroma en plusieurs collections à mesure que les données augmentent, comment implémenter la mémoire du dialogue sans exploser le budget de jetons, et un reranker à encodeur croisé améliorerait-il la précision de la récupération sur les 911 fragments actuels. Le projet est publié comme un journal de recherche sur GitHub.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches