Pesquisa 🇷🇺 30.07.2026 15:01

Construindo um RAG local para textos semânticos complexos: quando a IA em nuvem falha e o MiniLM não dá conta da filosofia

Sentence-Transformers (UKPLab)Sentence-Transformers (UKPLab) LM StudioLM Studio
Um desenvolvedor relata a construção de um pipeline RAG local para textos filosóficos de Jane Roberts, usando embeddings multilingual-e5-large e Qwen2.5 via LM Studio. O projeto inclui preparação de dados, marcação, divisão em partes (chunking) e recuperação. O autor busca feedback da comunidade sobre a arquitetura do índice Chroma, gerenciamento de estado de diálogo e uso de reranker.
Um desenvolvedor construiu um sistema RAG local para textos filosóficos de Jane Roberts depois que modelos de IA em nuvem alucinaram e falharam. Os scans brutos foram limpos, marcados em XML com tags de falante e divididos em parágrafos. Para embeddings, o multilingual-e5-large superou o all-MiniLM-L6-v2, que mostrou alto desvio semântico em terminologia abstrata. O pipeline usa ChromaDB para armazenamento vetorial e Qwen2.5-14B-coder via LM Studio para geração. As principais decisões de engenharia incluem enriquecimento duplo (prefixo passage: para E5, prompt Quotes from my book para o LLM), filtragem de direções de palco e suporte multilíngue. O autor destaca três perguntas em aberto: dividir ou não o índice Chroma em múltiplas coleções conforme os dados crescem, como implementar memória de diálogo sem estourar o orçamento de tokens e se um re-ranker de codificador cruzado melhoraria a precisão da recuperação nos 911 chunks atuais. O projeto é publicado como um registro de pesquisa no GitHub.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas