복잡한 의미론적 텍스트를 위한 로컬 RAG 구축: 클라우드 AI가 실패하고 MiniLM이 철학에서 무너질 때
Sentence-Transformers (UKPLab)
LM Studio
한 개발자가 제인 로버츠의 철학적 텍스트를 위해 로컬 RAG 파이프라인을 구축한 경험을 이야기한다. 이 프로젝트는 multilingual-e5-large 임베딩과 LM Studio를 통한 Qwen2.5를 사용한다. 프로젝트에는 데이터 준비, 마크업, 청킹, 검색이 포함된다. 저자는 Chroma 인덱스 아키텍처, 대화 상태 관리, 재순위화기 사용에 대한 커뮤니티 피드백을 구한다.
한 개발자가 클라우드 AI 모델이 환각을 일으키고 실패한 후, 제인 로버츠의 철학 텍스트를 위한 로컬 RAG 시스템을 구축했다. 원시 스캔본을 정리하고, 화자 태그와 함께 XML로 마크업하고, 문단 단위로 청크를 나누었다. 임베딩의 경우, multilingual-e5-large가 all-MiniLM-L6-v2보다 성능이 우수했는데, 후자는 추상 용어에 대해 높은 의미론적 드리프트를 보였다. 파이프라인은 벡터 저장을 위해 ChromaDB를 사용하고, 생성을 위해 LM Studio를 통한 Qwen2.5-14B-coder를 사용한다. 주요 엔지니어링 결정에는 이중 강화(E5용 passage: 접두사, LLM용 제 책에서 인용 프롬프트), 무대 지시 유형 전달 필터링, 다국어 지원이 포함된다. 저자는 세 가지 공개 질문을 제기한다: 데이터가 늘어남에 따라 Chroma 인덱스를 여러 컬렉션으로 분할할지, 토큰 예산을 폭발시키지 않고 대화 메모리를 구현할 방법, 그리고 교차 인코더 리랭커가 현재 911개 청크에 대한 검색 정확도를 향상시킬지 여부. 이 프로젝트는 GitHub에 연구 로그로 공개되어 있다.
출처: Habr — хаб ИИ —
원문
