Paikallisen RAG-järjestelmän rakentaminen monimutkaisille semanttisille teksteille: kun pilvi-tekoäly pettää ja MiniLM hajoaa filosofiaan
Sentence-Transformers (UKPLab)
LM Studio
Kehittäjä kertoo paikallisen RAG-putkilinjan rakentamisesta Jane Robertsin filosofisille teksteille käyttäen multilingual-e5-large-upotuksia ja Qwen2.5:ttä LM Studion kautta. Projekti sisältää tiedon valmistelun, merkinnän, paloittelun ja haun. Kirjoittaja pyytää yhteisön palautetta Chroma-indeksin arkkitehtuurista, vuoropuhelutilan hallinnasta ja uudelleenrankkaajan käytöstä.
Kehittäjä rakensi paikallisen RAG-järjestelmän Jane Robertsin filosofisille teksteille, kun pilvipohjaiset tekoälymallit hallusinoivat ja epäonnistuivat. Raakaskannaukset siivottiin, merkittiin XML-muotoon puhujatunnisteilla ja pilkottiin kappaleiksi. Upotuksissa multilingual-e5-large ylitti all-MiniLM-L6-v2:n, joka osoitti merkittävää semanttista ajautumista abstraktissa terminologiassa. Putki käyttää ChromaDB:tä vektori tallennukseen ja Qwen2.5-14B-coder -mallia LM Studion kautta generointiin. Keskeisiä suunnitteluratkaisuja ovat kaksoisrikastus (passage: -etuliite E5:lle, Quotes from my book -kehote LLM:lle), näyttöohjeiden kaltaisen toimitustavan suodattaminen ja monikielisyyden tuki. Kirjoittaja nostaa esiin kolme avointa kysymystä: pitäisikö Chroma-indeksi jakaa useisiin kokoelmiin datan kasvaessa, miten toteuttaa dialogimuisti ilman, että token-budjetti räjähtää, ja parantaisiko cross-encoder -tyyppinen uudelleenjärjestäjä haun tarkkuutta nykyisillä 911 lohkolla. Projekti on julkaistu tutkimuspäiväkirjana GitHubissa.
Lähde: Habr — хаб ИИ —
Alkuperäinen
