Nghiên cứu 🇷🇺 30.07.2026 15:01

Xây dựng hệ thống RAG cục bộ cho văn bản ngữ nghĩa phức tạp: khi AI đám mây thất bại và MiniLM gặp khó với triết học

Sentence-Transformers (UKPLab)Sentence-Transformers (UKPLab) LM StudioLM Studio
Một nhà phát triển kể lại quá trình xây dựng hệ thống RAG cục bộ cho các văn bản triết học của Jane Roberts, sử dụng embeddings multilingual-e5-large và Qwen2.5 thông qua LM Studio. Dự án bao gồm chuẩn bị dữ liệu, đánh dấu, phân đoạn và truy xuất. Tác giả tìm kiếm phản hồi từ cộng đồng về kiến trúc chỉ mục Chroma, quản lý trạng thái hội thoại và cách sử dụng bộ xếp hạng lại.
Một nhà phát triển đã xây dựng hệ thống RAG cục bộ cho các văn bản triết học của Jane Roberts sau khi các mô hình AI đám mây bị ảo giác và thất bại. Các bản scan thô đã được làm sạch, đánh dấu bằng XML với các thẻ người nói, và được chia thành các đoạn văn. Đối với embeddings, mô hình multilingual-e5-large vượt trội so với all-MiniLM-L6-v2 vốn có độ lệch ngữ nghĩa cao trên các thuật ngữ trừu tượng. Pipeline sử dụng ChromaDB để lưu trữ vector và Qwen2.5-14B-coder thông qua LM Studio để sinh văn bản. Các quyết định kỹ thuật chính bao gồm tăng cường dữ liệu kép (tiền tố 'passage:' cho E5, lời nhắc 'Trích dẫn từ cuốn sách của tôi' cho LLM), lọc ra các đoạn mô tả sân khấu, và hỗ trợ đa ngôn ngữ. Tác giả nêu ba câu hỏi mở: có nên chia chỉ mục Chroma thành nhiều bộ sưu tập khi dữ liệu tăng lên, cách triển khai bộ nhớ đối thoại mà không làm tăng vọt ngân sách token, và liệu bộ xếp hạng lại cross-encoder có cải thiện độ chính xác truy xuất trên 911 khối dữ liệu hiện tại hay không. Dự án được công bố dưới dạng nhật ký nghiên cứu trên GitHub.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới