МоделиИсследования 🇷🇺 20.07.2026 03:03

Русский RAG-сплиттер с резкой по индексам: как обучить и зачем

T-Bank AI (t-tech)T-Bank AI (t-tech) DeepSeekDeepSeek Moonshot AIMoonshot AI
Разработчик обучил собственный RAG-сплиттер для русского языка, который на выходе даёт не переписанный текст, а список индексов границ чанков. Это обеспечивает lossless-нарезку, дешевизну вывода и целостность таблиц. Модель на базе T-lite-it-2.1 обучена через LoRA на RTX 5090, разметка задистиллирована от DeepSeek-V4-Flash.
Автор проекта обучил собственный русский RAG-сплиттер, вдохновившись датским context-aware-splitter. Ключевое отличие: модель возвращает не переписанный текст, а индексы границ чанков, по которым хост затем режет оригинальный документ. Такой подход даёт три преимущества: lossless-нарезку (байт-в-байт совпадение с исходником), дешёвый вывод (около 35–40 токенов JSON вместо переписывания всего документа) и целостность таблиц — таблица остаётся атомарным юнитом, граница не может пройти внутри неё. В качестве базовой модели выбрана t-tech/T-lite-it-2.1 из-за эффективного кириллического токенайзера (1.74 токена на слово против 3.17 у Llama-2), совместимости с llama.cpp Vulkan на AMD и открытой лицензии Apache-2.0. Обучение проводилось методом bf16-LoRA через Unsloth на RTX 5090: 3.5 часа, пик 25.4 ГБ VRAM, 2122 шага за 2 эпохи. Разметку для обучения задистиллировали от self-hosted DeepSeek-V4-Flash с grammar-constrained decoding, температура 0.2. После обучения модель сжата в GGUF Q5_K_M (~5.9 ГБ) и запущена на AMD Strix Halo через llama.cpp Vulkan: на тестовом документе из 9 юнитов получено около 1.2 секунды на документ при 40 ток/с генерации и 947 ток/с prompt eval. Метрика boundary-F1 @±1 составила 0.821, но это teacher-agreement с метками учителя, а не качество RAG downstream (hit-rate/faithfulness пока не измерялись).
Сокращения
RAG = Retrieval Augmented Generation — генерация с дополнением извлечением
GGUF = GPT-Generated Unified Format — унифицированный формат моделей от GPT
LoRA = Low-Rank Adaptation — низкоранговая адаптация
VRAM = Video Random Access Memory — видеопамять
JSON = JavaScript Object Notation — текстовый формат обмена данными
F1 = F1-score — F1-мера
GPU = Graphics Processing Unit — графический процессор
API = Application Programming Interface — программный интерфейс приложения
JSONL = JSON Lines — формат JSON Lines
Источник: Habr — хаб NLP — оригинал

Наши прошлые публикации по теме

Есть свежие новости