ModellenHardware & Inferentie 🇷🇺 28.07.2026 20:02

Hoe ik een Russische embedder verkleinde tot 24 miljoen parameters — en het bijna verpestte met één cijfer

DeepPavlovDeepPavlov BAAIBAAI MicrosoftMicrosoft
Een engineer trainde een lichtgewicht Russische dense retriever, STRIZH, met 24,4M parameters en 4 lagen, voor lokale RAG op een gedeelde GPU. Een enkel fout getal in de tokenizerconfiguratie (model_max_length=256) deed Recall@10 dalen van 0,589 naar 0,448, waardoor het werk bijna voor niets was. Het model is bedoeld voor snelle eerste-fase retrieval op AMD Strix Halo, en concurreert met bge-m3 in co-residentie scenario's.
De auteur ontwikkelde een kleine Russische dense retriever genaamd STRIZH voor een lokaal RAG-systeem dat draait op een AMD Strix Halo-node met 128 GB unified memory. De iGPU van de node wordt gedeeld door de generatieve LLM, embedder, reranker en periodieke herindexering, dus er is een lichtgewicht retriever nodig om de rekencontention te verminderen. Na een mislukte poging tot embeddingregressie met behulp van MSE-loss, trainde de auteur met succes een retrieval-donormodel met 12 lagen met behulp van contrastief leren en destilleerde dit vervolgens naar 4 lagen. STRIZH heeft 24,4 miljoen parameters, vectorafmeting 384, mean pooling, geen query/passage-voorvoegsels en ondersteunt context tot 8192 tokens. Op een lokale corpus behaalde het Recall@10 van 0,751 op een gefilterde subset en 0,800 op de volledige set. In co-residentiebenchmarks met Qwen3.6-35B-A3B zorgde STRIZH voor slechts een daling van 2% in generatiedoorvoer versus 7% voor bge-m3 tijdens een online belasting van 200 queries per seconde, en indexeerde het 46 batches per seconde versus 4,9. Er werd echter een fout ontdekt na publicatie: de tokenizerconfiguratie had model_max_length=256, wat bij handhaving leidde tot een daling van Recall@10 van 0,589 naar 0,448. De auteur merkt op dat STRIZH niet bedoeld is om grotere modellen zoals USER2-small of bge-m3 te vervangen, maar om een niche te vullen voor efficiënte dense retrieval onder strikte rekenbudgetten.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws