Comment j'ai réduit un encodeur russe à 24 millions de paramètres — et failli tout gâcher avec un seul chiffre
DeepPavlov
BAAI
Microsoft
Un ingénieur a entraîné un récupérateur dense russe léger, STRIZH, avec 24,4 millions de paramètres et 4 couches, pour un RAG local sur GPU partagé. Un seul nombre erroné dans la configuration du tokeniseur (model_max_length=256) a fait chuter le Recall@10 de 0,589 à 0,448, annulant presque le travail. Le modèle est destiné à une récupération rapide en première étape sur AMD Strix Halo, en concurrence avec bge-m3 dans des scénarios de co-résidence.
L'auteur a développé un petit récupérateur dense russe nommé STRIZH pour un système RAG local fonctionnant sur un nœud AMD Strix Halo avec 128 Go de mémoire unifiée. L'iGPU du nœud est partagé par le LLM génératif, l'embeddeur, le re-ranker et la réindexation périodique, d'où la nécessité d'un récupérateur léger pour réduire la contention de calcul. Après une tentative infructueuse de régression d'embedding à l'aide d'une perte MSE, l'auteur a réussi à entraîner un modèle donneur de récupération avec 12 couches en utilisant l'apprentissage contrastif, puis l'a distillé en 4 couches. STRIZH possède 24,4 millions de paramètres, une taille de vecteur de 384, un pooling moyen, aucun préfixe requête/passage, et prend en charge un contexte allant jusqu'à 8 192 jetons. Sur un corpus local, il a atteint un Recall@10 de 0,751 sur un sous-ensemble filtré et de 0,800 sur l'ensemble complet. Dans les benchmarks de co-résidence avec Qwen3.6-35B-A3B, STRIZH n'a entraîné qu'une baisse de débit de génération de 2 % contre 7 % pour bge-m3 lors d'une charge en ligne de 200 requêtes par seconde, et a indexé 46 lots par seconde contre 4,9. Cependant, une erreur a été découverte après la publication : la configuration du tokeniseur avait model_max_length=256, ce qui, une fois appliqué, a entraîné une chute du Recall@10 de 0,589 à 0,448. L'auteur note que STRIZH n'est pas destiné à remplacer des modèles plus grands comme USER2-small ou bge-m3, mais à combler un créneau pour la récupération dense efficace sous des budgets de calcul stricts.
Source: Habr — хаб ИИ —
original
