Cómo reduje un embedder ruso a 24 millones de parámetros — y casi lo arruino con un solo dígito
DeepPavlov
BAAI
Microsoft
Un ingeniero entrenó un recuperador denso ruso ligero, STRIZH, con 24,4 millones de parámetros y 4 capas, para RAG local en GPU compartida. Un único número incorrecto en la configuración del tokenizador (model_max_length=256) redujo Recall@10 de 0,589 a 0,448, casi anulando el trabajo. El modelo está pensado para recuperación rápida de primera etapa en AMD Strix Halo, compitiendo con bge-m3 en escenarios de co-residencia.
El autor desarrolló un pequeño recuperador denso en ruso llamado STRIZH para un sistema RAG local que se ejecuta en un nodo AMD Strix Halo con 128 GB de memoria unificada. La iGPU del nodo es compartida por el LLM generativo, el incrustador, el reordenador y el reindexado periódico, por lo que se necesita un recuperador ligero para reducir la contención de cómputo. Tras un intento fallido de regresión de incrustaciones utilizando pérdida de error cuadrático medio (MSE), el autor entrenó con éxito un modelo donante de recuperación con 12 capas utilizando aprendizaje contrastivo y luego lo destiló a 4 capas. STRIZH tiene 24,4 millones de parámetros, tamaño de vector 384, agrupación media, sin prefijos de consulta/pasaje, y admite contexto de hasta 8192 tokens. En un corpus local, logró Recall@10 de 0,751 en un subconjunto filtrado y 0,800 en el conjunto completo. En evaluaciones de coexistencia con Qwen3.6-35B-A3B, STRIZH causó solo una caída del 2% en el rendimiento de generación en comparación con el 7% de bge-m3 durante una carga en línea de 200 consultas por segundo, e indexó 46 lotes por segundo frente a 4,9. Sin embargo, se descubrió un error después de la publicación: la configuración del tokenizador tenía model_max_length=256, que cuando se aplicaba provocaba una caída en Recall@10 de 0,589 a 0,448. El autor señala que STRIZH no pretende reemplazar modelos más grandes como USER2-small o bge-m3, sino llenar un nicho para la recuperación densa eficiente bajo presupuestos de cómputo estrictos.
Fuente: Habr — хаб ИИ —
original
