ModelosHardware e Inferência 🇷🇺 28.07.2026 20:02

Como reduzi um embedder russo para 24 milhões de parâmetros — e quase o estraguei com um dígito

DeepPavlovDeepPavlov BAAIBAAI MicrosoftMicrosoft
Um engenheiro treinou um retriever denso russo leve, chamado STRIZH, com 24,4 milhões de parâmetros e 4 camadas, para RAG local em GPU compartilhada. Um único número errado na configuração do tokenizador (model_max_length=256) fez o Recall@10 cair de 0,589 para 0,448, quase invalidando o trabalho. O modelo destina-se a recuperação rápida de primeira etapa em AMD Strix Halo, competindo com o bge-m3 em cenários de co-residência.
O autor desenvolveu um pequeno recuperador denso em russo chamado STRIZH para um sistema RAG local rodando em um nó AMD Strix Halo com 128 GB de memória unificada. A iGPU do nó é compartilhada pelo LLM generativo, pelo embedder, pelo reranker e pela reindexação periódica, então um recuperador leve é necessário para reduzir a contenção computacional. Após uma tentativa fracassada de regressão de embeddings usando perda MSE, o autor conseguiu treinar um modelo doador de recuperação com 12 camadas usando aprendizado contrastivo e depois o destilou para 4 camadas. STRIZH tem 24,4 milhões de parâmetros, tamanho de vetor 384, pooling médio, sem prefixos de consulta/passagem, e suporta contexto de até 8192 tokens. Em um corpus local, alcançou Recall@10 de 0,751 em um subconjunto filtrado e 0,800 no conjunto completo. Em benchmarks de co-residência com Qwen3.6-35B-A3B, STRIZH causou apenas uma queda de 2% no throughput de geração versus 7% para bge-m3 durante carga online de 200 consultas/segundo, e indexou 46 lotes/segundo versus 4,9. No entanto, um erro foi descoberto após a publicação: a configuração do tokenizador tinha model_max_length=256, que quando aplicado levou a uma queda no Recall@10 de 0,589 para 0,448. O autor observa que o STRIZH não pretende substituir modelos maiores como USER2-small ou bge-m3, mas preencher um nicho para recuperação densa eficiente sob orçamentos computacionais estritos.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas