模型硬件与推理 🇷🇺 28.07.2026 20:02

如何将俄语嵌入模型压缩至2400万参数——以及一个数字差点毁掉全部工作

DeepPavlovDeepPavlov BAAIBAAI MicrosoftMicrosoft
一位工程师训练了一个轻量级俄语密集检索模型STRIZH,参数量为2440万,层数为4层,用于共享GPU上的本地检索增强生成。分词器配置中一个错误的数字(模型最大长度设为256)导致召回率@10从0.589降至0.448,几乎使工作付诸东流。该模型旨在AMD Strix Halo平台上实现快速第一级检索,在与bge-m3共驻内存的场景中竞争。
作者开发了一个名为STRIZH的小型俄语稠密检索器,用于在配备128 GB统一内存的AMD Strix Halo节点上运行的本地RAG系统。该节点的iGPU由生成式LLM、嵌入器、重排序器和周期性重新索引共享,因此需要轻量级检索器以减少计算争用。在使用MSE损失进行嵌入回归的尝试失败后,作者成功使用对比学习训练了一个12层的检索捐赠模型,然后将其蒸馏为4层。STRIZH拥有2440万个参数,向量大小为384,采用均值池化,没有查询/段落前缀,并支持最长8192个令牌的上下文。在本地语料库上,它在过滤子集上实现了0.751的Recall@10,在完整集上实现了0.800。在与Qwen3.6-35B-A3B的共驻基准测试中,STRIZH在每秒200次查询的在线负载下仅导致2%的生成吞吐量下降,而bge-m3为7%,并且索引速度为每秒46批,而bge-m3为每秒4.9批。然而,发布后发现了一个错误:分词器配置的model_max_length=256,强制执行该设置导致Recall@10从0.589降至0.448。作者指出,STRIZH并非旨在取代像USER2-small或bge-m3这样的大型模型,而是为了在严格的计算预算下填补高效稠密检索的空白。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻