研究应用 🇷🇺 10.08.2026 11:02

当签名不足时:清除图像搜索中的“灰色地带”

ЯндексЯндекс
Yandex 图像搜索通过使用联合分析图像和文本的多模态模型提高了相关性。他们从重型视觉语言模型(VLM)开始,将其蒸馏为每个流水线阶段的轻量模型,并将前几个结果中的相关图像提高了 5%。
Yandex Images 历史上使用两个独立的信号对文档进行排序:图像到文本(i2t)和文本到文本(t2t)相关性,但这种方法在信号不一致的“灰色地带”表现不佳。在 Konstantin Nikolaev 的带领下,团队首先构建了一个多模态 VLM,能够同时处理图像和文本,但其速度过慢,无法满足实时排序的需求。随后,他们将其蒸馏为一组更轻量的模型:一个名为 vBERT 的双向编码器、一个双编码器、一个嵌入器以及一个轻量级交叉编码器(LCE)。嵌入器用于基于 HNSW 索引的候选生成,双编码器用于草稿排序,LCE 用于最终重排序。这些模型作为现有集成系统的一个额外因素被加入,而非取代它。这些改动使得顶部相关图像数量增加了 4%,这来自双编码器和交叉编码器;若计入嵌入器,总增幅为 5%。关键思路在于离线计算文档嵌入,仅在运行时计算查询侧和聚合,从而能够以每秒数万查询的速度进行实时处理。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻