Wenn die Signatur nicht reicht: Den Graubereich in der Bildersuche klären
Яндекс
Yandex Images verbesserte die Relevanz durch multimodale Modelle, die Bild und Text gemeinsam analysieren. Sie starteten mit einem schweren VLM, destillierten es in leichtere Modelle für jede Pipeline-Stufe und erhöhten die relevanten Bilder in den Top-Ergebnissen um 5 Prozent.
Yandex Images hat Dokumente bisher anhand von zwei getrennten Signalen gerankt: Bild-zu-Text (i2t) und Text-zu-Text (t2t) Relevanz, aber dieser Ansatz hatte Schwierigkeiten in der „Grauzone“, in der diese Signale divergierten. Das Team, geleitet von Konstantin Nikolaev, baute zunächst ein multimodales VLM, das Bild und Text zusammen verarbeitet, aber es war zu langsam für das Echtzeit-Ranking. Sie destillierten es in eine Reihe leichterer Modelle: einen bidirektionalen Encoder namens vBERT, einen Bi-Encoder, einen Embedder und einen leichten Cross-Encoder (LCE). Der Embedder wird für die Kandidatengenerierung mit einem HNSW-Index verwendet, der Bi-Encoder für das Entwurfsranking und der LCE für das finale Re-Ranking. Diese Modelle wurden als zusätzlicher Faktor zum bestehenden Ensemble hinzugefügt, nicht als Ersatz. Die Änderungen führten zu einer Steigerung um 4 Prozent relevanter Bilder an der Spitze durch den Bi-Encoder und den Cross-Encoder und insgesamt 5 Prozent inklusive des Embedders. Der entscheidende Einblick war, Dokument-Embeddings offline zu berechnen und nur die Abfrageseite und die Aggregation zur Laufzeit zu berechnen, was eine Echtzeitverarbeitung mit Zehntausenden von Abfragen pro Sekunde ermöglicht.
Quelle: Habr — хаб ML —
Original
