Wanneer de handtekening niet genoeg is: het 'grijze gebied' in beeldzoekopdrachten opruimen
Яндекс
Yandex Images verbeterde de relevantie door multimodale modellen te gebruiken die gezamenlijk beeld en tekst analyseren. Ze begonnen met een zwaar vision-language model (VLM), destilleerden dit naar lichtere modellen voor elke pijplijnfase, en verhoogden het aantal relevante afbeeldingen in de topresultaten met 5%.
Yandex Images rangschikte documenten historisch gezien op basis van twee afzonderlijke signalen: beeld-naar-tekst (i2t) en tekst-naar-tekst (t2t) relevantie, maar deze aanpak had moeite in de 'grijze zone' waar deze signalen elkaar tegenspraken. Het team, onder leiding van Konstantin Nikolaev, bouwde eerst een multimodale VLM die beeld en tekst samen verwerkt, maar die was te traag voor realtime-ranking. Ze distilleerden het tot een set lichtere modellen: een bidirectionele encoder genaamd vBERT, een bi-encoder, een embedder en een lichte cross-encoder (LCE). De embedder wordt gebruikt voor kandidaatgeneratie met een HNSW-index, de bi-encoder voor concept-ranking en de LCE voor de uiteindelijke herranking. Deze modellen zijn toegevoegd als een extra factor aan het bestaande ensemble, niet ter vervanging ervan. De wijzigingen resulteerden in een toename van 4% in relevante afbeeldingen bovenaan door de bi-encoder en cross-encoder, en 5% in totaal inclusief de embedder. De belangrijkste inzicht was om document-embeddings offline te berekenen en alleen de query-kant en aggregatie tijdens de uitvoering te berekenen, waardoor realtime verwerking met tienduizenden queries per seconde mogelijk werd.
Bron: Habr — хаб ML —
origineel
