PesquisaAplicações 🇷🇺 10.08.2026 11:02

Quando a Assinatura Não é Suficiente: Eliminando a 'Zona Cinzenta' na Busca de Imagens

ЯндексЯндекс
O Yandex Images melhorou a relevância usando modelos multimodais que analisam conjuntamente imagem e texto. Eles começaram com um VLM pesado, destilaram-no em modelos mais leves para cada etapa do pipeline e aumentaram as imagens relevantes nos principais resultados em 5%.
O Yandex Images historicamente classificava documentos usando dois sinais separados: relevância imagem-texto (i2t) e texto-texto (t2t), mas essa abordagem enfrentava dificuldades na 'zona cinzenta' onde esses sinais divergiam. A equipe, liderada por Konstantin Nikolaev, primeiro construiu um VLM multimodal que processa imagem e texto juntos, mas era muito lento para classificação em tempo real. Eles o destilaram em um conjunto de modelos mais leves: um codificador bidirecional chamado vBERT, um bi-codificador, um incorporador (embedder) e um cross-codificador leve (LCE). O incorporador é usado para geração de candidatos com um índice HNSW, o bi-codificador para classificação preliminar e o LCE para reclassificação final. Esses modelos foram adicionados como um fator extra ao ensemble existente, não o substituindo. As mudanças resultaram em um aumento de 4% nas imagens relevantes no topo com o bi-codificador e o cross-codificador, e 5% no total incluindo o incorporador. A principal inovação foi calcular as incorporações (embeddings) dos documentos offline e calcular apenas o lado da consulta e a agregação em tempo de execução, permitindo processamento em tempo real com dezenas de milhares de consultas por segundo.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas