InvestigaciónAplicaciones 🇷🇺 10.08.2026 11:02

Cuando la Firma No Es Suficiente: Despejando la 'Zona Gris' en la Búsqueda de Imágenes

ЯндексЯндекс
Yandex Images mejoró la relevancia mediante el uso de modelos multimodales que analizan conjuntamente imagen y texto. Comenzaron con un VLM pesado, lo destilaron en modelos más ligeros para cada etapa del proceso y aumentaron las imágenes relevantes en los primeros resultados en un 5%.
Históricamente, Yandex Images clasificaba los documentos utilizando dos señales separadas: relevancia de imagen a texto (i2t) y de texto a texto (t2t), pero este enfoque tenía dificultades en la 'zona gris' donde estas señales no coincidían. El equipo, liderado por Konstantin Nikolaev, primero construyó un VLM multimodal que procesa imagen y texto juntos, pero era demasiado lento para la clasificación en tiempo real. Lo destilaron en un conjunto de modelos más ligeros: un codificador bidireccional llamado vBERT, un bi-codificador, un embedder y un codificador cruzado ligero (LCE). El embedder se utiliza para la generación de candidatos con un índice HNSW, el bi-codificador para la clasificación preliminar y el LCE para la reordenación final. Estos modelos se añadieron como un factor adicional al conjunto existente, no reemplazándolo. Los cambios resultaron en un aumento del 4% en imágenes relevantes en la parte superior gracias al bi-codificador y al codificador cruzado, y un 5% en total incluyendo el embedder. La idea clave fue calcular las incrustaciones de los documentos fuera de línea y solo calcular el lado de la consulta y la agregación en tiempo de ejecución, lo que permite el procesamiento en tiempo real con decenas de miles de consultas por segundo.
Fuente: Habr — хаб ML — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas