Когда подписи недостаточно: устранение «серой зоны» в поиске изображений

Яндекс
Поиск изображений в Яндексе повысил релевантность с помощью мультимодальных моделей, которые совместно анализируют изображение и текст. Сначала была создана тяжёлая мультимодальная модель, затем её дистиллировали в более лёгкие модели для каждого этапа пайплайна, что увеличило долю релевантных изображений в топе выдачи на 5%.
Яндекс.Картинки исторически ранжировали документы с помощью двух отдельных сигналов: релевантности «изображение-текст» (i2t) и «текст-текст» (t2t), однако этот подход давал сбои в «серой зоне», где эти сигналы противоречили друг другу. Команда под руководством Константина Николаева сначала создала мультимодальную VLM (модель «видение-язык»), которая обрабатывает изображение и текст вместе, но она
Показать ещё ↓
Источник: Habr — хаб ML — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости