AraştırmaUygulamalar 🇷🇺 10.08.2026 11:02

İmza Yeterli Olmadığında: Görsel Aramada 'Gri Bölgeyi' Temizleme

ЯндексЯндекс
Yandex Görsel, görüntü ve metni birlikte analiz eden çok modlu modeller kullanarak alaka düzeyini artırdı. Ağır bir görsel dil modeliyle başlayıp, boru hattının her aşaması için daha hafif modellere damıttılar ve üst sonuçlardaki ilgili görselleri %5 artırdılar.
Yandex Images, geçmişte görselleri iki ayrı sinyal kullanarak sıralıyordu: görüntü-metin (i2t) ve metin-metin (t2t) ilgililik. Ancak bu yaklaşım, bu sinyallerin çeliştiği 'gri bölgede' zorlanıyordu. Konstantin Nikolaev liderliğindeki ekip, önce görüntüyü ve metni birlikte işleyen çok modlu bir VLM (görsel-dil modeli) geliştirdi, ancak bu model gerçek zamanlı sıralama için çok yavaştı. Bu modeli, daha hafif bir dizi modele damıttılar: vBERT adında çift yönlü bir kodlayıcı, bir çift kodlayıcı (bi-encoder), bir gömücü (embedder) ve hafif bir çapraz kodlayıcı (LCE). Gömücü, HNSW endeksi ile aday üretimi için kullanılıyor; çift kodlayıcı taslak sıralama için, LCE ise son yeniden sıralama için. Bu modeller mevcut topluluğun (ensemble) yerine geçmedi, ek bir faktör olarak eklendi. Yapılan değişiklikler, çift kodlayıcı ve çapraz kodlayıcı sayesinde üst sıralardaki ilgili görsellerde %4, gömücü dahil toplamda ise %5 artış sağladı. Anahtar nokta, belge gömülerinin çevrimdışı hesaplanması ve yalnızca sorgu tarafı ve toplama işlemlerinin çalışma zamanında yapılmasıydı; bu da saniyede on binlerce sorgu ile gerçek zamanlı işlemeyi mümkün kıldı.
Kaynak: Habr — хаб ML — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler