연구애플리케이션 🇷🇺 10.08.2026 11:02

시그니처만으로는 부족할 때: 이미지 검색의 '회색 지대' 해소

ЯндексЯндекс
Yandex Images는 이미지와 텍스트를 함께 분석하는 멀티모달 모델을 사용하여 관련성을 개선했습니다. 이들은 무거운 VLM(비전 언어 모델)으로 시작해, 각 파이프라인 단계에 맞는 더 가벼운 모델로 증류했으며, 상위 결과에서 관련 이미지를 5% 증가시켰습니다.
Yandex Images는 역사적으로 문서를 두 가지 별개의 신호, 즉 이미지-텍스트(i2t) 관련성과 텍스트-텍스트(t2t) 관련성을 사용하여 순위를 매겼지만, 이 접근 방식은 두 신호가 일치하지 않는 '회색 지대'에서 어려움을 겪었습니다. Konstantin Nikolaev가 이끄는 팀은 먼저 이미지와 텍스트를 함께 처리하는 멀티모달 VLM(비전-언어 모델)을 구축했지만, 실시간 순위 매기기에는 너무 느렸습니다. 그들은 이를 vBERT라는 양방향 인코더, 바이-인코더, 임베더, 그리고 경량 크로스-인코더(LCE)로 구성된 더 가벼운 모델 세트로 증류했습니다. 임베더는 HNSW 인덱스가 있는 후보 생성을 위해 사용되고, 바이-인코더는 초안 순위 매기기에, LCE는 최종 재순위 매기기에 사용됩니다. 이러한 모델들은 기존 앙상블을 대체하는 것이 아니라 추가 요소로 포함되었습니다. 이러한 변경으로 상위에 관련 이미지가 바이-인코더와 크로스-인코더를 통해 4% 증가했고, 임베더를 포함하여 총 5% 증가했습니다. 핵심 통찰은 문서 임베딩을 오프라인으로 계산하고 런타임에 쿼리 측 및 집계만 계산하여 초당 수만 건의 쿼리를 실시간으로 처리할 수 있게 한 것입니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스