TutkimusSovellukset 🇷🇺 10.08.2026 11:02

Kun allekirjoitus ei riitä: kuvanhaun 'harmaan alueen' selvittäminen

ЯндексЯндекс
Yandex Images paransi relevanssia käyttämällä multimodaalisia malleja, jotka analysoivat kuvaa ja tekstiä yhdessä. He aloittivat raskaasta VLM:stä, tislattivat sen kevyemmiksi malleiksi jokaista putkiston vaihetta varten, ja lisäsivät relevanttien kuvien määrää huipputuloksissa 5 prosentilla.
Yandex Images -kuvahaku on historiallisesti luokitellut dokumentteja kahdella erillisellä signaalilla: kuvan ja tekstin välisellä relevanssilla (i2t) sekä tekstin ja tekstin välisellä relevanssilla (t2t). Tämä lähestymistapa tuotti kuitenkin ongelmia niin sanotulla harmaalla alueella, jossa nämä signaalit olivat ristiriidassa keskenään. Konstantin Nikolaevin johtama tiimi rakensi ensin multimodaalisen VLM-mallin, joka käsittelee kuvaa ja tekstiä yhdessä, mutta se oli liian hidas reaaliaikaiseen luokitteluun. He tislasivat sen joukoksi kevyempiä malleja: kaksisuuntaisen kooderin nimeltä vBERT, bi-kooderin, upotusmallin (embedder) ja kevyen ristikooderin (LCE). Upotusmallia käytetään ehdokkaiden tuottamiseen HNSW-indeksillä, bi-kooderia alustavaan luokitteluun ja LCE:tä lopulliseen uudelleenluokitteluun. Nämä mallit lisättiin olemassa olevaan kokonaisuuteen lisätekijänä, ei korvaamaan sitä. Muutokset johtivat neljän prosentin kasvuun relevanttien kuvien määrässä kärjessä bi-kooderin ja ristikooderin ansiosta, ja yhteensä viiteen prosenttiin upotusmallin kanssa. Keskeinen oivallus oli laskea dokumenttien upotukset offline-tilassa ja suorittaa vain kyselypuolen ja aggregoinnin laskenta reaaliajassa, mikä mahdollistaa reaaliaikaisen käsittelyn kymmenillä tuhansilla kyselyillä sekunnissa.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset