الأبحاثالتطبيقات 🇷🇺 10.08.2026 11:02

عندما لا تكفي البصمة: توضيح 'المنطقة الرمادية' في البحث عن الصور

ЯндексЯндекс
قامت ياندكس للصور بتحسين ملاءمة النتائج باستخدام نماذج متعددة الوسائط التي تحلل الصورة والنص معًا. بدأوا بنموذج رؤية لغوي ضخم، ثم قاموا بتقطيره إلى نماذج أخف لكل مرحلة من مراحل خط المعالجة، مما زاد نسبة الصور الملائمة في النتائج العلوية بنسبة 5%.
تاريخيًا، كانت ياندكس للصور ترتب المستندات باستخدام إشارتين منفصلتين: الارتباط بين الصورة والنص (i2t) والارتباط بين النص والنص (t2t)، لكن هذا النهج واجه صعوبات في "المنطقة الرمادية" حيث تتعارض هاتان الإشارتان. قام الفريق بقيادة كونستانتين نيكولاييف أولاً ببناء نموذج رؤية لغوي متعدد الوسائط (VLM) يعالج الصورة والنص معًا، لكنه كان بطيئًا جدًا للترتيب في الوقت الفعلي. ثم قاموا بتقطيره إلى مجموعة من النماذج الأخف: مُرمِّز ثنائي الاتجاه يُسمى vBERT، ومُرمِّز ثنائي، ومُضمِّن (embedder)، ومُرمِّز متقاطع خفيف (LCE). يُستخدم المُضمِّن لتوليد المرشحين باستخدام فهرس HNSW، ويُستخدم المُرمِّز الثنائي للترتيب المبدئي، ويُستخدم المُرمِّز المتقاطع الخفيف لإعادة الترتيب النهائية. أُضيفت هذه النماذج كعامل إضافي إلى المجموعة الحالية، دون استبدالها. أدت هذه التغييرات إلى زيادة بنسبة 4% في الصور ذات الصلة في الأعلى من المُرمِّز الثنائي والمُرمِّز المتقاطع، و5% إجمالاً بما في ذلك المُضمِّن. كانت الرؤية الأساسية هي حساب تضمينات المستندات دون اتصال بالإنترنت وحساب جانب الاستعلام والتجميع فقط في وقت التشغيل، مما يتيح المعالجة في الوقت الفعلي بعشرات الآلاف من الاستعلامات في الثانية.
المصدر: Habr — хаб ML — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة