Nghiên cứuỨng dụng 🇷🇺 10.08.2026 11:02

Khi Chữ Ký Không Đủ: Làm Rõ 'Vùng Xám' trong Tìm Kiếm Hình Ảnh

ЯндексЯндекс
Yandex Images đã cải thiện độ liên quan bằng cách sử dụng các mô hình đa phương thức phân tích đồng thời hình ảnh và văn bản. Họ bắt đầu với một mô hình ngôn ngữ thị giác (VLM) nặng, chưng cất nó thành các mô hình nhẹ hơn cho từng giai đoạn của pipeline, và tăng tỷ lệ hình ảnh liên quan trong các kết quả hàng đầu lên 5%.
Yandex Images trước đây xếp hạng tài liệu bằng hai tín hiệu riêng biệt: mức độ liên quan giữa hình ảnh và văn bản (i2t) và giữa văn bản và văn bản (t2t), nhưng cách tiếp cận này gặp khó khăn trong 'vùng xám' khi hai tín hiệu này không đồng thuận. Nhóm nghiên cứu, do Konstantin Nikolaev dẫn đầu, trước tiên đã xây dựng một mô hình ngôn ngữ thị giác đa phương thức (VLM) xử lý đồng thời hình ảnh và văn bản, nhưng mô hình này quá chậm để xếp hạng theo thời gian thực. Họ đã chưng cất nó thành một tập hợp các mô hình nhẹ hơn: một bộ mã hóa hai chiều gọi là vBERT, một bộ mã hóa kép (bi-encoder), một bộ nhúng (embedder) và một bộ mã hóa chéo nhẹ (LCE). Bộ nhúng được sử dụng để tạo ứng viên với chỉ mục HNSW, bộ mã hóa kép dùng để xếp hạng nháp, và LCE để xếp hạng lại cuối cùng. Các mô hình này được thêm vào như một yếu tố bổ sung trong hệ thống tổng hợp hiện có, không thay thế nó. Kết quả là tăng 4% số hình ảnh liên quan ở vị trí đầu từ bộ mã hóa kép và bộ mã hóa chéo, và tổng cộng tăng 5% khi bao gồm cả bộ nhúng. Điểm mấu chốt là tính toán trước các vector nhúng của tài liệu và chỉ tính toán phía truy vấn và tổng hợp tại thời điểm chạy, cho phép xử lý theo thời gian thực với hàng chục nghìn truy vấn mỗi giây.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới