नया बेंचमार्क पुष्टि करता है: एआई मॉडल अभी भी खराब देखते हैं
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
मूनशॉट एआई ने परसेप्शनबेंच पेश किया है, जो तर्क और विश्व ज्ञान से दृश्य धारणा को अलग करने वाला एक बेंचमार्क है। परीक्षणों में, जीपीटी-5.6 सोल, किमी के3 और क्लाउड फेबल 5 सहित सभी प्रमुख मॉडलों ने महत्वपूर्ण कमजोरियां दिखाईं, कोई भी 60% सटीकता से अधिक नहीं पहुंचा। लेखकों का निष्कर्ष है कि कई तथाकथित तर्क त्रुटियां वास्तव में दोषपूर्ण दृश्य धारणा के कारण होती हैं, जो पिछले अध्ययनों की पुष्टि करता है।
मूनशॉट एआई, जो किमी के पीछे की टीम है, ने पर्सेप्शनबेंच जारी किया है, जो एक बेंचमार्क है जिसे मल्टीमॉडल भाषा मॉडल में दृश्य धारणा का अलगाव में परीक्षण करने के लिए डिज़ाइन किया गया है। सामान्य बेंचमार्क के विपरीत, पर्सेप्शनबेंच दृष्टि को दस परमाणु उप-कौशलों में विभाजित करता है, जिसमें प्रत्येक प्रश्न का उत्तर केवल देखकर दिया जा सकता है, बिना तर्क या बाहरी ज्ञान के। यह वर्गीकरण वास्तविक मॉडल त्रुटियों से प्राप्त किया गया था, जिसे दृश्य संबंध, गिनती, विशेषता, गहराई और त्रि-आयामी, स्थानीयकरण, तुलना, सूक्ष्म पहचान, संदर्भ एकीकरण, ओसीआर (ऑप्टिकल कैरेक्टर रिकग्निशन) और मतिभ्रम जैसे क्षेत्रों में वर्गीकृत किया गया था। मूनशॉट एआई ने 17,000 से अधिक सत्यापित प्रश्नों के आंतरिक पूल से 3,000 प्रश्न प्रकाशित किए। 16 फ्रंटियर मॉडलों में, उच्चतम समग्र सटीकता 59.7% जीपीटी-5.6 सोल की है, उसके बाद किमी के3 58.5% के साथ, क्लॉड फेबल 5 57.2% के साथ, और जेमिनी 3.1 प्रो 56.2% के साथ है। ओपन-सोर्स मॉडल काफी पीछे हैं। मतिभ्रम श्रेणी औसतन सबसे कमजोर है: जीपीटी-5.6 सोल को वहां केवल 26.9% मिलता है, जबकि कमजोर जेमिनी 3.5 फ्लैश को 50.6% मिलता है। लेखकों का तर्क है कि कई कथित तर्क त्रुटियाँ वास्तव में धारणा स्तर पर होती हैं। मूनशॉट एआई ने पहले वर्ल्डवीक्यूए और बेबीविजन में योगदान दिया था, जिसने यह भी दिखाया कि फ्रंटियर मॉडल बुनियादी दृश्य कार्यों में विफल रहते हैं, जबकि मनुष्य उनसे बेहतर प्रदर्शन करते हैं। शोधकर्ता इसका कारण मौखिकीकरण अड़चन को बताते हैं।
स्रोत: The Decoder (DE) —
मूल
