शोध 🇩🇪 15.08.2026 09:01

नया बेंचमार्क पुष्टि करता है: एआई मॉडल अभी भी खराब देखते हैं

Moonshot AIMoonshot AI OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
मूनशॉट एआई ने परसेप्शनबेंच पेश किया है, जो तर्क और विश्व ज्ञान से दृश्य धारणा को अलग करने वाला एक बेंचमार्क है। परीक्षणों में, जीपीटी-5.6 सोल, किमी के3 और क्लाउड फेबल 5 सहित सभी प्रमुख मॉडलों ने महत्वपूर्ण कमजोरियां दिखाईं, कोई भी 60% सटीकता से अधिक नहीं पहुंचा। लेखकों का निष्कर्ष है कि कई तथाकथित तर्क त्रुटियां वास्तव में दोषपूर्ण दृश्य धारणा के कारण होती हैं, जो पिछले अध्ययनों की पुष्टि करता है।
मूनशॉट एआई, जो किमी के पीछे की टीम है, ने पर्सेप्शनबेंच जारी किया है, जो एक बेंचमार्क है जिसे मल्टीमॉडल भाषा मॉडल में दृश्य धारणा का अलगाव में परीक्षण करने के लिए डिज़ाइन किया गया है। सामान्य बेंचमार्क के विपरीत, पर्सेप्शनबेंच दृष्टि को दस परमाणु उप-कौशलों में विभाजित करता है, जिसमें प्रत्येक प्रश्न का उत्तर केवल देखकर दिया जा सकता है, बिना तर्क या बाहरी ज्ञान के। यह वर्गीकरण वास्तविक मॉडल त्रुटियों से प्राप्त किया गया था, जिसे दृश्य संबंध, गिनती, विशेषता, गहराई और त्रि-आयामी, स्थानीयकरण, तुलना, सूक्ष्म पहचान, संदर्भ एकीकरण, ओसीआर (ऑप्टिकल कैरेक्टर रिकग्निशन) और मतिभ्रम जैसे क्षेत्रों में वर्गीकृत किया गया था। मूनशॉट एआई ने 17,000 से अधिक सत्यापित प्रश्नों के आंतरिक पूल से 3,000 प्रश्न प्रकाशित किए। 16 फ्रंटियर मॉडलों में, उच्चतम समग्र सटीकता 59.7% जीपीटी-5.6 सोल की है, उसके बाद किमी के3 58.5% के साथ, क्लॉड फेबल 5 57.2% के साथ, और जेमिनी 3.1 प्रो 56.2% के साथ है। ओपन-सोर्स मॉडल काफी पीछे हैं। मतिभ्रम श्रेणी औसतन सबसे कमजोर है: जीपीटी-5.6 सोल को वहां केवल 26.9% मिलता है, जबकि कमजोर जेमिनी 3.5 फ्लैश को 50.6% मिलता है। लेखकों का तर्क है कि कई कथित तर्क त्रुटियाँ वास्तव में धारणा स्तर पर होती हैं। मूनशॉट एआई ने पहले वर्ल्डवीक्यूए और बेबीविजन में योगदान दिया था, जिसने यह भी दिखाया कि फ्रंटियर मॉडल बुनियादी दृश्य कार्यों में विफल रहते हैं, जबकि मनुष्य उनसे बेहतर प्रदर्शन करते हैं। शोधकर्ता इसका कारण मौखिकीकरण अड़चन को बताते हैं।
स्रोत: The Decoder (DE) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार