معيار جديد يؤكد: نماذج الذكاء الاصطناعي لا تزال ترى بشكل سيء
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
قدمت Moonshot AI معيار PerceptionBench، وهو معيار يعزل الإدراك البصري عن الاستدلال والمعرفة العامة. في الاختبارات، أظهرت جميع النماذج الرائدة بما في ذلك GPT-5.6 Sol وKimi K3 وClaude Fable 5 نقاط ضعف كبيرة، حيث لم يتجاوز أي منها دقة 60٪. ويستنتج المؤلفون أن العديد من الأخطاء المفترضة في الاستدلال ناتجة في الواقع عن إدراك بصري خاطئ، مما يؤكد دراسات سابقة.
أصدرت Moonshot AI، الفريق الذي يقف خلف Kimi، PerceptionBench، وهو معيار مصمم لاختبار الإدراك البصري في النماذج اللغوية متعددة الوسائط بشكل منعزل. على عكس المعايير الشائعة، يقسم PerceptionBench الرؤية إلى عشر مهارات فرعية ذرية، ويمكن الإجابة على كل سؤال بالنظر فقط، دون تفكير أو معرفة خارجية. اشتُق التصنيف من أخطاء النماذج الحقيقية، وصُنف إلى مجالات مثل العلاقة البصرية، والعد، والسمة، والعمق والأبعاد الثلاثية، والتوطين، والمقارنة، والتعرف الدقيق، وتكامل السياق، والتعرف الضوئي على الحروف، والهلوسة. نشرت Moonshot AI 3000 سؤال من مجموعة داخلية تضم أكثر من 17000 سؤال تم التحقق منها. عبر 16 نموذجًا رائدًا، بلغت أعلى دقة إجمالية 59.7% بواسطة GPT-5.6 Sol، تليها Kimi K3 بنسبة 58.5%، وClaude Fable 5 بنسبة 57.2%، وGemini 3.1 Pro بنسبة 56.2%. تتخلف النماذج مفتوحة المصدر بشكل كبير. فئة الهلوسة هي الأضعف في المتوسط: يحصل GPT-5.6 Sol على 26.9% فقط هناك، بينما يحصل Gemini 3.5 Flash الأضعف على 50.6%. يجادل المؤلفون بأن العديد من الأخطاء الإدراكية المتصورة تحدث فعليًا على مستوى الإدراك. سبق أن أصدرت Moonshot AI WorldVQA وساهمت في BabyVision، والتي أظهرت أيضًا أن النماذج الرائدة تفشل في المهام البصرية الأساسية، مع تفوق البشر عليها. يعزو الباحثون ذلك إلى اختناق اللفظ.
المصدر: The Decoder (DE) —
الأصلي
