Nieuwe benchmark bevestigt: AI-modellen zien nog steeds slecht
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Moonshot AI heeft PerceptionBench geïntroduceerd, een benchmark die visuele perceptie isoleert van redeneren en wereldkennis. In tests vertoonden alle toonaangevende modellen, waaronder GPT-5.6 Sol, Kimi K3 en Claude Fable 5, significante zwakheden, met geen enkele die boven 60% nauwkeurigheid uitkomt. De auteurs concluderen dat veel vermeende redeneerfouten eigenlijk worden veroorzaakt door gebrekkige visuele perceptie, wat eerdere studies bevestigt.
Moonshot AI, het team achter Kimi, heeft PerceptionBench uitgebracht, een benchmark die is ontworpen om visuele perceptie in multimodale taalmodellen geïsoleerd te testen. In tegenstelling tot gangbare benchmarks deelt PerceptionBench visie op in tien atomaire subvaardigheden, waarbij elke vraag alleen door te kijken kan worden beantwoord, zonder redenering of externe kennis. De taxonomie is afgeleid van echte modelfouten, gecategoriseerd in gebieden zoals visuele relatie, tellen, attribuut, diepte en 3D, lokalisatie, vergelijking, fijnmazige herkenning, contextintegratie, OCR en hallucinatie. Moonshot AI heeft 3.000 vragen gepubliceerd uit een interne pool van meer dan 17.000 geverifieerde vragen. Bij 16 toonaangevende modellen is de hoogste algehele nauwkeurigheid 59,7% voor GPT-5.6 Sol, gevolgd door Kimi K3 met 58,5%, Claude Fable 5 met 57,2% en Gemini 3.1 Pro met 56,2%. Open-source modellen blijven duidelijk achter. De categorie hallucinatie is gemiddeld het zwakst: GPT-5.6 Sol scoort daar slechts 26,9%, terwijl de zwakkere Gemini 3.5 Flash 50,6% haalt. De auteurs stellen dat veel waargenomen redeneerfouten eigenlijk op perceptieniveau optreden. Moonshot AI had eerder WorldVQA uitgebracht en bijgedragen aan BabyVision, die ook aantoonden dat toonaangevende modellen falen bij basale visuele taken, terwijl mensen het beter doen. De onderzoekers schrijven dit toe aan een verbalisatieknelpunt.
Bron: The Decoder (DE) —
origineel
