Recherche 🇩🇪 15.08.2026 09:01

Nouveau benchmark confirme : les modèles d'IA voient encore mal

Moonshot AIMoonshot AI OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Moonshot AI a introduit PerceptionBench, un benchmark qui isole la perception visuelle du raisonnement et des connaissances du monde. Lors des tests, tous les principaux modèles, y compris GPT-5.6 Sol, Kimi K3 et Claude Fable 5, ont montré des faiblesses significatives, aucun ne dépassant 60 % de précision. Les auteurs concluent que de nombreuses erreurs de raisonnement présumées sont en réalité causées par une perception visuelle défectueuse, confirmant des études antérieures.
Moonshot AI, l'équipe derrière Kimi, a publié PerceptionBench, un benchmark conçu pour tester la perception visuelle des modèles de langage multimodaux de manière isolée. Contrairement aux benchmarks courants, PerceptionBench décompose la vision en dix sous-compétences atomiques, chaque question pouvant être résolue par la simple observation, sans raisonnement ni connaissance externe. La taxonomie a été dérivée d'erreurs réelles de modèles, catégorisées en domaines tels que la Relation Visuelle, le Comptage, l'Attribut, la Profondeur et la 3D, la Localisation, la Comparaison, la Reconnaissance Fine, l'Intégration Contextuelle, l'OCR et l'Hallucination. Moonshot AI a publié 3 000 questions issues d'un ensemble interne de plus de 17 000 questions vérifiées. Sur 16 modèles de pointe, la précision globale la plus élevée est de 59,7 % pour GPT-5.6 Sol, suivi de Kimi K3 à 58,5 %, Claude Fable 5 à 57,2 % et Gemini 3.1 Pro à 56,2 %. Les modèles open-source sont nettement en retard. La catégorie hallucination est la plus faible en moyenne : GPT-5.6 Sol n'obtient que 26,9 % dans cette catégorie, tandis que le plus faible Gemini 3.5 Flash obtient 50,6 %. Les auteurs soutiennent que de nombreuses erreurs perçues comme des erreurs de raisonnement se produisent en réalité au niveau de la perception. Moonshot AI avait précédemment publié WorldVQA et contribué à BabyVision, qui montraient également que les modèles de pointe échouaient à des tâches visuelles de base, les humains les surpassant. Les chercheurs attribuent cela à un goulot d'étranglement de verbalisation.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches