была выведена из реальных ошибок моделей и включает такие категории, как визуальные отношения, подсчет, атрибуты, глубина и 3D, локализация, сравнение, распознавание мелких деталей, интеграция контекста, распознавание символов и галлюцинации. Moonshot AI опубликовала 3000 вопросов из внутреннего пула, насчитывающего более 17 000 проверенных вопросов. Среди 16 передовых моделей наивысшая общая точность составляет 59,7% у GPT-5.6 Sol, за ней следуют Kimi K3 с 58,5%, Claude Fable 5 с 57,2% и Gemini 3.1 Pro с 56,2%. Модели с открытым исходным кодом значительно отстают. Категория галлюцинаций в среднем самая слабая: GPT-5.6 Sol набирает там только 26,9%, тогда как более слабая Gemini 3.5 Flash получает 50,6%. Авторы утверждают, что многие ошибки, воспринимаемые как ошибки рассуждения, на самом деле возникают на уровне восприятия. Ранее Moonshot AI выпустила WorldVQA и внесла вклад в BabyVision, которые также показали, что передовые модели терпят неудачу в базовых визуальных задачах, в то время как люди их превосходят. Исследователи связывают это с узким местом вербализации.