Исследования 🇩🇪 15.08.2026 09:01

Новый бенчмарк подтверждает: модели искусственного интеллекта по-прежнему плохо видят

Moonshot AI OpenAI Anthropic Google/DeepMind Alibaba/Qwen
Компания Moonshot AI представила бенчмарк PerceptionBench, который изолирует визуальное восприятие от рассуждений и знаний о мире. В тестах все ведущие модели, включая GPT-5.6 Sol, Kimi K3 и Claude Fable 5, показали значительные слабости, ни одна не превысила 60% точности. Авторы заключают, что многие предполагаемые ошибки рассуждений на самом деле вызваны ошибочным визуальным восприятием, что подтверждает более ранние исследования.
Moonshot AI, команда, стоящая за Kimi, выпустила PerceptionBench — бенчмарк, предназначенный для проверки визуального восприятия в мультимодальных языковых моделях в чистом виде. В отличие от обычных бенчмарков, PerceptionBench разбивает зрение на десять атомарных поднавыков, при этом на каждый вопрос можно ответить, лишь взглянув на изображение, без рассуждений или внешних знаний. Таксономия
Показать ещё ↓
Источник: The Decoder (DE) — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости