использование LLM в качестве источников оценки опасно: они коррелируют с людьми только на калибровочном наборе, а смещение в свою пользу приводит к завышению собственных результатов. Единственный правильный подход — генерировать примеры, на которых модель терпит неудачу. Среди шести основных ошибок, допускаемых создателями бенчмарков: запуск бенчмарка с точностью 70–80% на топ-модели (следует стремиться к 0–1%), отсутствие проверки истинной мультимодальности задачи, опора на собственную теорию интеллекта, игнорирование спама от краудсорсеров (до 25% случайных ответов), концентрация работы на одном исполнителе и публикация результатов без p-значений и доверительных интервалов. В будущем необходимы динамические бенчмарки, лонгитюдные исследования влияния LLM на людей, калибровка знаний моделей и задачи, которые может решить кошка, но не может GPT.