6 уроков по созданию бенчмарков из туториала NeurIPS
Google DeepMind
Авторы SWE-bench и GPQA на NeurIPS рассказали о ключевых ошибках при создании бенчмарков: тирании метрик, субъективности краудсорсинга, опасности использования LLM в качестве оценщиков и необходимости динамических тестов. Основные советы — избегать насыщенных бенчмарков, проверять мультимодальность и публиковать результаты с доверительными интервалами.
На туториале NeurIPS «Искусство бенчмаркинга» с участием авторов SWE-bench, GPQA и исследователей из Google DeepMind, NYU и Berkeley обсуждались ключевые проблемы и подводные камни создания бенчмарков. Среди них — тирания метрик, когда метрики имеют «медовые точки», позволяющие моделям «взламывать» тест, при этом корреляция Пирсона не может выявить эти точки. Также было отмечено, что
Показать ещё ↓
Источник: Хабр — Data Mining —
оригинал
