RechercheSécurité de l'IA 🇷🇺 27.07.2026 13:06

6 leçons pour créer des benchmarks tirées du tutoriel NeurIPS

Google DeepMindGoogle DeepMind
Les auteurs de SWE-bench et GPQA à NeurIPS ont discuté des erreurs clés dans la création de benchmarks : la tyrannie des métriques, la subjectivité du crowdsourcing, le danger d'utiliser les LLM comme évaluateurs et la nécessité de tests dynamiques. Principaux conseils : éviter les benchmarks saturés, vérifier la multimodalité et publier les résultats avec des intervalles de confiance.
Lors du tutoriel NeurIPS « The Art of Benchmarking », qui réunissait des auteurs de SWE-bench, GPQA et des chercheurs de Google DeepMind, NYU et Berkeley, les principaux problèmes et pièges de la création de benchmarks ont été discutés. Il s'agit notamment de la tyrannie des métriques, où les métriques présentent des zones de prédilection permettant aux modèles de « hacker » le test, le coefficient de corrélation de Pearson ne parvenant pas à détecter ces points. Il a également été noté que l'utilisation de LLM comme sources d'évaluation est dangereuse : ils ne corrèlent avec les humains que sur l'ensemble de calibration, et le biais d'auto-évaluation conduit à des résultats gonflés. La seule approche correcte consiste à générer des exemples sur lesquels le modèle échoue. Parmi les six erreurs majeures commises par les créateurs de benchmarks : lancer un benchmark avec une précision de 70 à 80 % sur le meilleur modèle (il faudrait viser 0 à 1 %), l'absence de vérification de la véritable multimodalité de la tâche, le recours à sa propre théorie de l'intelligence, l'incapacité à filtrer le spam des participants (jusqu'à 25 % de réponses aléatoires), la concentration du travail sur un seul participant, et la publication des résultats sans valeurs de p ni intervalles de confiance. À l'avenir, nous avons besoin de benchmarks dynamiques, d'études longitudinales de l'impact des LLM sur les humains, de la calibration des connaissances des modèles, et de tâches qu'un chat peut résoudre mais pas un GPT.
Source: Хабр — Data Mining — original
Nos articles précédents sur ce sujet ↓
Infos fraîches