6 Lektionen für die Erstellung von Benchmarks aus dem NeurIPS-Tutorial
Die Autoren von SWE-bench und GPQA diskutierten auf dem NeurIPS wesentliche Fehler bei der Erstellung von Benchmarks: Tyrannei der Metriken, Subjektivität des Crowdsourcings, Gefahr der Verwendung von LLMs als Evaluatoren und die Notwendigkeit dynamischer Tests. Die wichtigsten Ratschläge: gesättigte Benchmarks vermeiden, Multimodalität prüfen und Ergebnisse mit Konfidenzintervallen veröffentlichen.
Google DeepMind
Хабр — Data Mining27.07 · 13:06

