OnderzoekAI-veiligheid 🇷🇺 27.07.2026 13:06

6 lessen voor het maken van benchmarks van de NeurIPS-tutorial

Google DeepMindGoogle DeepMind
De auteurs van SWE-bench en GPQA op NeurIPS bespraken veelgemaakte fouten bij het maken van benchmarks: tirannie van metrieken, subjectiviteit van crowdsourcing, gevaar van het gebruik van LLM's als beoordelaars en de noodzaak van dynamische tests. Belangrijkste advies — vermijd verzadigde benchmarks, controleer multimodaliteit en publiceer resultaten met betrouwbaarheidsintervallen.
Tijdens de NeurIPS-tutorial 'The Art of Benchmarking', met auteurs van SWE-bench, GPQA en onderzoekers van Google DeepMind, NYU en Berkeley, werden belangrijke problemen en valkuilen bij het maken van benchmarks besproken. Deze omvatten metrische tirannie, waarbij metrieken 'honingplekken' hebben die modellen in staat stellen de test te 'hacken', en waarbij de Pearson-correlatie er niet in slaagt deze punten te detecteren. Ook werd opgemerkt dat het gebruik van LLM's als evaluatiebron gevaarlijk is: ze correleren alleen met mensen op de calibratieset, en zelfbias leidt tot opgeblazen eigen resultaten. De enige juiste aanpak is het genereren van voorbeelden waarop het model faalt. Onder de zes grootste fouten van benchmarkmakers: het lanceren van een benchmark met 70-80% nauwkeurigheid op het beste model (men zou moeten streven naar 0-1%), gebrek aan verificatie van echte multimodaliteit van de taak, vertrouwen op de eigen intelligentietheorie, het niet filteren van crowdfraude (tot 25% willekeurige antwoorden), concentratie van werk op één enkele crowdwerker, en het publiceren van resultaten zonder p-waarden en betrouwbaarheidsintervallen. In de toekomst hebben we dynamische benchmarks nodig, longitudinale studies naar de impact van LLM's op mensen, calibratie van modelkennis, en taken die een kat kan oplossen maar GPT niet.
Bron: Хабр — Data Mining — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws