Waarom werkt mijn model niet?
Het artikel bespreekt veelvoorkomende valkuilen in machine learning die ertoe leiden dat modellen falen in de praktijk, ondanks dat ze tijdens het testen goed presteren. Belangrijke problemen zijn misleidende data (verborgen variabelen, schijncorrelaties, labelingsfouten), datalekken (preprocessing vóór het splitsen, vooruitkijkbias, iteratieve overfitting op de testset) en ongepaste metriekkeuze (bijvoorbeeld nauwkeurigheid bij onevenwichtige data). De auteur beveelt de REFORMS-checklist aan en praktijken zoals het gebruik van salientiekaarten, diverse benchmarks en goede datasplitsingen om de betrouwbaarheid van modellen te verbeteren.
Het artikel, gebaseerd op 20 jaar ML-ervaring van de auteur en het paper 'How to avoid machine learning pitfalls: a guide for academic researchers', schetst veelgemaakte fouten die ertoe leiden dat modellen falen in productie. Ten eerste misleidende data: verborgen variabelen (bijvoorbeeld lichaamshouding in longscans voor Covid) en schijnverbanden (denk aan achtergrondpixels in tankafbeeldingen) zorgen dat modellen irrelevante patronen leren. Adversarial attacks maken misbruik van deze schijnverbanden. Labelingsfouten, zelfs bij een paar procent, kunnen benchmarkvergelijkingen verstoren. Ten tweede datalekken: datagestuurde voorbewerking (centreren, schalen, kenmerkselectie, data-augmentatie) op de volledige dataset vóór het opsplitsen van testdata lekt informatie en blaast prestaties op. Look-ahead bias in tijdreeksvoorspellingen en het iteratief overfitten van de testset (trainen op de testset) zijn veelvoorkomende lekken. Ten derde ongepaste metrieken: het gebruik van nauwkeurigheid op ongebalanceerde data kan misleidend zijn. De auteur beveelt de REFORMS-checklist aan voor ML-gebaseerde wetenschap en praktijken zoals het onderzoeken van saliency maps, het gebruik van meerdere benchmarks en het waarborgen van correcte datasplitsingen.
Bron: The Gradient —
origineel
