Seize et une raison de plus pour connaître SHAP
L'article explique pourquoi SHAP (SHapley Additive exPlanations) est une méthode unique et populaire pour l'interprétation des modèles d'apprentissage automatique, ancrée dans la théorie des jeux. Il retrace son histoire depuis la valeur de Shapley (1953), sa reformulation en problème de moindres carrés pondérés (1988), et ses premières applications à l'apprentissage automatique (2010, 2014), culminant avec l'approche unifiée de Lundberg et Lee (2017). Le texte décrit également les axiomes clés, les méthodes d'estimation par permutation et par noyau, et présente 15 extensions (raisons) développées depuis la publication de 2017.
L'article, écrit par une chercheuse nommée Sabrina, offre un aperçu approfondi de SHAP, une méthode pour expliquer les prédictions de modèles d'apprentissage automatique basée sur la théorie des jeux coopératifs. Il commence par la valeur de Shapley classique introduite par Lloyd Shapley en 1953, qui propose une allocation équitable et unique des gains d'une équipe basée sur la contribution marginale moyenne de chaque joueur. En 1988, Charnes, Golany, Keane et Rousseau ont montré que la valeur de Shapley peut être calculée comme la solution d'un problème de moindres carrés pondérés, ce qui est ensuite devenu la base de KernelSHAP. Les premières adaptations à l'apprentissage automatique sont venues en 2010 de Štrumbelj et Kononenko, qui ont introduit une estimation basée sur les permutations utilisant l'échantillonnage de Monte Carlo, et en 2014, ont étendu aux sous-ensembles, révélant des interactions et de la redondance. Le moment charnière a été l'article de 2017 de Lundberg et Lee, « A Unified Approach to Interpreting Model Predictions », qui a introduit le cadre SHAP avec des propriétés telles que l'exactitude locale, l'absence de données et la cohérence, et en a prouvé l'unicité. KernelSHAP estime les valeurs SHAP en résolvant une régression linéaire pondérée avec un noyau de Shapley qui met l'accent sur les petites et grandes coalitions. Malgré ses forces, l'article note que l'implémentation originale de l'échantillonnage de fond peut violer les hypothèses, ce qui a conduit au développement de 15 extensions pour résoudre divers problèmes. Le titre « 16 et une raison de plus » fait référence aux 15 extensions plus la base axiomatique comme première raison, avec une raison finale cachée révélée à la fin de l'article.
Source: Habr — хаб ML —
original
