了解SHAP的16个理由,以及另外一个额外理由
本文解释了为什么SHAP(SHapley Additive exPlanations)作为一种机器学习模型解释方法独特且流行,其根源在于博弈论。文章追溯了从Shapley值(1953年)、其在1988年被重构为加权最小二乘问题,到2010年和2014年首次应用于机器学习,最终在2017年由Lundberg和Lee提出统一方法。文中还描述了关键公理、置换和基于核的估计方法,并概述了自2017年发布以来开发的15个扩展(理由)。
这篇文章由一位名叫Sabrina的研究人员撰写,深入探讨了SHAP,这是一种基于合作博弈论的机器学习模型预测解释方法。文章从Lloyd Shapley于1953年提出的经典Shapley值开始,该值基于每位玩家的平均边际贡献,提供了一种对团队收益的公正分配的独特方案。1988年,Charnes、Golany、Keane和Rousseau证明,可以将Shapley值计算为一个加权最小二乘问题的解,这后来成为KernelSHAP的基础。2010年,Štrumbelj和Kononenko首次将其应用于机器学习,他们引入了一种基于置换的蒙特卡洛采样估计方法,并在2014年扩展到子集,揭示了交互作用和冗余性。关键的转折点是2017年Lundberg和Lee发表的论文《解释模型预测的统一方法》,该论文引入了SHAP框架,具有局部准确性、缺失性和一致性等性质,并证明了其唯一性。KernelSHAP通过求解一个带有shapley核的加权线性回归来估计SHAP值,该核强调小规模和大规模的联盟。尽管有其优势,文章指出,背景采样的原始实现可能会违反假设,因此开发了15种扩展来解决各种问题。标题“16个以及另一个原因”指的是15个扩展加上公理基础作为第一个原因,而文章末尾揭示了隐藏的最后一个原因。
来源: Habr — хаб ML —
原文
