Cinq perspectives sur l'ACP : de la maximisation de la variance à la décomposition en valeurs singulières
L'article explore l'analyse en composantes principales (ACP) à travers cinq points de vue distincts : la maximisation de la variance, la décorrélation, le blanchiment, la décomposition en valeurs singulières (SVD pour singular value decomposition) et les interprétations géométriques. Chaque perspective révèle différentes fondations mathématiques de la même méthode, soulignant son importance dans l'analyse des données.
L'article présente l'ACP sous cinq angles, en commençant par la maximisation de la variance : la première composante principale est la direction qui maximise la variance projetée, trouvée comme le vecteur propre de la matrice de covariance associé à la plus grande valeur propre. Les composantes suivantes sont orthogonales et correspondent à des valeurs propres plus faibles. La matrice de covariance est symétrique et semi-définie positive, ce qui entraîne des valeurs propres non négatives. L'ACP décorrèle les données car les composantes principales ont une matrice de covariance diagonale. La blanchiment (whitening) étend l'ACP en mettant à l'échelle les composantes pour avoir une variance unitaire, bien que cela puisse amplifier le bruit. Une autre perspective considère l'ACP comme un cas particulier de la décomposition en valeurs singulières (SVD) de la matrice de données centrée, reliant les vecteurs singuliers aux vecteurs propres des matrices de covariance. L'article aborde également la décomposition spectrale, les projecteurs orthogonaux et les transformations affines, tous convergeant vers une vue géométrique unifiée. La discussion s'inspire d'un cours de l'Institut Skoltech sur les méthodes géométriques de l'apprentissage automatique par Alexander Bernstein.
Source: Habr — хаб ML —
original
