PCA를 바라보는 다섯 가지 관점: 분산 최대화에서 SVD까지
이 기사는 주성분 분석(PCA)을 분산 최대화, 상관 제거, 백색화, SVD, 기하학적 해석이라는 다섯 가지 관점에서 탐구합니다. 각 관점은 동일한 방법의 서로 다른 수학적 기반을 드러내며, 데이터 분석에서의 중요성을 강조합니다.
이 기사는 다섯 가지 관점에서 PCA를 제시합니다. 분산 최대화로 시작하여, 첫 번째 주성분은 투영된 분산을 최대화하는 방향이며, 공분산 행렬의 가장 큰 고유값에 해당하는 고유벡터로 구해집니다. 이후의 성분들은 직교하며 더 작은 고유값들에 대응합니다. 공분산 행렬은 대칭이고 양의 준정부호이므로 고유값은 음수가 아닙니다. PCA는 주성분들이 대각 공분산 행렬을 가지기 때문에 데이터의 상관을 제거합니다. 백색화(whitening)는 성분들을 단위 분산으로 스케일링하여 PCA를 확장하지만, 잡음을 증폭시킬 수 있습니다. 또 다른 관점에서는 PCA를 중심화된 데이터 행렬의 특이값 분해(SVD, Singular Value Decomposition)의 특수한 경우로 간주하며, 특이 벡터를 공분산 행렬의 고유벡터와 연결합니다. 이 기사는 또한 스펙트럼 분해, 직교 투영 연산자, 아핀 변환을 다루며, 모두 통일된 기하학적 관점을 지지합니다. 이 논의는 Alexander Bernstein의 Skoltech 기계 학습의 기하학적 방법 강의에서 영감을 받았습니다.
출처: Habr — хаб ML —
원문
