word2vec는 실제로 무엇을 배울까? 연구자들이 마침내 정확한 학습 이론을 제시하다
Berkeley Artificial Intelligence Research (BAIR)
BAIR(버클리 인공지능 연구소) 연구진이 word2vec 학습 과정에 대한 최초의 정량적이고 예측 가능한 이론을 개발했습니다. 연구진은 현실적인 조건에서 학습이 가중치 없는 최소제곱 행렬 분해로 축소되며, 최종 임베딩이 말뭉치 통계에서 파생된 특정 행렬의 주성분 분석(PCA)으로 주어진다는 것을 증명했습니다.
새로운 논문에서 BAIR(버클리 인공지능 연구소)의 연구자들은 word2vec의 학습 동역학에 대한 최초의 폐쇄형 이론을 제시했습니다. 그들은 임베딩이 0에 가깝게 초기화될 때 모델이 한 번에 하나의 개념을 학습하며, 각 개념은 직교 선형 부분공간에 해당하고, 임베딩 행렬의 유효 순위가 단계적으로 증가한다는 것을 보여줍니다. 학습된 특징은 동시 발생 확률에 의해 정의된 행렬 M*의 최상위 고유벡터입니다. 이 이론은 수치 실험과 잘 일치합니다. word2vec는 유추 벤치마크에서 68%를 달성하고, 근사 모델은 66%를 달성하는 반면, 고전적인 PPMI 방법은 51%에 그칩니다. 이 연구는 또한 성별이나 시제와 같은 추상적인 개념에 대한 선형 표현의 출현을 설명합니다.
출처: BAIR (Berkeley AI) —
원문
