word2vecは実際に何を学習するのか?研究者がついに正確な学習理論を解明
Berkeley Artificial Intelligence Research (BAIR)
BAIR(バークレー人工知能研究所)の研究者らは、word2vecの学習プロセスに関する初の定量的かつ予測可能な理論を開発した。現実的な条件下では、学習が非加重最小二乗行列分解に帰着し、最終的な埋め込みはコーパス統計から導出される特定の行列の主成分分析(PCA)によって与えられることを証明した。
BAIRの研究者らによる新しい論文で、word2vecの学習ダイナミクスに関する初の閉形式理論が提示されました。埋め込みがゼロ付近で初期化されると、モデルは概念を一つずつ学習し、各概念は直交する線形部分空間に対応し、埋め込み行列の実効ランクが段階的に増加することが示されました。学習される特徴は、共起確率によって定義される行列M*の上位固有ベクトルです。この理論は数値実験とよく一致しており、word2vecはアナロジーベンチマークで68%を達成し、近似モデルは66%であるのに対し、古典的なPPMI法では51%でした。また、この研究は、性別や時制などの抽象概念に対する線形表現の出現も説明しています。
出典: BAIR (Berkeley AI) —
原文
