Wat leert word2vec nu werkelijk? Onderzoekers hebben eindelijk een exacte leertheorie
Berkeley Artificial Intelligence Research (BAIR)
Onderzoekers van BAIR (Berkeley AI) hebben de eerste kwantitatieve en voorspellende theorie voor het leerproces van word2vec ontwikkeld. Ze bewijzen dat, onder realistische omstandigheden, training teruggebracht wordt tot gewone kleinste-kwadraten matrixfactorisatie, met uiteindelijke embeddings gegeven door PCA van een specifieke matrix die is afgeleid van corpusstatistieken.
In een nieuw artikel geven onderzoekers van BAIR de eerste gesloten-vorm theorie voor de leerdynamiek van word2vec. Ze laten zien dat wanneer embeddings bijna nul worden geïnitialiseerd, het model concepten één voor één leert, elk corresponderend met een orthogonale lineaire deelruimte, en de effectieve rang van de embeddingmatrix stapsgewijs toeneemt. De geleerde kenmerken zijn de top eigenvectoren van een matrix M* die wordt gedefinieerd door co-occurrence waarschijnlijkheden. De theorie komt goed overeen met numerieke experimenten: word2vec behaalt 68% op analogiebenchmarks, het benaderende model 66%, versus 51% voor de klassieke PPMI-methode. Het werk verklaart ook het ontstaan van lineaire representaties voor abstracte concepten zoals geslacht of tijd.
Bron: BAIR (Berkeley AI) —
origineel
