¿Qué aprende realmente word2vec? Los investigadores finalmente tienen una teoría de aprendizaje exacta
Berkeley Artificial Intelligence Research (BAIR)
Investigadores de BAIR (Berkeley AI) han desarrollado la primera teoría cuantitativa y predictiva para el proceso de aprendizaje de word2vec. Demuestran que, en condiciones realistas, el entrenamiento se reduce a la factorización de matrices por mínimos cuadrados no ponderados, con las incrustaciones finales dadas por el PCA de una matriz específica derivada de las estadísticas del corpus.
En un nuevo artículo, investigadores de BAIR presentan la primera teoría de forma cerrada para la dinámica de aprendizaje de word2vec. Demuestran que, cuando los embeddings se inicializan cerca de cero, el modelo aprende conceptos de uno en uno, cada uno correspondiente a un subespacio lineal ortogonal, y el rango efectivo de la matriz de embeddings incrementa paso a paso. Las características aprendidas son los autovectores principales de una matriz M* definida por probabilidades de coocurrencia. La teoría coincide bien con los experimentos numéricos: word2vec alcanza un 68 % en los benchmarks de analogías, el modelo aproximado obtiene un 66 %, frente al 51 % del método clásico PPMI. El trabajo también explica la aparición de representaciones lineales para conceptos abstractos como el género o el tiempo verbal.
Fuente: BAIR (Berkeley AI) —
original
