What Does word2vec Actually Learn? Researchers Finally Have an Exact Training Theory
Berkeley Artificial Intelligence Research (BAIR)
Researchers from BAIR (Berkeley Artificial Intelligence Research) have presented the first complete quantitative theory of word2vec training. They proved that in practically relevant regimes, training reduces to principal component analysis (PCA) matrix factorization, with each learned feature corresponding to an interpretable concept. The theory allows computing all features in advance based on corpus statistics and algorithm hyperparameters.
В новой работе исследователи из BAIR (Berkeley Artificial Intelligence Research) впервые получили замкнутую аналитическую теорию обучения word2vec. Они доказали, что при реалистичных условиях обучение сводится к невзвешенной факторизации матрицы методом наименьших квадратов, а динамика градиентного спуска решается в замкнутой форме: итоговые представления даются методом главных компонент (Principal Component Analysis, PCA). При малой начальной инициализации веса модели обучаются дискретными шагами, каждый из которых добавляет один новый ортогональный линейный подпространственный признак. Эти признаки — собственные векторы матрицы M*, вычисляемой из вероятностей совместной встречаемости слов и униграммов. Например, первый главный вектор выделяет слова, связанные с биографиями знаменитостей, второй — с государственным управлением, третий — с географическими описаниями. Теория использует четыре мягких приближения (квартичное разложение целевой функции, специальная настройка гиперпараметров, достаточно малые начальные веса и бесконечно малые шаги градиентного спуска), но не накладывает ограничений на распределение данных. Эксперименты показывают, что приближённая модель достигает 66% точности на задаче аналогий (word2vec — 68%, классический метод PPMI (Positive Pointwise Mutual Information) — 51%). Кроме того, теория позволила описать возникновение абстрактных линейных представлений (например, мужской/женский род) как разреженных случайных матричных моделей: на ранних этапах обучения преобладает семантический сигнал, а на поздних может начать доминировать шум, ухудшающий точность представлений.
Nguồn: BAIR (Berkeley AI) —
bản gốc
