语言模型的隐藏语法:关于文本生成结构的三个发现
OpenAI
作者对语言模型的内部结构进行了为期两年的研究,发现文本生成遵循稳定的语法路径,模型构建了句子方向的内部地图,不确定性仅在后期特定单词选择阶段出现。
В статье на Habr автор делится результатами двухлетнего исследования скрытой грамматики больших языковых моделей. Первое открытие: генерация текста гораздо более структурирована, чем кажется — модель движется по стабильному ядру высокопредсказуемых грамматических путей, подобно основным дорогам в городе, причём эта структура сохраняется даже при разных значениях temperature. Второе открытие: модели строят внутренние карты направления предложения. Эксперименты с GPT-2 показали, что сигнал о грамматической роли следующего слова появляется в середине сети, а не на последнем слое, что указывает на планирование общего направления предложения до выбора конкретных слов. Третий вывод: неопределённость возникает поздно, при выборе точного слова, а не на этапе построения грамматической структуры. Это говорит о двух дополняющих процессах — один организует структуру предложения, другой подбирает слова. Автор считает, что эти находки помогут создавать более понятные и вычислительно эффективные ИИ-системы.
来源: Habr — хаб NLP —
原文
