Die verborgene Grammatik von Sprachmodellen: Drei Entdeckungen zur Struktur der Textgenerierung
OpenAI
Der Autor führte eine zweijährige Studie zur internen Struktur von Sprachmodellen durch und fand heraus, dass die Textgenerierung stabilen grammatikalischen Pfaden folgt, Modelle eine interne Karte der Satzrichtung aufbauen und Unsicherheit erst in späteren Phasen der spezifischen Wortauswahl entsteht.
В статье на Habr автор делится результатами двухлетнего исследования скрытой грамматики больших языковых моделей. Первое открытие: генерация текста гораздо более структурирована, чем кажется — модель движется по стабильному ядру высокопредсказуемых грамматических путей, подобно основным дорогам в городе, причём эта структура сохраняется даже при разных значениях temperature. Второе открытие: модели строят внутренние карты направления предложения. Эксперименты с GPT-2 показали, что сигнал о грамматической роли следующего слова появляется в середине сети, а не на последнем слое, что указывает на планирование общего направления предложения до выбора конкретных слов. Третий вывод: неопределённость возникает поздно, при выборе точного слова, а не на этапе построения грамматической структуры. Это говорит о двух дополняющих процессах — один организует структуру предложения, другой подбирает слова. Автор считает, что эти находки помогут создавать более понятные и вычислительно эффективные ИИ-системы.
Quelle: Habr — хаб NLP —
Original
