Скрытая грамматика языковых моделей: три открытия о структуре генерации текста
OpenAI
Автор провёл двухлетнее исследование внутренней структуры языковых моделей и обнаружил, что генерация текста следует стабильным грамматическим путям, модели строят внутреннюю карту направления предложения, а неопределённость возникает лишь на поздних этапах выбора конкретных слов.
В статье на Habr автор делится результатами двухлетнего исследования скрытой грамматики больших языковых моделей. Первое открытие: генерация текста гораздо более структурирована, чем кажется — модель движется по стабильному ядру высокопредсказуемых грамматических путей, подобно основным дорогам в городе, причём эта структура сохраняется даже при разных значениях temperature. Второе открытие:
Показать ещё ↓
- Сокращения
- GPT-2 = Generative Pre-trained Transformer 2 — генеративный предобученный трансформер 2
Источник: Habr — хаб NLP —
оригинал
