Скрытая грамматика языковых моделей: три открытия о внутренней структуре генерации текста
OpenAI
Исследование внутренней структуры генерации текста языковыми моделями показало, что их работа гораздо более структурирована, чем кажется: модель следует стабильным грамматическим путям, строит внутреннюю карту направления предложения, а неопределённость возникает лишь на финальном этапе выбора конкретного слова.
Автор провёл двухлетнее исследование скрытых грамматических механизмов языковых моделей. Он обнаружил три ключевых открытия. Первое: генерация текста ИИ гораздо более структурирована, чем кажется, — модель следует стабильным грамматическим путям, которые остаются последовательными даже при разных настройках температуры. Второе: языковые модели строят внутренние карты направления предложения — сигнал о грамматической роли следующего слова появляется уже в середине сети, задолго до финального слоя, что говорит о планировании структуры предложения. Третье: неопределённость возникает не на ранних этапах, а лишь на финальной стадии выбора конкретного слова, когда модель выбирает лексику для уже построенного общего плана. Автор предполагает, что генерация языка состоит из двух процессов: один организует общую структуру, другой подбирает конкретные слова. Это может изменить подход к проектированию ИИ-систем, позволяя разделить структурированные и неопределённые части генерации для повышения эффективности и интерпретируемости.
Источник: Habr — хаб ML —
оригинал
