(адаптивной дообучении). Результаты показали, что на знакомом шаблоне минимальная вероятность правильного токена составила 99.93%, на перестановке токенов — 81.69%, а на неизвестной структуре вопроса — всего 10.46%, при этом модель ответила 'cat can fly' вместо ожидаемого 'cat cannot read'. Задача сохранения отношений была выполнена полностью (14 из 14, точность 100%). Эксперимент демонстрирует, что граница возможностей модели проходит между запоминанием и локальным переносом и настоящим обобщением: модель хорошо воспроизводит выученное и справляется с небольшими изменениями, но новая структура разрушает поведение. Причина ограниченности не только в количестве параметров, но и в малом корпусе с ограниченным числом конструкций. Автор отмечает, что увеличение нейронов или блоков без более разнообразных данных лишь улучшит запоминание. Это воспроизводимая учебная диагностика, а не полноценный benchmark (эталонный тест).