ResearchModels 🇷🇺 31.07.2026 16:01

Memorization vs Generalization: что действительно умеет языковая модель на 2160 параметров

Эксперимент с крошечной языковой моделью на 2160 параметров показал уверенное запоминание обученных шаблонов (99.93% вероятность токена), ограниченный перенос на перестановку знакомых токенов (81.69%) и провал на новой структуре вопроса (10.46%). Модель сохранила все 14 исходных отношений без catastrophic forgetting.
В версии 1.1.0 проекта Tiny Language Model на Node.js, после обсуждения в ML-сообществе и фидбека от инженеров на Hashnode, было добавлено исследование границы между запоминанием и обобщением. С фиксированным seed 42 проведена frozen evaluation из четырёх проверок: точный обученный шаблон, знакомые токены в новом порядке, полностью отложенный шаблон и сохранение 14 отношений после adaptive SFT. Результаты показали, что на знакомом шаблоне минимальная вероятность правильного токена составила 99.93%, на перестановке токенов — 81.69%, а на неизвестной структуре вопроса — всего 10.46%, при этом модель ответила 'cat can fly' вместо ожидаемого 'cat cannot read'. Задача сохранения отношений была выполнена полностью (14 из 14, точность 100%). Эксперимент демонстрирует, что граница возможностей модели проходит между запоминанием и локальным переносом и настоящим обобщением: модель хорошо воспроизводит выученное и справляется с небольшими изменениями, но новая структура разрушает поведение. Причина ограниченности не только в количестве параметров, но и в малом корпусе с ограниченным числом конструкций. Автор отмечает, что увеличение нейронов или блоков без более разнообразных данных лишь улучшит запоминание. Это воспроизводимая учебная диагностика, а не полноценный benchmark.
Abbreviations
ML = Machine Learning — машинное обучение
SFT = Supervised Fine-Tuning — обучение с учителем (дообучение)
Source: Habr — хаб ИИ — original
Our earlier posts on this topic ↓
Fresh news