которых снабжён вопросами, проверяющими кодирование, воспроизведение и распознавание. Оценивая 13 больших языковых моделей с мышлением и без него, они показывают, что передовые модели, такие как Gemini-3-Pro и GPT-5, кодируют 95–98% фактов, но не могут напрямую воспроизвести 26–34%, при этом даже с мышлением ошибки составляют 11–12%. Масштабирование в семействе Gemma 3 снижает ошибки кодирования, но ошибки воспроизведения сохраняются, что указывает на то, что воспроизведение является узким местом. На воспроизведение влияет контекст обучения; редкие факты кодируются, но их трудно воспроизвести, а «проклятие обращения» переосмысливается как проблема воспроизведения, поскольку распознавание в заданиях с множественным выбором не нарушено. Мышление улучшает воспроизведение в наибольшей степени для редких и обратных фактов, восстанавливая 40–65% закодированных, но не напрямую известных фактов, действуя как механизм облегчения воспроизведения, а не чистого рассуждения.