проведенном исследователями из Университета Аризоны и Технического университета Клуж-Напоки, LLM, такие как GPT-4 и Claude 3, получили таблицу с примерами и должны были предсказать недостающее значение. Без какой-либо тонкой настройки они показали результаты, сопоставимые со специализированными программами, а на функции Фридмана №2 Claude 3 даже превзошел пять таких инструментов. Интересно, что увеличение количества примеров улучшало точность, что нельзя объяснить случайностью. Это обучение в контексте примечательно тем, что не требует дополнительного обучения. Однако LLM ненадежны: их предсказания меняются в зависимости от порядка строк и точности чисел, и у них нет ограничения, иногда они дают совершенно неверные ответы. Несмотря на то, что каждое предсказание обходится на порядки дороже, чем у классических инструментов, LLM блистают, когда данных мало, они содержат текст или когда имена столбцов несут смысл. Новые специализированные модели, такие как TabPFN, опубликованные в Nature в начале 2025 года, превосходят LLM на чисто числовых таблицах с небольшим объемом данных, затрачивая менее трех секунд на то, чтобы превзойти комбинацию классических методов, работавшую четыре часа. Рекомендуется использовать LLM только тогда, когда данных мало или есть значимый текст, и рассматривать их как дополнение, а не замену классическим инструментам.