удалось воспроизвести более 40% выводов, а в 8 — более 80%. Кроме того, четыре статьи опирались на модель, которая уже отключена от сети, из-за чего их результаты теперь невозможно воспроизвести в принципе. В другом исследовании была разработана система проверки статей на базе GPT-5, которая проанализировала работы с ведущих конференций по ИИ и выявила, что в среднем каждая статья содержит 4,7 объективных ошибки, а у 99,2% статей есть хотя бы одна проблема. Чаще всего встречались математические и формульные ошибки (54,0%). Среднее число ошибок в одной статье конференции NeurIPS выросло с 3,8 в 2021 году до 5,9 в 2025 году. Эти данные свидетельствуют о нарастающей проблеме с воспроизводимостью научных результатов и открывают новые направления для исследований, например пересмотр старых статей и исправление ошибок в них. Более того, теоретик-химик из Zhejiang Lab обнаружил, что ИИ предсказал температуры кипения, отличающиеся от значений в 75-летней базе данных, и после ручной проверки оказалось, что прав был именно ИИ, — это выявило ошибки в измерениях, сделанных столетие назад. Это показывает, что ИИ уже способен помогать в переоценке исторического массива научной литературы.