использовались упрощённые воспроизведения на синтетических данных. Из 2200 рассмотренных статей как минимум одно утверждение было независимо подтверждено в 1103 (51%) из них, включая 266 полностью воспроизведённых и 632 частично воспроизведённых без каких-либо опровержений; было подтверждено 3978 отдельных утверждений. Однако в 496 (23%) статей хотя бы одно утверждение было опровергнуто или оспорено, включая 49, где все утверждения были опровергнуты, и 242, где независимые команды пришли к противоположным выводам по одним и тем же утверждениям. Среди заметных подтверждённых опровержений — доказательство из статьи о подкачке страниц, которое не сработало после k=1024, теорема, рухнувшая на шаге 224, теоретическая статья, использующая обратный KL-дивергенцию, в то время как в коде использовалась прямая KL-дивергенция, и оценка, ослабленная токенами дополнения EOS (конец последовательности). Организаторы повторно проверили все заявленные опровержения и связались с авторами, которые отреагировали положительно. Конкурс также показал, что агенты сталкиваются с ограничениями, такими как локальные циклы и неверные интерпретации, и что для получения надёжных результатов необходим контроль со стороны человека, как это видно на примере победителя в категории «человек в цикле», который лично оценивал пары изображений. Мероприятие считается крупнейшей открытой проверкой утверждений конференции по машинному обучению, и все журналы, вердикты, трассы и артефакты находятся в открытом доступе.