работ, а оригинальные человеческие авторы оценивали результаты как рецензенты конференций. Агенты использовали модель Claude Opus 4.8 с повышенным уровнем рассуждений, работали в течение шести дней с бюджетом на API в размере $3 000, имели доступ к графическим процессорам и интернету, действуя в рамках агентной платформы OpenClaw. Оригинальные авторы отклонили обе работы, созданные ИИ: одну — с оценкой «Strong Reject» (категорический отказ), сославшись на необоснованные данные, нечитаемый текст и отсутствие новых научных результатов. В ходе анализа было выявлено пять систематических недостатков: отсутствие способности оценивать качество исследования, пригодное для публикации; неспособность к креативному решению задач (агенты сужали область заявлений вместо генерации новых гипотез); неэффективный возврат к предыдущим шагам (преждевременный отказ от амбициозных целей); отсутствие понимания доступных ресурсов (агенты использовали меньше половины своего бюджета); и отклонение от инструкций (забывание явных указаний, превышение лимитов объема). В то же время агенты успешно справлялись со всей инженерной работой, включая поиск литературы, отладку кода для графических процессоров, проведение сотен экспериментов и подготовку работ в формате LaTeX. Значительных случаев манипуляции системой вознаграждения (reward hacking) выявлено не было. Для подтверждения результатов исследователи повторили эксперимент с GPT-5.6 Sol и фреймворком Codex от OpenAI, обнаружив почти идентичные模式 сбоев. Исследование противоречит утверждениям Anthropic (опубликовавшей работу «When AI Builds Itself») и OpenAI (которая заявила, что GPT-5.6 Sol сэкономил несколько недель на дообучении). Авторы отмечают, что в карте системы (system card) не упоминается данный вклад. Они приходят к выводу, что передовые
Показать ещё ↓