языках программирования. Например, GPT-5.5 модернизировал процесс сборки библиотеки Python cyvcf2, а два агента — Claude Code и Codex — перенесли около 10 000 строк кода MHCflurry с TensorFlow на PyTorch. В проекте rustar-aligner был переписан STAR, инструмент на C/C++ объемом в несколько тысяч строк, на язык Rust; при этом была достигнута согласованность с оригиналом на тестовых наборах данных в 99,815% и 99,883%. RustQC, объединивший 15 инструментов контроля качества, сократил время выполнения с 15 часов 34 минут до 14 минут 54 секунд, то есть более чем в 60 раз. HelixForge, замена BamSurgeon, оказался в 59,6 раза быстрее в целом, а основные вычисления — в 98,6 раза быстрее. Однако агенты часто выглядели уверенными, но ошибались; например, при переписывании bayesm две процедуры содержали незаметные ошибки, включая инвертированный управляющий параметр и неправильный масштабный коэффициент. Исследователи пришли к выводу, что люди должны определять цели, критерии успеха и методы проверки, в то время как агенты занимаются реализацией. В отчете оценивается значительная экономия времени — например, поддержка NumPy может сэкономить около 650 часов в год, — но подчеркивается, что долгосрочное сопровождение и ответственность являются ключевыми проблемами. Некоторые изменения были приняты в основных проектах, в то время как другие, например для FastQC, были отклонены первоначальным автором, что привело к включению улучшений в оригинальную версию на Java. Отчет является ретроспективным и основан на самоотчетах; в нем отмечается, что узкое место смещается от реализации к проверке и научному рецензированию. Эта тенденция подтверждается исследованием METR и исследованием о разочаровании команд разработчиков в ИИ-коде. Отчет согласуется с более широкой научной стратегией OpenAI,
Показать ещё ↓