пригодными для использования. Для тестирования моделей, таких как Claude и большая языковая модель (LLM) на основе OpenAI Codex, были выбраны шесть недавно раскрытых уязвимостей в программном обеспечении с открытым исходным кодом. Модели сгенерировали 6080 попыток создания патчей в различных условиях и с разными подсказками. Результаты показали, что 21% патчей исправляли ошибку, но изменяли поведение приложения, а 53,9% попыток не удались, привели к появлению новых ошибок или к тому и другому одновременно. Команда ввела термин «FLAWED» для обозначения таких патчей, которые выглядят как исправления, но содержат скрытые дефекты, подчеркивая, что сгенерированные ИИ патчи часто выглядят рабочими, но не полностью устраняют уязвимости и могут порождать новые проблемы. Компания 1Password опубликовала свой инструментарий FLAWED на GitHub для дальнейших исследований. Кит Худлет, руководитель Off-by-1 Labs, подчеркнул, что контроль со стороны человека имеет первостепенное значение, и ИИ следует использовать для триажа уязвимостей, помогая защитникам расставлять приоритеты в отношении важных ошибок. Исследование показывает, что ИИ пока не готов к автономному созданию патчей, но может быть полезен в киберзащите.