416 тестов и кнопка «уничтожить всё»: где ломаются агентные проекты
Anthropic
Анализ шести агентных проектов выявил повторяющиеся недостатки: безопасность на уровне текста, необратимые действия без шлюзов и нулевые поведенческие тесты. Даже зрелый open-source проект с регрессионными тестами не имеет защит от необратимой отправки электронных писем. Автор предлагает десять диагностических вопросов для оценки зрелости агентных систем.
Автор с февраля 2026 года запускает автономного агента под названием Groundhog (Сурок) в исследовательском цикле с Claude Code и флагом --dangerously-skip-permissions. Затем он проверил шесть собственных агентских проектов по сводному чек-листу из шести источников (включая методологию жизненного цикла разработки продуктов ИИ AI-DISRUPT PDLC от Сбера) и выявил три повторяющиеся модели отказов:
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
