416次测试与一个“全部销毁”按钮:智能体代理项目在哪些地方失效
Anthropic
对六个智能体代理项目的分析揭示了反复出现的缺陷:安全措施仅停留在文本层面,不可逆操作缺乏防护门,以及零行为测试。即使一个拥有回归测试的成熟开源项目,仍缺少针对不可逆邮件发送的安全防护。作者提出了十个诊断性问题,用以评估智能体系统的成熟度。
作者自2026年2月起,使用Claude Code和--dangerously-skip-permissions标志,在研究循环中运行一个名为Groundhog(Surok)的自主代理。随后,他们根据来自六个来源(包括Sber的AI-DISRUPT PDLC方法论)的综合检查清单,审计了自己的六个代理项目,发现了三个反复出现的失败模式:仅在提示词中强制执行安全性(模型可能被覆盖)、缺乏确认的不可逆操作(例如,重建命令会清除所有丰富数据)、以及行为性错误零回归测试。作者还审查了一个匿名的大型开源代理项目:该项目具有代码级权限检查和对过去错误的回归测试,但仍然在没有草稿/确认步骤的情况下不可逆地发送电子邮件。一个较新的开源框架(HarnessX)提供了一个可选的interrupt_on门控,但并非默认启用。Sber的PDLC方法论将许多缺失的控制措施形式化:策略即代码、评估即完成契约,以及R0–R5权限阶梯,其中R3+级别对状态更改操作强制要求中止/回滚。作者构建了第七个项目,实施了一些经验教训:现在每次发布前都会运行评估,并且事故会成为命名的回归测试。
来源: Habr — хаб ИИ —
原文
