416のテストと「全削除」ボタン:エージェントプロジェクトが失敗するポイント
Anthropic
6つのエージェントプロジェクトの分析により、安全対策がテキストのみであること、ゲートなしの不可逆的なアクション、行動テストの欠如といった繰り返し発生する欠陥が明らかになった。成熟したオープンソースプロジェクトでさえ、回帰テストがあっても不可逆的なメール送信に対する安全策が欠けている。著者はエージェントシステムの成熟度を評価するための10の診断質問を提案する。
著者は2026年2月から、Claude Codeと--dangerously-skip-permissionsを用いた研究ループ上で、Groundhog(Surok)と呼ばれる自律エージェントを稼働させている。その後、6つのソース(SberのAI-DISRUPT PDLC手法を含む)から構成された複合チェックリストを用いて、自らのエージェントプロジェクト6つを監査したところ、3つの再発する障害パターンが見つかった。すなわち、プロンプトでのみ安全性が強制される(モデルが上書き可能)こと、確認なしに不可逆的なアクションを実行する(例:再構築コマンドがすべてのエンリッチデータを消去する)こと、そして振る舞いのバグに対する回帰テストが皆無であることである。著者はまた、匿名の大規模オープンソースエージェントプロジェクトをレビューした。そこにはコードレベルのパーミッションチェックと過去のバグに対する回帰テストがあったものの、下書きや確認ステップなしに電子メールを不可逆的に送信していた。新しいオープンソースフレームワーク(HarnessX)はinterrupt_onゲートを提供しているが、オプションでありデフォルトではない。SberのPDLC手法は、不足しているコントロールの多くを形式化している。すなわち、ポリシー・アズ・コード、評価(eval)を完了契約として扱うこと、R0~R5のパーミッションラダーと、R3以上の状態変更操作に対する必須のアボート/ロールバックである。著者は、学んだ教訓の一部を実装した7つ目のプロジェクトを構築した。現在では、各リリース前に評価が実行され、インシデントが名前付きの回帰テストとなるようになっている。
出典: Habr — хаб ИИ —
原文
