416件のテストと「すべて破棄」ボタン:エージェントプロジェクトが破綻する場所
Anthropic
6つのエージェントプロジェクトの分析により、安全性がテキスト上のみで語られている、不可逆的なアクションにゲートがない、行動テストがゼロ、といった課題が繰り返し浮き彫りになった。成熟したオープンソースプロジェクトでも回帰テストはあるが、不可逆的なメール送信に対する保護策は欠けている。著者はエージェントシステムの成熟度を評価する10の診断質問を提案する。
著者は2026年2月から、Claude Codeと--dangerously-skip-permissionsを用いた研究ループ上で、Groundhog(Surok)と呼ばれる自律エージェントを稼働させている。その後、6つのソース(SberのAI-DISRUPT PDLC手法を含む)から構成された複合チェックリストを用いて、自らのエージェントプロジェクト6つを監査したところ、3つの再発する障害パターンが見つかった。すなわち、プロンプトでのみ安全性が強制される(モデルが上書き可能)こと、確認なしに不可逆的なアクションを実行する(例:再構築コマンドがすべてのエンリッチデータを消去する)こと、そして振る舞いのバグに対する回帰テストが皆無であることである。著者はまた、匿名の大規模オープンソースエージェントプロジェクトをレビューした。そこにはコードレベルのパーミッションチェックと過去のバグに対する回帰テストがあったものの、下書きや確認ステップなしに電子メールを不可逆的に送信していた。新しいオープンソースフレームワーク(HarnessX)はinterrupt_onゲートを提供しているが、オプションでありデフォルトではない。SberのPDLC手法は、不足しているコントロールの多くを形式化している。すなわち、ポリシー・アズ・コード、評価(eval)を完了契約として扱うこと、R0~R5のパーミッションラダーと、R3以上の状態変更操作に対する必須のアボート/ロールバックである。著者は、学んだ教訓の一部を実装した7つ目のプロジェクトを構築した。現在では、各リリース前に評価が実行され、インシデントが名前付きの回帰テストとなるようになっている。
出典: Habr — хаб ИИ —
原文
