エージェントAI安全性 🇷🇺 12.08.2026 00:02

私のAIエージェント群が真に自律的であることを検証した方法

AnthropicAnthropic
AIエージェント群の運用者は、エージェントの自律性を証明するための検証ハーネスを構築した方法を説明しています。彼らはイベントログ上の純粋関数として4つの不変条件を定義し、実データで実行しました。その結果、第2層のリスクは人間の承認によって適切にゲートされていたものの、独立した検証はほとんど実行されておらず、宣言された規律と現実の間にギャップがあることが明らかになりました。
AIエージェントのフリート運用者であり、開発者出身ではない人物が、6週間にわたり交渉を実行する4台のマシンからなるフリートが真に自律的であることを証明しようと試みた。彼らは、INV-1からINV-4までの不変条件を、イベントログに対する純粋関数として定義し、Tier-2アクションをコミットする前の人間による承認や、コミット前の独立した検証といった行動規則を検証した。これらのチェックを64件の実際の提案と317件のイベントに対して実行したところ、INV-1(Tier-2に対する人間のゲート)は100%合格したが、INV-2(独立検証)はわずか7.7%しか合格せず、VERIFYが推奨事項であり、強制されていないことを示した。INV-3は、ハブがACCEPTを17回繰り返した重複イベントストームのバグを検出し、INV-4は、人間による解決を待たずにコミットされた5件のエスカレーションを明らかにした。運用者は、これらの結果を透明性をもって公開し、適切な人間による承認フローを示す実際のトレースと、検証がコミッターによって行われたために同じトレースがINV-2に不合格となった例を提示した。また、制限事項、エラー、評価ハーネスのオープンソースコードについても議論した。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース